OmniTools 7月9日消息,OpenAI 对编码评测基准 SWE-Bench Pro 开展专项审计,发现在其公开子集的 731 个任务中,约 30% 存在数据质量问题。具体问题包括测试用例过于严格、提示词描述不充分、测试覆盖不全或存在误导性提示等。
同期数据显示,前沿模型在该基准上的通过率在八个月内从 23.3% 升至 80.3%,但 OpenAI 指出该提升可能部分源于评测缺陷而非真实能力跃升。
OpenAI 建议模型开发者审慎解读相关评测结果,并强调 AI 智能体正日益成为规模化数据质量检查的有效工具。