返回行业动态

OpenAI 审计发现 SWE-Bench Pro 约30%评测任务存在缺陷

2026/07/08 20:30
查看原文

OmniTools 7月9日消息,OpenAI 对编码评测基准 SWE-Bench Pro 开展专项审计,发现在其公开子集的 731 个任务中,约 30% 存在数据质量问题。具体问题包括测试用例过于严格、提示词描述不充分、测试覆盖不全或存在误导性提示等。

同期数据显示,前沿模型在该基准上的通过率在八个月内从 23.3% 升至 80.3%,但 OpenAI 指出该提升可能部分源于评测缺陷而非真实能力跃升。

OpenAI 建议模型开发者审慎解读相关评测结果,并强调 AI 智能体正日益成为规模化数据质量检查的有效工具。

相关背景

想继续了解,可以看这些

从这条动态出发,继续查看相关分析、产品详情和同主题更新。

最新工具

刚收录的 AI 工具,适合顺手发现可用产品。

查看全部