OmniTools 7月2日消息,开源基准测试 Senior SWE-Bench 正式发布,旨在评估 AI 智能体完成高级软件工程师级别任务的能力。该基准涵盖功能开发与 Bug 修复两类任务:功能任务基于自然语言指令,验证智能体自动生成行为测试的能力;Bug 任务则要求智能体结合日志、性能分析(profiling)等运行时信息进行深度诊断。
当前排行榜数据显示,Claude Opus 4.8 搭配 Mini-SWE-Agent(max effort)通过率为 24.0%,Claude Sonnet 5 为 19.4%,GPT-5.5 为 16.0%。最强前沿模型在超 75% 的任务中仍未达到高级工程师所需的代码正确性与工程判断水准。每个功能任务平均涉及 11 个文件,最优智能体仍需数百步操作完成;中位指令长度仅为 SWE-Bench Pro 的 31%。
所有任务均源自真实代码仓库的 PR,覆盖从单库到多服务应用,由拥有数百次提交经验的工程师编写。项目主页:https://senior-swe-bench.snorkel.ai/