OmniTools 10月2日消息,Artificial Analysis 发布最新 Coding Agent Index 编程智能体性能榜单。Claude Sonnet 5.5(max)在 Claude Code 环境中以 68 分位列第一,GPT-6.1 Sol 与 Gemini 4 Argon 紧随其后。
榜单显示,三者虽综合表现领先,但单任务成本差异显著:Claude Sonnet 5.5 每任务最高达 14.19 美元,为当前测试模型中成本最高者。
该榜单基于标准化编程任务评估,涵盖代码生成、调试与执行等维度,未披露具体测试数据集与方法细节。