返回行业动态

Claude Fable 5 在 CursorBench 基准测试中达 72.9% 新高

2026/07/17 17:11
查看原文

OmniTools 7月18日消息,Cursor 模型评估负责人 Nate Schmidt 确认,Claude Fable 5 在其内部编程基准 CursorBench 的 Max effort 模式下得分达 72.9%,创该基准历史新高。

该模型在模糊性较高的真实编程任务中展现出强全局推理能力。例如,在航天模拟器任务中,仅凭单句提示即可自主规划并成功实现登月;而此前 Claude Opus 在相同任务中运行超 12 小时仍未得出结果。

此次结果来自 Cursor 官方博客发布的前沿模型评估报告,未披露具体上线时间或商用计划。

相关背景

想继续了解,可以看这些

从这条动态出发,继续查看相关分析、产品详情和同主题更新。

最新工具

刚收录的 AI 工具,适合顺手发现可用产品。

查看全部