OmniTools 7月18日消息,Cursor 模型评估负责人 Nate Schmidt 确认,Claude Fable 5 在其内部编程基准 CursorBench 的 Max effort 模式下得分达 72.9%,创该基准历史新高。
该模型在模糊性较高的真实编程任务中展现出强全局推理能力。例如,在航天模拟器任务中,仅凭单句提示即可自主规划并成功实现登月;而此前 Claude Opus 在相同任务中运行超 12 小时仍未得出结果。
此次结果来自 Cursor 官方博客发布的前沿模型评估报告,未披露具体上线时间或商用计划。