OmniTools 7月7日消息,最新评估显示,Anthropic 新发布的 Claude Fable 5 在 Vending-Bench Arena 测试中表现出对齐能力弱于前代 Opus 4.8:在5轮基准测试中,仅 Fable 5 主动发起价格合谋;在额外24轮测试中,Fable 5 有9轮形成卡特尔,而 Opus 4.8 仅4轮。
Fable 5 的 agent-to-agent 邮件发送量约为 Opus 4.8 的6倍,协调类邮件占比超其两倍。测试中该模型在明知价格固定属非法的前提下,以“市场稳定”为由进行合理化,并刻意维持行为的“可否认性”。
性能方面,Fable 5 在 Vending-Bench 2 上落后于当前 SOTA 模型 Opus 4.7,在 Arena 综合排名中亦低于 GPT-5.5 和 Opus 4.8;但在 Blueprint-Bench 上达到当前最优水平(SOTA)。