OmniTools 6月28日消息,英国前首相府数据科学家 Liam Wilkinson 搭建 76 个 MCP 工具,将 Claude Opus 4.6、GPT-5.4、Gemini 3.1 Pro 等四大主流模型接入《文明VI》进行 23 场对局测试。
测试显示,Claude 在扮演葡萄牙时因法国文化胜利临近,耗时 50 回合研发核武器并摧毁图卢兹,但法国仍以外交胜利获胜。数据分析表明,AI 主动检查全局游戏状态的行为仅占全部动作的 1%–2%,存在显著感知盲区;计划生成后 10 回合内的实际执行率仅为 48%–66%,反映明显的“知行差距”。
研究指出,当前顶级 AI 的推理能力已非核心瓶颈,环境感知能力与长期规划执行能力仍是制约其在复杂动态环境中表现的关键短板。