OmniTools 9月16日消息,IBM 研究院在 Hugging Face 最新技术博文中指出,当前主流 AI 智能体评测普遍依赖 Mean@k(k次运行平均通过率),但该指标掩盖了结果不一致问题:一个在 AppWorld 基准上 Mean@5 达 77.4% 的 ReAct 智能体,仅在 53.0% 的任务上实现全部 5 次运行均成功,存在 24.4 个百分点的“一致性缺口”(consistency gap)。
研究团队提出新诊断工具 Consistency Analyzer,通过单次轨迹回放与每决策点 5 次采样,定位易翻转(flip-prone)的扁平化概率分布步骤,无需真实环境重放或人工标注。基于此生成的“一致性指南”(consistency guidelines)可将上述缺口收窄至 12.0 个百分点,Pass^5 提升至 69.0%,且未牺牲平均准确率。
该方法已集成至开源 ALTK-Evolve 工具包,支持 GPT-4.1 等模型,相关技术报告已发布于 arXiv。研究强调,一致性是独立于能力的正交维度,建议在部署时同步报告 Mean@k 与 Pass^k 以全面评估智能体可靠性。