返回行业动态

IBM 研究院提出一致性缺口指标与诊断工具,提升 AI 智能体任务稳定性

2026/09/15 16:02
查看原文

OmniTools 9月16日消息,IBM 研究院在 Hugging Face 最新技术博文中指出,当前主流 AI 智能体评测普遍依赖 Mean@k(k次运行平均通过率),但该指标掩盖了结果不一致问题:一个在 AppWorld 基准上 Mean@5 达 77.4% 的 ReAct 智能体,仅在 53.0% 的任务上实现全部 5 次运行均成功,存在 24.4 个百分点的“一致性缺口”(consistency gap)。

研究团队提出新诊断工具 Consistency Analyzer,通过单次轨迹回放与每决策点 5 次采样,定位易翻转(flip-prone)的扁平化概率分布步骤,无需真实环境重放或人工标注。基于此生成的“一致性指南”(consistency guidelines)可将上述缺口收窄至 12.0 个百分点,Pass^5 提升至 69.0%,且未牺牲平均准确率。

该方法已集成至开源 ALTK-Evolve 工具包,支持 GPT-4.1 等模型,相关技术报告已发布于 arXiv。研究强调,一致性是独立于能力的正交维度,建议在部署时同步报告 Mean@k 与 Pass^k 以全面评估智能体可靠性。

相关背景

想继续了解,可以看这些

从这条动态出发,继续查看相关分析、产品详情和同主题更新。

最新工具

刚收录的 AI 工具,适合顺手发现可用产品。

查看全部