OmniTools 9月2日消息,艾伦人工智能研究所(AI2)联合 Hugging Face 发布新方法 BenchMIRT,用于在单题层面审计大语言模型(LLM)基准测试,识别其实际衡量的核心能力维度。
BenchMIRT 基于多维项目反应理论(MIRT),分析了 100 个开源 LLM 在 16 个基准(含 MMLU-Pro、GPQA、HarmBench、BBQ、WMDP 等)共 3.4 万道题目上的表现。结果显示,安全与通用推理是两大主导能力维度,但部分基准存在能力混杂现象——例如 BBQ(社会偏见测试)更显著关联通用推理能力,WMDP(危险知识测试)得分则与通用推理能力呈负相关。
该方法可识别最具区分度的题目,仅用 10% 题目即可复现全量基准对能力的排序效果;同时支持对未见过题目的答题结果进行预测,准确率达 79%。研究团队强调,BenchMIRT 不否定现有基准价值,而是提供更精细的信号解耦工具,助力构建更小、更聚焦、更可解释的评估体系。