OmniTools 9月23日消息,英国AI安全研究所(AISI)正基于EvalEval基础设施,公开共享前沿大模型评测结果,以提升AI评测的可复现性与可验证性。此次合作涵盖HealthBench、FrontierMath、Humanity's Last Exam、SWE-Bench及Terminal-Bench 2.0五大基准,覆盖Claude Opus 4/4.5/4.6与GPT-5/5.2/5.4共六款前沿模型,并包含Cyber CTFs和The Last Ones两项网络安全相关评测。
AISI同步发布论文《推理算力如何影响前沿大语言模型评测》,揭示评测协议与推理时算力对模型表现的影响,例如在Humanity's Last Exam中,模型在获得正确性反馈后随token消耗增加持续解题。所有结果均通过Evaluation Cards格式公开,含验证结果、上下文与配置信息。
双方合作源于NeurIPS 2025联合研讨会,已共同推动Every Eval Ever(EEE)评测报告通用架构落地。AISI此前亦在OptStop(优化评测终止)、HiBayES(分层贝叶斯建模)等方向推进评测标准化。