OmniTools 10月10日消息,Epoch AI 近日推出 InnovationEval 评测框架,旨在评估大语言模型能否独立复现人类发表的机器学习创新成果。
该评测以 Self-Distillation Policy Optimization(SDPO)论文为基准任务,要求模型从原始论文出发,完成算法复现、实验验证与结果分析全流程。
初步测试显示,当前最前沿的 AI 模型在该任务中仅实现约 15% 的人类论文所报告的 SDPO 增益,表明 AI 自主开展 AI 研发的能力仍处于早期阶段。