OmniTools 8月5日消息,普林斯顿大学团队开展“影子评估”实验,测试前沿AI智能体在开放式AI研究任务中的实际能力。实验要求智能体在六天内、动用数千美元API额度与算力资源,尝试解答两篇尚未发表论文的核心研究问题。
结果显示,两篇论文的原作者均明确拒绝了智能体提交的解答。分析指出,智能体普遍存在研究判断力不足、资源使用缺乏意识、难以应对创造性反馈、回溯修正能力薄弱,且未能严格遵循指令等问题。
研究团队强调,开放式研究对当前AI智能体仍具显著挑战,但本次实验样本量有限,结论属初步探索,后续需扩大测试范围并持续跟踪评估。