OmniTools 6月28日消息,普林斯顿大学近日推出CEO-Bench基准测试,要求AI智能体在模拟环境中运营SaaS公司NovaMind长达500天,初始启动资金为100万美元。
在参与测试的14个AI模型中,仅有Claude Fable 5(最佳轮次盈利4715万美元)、Claude Opus 4.8(2780万美元)和GPT-5.5(2130万美元)在最佳运行中实现盈利并超越起始资本。值得注意的是,一个不依赖大语言模型的简单规则启发式算法,通过固定定价、配额管理与针对性开发,最终盈利1576万美元,表现优于其余11个AI模型。
多数AI模型因无法维持连贯的商业策略,在模拟期结束前即宣告破产。该基准测试旨在重点评估AI智能体在复杂环境下的长期战略决策与执行能力。