返回行业动态

普林斯顿大学推出CEO-Bench:仅三款AI模型在500天模拟创业中实现盈利

2026/06/28 10:46
查看原文

OmniTools 6月28日消息,普林斯顿大学近日推出CEO-Bench基准测试,要求AI智能体在模拟环境中运营SaaS公司NovaMind长达500天,初始启动资金为100万美元。

在参与测试的14个AI模型中,仅有Claude Fable 5(最佳轮次盈利4715万美元)、Claude Opus 4.8(2780万美元)和GPT-5.5(2130万美元)在最佳运行中实现盈利并超越起始资本。值得注意的是,一个不依赖大语言模型的简单规则启发式算法,通过固定定价、配额管理与针对性开发,最终盈利1576万美元,表现优于其余11个AI模型。

多数AI模型因无法维持连贯的商业策略,在模拟期结束前即宣告破产。该基准测试旨在重点评估AI智能体在复杂环境下的长期战略决策与执行能力。

相关背景

想继续了解,可以看这些

从这条动态出发,继续查看相关分析、产品详情和同主题更新。

最新工具

刚收录的 AI 工具,适合顺手发现可用产品。

查看全部