OmniTools 9月4日消息,OpenAI 的 GPT-6 Astra 模型在 ARC-AGI-3 基准测试中取得当前最优(SOTA)成绩。标准 harness 得分为 63%,经 Provider Adapter harness 优化后达 99%,在 96% 的关卡中表现超越人类水平。
相关评测指出,ARC-AGI-3 基准已呈现饱和趋势。数据显示,更高推理层级的模型调用反而更节省成本——Astra 以更少动作完成关卡,显著降低 token 消耗与调用次数。
OmniTools 9月4日消息,OpenAI 的 GPT-6 Astra 模型在 ARC-AGI-3 基准测试中取得当前最优(SOTA)成绩。标准 harness 得分为 63%,经 Provider Adapter harness 优化后达 99%,在 96% 的关卡中表现超越人类水平。
相关评测指出,ARC-AGI-3 基准已呈现饱和趋势。数据显示,更高推理层级的模型调用反而更节省成本——Astra 以更少动作完成关卡,显著降低 token 消耗与调用次数。
从这条动态出发,继续查看相关分析、产品详情和同主题更新。
刚收录的 AI 工具,适合顺手发现可用产品。