刚收录的 AI 工具,适合继续发现可用产品。
8月20日,一个没有厂商署名的模型出现在OpenRouter上:定价0美元,1M上下文,最大输出128K,接受文本、图像和视频输入,支持函数调用。除了Ox Alpha这个名字,关于它的一切都是空白。
市场的反应比猜谜更快。它上线首日冲上OpenRouter用量榜首,刷新平台单日模型用量纪录,仅Hermes、Claude Code等前五大入口的累计用量就超过4万亿token;在另一家平台OpenCode上,DeepSeek连续56天的霸榜纪录也就此终结。到8月23日当周,据周榜统计,OpenRouter周token总量达93.4万亿、环比增长24%;上线不满一周,Ox Alpha即以11.6万亿token与DeepSeek V4 Flash并列周榜第一。按周榜口径计算,这个匿名模型吃掉了平台约12.4%的周用量。
六天里,社区主要在做的事是鉴定身份。tokenizer计数与GLM-5.3高度一致的指纹最先浮出水面,报错码与可用性的同步波动成了旁证,Gemini新版、Kimi K3.5、腾讯混元、微软MAI都曾被点名。这种发布方式有先例:今年2月,匿名模型Pony Alpha最终被确认为GLM-5的早期测试版。
8月26日,Z.ai确认Ox Alpha是其GLM系列最新迭代,正式型号GLM-5.3-Flash。官方文档披露,发布前以匿名身份在OpenCode和OpenRouter收集用户反馈,并称匿名期全部流量跑在中国AI芯片上;这一说法目前仅见于官方表述。当晚,权重以MIT许可上传至Hugging Face,320B总参数、18B激活的MoE架构,FP8精度。当晚放出的是Flash版权重;旗舰GLM-5.3的权重,官方承诺约两周内放出。
对开发者,这六天等于一次罕见的去品牌盲测。用量与评价都产生于无人知道出品方的环境里,是能力对比中最干净的样本;认领之后,口碑、价格、权重同时到位,但基准多为厂商自报,促销价9月9日截止,旗舰权重另有时间表。面具摘下了,真正值得算的是选型账本上实际多出来的那几笔:token成本变了多少,能力档位站在哪,长程智能体这类新场景为什么现在才跑得起。
先把价格摆上桌:哪些数字能直接进预算表
正式定价把这次事件变成一条完整的价格谱系。按每百万token计,匿名预览期是0美元。身份确认后,OpenRouter命名路由执行促销价:输入0.075美元、输出0.25美元、缓存读0.015美元,到9月9日24时截止。标价为输入0.15美元、输出0.50美元、缓存读0.03美元,这一口径来自第三方定价页对官方定价的转述,与OpenRouter页面的折扣结构一致。再往上,Z.ai定价页里GLM-5.3与GLM-5.2同为输入1.4美元、输出4.4美元;Claude平台文档里Opus 4.8为5美元与25美元;Anthropic官方给Fable 5的定价是10美元与50美元,缓存读1美元、缓存写12.5美元。
只看输出价,Flash标价对Fable 5是1/100,输入价约为1/67;促销期内,输出价差进一步拉大到1/200。对Opus 4.8则是输出1/50、输入约1/33。官方模型卡称,Flash以约1/10于GLM-5.2的价格全面超越GLM-5.2;OmniTools按标价逐项核算,输入约为1/9.3、输出约为1/8.8,四舍五入的口径基本成立。
这个核验值得做,因为它区分了两种低价:纯补贴的低价会随促销结束消失,有成本结构支撑的低价才有持续性。促销五折里确实含让利成分,但标价与官方公布的架构数字之间能对上账,依据在后文的架构部分展开。落到预算表上的操作含义只有一条:按标价而非促销价做规划。即便如此,输出成本也压在每百万token 1美元以内,输出密集型负载的成本结构由此改变。
缓存价差需要单独算一笔。Flash缓存读0.03美元,对Fable 5的1美元约为1/33,明显小于输出价1/100的差距。长程智能体负载会大量重复系统提示与历史上下文,缓存命中率高的团队会发现,实际成本差距比标价倍数收窄。倍数是上限不是均值,选型时该按自己负载的命中率算账,而不是直接套用厂商页面的对比数字。
接入路径上暂时不存在价差:OpenRouter命名路由与官方促销同价,已有8家推理服务商接入。选官方API还是聚合平台,考量落在稳定性、账单合并与条款细节上。
摘下面具之后,能力档位到底站在哪
盲测期的口碑先于基准表存在。r/openrouter上的一条长评给出的画像是:从零构建类任务强,一次通过多个高难度任务,速度快,但不太擅长接受纠正;同一条评测记录了约2.64亿token、连续运行18小时、零成本。Hacker News上有用户表示,Fable与Sol的额度一周耗尽后就切换到GLM系列,“够用于生产性工作”。量子位报道的一项10任务社区测试里,Ox Alpha完成率80%,高于Fable 5的65%;量子位同时声明,这一样本远不足以证明综合能力超越旗舰。这些样本的共同价值是没有品牌滤镜,共同局限是规模小、且匿名期的路由与正式端点环境未必一致,只能作参考信号。
参照系先摆清楚:GLM-5.3是智谱8月14日发布的文本旗舰,Flash是同系列的多模态新成员。独立评测机构Artificial Analysis给出的锚点更硬:GLM-5.3在Intelligence Index上得60分,与Fable 5的60分持平;完成同一套评测,GLM-5.3花费1238.50美元,Fable 5花费5630.52美元,差距约4.5倍。同档能力、不同档成本,这个判断在独立口径下成立。Flash在同一指数下的分数为57分,略低于旗舰的60分,这一数字出自Z.ai的引述。
厂商自报的基准表要打折看。Z.ai博客里GLM-5.3对Fable 5的五项对比是两胜三负:Terminal Bench 2.1的88.2对88.0、GDPval的1769对1743两项领先;Terminal Bench 3.0落后5.4分、DeepSWE落后2.8分、Toolathlon落后1.7分。输掉的三项集中在更长程的工程任务上,这就是“部分基准媲美”的准确边界。Flash的官方基准表对Opus 4.8为四项三胜一负,DeepSWE以63.4对58.0领先,Toolathlon与AutomationBench同样领先,Terminal Bench 2.1以84.3对85.0差0.7分;对上一代GLM-5.2则四项全面领先。但最接近真实编程环境的Z.ai Code Bench是私有基准,外部无法复核,Flash的29.0仍低于Opus 4.8的29.5。对选型的含义是:能力档位有数据支撑,置信度要打折,关键任务上的判断要靠自测。
弱项在官方表里也有明示:视觉理解项BabyVision,Flash得53.4,Gemini 3.7 Flash为70.9。图文协同是官方点名的场景,视觉侧的能力边界,接入前需要单独验证。
还有一项记录与成本直接相关。AA数据显示,GLM-5.3完成评测生成了1.7亿token,约为同指数中位数7200万的2.4倍,评测机构对其的评价是“非常啰嗦”。啰嗦的推理在0.50美元的输出价下代价被钝化,在50美元的输出价下会被放大。低价不只改变单价,还改写推理风格的经济性,这直接影响长思维链用不用得起的判断。
架构换价格:长程智能体为什么现在才跑得起
官方给Flash的定位表述很具体:面向编程、长周期智能体任务与生产级工作负载的推理模型,适合长程软件工程、复杂推理以及图文协同的工作流。对比GLM-5.3的文本旗舰定位,这是一次明确的场景迁移,迁移的支点写在架构里。
Flash是GLM-5系列第一个原生多模态模型,官方称其为首个采用稀疏注意力与线性注意力混合架构的开源前沿模型。与价格直接相关的是三组数字:激活参数18B,相比GLM-4.5系列的32B近乎减半;KV缓存相比GLM-5.3降低4.44倍;权重原生FP8精度。三项分别压低单次推理的计算量、长上下文的显存占用与权重体积。官方公布的架构数字为标价提供了成本结构上的解释依据,与价格核验互相印证;但这是推断而非已验证的因果,促销五折中的让利成分同样真实存在。
场景迁移的实质可以用一笔账说清。长周期智能体的token消耗结构是长上下文、多轮工具调用加上不可关闭的思维链:Flash的thinking默认开启,只有low、high、max三档可调,意味着每次调用都有推理token的固定消耗。匿名期那条18小时、2.64亿token的评测负载,按Flash标价计算,成本约在40到132美元之间,取决于输入与输出的构成比例;同一负载放到Fable 5的价格体系下约为2640到13200美元,差距约67到100倍。这是基于单一社区评测的情景推算,只能看量级:在旧价格体系下,让一个智能体连续跑18小时是不可想象的预算项;在新的输出价下,它进入了可以讨论的范围。
官方点名的场景也围绕这一经济性展开:前端开发、游戏构建、Blender 3D建模、真实环境中的浏览器与电脑操作,再延伸到以PPTX、PDF、XLSX为交付物的Office与金融研究工作流。这些任务的共同点是单次运行的token量以百万计,价格敏感度远高于一问一答的对话。
需要保留的是对生产验证的怀疑。基准以厂商自报为主,盲测样本小且产生于匿名环境;图文协同在长程任务中的稳定性、工具调用的成功率、连续运行数十小时后的表现衰减,这些生产级负载真正关心的指标,目前几乎没有公开数据。新场景是否成立,最终要靠开发者自己的负载回答。
权重到手之后,自托管的门槛与动机
MIT许可几乎不设限制,硬件门槛替许可把了关。按官方部署文档口径,vLLM下FP8权重约306GiB,默认部署需要约386GB显存,支持起点是NVIDIA Hopper架构;CPU与GPU异构的KTransformers路径需要350GB以上系统内存,官方验证过的上下文约50万token。这些是文档数字,社区实测尚少,但量级已经说明问题:Hopper级多卡服务器起步,个人开发者自托管基本出局。
自托管是否划算,取决于用量。按Flash标价做算术换算,每月10亿输出token的API支出约500美元。在这个价格水平下,为省钱而自托管的盈亏平衡点对应极高的用量,经济上很难成立;自托管的真实动机更可能是数据合规与可控性,代码资产不出域、推理策略自己定,这些是API换不来的。
于是三条路径的分工比较清晰。多数团队的默认选项是官方API或OpenRouter聚合,两者促销期同价,切换成本接近零。合规敏感且具备硬件运维能力的团队走自托管,门槛在硬件与运维,而非许可条款。重度编程用户可以评估订阅制,智谱文档显示,GLM Coding Plan套餐下Flash的可用额度是GLM-5.3的3倍。
匿名期还遗留了一个该进采购清单的问题:同一模型,不同入口的隐私条款并不一致。OpenRouter的stealth路由条款写明,提示词与补全由提供商留存但不用于训练;OpenCode入口的文档则宣称零留存。正式命名路由上线后条款如何变化,接入前应逐条确认。
时间表上也要留一段空窗:本次放出的是Flash版权重,GLM-5.3旗舰版权重官方承诺约两周内放出,冲着旗舰能力做自托管规划的团队,需要把这段间隔算进迁移节奏。
回到选型。把Ox Alpha纳入评估的理由是价格与盲测口碑:1/100的输出价、MIT权重、匿名期攒下的无品牌滤镜样本。暂缓全量迁移的理由同样具体:基准可复核性有限,生产验证刚刚开始,促销价9月9日截止。两头权衡,合理的起步不是二选一,而是影子流量:把Ox Alpha接到非关键任务,或与现有模型并行的对照链路上,用自己的负载验证基准表没有覆盖的指标。
这次事件改变的东西很具体:价格锚点被重置,1/100的输出价让长程智能体第一次在预算上跑得起来;一次去品牌盲测留下了干净的能力样本;MIT权重给了合规敏感团队自托管选项。没变的同样清楚:基准仍以厂商自报为主,促销会结束,生产级验证刚刚开始。匿名发布解决了能力可信度的一小半,剩下的一大半,要靠开发者自己的负载去回答。而权重与API都已就位,按标价算,一轮高强度验证的花费不过百美元量级。对选型来说,这可能是这次事件里最实际的变化。
读完这篇,可以继续看
Claude 记忆在哪里查看和编辑?Memory 设置、Topics 管理与敏感话题避坑指南
想逐条查看、编辑或删除 Claude 记住的内容,入口在 Settings > Memory:记忆按 Topics 主题分组,可单条改删,单处修改对之后所有对话生效。这篇指南同时讲清健康、信仰等敏感话题默认不存储的规则与手动开启方法,以及为什么换了 Projects 或 Cowork 它就“不记得”,适合 claude.ai 个人用户与 Team/Enterprise 成员,文末附避坑清单。
Claude Cowork 怎么用?启动入口、云端/本地模式与三端切换入门教程
Claude Cowork 怎么用?这篇入门教程面向刚接触的付费用户,按上手顺序讲清三件事:从哪里启动(消息框、网页、桌面、手机、Chrome 侧边栏),云端和本地模式怎么选(附对比表),同一个任务如何在网页、桌面、手机之间接力,并写明 Projects 的使用边界和免费计划不可用等前提。
行业深度
继续查看这个主题下的更多分析和案例。