OmniTools 8月24日消息,NVIDIA 官方消息,NVIDIA 宣布 Groq 3 LPX 推理加速器已进入全量生产阶段。该芯片作为 Vera Rubin 平台的扩展组件,专为智能体 AI(Agentic AI)设计,聚焦超低延迟、高吞吐量的 token 生成能力。
在 Artificial Analysis 基准测试中,Groq 3 LPX 运行 Gemma 4 31B 开源模型(上下文长度达 10 万 token)时,实现每秒 3400 个输出 token,创下该模型迄今最快记录;相较最近竞品平台,响应速度提升 4 倍。
Nebius 成为首家采用 Groq 3 LPX 的 AI 云服务商,计划将其集成至其生产级推理平台 Nebius Token Factory,面向开发者提供高响应速度的智能体 AI 服务。NVIDIA 表示,该芯片将与 Vera Rubin NVL72 系统协同,支撑前沿大模型训练与高并发推理需求。