OmniTools 8月24日消息,英伟达(NVIDIA)宣布 Groq 3 LPX 推理加速平台已进入全面量产阶段。作为 Vera Rubin NVL72 机架级系统的关键扩展,该平台专为代理式 AI(agentic AI)工作负载优化,旨在提供低延迟、高吞吐的 token 生成能力。
在 Artificial Analysis 基准测试中,Groq 3 LPX 运行 Gemma 4 31B 开源代理模型时,针对 10 万 token 长上下文场景实现每秒 3400 个输出 token,性能达最接近竞品平台的 4 倍。该平台采用低延迟推理架构,与 Vera Rubin GPU 协同工作:Rubin GPU 负责大规模上下文处理,LPX 则专注于延迟敏感的逐 token 解码任务,共同提升端到端推理效率。单机架部署可集成 256 颗 LP30 加速器,通过芯片直连实现确定性推理性能。
多家行业伙伴已宣布采用该方案:AI 云服务商 Nebius 成为首家采用 Groq 3 LPX 的客户;CoreWeave 在生产环境中部署 Spectrum-X Multiplane 网络以连接 Vera Rubin 机架;SpaceXAI 计划利用 Vera Rubin CPU 构建下一代代理 AI 架构,覆盖地面数据中心与轨道卫星场景。