返回行业动态

NVIDIA Vera Rubin NVL72实测:AI智能体推理能效达GB300 NVL72的30倍,Token成本降低35倍

2026/08/24 15:05
查看原文

OmniTools 8月24日消息,NVIDIA 官方消息,8月24日公布的实测数据显示,Vera Rubin NVL72系统在AI智能体(agentic AI)工作负载下,每兆瓦功耗的推理吞吐量最高可达GB300 NVL72的30倍,单百万token成本较后者降低35倍。

该数据基于SemiAnalysis AgentX真实编码轨迹工作负载测得,完整保留上下文累积、工具调用与子智能体调度等典型智能体行为。测试覆盖Kimi K3、MiniMax M3、GLM5.3、Qwen3.5及DeepSeek V4 Pro等多款主流模型。结果显示,Vera Rubin NVL72在DeepSeek V4 Pro模型上实现最高30倍能效提升,且当前数据尚未包含Vera CPU在工具调用场景的性能贡献。

Vera Rubin NVL72通过第五代Tensor Core、第三代Transformer引擎、NVFP4 4-bit量化、分布式KV缓存、KV感知路由、专家并行及第六代NVLink互联等软硬协同技术,显著提升长上下文推理效率。其NVL72 scale-up架构专为高带宽、低延迟智能体任务优化,支持在同等兆瓦预算内部署最多额外40%的GPU。

相关背景

想继续了解,可以看这些

从这条动态出发,继续查看相关分析、产品详情和同主题更新。

最新工具

刚收录的 AI 工具,适合顺手发现可用产品。

查看全部