返回行业动态

NVIDIA推理软件栈将DeepSeek V4模型单token成本降低至原有五分之一

2026/06/30 15:10
查看原文

OmniTools 6月30日消息,据NVIDIA官方博客披露,其全栈式推理软件栈在Blackwell平台(GB300 NVL72系统)上已实现DeepSeek V4模型单token成本最高降低5倍,部分优化在一个月内即达成。

该效果依托TensorRT-LLM、Dynamo推理框架及SGLang等开源工具协同优化,结合NVFP4精度、多token预测(MTP)、大型专家并行(Large EP)与NVLink互联技术,使Blackwell GPU单卡token吞吐量提升最高达20倍。

Baseten、Cognition、Deep Infra与Together AI等公司已基于该软件栈部署DeepSeek V4等前沿开源模型,其中Baseten通过TensorRT-LLM与定制运行时优化,在推理任务中实现每秒token数提升50%;Together AI则借助TensorRT-LLM加速Cursor实时编程体验的模型上线流程。

相关背景

想继续了解,可以看这些

从这条动态出发,继续查看相关分析、产品详情和同主题更新。

最新工具

刚收录的 AI 工具,适合顺手发现可用产品。

查看全部