OmniTools 6月30日消息,据NVIDIA官方博客披露,其全栈式推理软件栈在Blackwell平台(GB300 NVL72系统)上已实现DeepSeek V4模型单token成本最高降低5倍,部分优化在一个月内即达成。
该效果依托TensorRT-LLM、Dynamo推理框架及SGLang等开源工具协同优化,结合NVFP4精度、多token预测(MTP)、大型专家并行(Large EP)与NVLink互联技术,使Blackwell GPU单卡token吞吐量提升最高达20倍。
Baseten、Cognition、Deep Infra与Together AI等公司已基于该软件栈部署DeepSeek V4等前沿开源模型,其中Baseten通过TensorRT-LLM与定制运行时优化,在推理任务中实现每秒token数提升50%;Together AI则借助TensorRT-LLM加速Cursor实时编程体验的模型上线流程。