返回行业动态

Hugging Face 升级 vLLM 推理后端,Transformers 模型现可实现原生级推理速度

2026/07/08 15:29
查看原文

OmniTools 7月8日消息,Hugging Face 官方博客7月8日消息,Hugging Face 宣布 transformers 库的 vLLM 推理后端完成重大升级,现已在多项基准测试中达到甚至超越 vLLM 原生模型实现的吞吐量。

本次升级覆盖 Qwen3 系列三种典型架构:4B 密集模型(单卡)、32B 密集模型(张量并行)及 235B FP8 MoE 模型(数据+专家并行),均在 8×H100 节点上验证达标。用户仅需添加 --model-impl transformers 参数即可启用,无需修改模型代码或调整现有部署配置。

技术层面,新后端基于 torch.fx 对模型计算图进行静态分析,并结合 AST 源码重写,动态融合关键算子(如 MergedColumnParallelLinear、QKVParallelLinear 及专家并行相关内核),同时保持模型对 torch.compile 和 CUDA Graphs 的兼容性。目前线性注意力模型暂不支持,但官方表示将尽快完善。

相关背景

想继续了解,可以看这些

从这条动态出发,继续查看相关分析、产品详情和同主题更新。

最新工具

刚收录的 AI 工具,适合顺手发现可用产品。

查看全部