OmniTools 7月8日消息,Hugging Face 官方博客7月8日消息,Hugging Face 宣布 transformers 库的 vLLM 推理后端完成重大升级,现已在多项基准测试中达到甚至超越 vLLM 原生模型实现的吞吐量。
本次升级覆盖 Qwen3 系列三种典型架构:4B 密集模型(单卡)、32B 密集模型(张量并行)及 235B FP8 MoE 模型(数据+专家并行),均在 8×H100 节点上验证达标。用户仅需添加 --model-impl transformers 参数即可启用,无需修改模型代码或调整现有部署配置。
技术层面,新后端基于 torch.fx 对模型计算图进行静态分析,并结合 AST 源码重写,动态融合关键算子(如 MergedColumnParallelLinear、QKVParallelLinear 及专家并行相关内核),同时保持模型对 torch.compile 和 CUDA Graphs 的兼容性。目前线性注意力模型暂不支持,但官方表示将尽快完善。