返回行业动态

SGLang-JAX 支持 Ling-2.6-1T 在 TPU v7x 高效推理,MoE 核优化降低预填充延迟 53%

2026/06/17 18:07
查看原文

OmniTools 6月18日消息,LMSYS 官方博客 6月17日消息,SGLang-JAX 现已支持 inclusionAI 发布的 Ling-2.6-1T 模型(1T 稀疏 MoE 架构,63B 激活参数,256 路由专家,采用 top-8 路由加共享专家机制)在 TPU v7x 硬件上进行高效推理。

研究团队开发了 Fused MoE V2 Pallas 核,融合 scatter、专家 FFN 与 gather 操作,将 MoE 数据移动隐藏于计算过程中。该优化使 MoE 预填充延迟从 5.16ms 降至 2.42ms(降幅 53%),解码核延迟从 0.249ms 降至 0.211ms(降幅约 15%)。

仅替换 MoE 核即提升预填充吞吐量 24.8%,解码吞吐量提升 18.5%–35.3%。在 SGLang 解码基准测试中,16 块 TPU v7x 芯片的输出吞吐量达 16 块 H200 GPU 的 1.29 倍(mc=128)至 1.77 倍(mc=512)。完整支持还包括混合 KV/循环内存池、GLA 线性注意力及单控制器数据并行。

相关背景

想继续了解,可以看这些

从这条动态出发,继续查看相关分析、产品详情和同主题更新。

最新工具

刚收录的 AI 工具,适合顺手发现可用产品。

查看全部