OmniTools 6月18日消息,LMSYS 官方博客 6月17日消息,SGLang-JAX 现已支持 inclusionAI 发布的 Ling-2.6-1T 模型(1T 稀疏 MoE 架构,63B 激活参数,256 路由专家,采用 top-8 路由加共享专家机制)在 TPU v7x 硬件上进行高效推理。
研究团队开发了 Fused MoE V2 Pallas 核,融合 scatter、专家 FFN 与 gather 操作,将 MoE 数据移动隐藏于计算过程中。该优化使 MoE 预填充延迟从 5.16ms 降至 2.42ms(降幅 53%),解码核延迟从 0.249ms 降至 0.211ms(降幅约 15%)。
仅替换 MoE 核即提升预填充吞吐量 24.8%,解码吞吐量提升 18.5%–35.3%。在 SGLang 解码基准测试中,16 块 TPU v7x 芯片的输出吞吐量达 16 块 H200 GPU 的 1.29 倍(mc=128)至 1.77 倍(mc=512)。完整支持还包括混合 KV/循环内存池、GLA 线性注意力及单控制器数据并行。