返回行业动态

蚂蚁与 RadixArk 联合优化 Ling-3.0-flash:4 块 Blackwell GPU 上单请求解码延迟降低 54%

2026/08/21 18:15
查看原文

OmniTools 8月22日消息,蚂蚁 Ling Infra 团队与 RadixArk SGLang 团队联合优化 Ling-3.0-flash 混合线性注意力 MoE 模型,在 4 块 Blackwell GPU 上实现批处理规模为 1 时的解码性能提升。

单请求解码速度从 288 tok/s 提升至 606 tok/s,平均每 token 处理时间(TPOT)由 3.33 ms 降至 1.53 ms。

该优化聚焦于推理延迟降低,适用于低延迟场景下的大模型服务部署。

相关背景

想继续了解,可以看这些

从这条动态出发,继续查看相关分析、产品详情和同主题更新。

最新工具

刚收录的 AI 工具,适合顺手发现可用产品。

查看全部