OmniTools 8月22日消息,蚂蚁 Ling Infra 团队与 RadixArk SGLang 团队联合优化 Ling-3.0-flash 混合线性注意力 MoE 模型,在 4 块 Blackwell GPU 上实现批处理规模为 1 时的解码性能提升。
单请求解码速度从 288 tok/s 提升至 606 tok/s,平均每 token 处理时间(TPOT)由 3.33 ms 降至 1.53 ms。
该优化聚焦于推理延迟降低,适用于低延迟场景下的大模型服务部署。
OmniTools 8月22日消息,蚂蚁 Ling Infra 团队与 RadixArk SGLang 团队联合优化 Ling-3.0-flash 混合线性注意力 MoE 模型,在 4 块 Blackwell GPU 上实现批处理规模为 1 时的解码性能提升。
单请求解码速度从 288 tok/s 提升至 606 tok/s,平均每 token 处理时间(TPOT)由 3.33 ms 降至 1.53 ms。
该优化聚焦于推理延迟降低,适用于低延迟场景下的大模型服务部署。
从这条动态出发,继续查看相关分析、产品详情和同主题更新。
刚收录的 AI 工具,适合顺手发现可用产品。