返回行业动态

SGLang 集成 DSpark 推测解码:置信度驱动的可变长度验证

2026/07/06 17:21
查看原文

OmniTools 7月7日消息,SGLang 团队宣布将 DSpark 推测解码算法集成至开源推理引擎。该算法采用半自回归块起草器一次生成多个 token,并通过置信度头与顺序温度缩放(STS)为每个请求动态分配可变验证长度,以有效降低高负载下的无效验证开销。

目前 SGLang 已支持密集模型(如 Qwen3)与稀疏模型(如 DeepSeek-V4),借助全 CUDA 图技术处理不规则的每请求验证长度。系统提供三种验证模式:static(全长验证)、compact(默认生产路径)和 cap-accept(基于接受上限的测量模式)。

本次更新还引入了零开销调度、基于离线成本表的在线调度器以及融合 Triton 核等底层优化。在 H200 硬件上使用 DeepSeek-V4-Flash 的测试表明,DSpark 在全并发范围内相较 MTP 及非推测基线,实现了更优的吞吐量与延迟权衡。

相关背景

想继续了解,可以看这些

从这条动态出发,继续查看相关分析、产品详情和同主题更新。

最新工具

刚收录的 AI 工具,适合顺手发现可用产品。

查看全部