OmniTools 8月21日消息,Liquid AI 于 8 月 20 日发布 LFM2.5 系列模型的 DSpark 加速版本,涵盖 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 三款模型。该方案采用置信度调度的推测解码(DSpark)技术,在不改变输出质量的前提下显著提升推理吞吐量。
测试数据显示,在 H100 GPU 上,LFM2.5-8B-A1B-DSpark 实现最高 3.18 倍速度提升(428→1362 tokens/s);在 M4 Max MacBook Pro 上,LFM2.5-2.6B-DSpark 平均达 2.27 倍加速(61→139 tokens/s),多工具调用场景下平均延迟降低 57%。
DSpark draft 模型已开源,提供 Safetensors 与 GGUF 格式,支持 llama.cpp(含 Metal 后端)和 SGLang,并已集成至对应上游代码库。所有 draft 模型参数量约 300M,与原模型在 greedy 解码下输出完全一致。