OmniTools 8月21日消息,Hugging Face 发布 LFM2.5 系列三款模型的 DSpark 草稿模型检查点,采用投机解码技术,在不降低输出质量的前提下,GPU 吞吐量最高提升 3.18 倍,端侧推理速度最高提升 2.87 倍。该草稿模型参数量约 300M,可显著优化 LFM2.5 2.6B 模型的函数调用延迟,平均降低达 57%。目前相关模型已开源,并支持 llama.cpp 和 SGLang 推理框架。