返回行业动态

Hugging Face 发布 LFM2.5 系列 DSpark 草稿模型,推理速度最高提升 3.18 倍

2026/08/20 17:17
查看原文

OmniTools 8月21日消息,Hugging Face 发布 LFM2.5 系列三款模型的 DSpark 草稿模型检查点,采用投机解码技术,在不降低输出质量的前提下,GPU 吞吐量最高提升 3.18 倍,端侧推理速度最高提升 2.87 倍。该草稿模型参数量约 300M,可显著优化 LFM2.5-2.6B 模型的函数调用延迟,平均降低达 57%。目前相关模型已开源,并支持 llama.cpp 和 SGLang 推理框架。

相关背景

想继续了解,可以看这些

从这条动态出发,继续查看相关分析、产品详情和同主题更新。

最新工具

刚收录的 AI 工具,适合顺手发现可用产品。

查看全部