返回行业动态

Liquid AI 发布 LFM2.5-VL-3B 视觉语言模型,支持端侧高效运行

2026/08/12 14:02
查看原文

OmniTools 8月12日消息,Liquid AI 于 8 月 12 日发布 LFM2.5-VL-3B 视觉语言模型。该模型参数量约 31 亿,采用 SigLIP2 400M NaFlex 视觉编码器与 LFM2.5-2.6B 文本骨干网络组合,预训练数据达 34 万亿 token,视觉数据量为前代的 4 倍,并扩展词表至 128K 以更好支持非拉丁文字。

模型在屏幕/UI 理解、自然语言目标定位(grounding)、多图推理及函数调用能力四方面实现提升,支持文档、图表、界面元素等数字内容识别。基准测试显示,其在 MMBench、DocVQA、ScreenSpot-v2 等任务中表现领先同规模模型,且在非推理模式下响应直接、延迟低。

该模型已适配 llama.cpp、MLX、vLLM 等主流推理框架,在 M5 Max 上可达 228 token/s,在 Ryzen AI Max+ 395 上为 116 token/s,甚至可在 Galaxy S26 Ultra 上实现 20 token/s 的纯端侧运行;GPU 高并发场景下输出吞吐达约 11K token/s。模型已在 Hugging Face 平台开源。

相关背景

想继续了解,可以看这些

从这条动态出发,继续查看相关分析、产品详情和同主题更新。

最新工具

刚收录的 AI 工具,适合顺手发现可用产品。

查看全部