OmniTools 8月12日消息,Liquid AI 于 8 月 12 日发布 LFM2.5-VL-3B 视觉语言模型。该模型参数量约 31 亿,采用 SigLIP2 400M NaFlex 视觉编码器与 LFM2.5-2.6B 文本骨干网络组合,预训练数据达 34 万亿 token,视觉数据量为前代的 4 倍,并扩展词表至 128K 以更好支持非拉丁文字。
模型在屏幕/UI 理解、自然语言目标定位(grounding)、多图推理及函数调用能力四方面实现提升,支持文档、图表、界面元素等数字内容识别。基准测试显示,其在 MMBench、DocVQA、ScreenSpot-v2 等任务中表现领先同规模模型,且在非推理模式下响应直接、延迟低。
该模型已适配 llama.cpp、MLX、vLLM 等主流推理框架,在 M5 Max 上可达 228 token/s,在 Ryzen AI Max+ 395 上为 116 token/s,甚至可在 Galaxy S26 Ultra 上实现 20 token/s 的纯端侧运行;GPU 高并发场景下输出吞吐达约 11K token/s。模型已在 Hugging Face 平台开源。