返回行业动态

开源项目 AirLLM 实现单张 4GB GPU 运行 70B 大模型

2026/10/11 11:23
查看原文

OmniTools 10月11日消息,开源推理优化项目 AirLLM 宣布大幅降低大语言模型显存占用,支持在单张仅 4GB 显存的 GPU 上运行 70B 参数规模模型,全程无需量化、蒸馏或剪枝。该项目目前已适配 Kimi K3(2.8T)、Qwen3.8 Flash Next(125B)及 DeepSeek V3(671B)等超大参数模型,对应显存需求分别控制在 4GB 以内、约 6GB 和约 12GB。此外,AirLLM 新增低显存训练支持,可在 RTX 3060 Ti(6GB 显存)等设备上完成 125B MoE 模型的微调。项目完整代码、快速启动配置及训练指南已托管于 GitHub。

相关背景

想继续了解,可以看这些

从这条动态出发,继续查看相关分析、产品详情和同主题更新。

最新工具

刚收录的 AI 工具,适合顺手发现可用产品。

查看全部