OmniTools 10月11日消息,开源推理优化项目 AirLLM 宣布大幅降低大语言模型显存占用,支持在单张仅 4GB 显存的 GPU 上运行 70B 参数规模模型,全程无需量化、蒸馏或剪枝。该项目目前已适配 Kimi K3(2.8T)、Qwen3.8 Flash Next(125B)及 DeepSeek V3(671B)等超大参数模型,对应显存需求分别控制在 4GB 以内、约 6GB 和约 12GB。此外,AirLLM 新增低显存训练支持,可在 RTX 3060 Ti(6GB 显存)等设备上完成 125B MoE 模型的微调。项目完整代码、快速启动配置及训练指南已托管于 GitHub。