OmniTools 7月29日消息,Deltafin 项目成功在配备 64 GB 内存的 Apple M1 Max 设备上本地运行 2.8T 参数的 MoE 架构大模型 Kimi K3。当前中位推理速度为 0.0687 token/s(约 14.6 秒/词元)。
完整本地部署需约 1.7 TB 磁盘空间;若采用流式加载模式,磁盘占用可降至 215 GB,但推理速度将延长至 3 分钟以上/词元。
该项目提供 OpenAI 兼容 API 服务器,支持聊天与代码补全功能,官方建议客户端设置小时级超时以适配低速推理场景。