OmniTools 7月25日消息,AMD 正式发布全开源混合专家模型(MoE)Instella-MoE,总参数量 160 亿,每 Token 激活 28 亿参数。该模型完全基于 AMD Instinct MI300X 与 MI325X GPU,使用 ROCm 软件栈及 Primus、Miles 等开源框架完成端到端训练。
Instella-MoE 采用 Gated Multi-head Latent Attention(Gated MLA)与 FarSkip-Collective 等架构创新,支持 64K Token 长上下文,并完成预训练、中期训练、长上下文扩展、监督微调(SFT)、直接偏好优化(DPO)及强化学习(RL)全流程。其基础模型 Instella-MoE-16B-A3B 在多项基准测试中平均得分为 76.7 分,性能优于 SmolLM3-3B、OLMo-3-7B 等同规模开源模型。
AMD 同步公开全部模型权重、各阶段检查点、训练配置、数据配比及推理代码,涵盖从预训练到 RL 的完整训练管线,推动开放 AI 模型研究与复现。