返回行业动态

AMD发布全开源MoE大模型Instella-MoE,16B参数规模挑战主流开源模型

2026/07/25 03:29
查看原文

OmniTools 7月25日消息,AMD 正式发布全开源混合专家模型(MoE)Instella-MoE,总参数量 160 亿,每 Token 激活 28 亿参数。该模型完全基于 AMD Instinct MI300X 与 MI325X GPU,使用 ROCm 软件栈及 Primus、Miles 等开源框架完成端到端训练。

Instella-MoE 采用 Gated Multi-head Latent Attention(Gated MLA)与 FarSkip-Collective 等架构创新,支持 64K Token 长上下文,并完成预训练、中期训练、长上下文扩展、监督微调(SFT)、直接偏好优化(DPO)及强化学习(RL)全流程。其基础模型 Instella-MoE-16B-A3B 在多项基准测试中平均得分为 76.7 分,性能优于 SmolLM3-3B、OLMo-3-7B 等同规模开源模型。

AMD 同步公开全部模型权重、各阶段检查点、训练配置、数据配比及推理代码,涵盖从预训练到 RL 的完整训练管线,推动开放 AI 模型研究与复现。

相关背景

想继续了解,可以看这些

从这条动态出发,继续查看相关分析、产品详情和同主题更新。

最新工具

刚收录的 AI 工具,适合顺手发现可用产品。

查看全部