返回行业动态

NVIDIA NeMo AutoModel:一行代码加速Transformer MoE模型微调

2026/06/24 16:30
查看原文

OmniTools 6月25日消息,NVIDIA推出开源库NeMo AutoModel,基于Transformers v5构建,集成Expert Parallelism、DeepEP融合all-to-all调度及TransformerEngine内核。在MoE模型微调任务中,相比原生Transformers v5,训练吞吐量提升3.4–3.7倍,GPU内存占用降低29–32%,仅需修改一行import语句。

该方案在16节点、128张H100 GPU上成功完成Nemotron 3 Ultra 550B A55B模型的全参数微调——原生v5因内存不足无法运行,而AutoModel通过EP=64专家并行实现可行训练。

单节点场景下,30B规模MoE模型(如Qwen3-30B-A3B)亦验证出可量化的性能优势。

相关背景

想继续了解,可以看这些

从这条动态出发,继续查看相关分析、产品详情和同主题更新。

最新工具

刚收录的 AI 工具,适合顺手发现可用产品。

查看全部