OmniTools 6月25日消息,NVIDIA推出开源库NeMo AutoModel,基于Transformers v5构建,集成Expert Parallelism、DeepEP融合all-to-all调度及TransformerEngine内核。在MoE模型微调任务中,相比原生Transformers v5,训练吞吐量提升3.4–3.7倍,GPU内存占用降低29–32%,仅需修改一行import语句。
该方案在16节点、128张H100 GPU上成功完成Nemotron 3 Ultra 550B A55B模型的全参数微调——原生v5因内存不足无法运行,而AutoModel通过EP=64专家并行实现可行训练。
单节点场景下,30B规模MoE模型(如Qwen3-30B-A3B)亦验证出可量化的性能优势。