OmniTools 7月20日消息,小红书与北京大学联合提出并开源UltraEP,该方案首次将基于精确路由信息的实时负载均衡技术引入大规模MoE(Mixture of Experts)模型的训练与推理生产系统。其核心是在每个microbatch及每一网络层动态复制热点专家,实现细粒度负载调控。
实验显示,在Qwen3-235B等大模型上,UltraEP使训练吞吐平均达到理想性能的94.6%,较Megatron-LM提升42%;推理阶段prefill吞吐相较SGLang提升1.56倍。
该项目已开源,聚焦解决MoE架构中因专家分布不均导致的GPU算力浪费问题。