OmniTools 7月30日消息,Miles 团队在 NVIDIA Blackwell 架构上实现了两种原生低精度强化学习训练方案:端到端 MXFP8 与针对 MoE 专家权重的逐 token NVFP4。实验基于 8 卡 B200 环境,对 Qwen3 30B A3B 模型开展消融测试,结果显示 BF16 与全部五种低精度配置的原始奖励曲线高度重合。MXFP8 与 NVFP4 方案均有效降低了推理耗时。