返回行业动态

NVIDIA发布开放权重扩散语言模型Nemotron-Labs-TwoTower

2026/07/01 08:43
查看原文

OmniTools 7月1日消息,NVIDIA正式发布开放权重扩散语言模型Nemotron-Labs-TwoTower。该模型基于冻结的自回归骨干Nemotron-3-Nano-30B-A3B,采用双塔架构:上下文塔保持冻结,降噪器塔单独训练,二者通过层对齐交叉注意力与状态播种机制协同工作。

模型在2×H100 GPU上以BF16精度评估,保留98.7%的自回归基线质量,生成吞吐量提升2.42倍(γ=0.8,块大小S=16)。降噪器部分在约2.1T token上训练,骨干网络经25T token预训练;总参数量约60B,每token活跃参数约3B/塔。

Nemotron-Labs-TwoTower支持扩散、模拟自回归及纯自回归三种解码模式。

相关背景

想继续了解,可以看这些

从这条动态出发,继续查看相关分析、产品详情和同主题更新。

最新工具

刚收录的 AI 工具,适合顺手发现可用产品。

查看全部