OmniTools 8月10日消息,NVIDIA 发布开源端到端全双工语音对话模型 NemotronLabs VoiceChat 11B,支持流式语音理解与生成一体化处理,实测轮换延迟为 448 毫秒。 该模型是首个支持对话中实时工具调用的开源全双工语音模型,通过独立输出通道及预置“保持”话术,避免工具调用期间出现冷场。 模型权重与推理容器已公开,仅限研究用途;运行需单张 80 GB 显存 GPU,目前未提供托管 API 服务。