返回行业动态

通义实验室发布 Qwen-Audio-3.0-TTS 实时语音合成模型

2026/07/20 09:36
查看原文

OmniTools 7月20日消息,通义实验室正式发布 Qwen-Audio-3.0-TTS 实时语音合成模型,包含 Flash 和 Plus 两个版本。其中 Flash 版首包延迟约 300 毫秒;Plus 版在 Artificial Analysis 榜单排名第一,支持 16 种语言及 20 种中文方言。

技术指标方面,Flash 版本平均词错误率/字符错误率(WER/CER)低至 3.87;Plus 版本说话人相似度最高达 82.75。

相关背景

想继续了解,可以看这些

从这条动态出发,继续查看相关分析、产品详情和同主题更新。

最新工具

刚收录的 AI 工具,适合顺手发现可用产品。

查看全部