OmniTools 7月23日消息,阿里通义千问正式发布文本转语音模型Qwen Audio 3.0 TTS,提供Flash(面向实时交互)和Plus(面向高质量生成)两个版本。 新模型支持细粒度内联标签控制(如【whisper】、【angry】)、自然语言风格描述、16种语言输出,并可单次生成最长3分钟的语音内容。 据Artificial Analysis最新TTS排行榜数据,Qwen Audio 3.0 TTS当前位列第一。