OmniTools 7月15日消息,Hugging Face于2026年7月15日正式推出Real World VoiceEQ——一个面向真实场景的语音AI质量评估基准。该基准聚焦语音交互中被传统指标(如词错误率WER)忽略的人类感知维度,包括语调、情绪、说话人身份识别及背景环境理解等。
Real World VoiceEQ基于超100万条人工评分构建,涵盖78.5万条TTS和4.8万条STS评分,评估对象包括40余款主流开源与闭源语音模型,覆盖ASR、TTS、S2S及语音理解等15个以上能力维度、60余项指标。
研究发现:当前语音AI在“说”方面进步显著,但在“听”(尤其是对犹豫、语气、情感等副语言信息的理解)上仍存在明显短板;不同模型在各类能力上呈现高度专业化,尚无单一模型在全部8类能力组中均进入前五;人类评估在主观性任务(如角色适配性、身份一致性)中仍不可替代,现有语音语言模型(SLM)自动评估结果与人工评分一致性有限。