OmniTools 8月27日消息,Google DeepMind 正式发布 Gemini 3.5 Transcribe 语音转文本模型,专为实时语音交互场景设计,提供流式与非流式两种 API 接口。
据 Artificial Analysis 评测,该模型在流式模式下平均词错率为 4.0%,非流式模式下为 2.6%。模型支持超 85 种语言,具备自定义词汇能力,并可识别最多三位说话人。
Gemini 3.5 Transcribe 已上线 Google DeepMind 官方博客,面向开发者开放技术细节与接入方式。