返回行业动态

Google DeepMind 发布 Gemini 3.5 Transcribe 语音转文本模型

2026/08/26 17:27
查看原文

OmniTools 8月27日消息,Google DeepMind 正式发布 Gemini 3.5 Transcribe 语音转文本模型,专为实时语音交互场景设计,提供流式与非流式两种 API 接口。

据 Artificial Analysis 评测,该模型在流式模式下平均词错率为 4.0%,非流式模式下为 2.6%。模型支持超 85 种语言,具备自定义词汇能力,并可识别最多三位说话人。

Gemini 3.5 Transcribe 已上线 Google DeepMind 官方博客,面向开发者开放技术细节与接入方式。

相关背景

想继续了解,可以看这些

从这条动态出发,继续查看相关分析、产品详情和同主题更新。

最新工具

刚收录的 AI 工具,适合顺手发现可用产品。

查看全部