OmniTools 8月28日消息,Google 正式推出 Gemini 3.5 Transcribe,称其为目前最精准的语音转文本模型。该模型支持实时流式语音转写与预录音频批量处理两种模式。
开发者可通过 Live API 实现低延迟实时转写,也可通过 Interactions API 处理已录制的音频文件。该模型已集成于 Google AI Studio 及 Vertex AI 平台。
Gemini 3.5 Transcribe 是 Gemini 系列在语音理解方向的专项升级,官方暂未披露具体性能指标或支持语言列表。