OmniTools 8月29日消息,Google 正式推出专用于语音转文字的 Gemini 3.5 Transcribe 模型,主打快速、准确且低成本的自动语音识别(ASR)转录能力。
该模型原生支持说话人分离与词级毫秒级时间戳,兼容 85 种以上语言的自动识别及语码转换。用户可通过 custom_vocabulary 参数传入最多 1000 个领域术语,以降低专有名词识别错误率。
Gemini 3.5 Transcribe 提供 Smart Transcription 和 Verbatim 两种转录模式,分别适用于摘要提炼与逐字还原场景。