返回行业动态

IBM 发布 Granite Speech 5.0 TurboCTC 语音识别模型,实时转录速度超 12600 RTFx

2026/08/25 15:02
查看原文

OmniTools 8月25日消息,IBM 近日在 Hugging Face 平台正式发布 Granite Speech 5.0 系列语音识别模型,包括两款 470M 参数的英文 ASR 模型:granite-speech-5.0-470m-turboctc(Apache 2.0 许可)与 granite-speech-5.0-470m-turboctc-nc(CC-BY-NC-SA-4.0 许可)。二者均采用纯编码器架构,支持流式识别,实测在 NVIDIA H200 GPU 上批量推理吞吐量达 12,600 RTFx,即每秒可转录超 3.5 小时语音。

据非官方测试结果,两模型在 OpenASR 公开测试集上的加权词错误率(WER)分别为 5.00% 与 4.85%,在 FFASR 远场语音识别榜单中分列第 9 与第 5 名,且为当前榜单中速度最快的两个模型。新模型通过三级 2 倍时序下采样与定制化分词器(BPE 或 SentencePiece),将输出速率降至 12.5 token/s,显著降低内存占用并提升边缘设备适配性。

该系列模型训练数据涵盖 MLS、LibriSpeech、CommonVoice-17 等自然语音数据及合成语音数据,其中非商用版额外使用 GigaSpeech 与 SPGI Speech 等数据。模型已原生支持 Hugging Face Transformers 库,开发者可通过标准 API 快速调用。

相关背景

想继续了解,可以看这些

从这条动态出发,继续查看相关分析、产品详情和同主题更新。

最新工具

刚收录的 AI 工具,适合顺手发现可用产品。

查看全部