OmniTools 8月25日消息,IBM 近日在 Hugging Face 平台正式发布 Granite Speech 5.0 系列语音识别模型,包括两款 470M 参数的英文 ASR 模型:granite-speech-5.0-470m-turboctc(Apache 2.0 许可)与 granite-speech-5.0-470m-turboctc-nc(CC-BY-NC-SA-4.0 许可)。二者均采用纯编码器架构,支持流式识别,实测在 NVIDIA H200 GPU 上批量推理吞吐量达 12,600 RTFx,即每秒可转录超 3.5 小时语音。
据非官方测试结果,两模型在 OpenASR 公开测试集上的加权词错误率(WER)分别为 5.00% 与 4.85%,在 FFASR 远场语音识别榜单中分列第 9 与第 5 名,且为当前榜单中速度最快的两个模型。新模型通过三级 2 倍时序下采样与定制化分词器(BPE 或 SentencePiece),将输出速率降至 12.5 token/s,显著降低内存占用并提升边缘设备适配性。
该系列模型训练数据涵盖 MLS、LibriSpeech、CommonVoice-17 等自然语音数据及合成语音数据,其中非商用版额外使用 GigaSpeech 与 SPGI Speech 等数据。模型已原生支持 Hugging Face Transformers 库,开发者可通过标准 API 快速调用。