OmniTools 7月1日消息,Hugging Face 与 Cerebras 宣布合作,将 Gemma 4 31B 视觉语言模型集成至实时语音 AI 系统中。该方案采用开源、模块化的级联式语音到语音(Speech-to-Speech)架构,核心环节涵盖语音识别(NVIDIA Parakeet)、大语言模型推理(Gemma 4 运行于 Cerebras 硬件)及语音合成(阿里巴巴 Qwen3TTS)。
该架构显著降低了端到端延迟,尤其优化了 P95 尾部延迟表现,使 AI 对话响应更接近人类自然交互节奏。Cerebras 提供的高性能推理能力有效解决了语言模型响应速度的瓶颈。
目前,该语音 AI 流水线已部署于 Reachy Mini 机器人,全球运行数量超 9000 台。相关演示与开源代码已在 Hugging Face Spaces 及 GitHub 公开。