OmniTools 8月7日消息,独立开发者叶小叔利用面壁智能开源的语音模型 VoxCPM,成功克隆某千万粉丝网红的声音,并构建了 STT → LLM → VoxCPM(TTS)三段式实时对话系统。该方案 TTS 首包延迟低于 1 秒,端到端响应体感为 2 至 3 秒。