搭一套能跑起来的语音AI Agent,识别、合成、打断处理、多路对话这几层,到底有哪些是开发者可以直接拿现成开源项目用的。
一. 语音识别(ASR/STT):给系统一双耳朵
whisper.cpp
OpenAI Whisper的C/C++移植版,零依赖,是Whisper衍生项目里体量最大的一个,53.9k star。支持Metal、CUDA、ROCm、Vulkan多种推理后端,能编译到iOS、Android、WASM上跑,2026年还在持续发版(v1.9.2、v1.9.4)。llama.cpp生态带来的联动效应,让它基本坐稳了端侧、离线语音识别的事实标准这个位置。
faster-whisper
用CTranslate2重新实现的Whisper推理引擎,25k star,MIT协议。同样的模型权重,推理速度比原版快4倍左右,显存占用也更低,是服务端、GPU部署场景的主流选择。2026年多篇对比评测文章(比如拿它和whisper.cpp做性能对比)依然把它当基准,说明这个项目在生产环境里的实际使用率并没有随时间掉下去。
识别这一层还有几个值得知道但没必要单独展开的项目:NVIDIA Parakeet / NeMo(18.5k star,Apache 2.0,Canary-Qwen-2.5B在Open ASR Leaderboard上跑出5.63%的WER,是目前精度天花板级别的选择);Moonshine(10.9k star,MIT开放权重,主打边缘设备超低延迟,Hacker News上有过一轮”比Whisper Large v3还准”的讨论);SenseVoice(阿里FunAudioLLM出品,9.4k star,MIT协议,中/粤/英/日/韩多语言加情感识别一体化,中文场景下热度最高的一个)。
二. 语音合成(TTS):给系统一张嘴
Chatterbox
Resemble AI开源的零样本语音克隆TTS,26.5k star,MIT协议,是这批候选里热度最高的项目。围绕它已经长出了一整个变体家族:Chatterbox-Turbo(350M参数,低延迟,支持`[laugh]`、`[cough]`这类副语言标签)、Multilingual V3(覆盖23种以上语言)、Nano(CPU上能跑到3倍实时速度)。从边缘设备到实时语音Agent,基本各种场景都能找到对应的版本。
F5-TTS
基于Flow Matching的DiT架构零样本语音克隆方案,15.1k star,代码MIT协议,但预训练权重是CC-BY-NC——如果打算商用,要么自己重新训练,要么换一套MIT协议的权重,这一点容易被忽略,用之前务必确认清楚。截至2026年仓库的issue和PR依然在持续合并,是学术界到工程界公认的”高质量克隆”代表作,经常被拿来当其他TTS项目的对比基准。
这一层还有两个值得一提的:Kokoro TTS(8.4k star,Apache 2.0,只有82M参数,Hacker News上一条讨论帖拿到515个赞、98条评论,不少开发者反馈”比一些云端TTS服务听起来还自然”,能在CPU甚至手机端近实时跑起来,缺点是极短的单词或文字合成偶尔会有瑕疵);Orpheus-TTS(Canopy Labs出品,6.3k star,Apache 2.0,用Llama-3B架构直接做TTS,是”LLM原生做语音合成”这条新路线的代表,支持零样本音色克隆和情感引导)。
三. 语音活性检测与说话人分离:容易被漏掉的一环
这两件事经常被当成”顺带处理”的小功能,实际上是实时语音对话能不能打断得自然、能不能分清是谁在说话的基础。Silero VAD(9.9k star,MIT协议)单次推理不到1毫秒,不需要GPU,已经是LiveKit Agents、Pipecat这类框架内置的默认VAD组件,算是事实标准。pyannote-audio(10.4k star,MIT协议)是说话人分离领域的基准工具箱,覆盖VAD、说话人变化检测、重叠语音检测、声纹embedding,2025年发布的新一代开源模型pyannote/speaker-diarization-community-1,说明这个项目还在持续迭代,不是躺在那吃老本。
四. 编排框架:把这几层拼成一个能对话的系统
TEN Framework
节点可以自由组合STT、LLM、工具调用、记忆、视觉这些模块,自带VAD和打断处理扩展,支持RTC和WebSocket两种实时连接方式,扩展模块能用C++、Go、Python开发。11k star,2026年commit数超过2000次,是这批候选里增长最快的新兴项目。它的quick start示例直接用Agora App ID和App Certificate做实时传输通道。
Moshi
Kyutai自研的语音对话模型,10.8k star,明确定位为”full-duplex spoken dialogue framework”,真正的全双工,不是”检测到你说话就暂停”这种模拟出来的伪双工,用Mimi流式神经编解码器实现同时说和听。这条技术路线跟TEN Framework这类”管道式编排”完全不是一回事,是现在少数几个把全双工做到工程可用的开源方案。需要注意的是模型权重协议是CC BY-NC-SA 4.0,同样是非商用限制。本文开头提到的Unmute,就是架在Moshi之上的一层包装,让开发者不用自己处理底层模型细节,直接把任意文本LLM接进去就能用——包装层本身规模不大(1.5k star),但背后这套全双工架构是真材实料。
五. 写在最后
这几个项目搭一搭,一个能跑起来的语音AI Agent demo并不难攒出来。但从”能跑”到”生产可用”之间还有一道工程门槛:全球用户的延迟怎么控制在可接受范围、弱网丢包怎么兜底、并发规模上来之后系统扛不扛得住、多轮对话的状态怎么稳定维护,这些不是换一个开源模型就能解决的问题。如果你的产品正好卡在这一层,可以看看声网的对话式AI引擎。