2026年10月5日,亚马逊在Bedrock上线了Amazon Nova 2.5 Sonic,内容是推理能力、指令遵循、工具调用准确性的提升,延迟也有所降低,公告原文没有给出任何百分比或毫秒数字,第三…
2026年10月5日,亚马逊在Bedrock上线了Amazon Nova 2.5 Sonic,内容是推理能力、指令遵循、工具调用准确性的提升,延迟也有所降低,公告原文没有给出任何百分比或毫秒数字,第三…
从微软一次性发布的三款语音模型,看流式架构怎么把延迟压进了百毫秒区间 2026年10月1日,微软一次性放出了三款语音模型:流式语音识别MAI-Transcribe-2-Streaming,两档语音合成…
Meta Connect 2026上,扎克伯格把Muse叫作”个人超级智能”,同一场发布会里落地了两条完全不同形态的产品:一个是让AI长出脸和身体、能实时对话的Muse Rea…
搭一套能跑起来的语音AI Agent,识别、合成、打断处理、多路对话这几层,到底有哪些是开发者可以直接拿现成开源项目用的。 一. 语音识别(ASR/STT):给系统一双耳朵 whisper.cpp O…
过去两年,Voice AI 行业出现了一个非常明显的变化:开源语音模型越来越多,而且越来越强。 从早期 Whisper 带动 ASR 开源,到今天 Qwen、Microsoft 等大厂不断推出新的 A…
过去两年,语音模型的数量进入爆发期。Whisper、Qwen3-ASR、Qwen3-TTS 等开源模型不断降低部署门槛;OpenAI、Google等厂商持续推出实时语音、语音识别与语音合成 API。开…
8 月 18 日,NVIDIA AI Blueprints 的 Nemotron Voice Agent 发布 v2.1.0。release notes 很短,新增 Chatterbox TTS Mu…
8 月 18 日,k2-fsa 发布 sherpa-onnx v1.13.6,新增 VAD 加 ASR Flutter 示例,统一 Flutter 和 Dart CLI 初始化 API,修 Andro…
2026 年 8 月 3 日,NVIDIA 在 Hugging Face 上开放了 NemotronLabs VoiceChat 11B 的权重——这是目前第一个同时支持全双工对话和实时工具调用的开源…
科技媒体TestingCatalog近日披露,微软正在封闭测试一款名为MAI Realtime的原生实时语音模型。从目前曝光的MAI Playground测试界面来看,MAI Realtime可能是微…
本博客为技术交流与平台行业信息分享平台,内容仅供交流参考,文章内容不代表本公司立场和观点,亦不构成任何出版或销售行为。