在线咨询
专属客服在线解答,提供专业解决方案
工单支持
专业技术支持团队,随时响应服务需求

漫步1024

博客封面6月3
NVIDIA Nemotron Voice Agent v2.1.0 更新,多语种声音和轮次判断成了重点

8 月 18 日,NVIDIA AI Blueprints 的 Nemotron Voice Agent 发布 v2.1.0。release notes 很短,新增 Chatterbox TTS Mu...

2026-08-19

声网博客2026年3月封面12
端侧离线语音识别框架 sherpa-onnx 更新,Flutter 语音链路更好接了

8 月 18 日,k2-fsa 发布 sherpa-onnx v1.13.6,新增 VAD 加 ASR Flutter 示例,统一 Flutter 和 Dart CLI 初始化 API,修 Andro...

2026-08-19

博客封面8月8
NVIDIA VoiceChat 11B:首个开源全双工语音工具调用模型

2026 年 8 月 3 日,NVIDIA 在 Hugging Face 上开放了 NemotronLabs VoiceChat 11B 的权重——这是目前第一个同时支持全双工对话和实时工具调用的开源...

博客封面8月3
微软MAI Realtime曝光:全双工语音、17种语言与低延迟打断

科技媒体TestingCatalog近日披露,微软正在封闭测试一款名为MAI Realtime的原生实时语音模型。从目前曝光的MAI Playground测试界面来看,MAI Realtime可能是微...

2026-08-04

博客封面8月2
只激活120亿参数,Inkling-Small为何能反超自家9750亿参数模型?

7月30日,Thinking Machines Lab正式发布开放权重模型Inkling-Small。虽然名字里带着“Small”,但Inkling-Small依然拥有2760亿总参数。它真正变“小”...

博客封面7月11
9.36M 参数跑出 6.28 倍实时:小型端侧 TTS 对实时互动意味着什么?

在大模型语音能力快速升级的这几年,TTS(文本转语音)系统经常被更大的参数规模、更丰富的音色、更复杂的情绪控制和更强的云端推理能力定义。但放到实时互动场景里,TTS 很快会遇到更具体的问题,比如低端设...

博客封面7月9
从“能说话”到“会表达”:Qwen-Audio-3.0-TTS 对实时互动的启发

7 月 14 日,Qwen Cloud 发布了 qwen-audio-3.0-tts-plus 和 qwen-audio-3.0-tts-flash。Qwen-Audio-TTS 增强了多语言和中文方...

博客封面7月6
OpenAI 发布全双工语音模型 GPT-Live 与 GPT-Live-1 mini

2026 年 7 月 8 日,OpenAI 发布 GPT-Live。这是新一代语音模型家族,即日起接管 ChatGPT Voice。首发两个版本:GPT-Live-1 和 GPT-Live-1 min...

1 2 3 9