在线咨询
专属客服在线解答,提供专业解决方案
工单支持
专业技术支持团队,随时响应服务需求

博客

实时互动 (RTE) 学习、实践与技术洞察

对话式 AI 进入智能硬件,实时音视频技术底座要先解决什么?

智能硬件接入 AI 实时语音之后,产品面临的挑战和以前完全不一样了。以前是唤醒词加固定指令,交互是单向的、结构化的,设备只要把用户说的词匹配上就算完成任务。现在,用户在客厅里追问一句上下文、在机器人回…

NVIDIA Nemotron Voice Agent v2.1.0 更新,多语种声音和轮次判断成了重点

8 月 18 日,NVIDIA AI Blueprints 的 Nemotron Voice Agent 发布 v2.1.0。release notes 很短,新增 Chatterbox TTS Mu…

端侧离线语音识别框架 sherpa-onnx 更新,Flutter 语音链路更好接了

8 月 18 日,k2-fsa 发布 sherpa-onnx v1.13.6,新增 VAD 加 ASR Flutter 示例,统一 Flutter 和 Dart CLI 初始化 API,修 Andro…

智能硬件 Demo 怎么快速跑通:从开通项目到第一路音视频通话

智能硬件团队第一次接音视频,控制台项目开好了,App ID 拿到了,后台也能生成 RTC Token,设备端日志里有入会成功,App 页面上有接听按钮和通话状态。真到联调时,点了呼叫没有声音,或者 A…

ESP32 低资源设备如何做语音通话:内存、采样率与网络参数优化

ESP32 是乐鑫科技推出的一款低成本、低功耗 Wi-Fi + 蓝牙 SoC,广泛用于智能家居、可穿戴设备、工业控制和 IoT 终端。儿童手表、智能门铃、AI 玩具、宠物摄像头、语音遥控器,很多消费类…

游戏语音质量怎么评估:开黑语音的接通率、卡顿率、延迟和弱网恢复

游戏语音出现问题,排查起来比想象中麻烦。通话横跨业务服务、RTC 频道、网络、音频设备和游戏进程,任何一段出问题,都会给玩家带来不佳体验。偶发问题尤其难定位,复现不了就只能让玩家重新登录,下次照样出现…

RTOS是什么?实时操作系统的特点、应用场景及音视频开发要点

RTOS 是 Real-Time Operating System 的缩写,中文通常叫实时操作系统。很多人第一次看到这个词,会下意识把“实时”理解成“运行速度更快”。这个理解不太准确。RTOS 真正在…

免费语音活动检测工具盘点:开源VAD工具推荐与评测对比

更新时间:2026年8月12日 一、引言 什么是 VAD(语音活动检测)? VAD(Voice Activity Detection) 是一种用于判别音频片段中是否存在人声的技术。它将连续音频切分为“…

游戏语音卡顿怎么排查?从玩家反馈到 RTC 指标的质量监控方法

游戏语音出问题,排查链路很长,接通率、音频卡顿率、端到端延迟、丢包恢复、断线重连,每个维度对应不同的排查方向,也对应不同的数据来源。有些能从 SDK 回调拿到,有些要游戏业务侧自己记录。本文逐一拆解这…

智能手表音视频通话怎么做?Android 与 RTOS 的 RTC SDK 选型指南

智能手表加入音视频通话,选型很容易从一句“SDK支持Android或RTOS吗”开始。到了样机阶段,问题会迅速变多:摄像头能否稳定采集,外放回声怎么处理,蜂窝网络切换后能否恢复,通话十几分钟会不会发热…

Agora 在Robotics Fair 2026举办实时语音 AI 实践工作坊

Robotics Fair 2026 期间,Agora 携手 Seeed Studio 举办实时语音 AI 实践工作坊,围绕语音AI 与 Physical AI 的融合应用开展现场实践。参与者基于 A…

NVIDIA VoiceChat 11B:首个开源全双工语音工具调用模型

2026 年 8 月 3 日,NVIDIA 在 Hugging Face 上开放了 NemotronLabs VoiceChat 11B 的权重——这是目前第一个同时支持全双工对话和实时工具调用的开源…

儿童手表语音对讲怎么做:短语音、实时对讲与家庭群聊方案

家长最怕孩子出事打不通,孩子最怕在学校被铃声吓到,产品团队最怕上线后弱网掉线率高、续航撑不到放学。儿童手表语音功能的设计,从这几件事出发比从功能列表出发要靠谱得多。 短语音、实时对讲、家庭群聊,底层链…

宠物智能喂食器如何接入实时视频与语音对讲?

宠物智能喂食器加上摄像头和语音之后,产品性质就变了。它不再只是一台定时出粮的机器,而是一个让用户在远处确认宠物状态、随时互动的看护设备。这篇文章从链路设计的角度拆开讲:摄像头、语音对讲、喂食控制、云回…

什么是AI外呼?AI外呼的价值、应用场景,与人工外呼的区别

AI 外呼是用一套能听、能理解、能开口回应的系统去打电话,而不是让人工坐席一个个拨号。自动拨号本身不是新技术,二十年前的预测式外呼系统就能批量拨打号码。变化发生在电话接通之后:机器能不能听懂对方在说什…

AI 玩具语音方案怎么选:一体化平台、自建链路与 BYOM 的差异

AI 玩具语音方案,不建议只按“哪家模型回答更好”来选。玩具面对的是孩子、家长和真实家庭环境,语音链路要能听清、反应快、能打断、内容安全、成本可控,还要适配有限的芯片、电池、麦克风和扬声器。 市场上常…

微软MAI Realtime曝光:全双工语音、17种语言与低延迟打断

科技媒体TestingCatalog近日披露,微软正在封闭测试一款名为MAI Realtime的原生实时语音模型。从目前曝光的MAI Playground测试界面来看,MAI Realtime可能是微…

只激活120亿参数,Inkling-Small为何能反超自家9750亿参数模型?

7月30日,Thinking Machines Lab正式发布开放权重模型Inkling-Small。虽然名字里带着“Small”,但Inkling-Small依然拥有2760亿总参数。它真正变“小”…

智能硬件语音交互架构是什么:麦克风、RTC、ASR、LLM、TTS 全链路解析

智能硬件做 AI 语音交互,会先讨论大模型:用哪家 LLM、参数多大、回答聪不聪明。真正到设备上,体验往往容易被更基础的问题拦住:麦克风收不清、外放有回声、用户打断不了、网络一抖就断句、TTS 播放慢…

IoT 设备做音视频通话,用 WebRTC、自研还是 RTC SDK?

IoT 设备要做音视频通话,技术方案通常绕不开三个选项:直接用 WebRTC,自己做一套实时音视频链路,或者接入成熟 RTC SDK。选型看起来像技术问题,最后经常变成产品节奏、硬件规格、云端成本和运…

智能硬件为什么需要实时音视频:从远程看护到 AI 语音交互的产品形态拆解

很多智能硬件团队第一次讨论“要不要接实时音视频”,往往是从一个具体功能开始的:老人手表能不能一键呼叫子女,儿童手表能不能视频通话,宠物摄像头能不能双向语音,机器人能不能远程操控,AI 玩具能不能自然对…