在线咨询
专属客服在线解答,提供专业解决方案
工单支持
专业技术支持团队,随时响应服务需求

Physical AI 为什么离不开 RTC?机器人背后的实时通信技术

这两年看具身智能相关的报道和展会,一个很直观的感受是:机器人的”身体”正在变得越来越聪明。会走路、会抓取、能听懂指令、能给出自然的语音回应,这些能力几乎每隔几个月就会被刷新一次上限。但如果仔细看这些演示背后的技术架构,会发现一个经常被忽略的部分——支撑这些能力落地的,往往不是机器人本体单打独斗,而是它和云端、和手机、和操作它的人之间,有一条稳定、低延迟、双向的通信链路在持续工作。

这条链路平时不太会被单独拿出来讨论,因为它不像视觉识别或者运动控制那样直观、那样容易演示。但它一旦不稳定,前面所有的感知、决策、语音交互能力都会打折扣,甚至直接失效。这篇想聊清楚一件事:Physical AI 为什么绕不开实时通信,这套通信具体要满足什么条件,声网又是怎么给出方案的。


一. 机器人为什么天生离不开”通信”这件事

一个常见的误解是,把机器人当成一个自给自足的闭环系统,传感器采集数据,本体上的芯片做决策,电机执行动作,整个过程好像不需要外部参与。但Physical AI 底层技术逻辑,把这套系统分成感知层、决策层、执行层和通信层四个部分,且通信层是”最容易被忽视的关键基础设施”。这篇文章要展开的,正是这一层。

服务机器人、巡检机器人在工作时,需要把摄像头画面实时传回云端或者操作人员的手机,让人能远程看到现场情况;不少机器人的决策环节依赖云端更大算力的模型推理,本体采集完数据要传上去、算完结果要传回来才能驱动动作。这其实也是 VLA 模型在实际落地时会遇到的通信挑战之一:推理结果算出来了,怎么”送达”机器人本体去驱动动作,本身就是一层需要单独解决的问题;陪伴机器人、家用助理机器人要和人进行语音对话,这个对话本身就是一来一回的实时交互;而巡逻、安防这类场景下,机器人遇到本地判断不了的情况,还需要人远程接管,直接下发控制指令。

这几类需求看起来分属不同场景,机器人的”大脑”和”感官”,不一定都长在它自己身上,很多时候需要靠通信把云端、设备、人这三方连起来,共同完成一次完整的感知-决策-执行闭环。

声网的 AI 机器人解决方案覆盖的品类相当宽:服务机器人、巡检机器人、陪伴机器人、具身机器人、各类机器宠物,还有无人机、无人车、工业机器人、智能车机——这些设备形态差异很大,但对”实时把信息传出去、把指令传进来”这件事的依赖是共通的。


二. 这不是普通的”发个请求”就能解决的

很多开发者接触这类需求的第一反应,是用常规的 HTTP API 来做。设备定时向服务器发个请求,问一下有没有新指令,或者把一段录好的数据传上去。这套模式对很多互联网应用来说够用,但放到机器人身上,问题很快就会暴露出来。

机器人需要传输的是持续的音视频流和控制指令,不是偶尔查询一次的结构化数据;这条链路要求双向、低延迟、还得在网络不稳定的时候尽量不中断。这种持续在线、双向实时、且不能容忍明显延迟的通信需求,和”问一次答一次”的请求-响应模式,从底层设计逻辑上就是两回事,也是为什么机器人产品从一开始就要考虑用 RTC 这类实时互动技术,而不是简单套用一套常规的网络接口方案。


三. 拆开看,机器人对实时通信到底有哪些具体要求

要看得清。机器人身上可能不止一颗摄像头,云端或者操作端也常常需要同时监看多台设备、多个角度,这就要求画面清晰、多路并发还不能互相拖累——分辨率和流畅度但凡打折扣,远程判断现场情况这件事的价值就会大打折扣。

要听得懂、说得自然。陪伴类、服务类机器人越来越强调语音交互,用户对这类设备的期待已经不是”喊一句等三秒”,而是接近人和人对话的节奏——能自然接话,还要能被随时打断,不能你一开口它还在自顾自地说。

要控得住。远程操控这件事,光是把指令”发出去”是不够的,必须确保指令能可靠”送达”并且被设备真正执行。这个要求听起来简单,但在网络环境不理想的情况下,恰恰是最容易出问题的一环——指令发出去了,设备到底收没收到、执行没执行,用户是要有明确反馈的。

要扛得住。机器人不一定总是在写字楼里那种网络良好的环境下工作,室外巡检、跨区域部署,都会遇到信号不好、丢包率高的情况。这条通信链路能不能在弱网下不断连、断了以后能不能快速恢复,直接决定了机器人的可用范围能不能真正走出实验室。


四. 声网在这四件事上给出的方案

看得清这件事,靠的是视频编解码和多路并发能力。声网的 AI 机器人解决方案支持多路高清视频上行,满足多角度、多设备同时监看的需求,并且支持 4K 超高清画质;在同等画质下,通过自研视频编码技术,码率最高可以节省 70% 以上。这意味着在带宽有限的情况下,画面依然能保持清晰,不用靠牺牲分辨率去换流畅度。

听得懂、说得自然这件事,对应的是对话式 AI 引擎的低延迟交互能力。官方给出的数据是对话延迟低至 650 毫秒,打断响应低至 340 毫秒,同时能屏蔽 95% 的环境人声和噪声干扰。这几个数字合在一起,对应的其实是同一种体验——用户说话,机器人接得上;用户打断,机器人能立刻停下来听,而不是自顾自把话说完。

控得住这件事,声网走的是把”看”和”控”拆成两条独立通道的思路。画面和语音走实时音视频(RTC)通道,而控制指令走的是另一条专门的实时信令(RTM)通道——这条通道给出的指标是全球端到端延迟低于 100 毫秒(99 分位值),同区域往返延迟可以做到 50 毫秒以内,即便在 70% 丢包的弱网环境下,也能保证消息的送达率,配合超过 99.99% 的运行时间 SLA。把”控制指令”单独用一条更严格的通道来保障,而不是和视频流混在一起传,是因为用户或许能容忍画面卡顿一下,但很难接受”发了停止指令,设备却没反应”。

扛得住这件事,是前面三点能够成立的底层前提。声网的方案在 80% 音视频丢包的网络环境下依然能进行稳定流畅的通话,即便出现 3 到 5 秒的短暂断网,恢复后也能自如响应;全网覆盖超过 200 个国家和地区,全球延时中位数低于 76 毫秒,全网可用时间超过 99.99%。这几项指标合起来的意思是,不管机器人被部署在网络条件多复杂的环境里,前面提到的”看得清、说得自然、控得住”,都不会因为一次网络波动就全部失效。


五. 写在最后

Physical AI 这两年被讨论最多的,往往是模型能力的进步。机器人能理解多复杂的指令、能完成多精细的动作。但真正让这些能力从实验室走到用户手里的,还有一层不太起眼、却缺一不可的基础设施,就是这篇聊的实时通信。看得清、说得自然、控得住、扛得住网络波动,这四件事任何一件掉链子,前面的智能程度都会被打折扣。

如果你正在做服务机器人、巡检机器人、陪伴机器人、机器狗,或者其他需要把画面、语音、控制指令实时传出去的具身智能硬件,欢迎了解声网的 AI 机器人解决方案。

在声网,连接无限可能

想进一步了解「对话式 AI 与 实时互动」?欢迎注册,开启探索之旅。

本博客为技术交流与平台行业信息分享平台,内容仅供交流参考,文章内容不代表本公司立场和观点,亦不构成任何出版或销售行为。