在线咨询
专属客服在线解答,提供专业解决方案
工单支持
专业技术支持团队,随时响应服务需求

Teleoperation 是什么?为什么机器人依然需要人类远程接管

人形机器人的宣传视频里,”全自主”是最常被拿来强调的词之一,但真实情况是,不少机器人遇到复杂或陌生任务时,背后依然有人通过 VR 头显远程接管。机器人搞不定的任务,由远程操作员实时介入替它完成,这件事在行业里比外界想象的更普遍。

这篇想讲清楚的是:Teleoperation(远程操控)到底是什么、为什么机器人越来越聪明,这个角色却没有被淘汰,以及让它稳定工作,背后要解决哪些技术问题。


一. Teleoperation 到底是什么,和”遥控”有什么不同

Teleoperation 不是小时候玩具车那种”摁个遥控器”的遥控。遥控车按一个按钮对应一个固定动作,Teleoperation 要做的事复杂得多,把一个人的动作、视角、临场判断,实时”搬”到远端那台机器人身上,让机器人替它完成只有人在场才做得出的判断。 宇树科技今年发布的全身遥操作平台是个具体例子。操作员戴上设备,自己的动作实时映射到机器人身上,机器人同步跟着做;操作员眼前看到的,是机器人摄像头拍到的第一视角画面,边看边调整动作。这套能力背后,对应的是宇树今年申请的一项专利,叫”沉浸式机器人遥操作方法和系统”。

这里要先分清两种容易被混着说的 Teleoperation。一种是用来”教”机器人的,人远程操控机器人做一遍任务,这个过程里产生的动作数据被记录下来,拿去训练机器人自己的决策能力,本质上是一种数据采集手段。另一种是用来”兜底”的,机器人已经在实际干活了,碰上自己处理不了的情况,直接由人实时接管替它做完,不涉及训练,图的是当下把事情办成。这篇要讲的,主要是第二种。


二. “遥操作的重要性正在下降”?这话只说对了一半

这两年具身智能圈子里确实流传着一种说法,随着模型能力变强,遥操作会逐渐被淘汰。这个判断不是空穴来风。英伟达具身智能负责人 Jim Fan 今年在一次公开演讲中提到过一个具体案例:他们内部一个叫 EgoScale 的项目,预训练用了 2.1 万小时人类第一视角视频,而专门用来做动作微调的高精度遥操数据只有 50 小时,加上 4 小时遥操数据,合计占总数据量不到 0.1%,却依然训出了一条持续提升的性能曲线。这个结果说明,靠人工一条条采集遥操作示范数据来”教”机器人这件事,确实可以被更高效的数据策略大幅替代。

但这说的是前面提到的第一种 Teleoperation,用来采集训练数据的那种。真正用来实时兜底的第二种 Teleoperation,情况完全不同。这是两件不同的事,混在一起讨论,很容易让人误以为 Teleoperation 整体都要退场。

机器人公司 1X 旗下的家用机器人 NEO,是个能说明这件事的具体例子。NEO 遇到不会的复杂任务时,会请求远程操作员介入。官方演示里,NEO 从冰箱里拿一瓶水要花掉将近一分钟,把餐具放进洗碗机动作僵硬迟缓,这些环节目前都离不开人工远程接管。

更关键的一点是,机器人正在被推向更多家庭、工厂、户外这类此前没训练过的真实场景。场景越陌生,自主能力覆盖不到的边界情况就越多,不会越来越少。这正是为什么”实时远程接管”这个角色,不会随着模型变强而消失,反而会随着机器人铺得更广而变得更重要。


三. 为什么这件事在技术上比看起来难得多

画面要传得够快够清楚,操作员才能”看准”

远程操作员做判断,完全依赖眼前那块屏幕上的画面。画面延迟高、分辨率不够、稍微一卡顿,操作员的判断就会跟不上机器人实际所处的真实状态——NEO 拿一瓶水要花一分钟,相当一部分原因就是操作员隔着画面做远程判断,动作天然会更谨慎、更迟缓;而特斯拉那次摔倒事件里,如果操作员的画面反馈和机器人实际姿态之间存在哪怕零点几秒的错位,一个本该顺畅的收尾动作,就可能变成一次摔倒。

指令要能送达并执行,不是发出去就算完

“看”和”控”其实是两件不同的事,对可靠性的要求也不一样。用户或许能容忍画面卡顿一下,但很难接受操作员已经做出判断、按下了指令,机器人却没反应——尤其是在宇树提到的核电站、高温钢铁厂这类场景里,一条该送达的指令延迟或者丢失,可能直接关系到安全,而不只是体验差一点。

弱网环境下,这两件事还得同时扛住

真实的部署环境很少是实验室那种理想网络。核电站、钢铁厂这类场所网络条件往往更复杂,家庭、户外场景的网络也谈不上稳定——要同时保证操作员”看得清”、机器人”收得到指令”,对底层通信能力的要求,比一次普通的视频通话要高得多。


四. 声网平行操控方案,怎么分别应对这三件事

看得清:多路高清、画质不打折

声网的机器人解决方案支持多路高清视频上行,满足多角度、多设备同时监看的需求,支持 4K 超高清画质;在同等画质下,通过自研视频编码技术,码率最高可以节省 70% 以上——这意味着操作员那块屏幕上的画面,不用靠牺牲清晰度去换流畅度。

控得住:看和控分开走,指令走更严格的通道

画面走的是实时音视频(RTC)通道,而远程操作指令走的是另一条独立的实时信令(RTM)通道——这条通道给出的指标是全球端到端延迟低于 100 毫秒(99 分位值),同区域往返延迟可以做到 50 毫秒以内,即便在 70% 丢包的弱网环境下,也能保证消息的送达率,配合超过 99.99% 的运行时间 SLA。把控制指令单独用一条更严格的通道来保障,而不是和视频流混在一起传,道理很直接:操作员可以忍受画面卡顿一下,但很难接受”按下了接管指令,机器人却没反应”。

扛得住:弱网下也不崩

声网的方案在 80% 音视频丢包的网络环境下依然能进行稳定流畅的通话,全网覆盖超过 200 个国家和地区,全球延时中位数低于 76 毫秒,全网可用时间超过 99.99%。不管机器人被部署在核电站、钢铁厂这类复杂网络环境,还是普通家庭的 Wi-Fi 下,操作员”看得清、控得住”这两件事,都不会因为一次网络波动就全部失效。


五. 写在最后

Teleoperation 不是机器人不够聪明的遮羞布,而是机器人被真正推向复杂、没见过的真实世界时,一道合理、甚至必要的安全网。随着自主能力覆盖的场景越来越广,这道安全网不会消失,只会变得更重要,而这道安全网稳不稳,归根结底是个通信问题:画面传得够不够快够不够清楚,指令送不送得到、执行不执行得了,弱网环境下这两件事还扛不扛得住。

如果你正在做人形机器人、服务机器人,或者其他需要远程接管能力的具身智能硬件,欢迎了解声网的平行操控解决方案。

在声网,连接无限可能

想进一步了解「对话式 AI 与 实时互动」?欢迎注册,开启探索之旅。

本博客为技术交流与平台行业信息分享平台,内容仅供交流参考,文章内容不代表本公司立场和观点,亦不构成任何出版或销售行为。