Meta Connect 2026上,扎克伯格把Muse叫作”个人超级智能”,同一场发布会里落地了两条完全不同形态的产品:一个是让AI长出脸和身体、能实时对话的Muse Realtime Avatar,一个是连摄像头都没有、纯靠语音交互的Ray-Ban Meta Audio眼镜。形态南辕北辙,但两条线要解决的底层问题是同一个:AI和人之间的这场交互,必须是实时的。这件事往下拆,会发现至少有三层完全不同的技术活,Meta这次发布正好把每一层的难度都摆出来了。
一. Meta Connect发布了什么
Muse Realtime Avatar是Meta AI Research新出的一个模型,把原来只能语音对话的Muse Realtime Voice,变成一个有表情、有手势、口型能跟语音对上的可视化AI形象,支持实时视频通话场景。同一场发布会上的Ray-Ban Meta Audio,是Meta第一款不带摄像头的智能眼镜,349美元起,43克,10月13日发货,主打纯音频交互——播音乐、接电话、实时翻译,靠”Hey Muse”这句唤醒词启动。这里要说清楚一件容易搞混的事:能”看懂你眼前的东西并据此回答问题”这个能力,属于同期发布的另一款带摄像头的Ray-Ban Meta Gen 3(449美元),不属于没有摄像头的Audio版本,Audio版本从硬件上就看不见任何东西,这是两款不同定位的产品。
二. Muse Realtime Avatar:这事到底难在哪
Meta自己公布的数据,把”让AI形象实时说话”这件事的技术门槛讲得很具体。要把语音、口型、表情、身体动作同步驱动起来,同时还要做到实时,原本需要一个教师模型跑120次模型调用才能达到的效果,Meta通过自蒸馏和分布匹配蒸馏,训练出一个只需要2次调用就能跑出接近效果的学生模型——这意味着计算量压缩到了原来的六十分之一,不然这套东西根本没法实时跑起来。压缩之后的实际表现是:从用户说完话到收到第一个响应字节,大约870毫秒;画面输出是448×768分辨率、25帧每秒;在NVIDIA GB200这颗专门为这套模型做过协同优化的硬件上,每一步计算耗时20毫秒,能生成8帧、够播放320毫秒的内容。跟两个已经商用的同类系统做人类评估对比,对Runway Characters的偏好度是78%比22%,对HeyGen LiveAvatar是88%比12%,都是明显优势。
即便做到这个程度,Meta自己也承认这套东西目前还处在”early preview”阶段,画面偶尔会出现扭曲和模糊。这句话值得多看一眼:说明把AI形象做到能实时、自然地对话,即便顶着Meta的模型能力和GB200级别的算力堆过去,也还没做到完全成熟。这不是一道靠砸钱就能立刻解决的题。
三. 声网在AI编排这一层,做到了什么程度
实时AI形象:唇形同步做到50毫秒以内
声网的对话式AI引擎搭配Ready Player Me做实时AI虚拟形象唇形同步,走的是这样一条链路:用户说话,声网RTC把音频实时传给对话式AI引擎,引擎内部完成语音识别、大模型推理、语音合成,生成的音频再通过RTC传回客户端;客户端这边用WebAudio对拿到的音频做实时频率分析,把声音特征映射成音素,再用这些音素去驱动3D模型的口型形变。整条链路对”声音到画面”这段延迟的目标是控制在50毫秒以内,画面帧率目标60帧每秒。这个50毫秒和前面Meta的870毫秒不是同一件事,870毫秒是”你说完话到AI开始回应”这段响应延迟,50毫秒是”AI的声音和嘴型对不对得上”这段同步延迟,两者维度不同,不能直接拿来比谁快。
语音交互:打断要自然,说话人要分得清
Ray-Ban Meta Audio这类免持设备真正的交互难点,不在于能不能听懂话,而在于对话过程中能不能打断得自然。声网对话式AI引擎的”优雅打断2.0″,能识别”嗯””啊”这类没有实际语义的语气词,不会把这些当成用户说完话的信号去抢话。多人同时在场的场景,声网用的是声纹识别:4到10秒的语音注册,之后实时比对,基本没有可感知的延迟就能分清楚是谁在说话。
四. 但这些都要先解决一个更基础的问题:怎么把音视频实时送到位
前面说的这些能力,唇形同步也好,打断处理也好,本质上都是”AI编排”这一层的活,负责把语音识别、大模型推理、语音合成、画面渲染这几件事串起来做好。但这一层能不能work,前提是有一条稳定的实时链路,把用户设备上的音视频送到AI那边,再把AI生成的结果送回来。Meta现在演示的Muse Realtime Avatar,是在自己的数据中心、自己的GB200集群上跑,服务的是自己封闭生态里的用户,这条链路相对可控。但凡这套AI形象能力要给一个真实企业客户去用、要服务分布在全球各地的真实用户,音视频就得先跨过运营商网络、跨境链路、公网拥堵这些现实问题,才能到得了AI那一端——而这些问题,跟AI模型本身做得好不好,完全是两回事。
这条链路的稳定性,声网这几年做的是两件事:一是丢包对抗,用FEC前向纠错和ARQ重传搭配着来,轻度丢包靠FEC直接冗余恢复不用等一次网络来回,丢包率明显升高时再靠ARQ针对性重传关键包;二是全球动态路径调度,SD-RTN这张软件定义实时网持续采集全球各节点间的链路质量、带宽和负载数据,动态算出一条延迟最低、最稳定的传输路径,而不是固定走某一条线路。AI编排这一层大家都在卷模型效果、卷响应速度,但音视频能不能先稳定、低延迟地跨越全球网络送到位,是声网这么多年真正积累下来的护城河。
五. 写在最后
Meta连自己都说Muse Realtime Avatar还在”early preview”,会有扭曲模糊的问题,这说明AI编排这层的门槛是真实存在的,声网在唇形同步、打断处理、声纹识别这几件事上也是一步步做出来的,没有捷径。但AI编排层做得再好,音视频送不到用户那儿,一切都无从谈起。声网真正的差异化,不在于比谁的AI形象更逼真,而在于不管是语音交互还是实时AI形象,都能稳定、低延迟地把这段实时体验送到全球任何一个用户面前。如果你的产品正好需要这类实时AI交互能力,可以看看声网的对话式AI引擎。