在线咨询
专属客服在线解答,提供专业解决方案
工单支持
专业技术支持团队,随时响应服务需求

VLA 和 World Model 有什么区别?

VLA 和 World Model 这两个词经常一起出现在具身智能相关的讨论里,容易让人以为是同一件事的两种叫法,或者是新旧版本的关系——毕竟都属于机器人”大脑”里的技术,都直接决定了机器人聪不聪明。但它们解决的其实是两个完全不同的问题,是并行存在的两条技术路线。

之前分别写过《视觉语言动作模型(VLA)是什么》和《世界模型是什么》两篇,各自把技术细节讲得比较透。这篇专门把两者放在一起,说清楚为什么会有这两条路线,它们各自的局限是怎么从各自的设计里”长”出来的,以及现在已经有哪些真实项目在琢磨怎么把两者拼在一起。


一. 两个词为什么总被放在一起讨论

根源在于它们都属于 Physical AI 架构里的”决策层”,都直接介入机器人”该怎么做”这个环节,很多技术报道也习惯把两者并列提及,久而久之容易让人觉得它们是竞争关系,或者是同一套系统的不同叫法。实际上,VLA 和 World Model 各自只负责其中一半的工作,另一半恰恰是对方在做——一个说”我现在要做什么”,一个说”这么做了会怎样”,两句话合在一起,才是一次完整的决策。


二. 先看各自具体是怎么做的,而不是抽象定义

VLA:一次映射,直接给动作

VLA 这条路线上,比较有代表性的几个模型走的其实是不太一样的具体做法。Physical Intelligence 的 π0 用的是”流匹配”(flow matching)方法,把动作生成建模成一个连续的去噪过程,而不是一步到位输出一个固定动作;Google 的 RT-2 走的是另一条路,把一个已经在互联网图文数据上训练好的视觉语言模型,直接用机器人的轨迹数据做微调,让它把”动作”也当成一种可以像文字一样输出的”语言”;伯克利系的 OpenVLA 则是想把这套能力做成开源、可复现的版本,方便更多团队在此基础上做二次开发。三者的共同点是:无论中间具体怎么实现,最终都是”感知信息 + 指令进去,一套动作指令出来”,这个过程里没有一步是专门用来”预判这套动作做下去会怎样”的。

World Model:先预测,再给动作建议

World Model 这条路线上,英伟达把这套预测能力具体落到机器人动作层面,做出了一个叫 WAM(World Action Model)的方向,技术上用的是”联合视频-动作扩散变换器”,预训练阶段吃的是大规模视频数据,既有互联网上的视频,也有人类第一视角拍摄的日常操作画面,训练目标是让模型同时学会预测”接下来画面会变成什么样”和”对应该输出什么动作”,这两件事被绑在一起训练,而不是先学会看视频、再单独学一套动作映射。这么做换来一个挺实用的副产品:模型不再需要为每一款新机器人都重新采集成千上万条专属示教数据,官方给出的说法是,只用 10 到 20 分钟人类第一视角视频,就能让模型适配一个新的机器人本体。这套方案已经在 Franka Panda 机械臂配 Robotiq 夹爪的 DROID 平台上跑通,部署到英伟达自己的 Jetson Thor 边缘计算平台上,能做到 15Hz 的实时控制频率。


三. 两条路线的局限,其实是从各自的训练方式里”长”出来的,不是凑数凑出来的

VLA的局限,出在”监督赤字”

VLA 之所以不具备预判后果的能力,根子在训练时用的监督信号上。学术界对这个问题有过一个比较具体的诊断,出自一项叫 DriveVLA-W0 的研究:VLA 训练时,输入的视觉画面是高维、稠密的信息。一帧图像里包含了成千上万个像素点携带的细节;但用来监督训练的动作标签,往往只是几个数字,比如方向盘转多少度、油门踩多深。这种”输入信息量远大于监督信号量”的不匹配,会让模型很容易走捷径——记住”看到这种画面、大概率该这么转方向盘”这种表面关联,而不是真正学会背后的物理规律。数据量越堆越大,这种捷径式的记忆反而会让模型的提升边际递减,行话叫”监督赤字”。DriveVLA-W0 的解法是,在正常训练动作输出的同时,额外给模型加了一项”预测下一帧画面会是什么样”的训练任务——这项任务本身不需要额外的人工标注,因为下一帧画面就是现成的、不需要标注的”标准答案”。多学这一项任务之后,模型被逼着去理解画面背后真正的物理规律,而不只是记表面关联。效果是碰撞率降低了 20.4%,而且推理延迟反而只有原方案的 63.1%——多学一层预测能力,不但没拖慢速度,判断还更准了,这也从侧面说明,VLA 原来的”捷径式学习”确实浪费了不少计算量在没用的地方。

World Model的局限,出在”误差累积”

World Model 这边的局限,同样是训练方式的直接后果,只是方向相反。它靠的是在内部一步步推演未来状态,问题在于每往后推一步,误差就会跟着传递并放大一点——预测第一秒还比较准,但要连续预测好几秒之后的场景,累积误差会让预演结果慢慢失真,这也是为什么英伟达那组”omni checkpoint 把 RoboLab 基准成功率从 28.1% 提升到 36.8%”的数据里,提升是实打实的,但离”完全可靠”还有明显差距——World Model 目前给出的更像是一份”大概率靠谱的参考答案”,不是一份能百分百信任的判决书。同时,因为要在内部同时模拟好几种可能的动作方案再挑一个,这个过程对算力的消耗,天然比 VLA 那种”一次映射、直接出结果”的方式要重得多。


四. 两层配合,已经有具体项目做出来了,不是纸上谈兵

用一个具体场景走一遍会更直观:让机器人在一个没见过的房间里,把一张椅子挪到墙角。VLA 先给出一套动作:伸手推椅子、往哪个方向用力。如果系统里还接了 World Model,它会在椅子真正被推动之前,先在内部预演几种推法:这个方向推下去会不会撞到旁边的桌子、椅子腿会不会卡进地毯的褶皱里。预演的结果会反馈回决策环节,挑出最稳妥的一种方案,再交给 VLA 真正去执行。

如果没有 World Model,VLA 系统给什么指令做什么动作,没有能力判断后果;没有 VLA,World Model 再会预测,也没有一套机制把”最优方案”变成机械臂真正的电机指令,两者缺一不可。

这不只是一个假设性的例子,已经有团队把这套配合具体做了出来。

WorldVLA:把两者统一进同一个token空间

阿里巴巴达摩院联合湖畔实验室、浙江大学在 2025 年 10 月发布的 WorldVLA,做法是用三套独立的分词器,把图像(基于 VQ-GAN)、文本(BPE 分词)、动作(离散化成 256 个区间)统一转换成同一种 token,放进一个自回归框架里一起训练——这样一来,”预测下一帧画面”和”生成下一步动作”在模型内部走的是同一套机制,不再是两个各自独立、事后拼接的模块。为了避免动作生成时因为误差累积导致后面的动作越来越离谱,团队还专门设计了一套针对动作序列的注意力掩码。

LingBot-VA:用”闭环推演”解决误差累积

蚂蚁灵波开源的 LingBot-VA 解决的则正好是前面提过的那个”长时序预测容易累积误差”的问题——它的核心是一套”闭环推演”机制,不是让模型闷头预测到底,而是在任务执行过程中持续接收真实环境的反馈,边走边修正,把误差控制在可控范围内。这套机制在 RoboTwin 2.0 基准(50个双臂操作任务)上,Easy 设置成功率做到 92.0%,Hard 设置 91.1%;在 LIBERO 基准上是 98.5%;面对真实世界里没见过的高难度任务,只用 50 条示范数据就能完成适配,整体成功率比业界基线 π0.5 高出超过 20 个百分点,论文也已经被机器人顶会 RSS 2026 接收。


五. 未来:会不会走向融合

WorldVLA 和 LingBot-VA 这两个案例其实已经给出了同一个信号:谁都没有把 VLA 或 World Model 单独拿出来抛弃,而是在琢磨怎么把两者拼进同一套训练流程、甚至同一个模型里,而不是各自训练好、事后简单拼接。哪种拼法最后会成为主流,现在下结论还为时尚早——但可以确定的是,机器人的”大脑”越来越不会是单一模型说了算,而是”做什么”和”会怎样”这两种能力,分层配合的结果。


参考资料

NVIDIA 官网:What Is a World Action Model (WAM)?

NVIDIA 开发者博客:Beyond VLAs: How World Action Models Reshape Robot Manipulation

NVIDIA 开发者博客:Pretrained to Imagine, Fine-Tuned to Act: The Rise of World-Action Models

搜狐:阿里新研究:统一了VLA和世界模型(WorldVLA)

量子位:蚂蚁灵波LingBot-VA论文被机器人顶会RSS 2026接收

网易:DriveVLA-W0用世界模型放大自动驾驶Data Scaling Law

在声网,连接无限可能

想进一步了解「对话式 AI 与 实时互动」?欢迎注册,开启探索之旅。

本博客为技术交流与平台行业信息分享平台,内容仅供交流参考,文章内容不代表本公司立场和观点,亦不构成任何出版或销售行为。