在线咨询
专属客服在线解答,提供专业解决方案
工单支持
专业技术支持团队,随时响应服务需求

世界模型(World Model)是什么?为什么 Physical AI 离不开它?

你看到一个杯子放在桌子边缘,不用真的把它推下去,就已经知道它掉到地上大概率会摔碎。这种”不用真的做,脑子里先过一遍”的能力,人几乎意识不到自己在用,但恰恰是行动之前最关键的一步,它让你在做一件事之前,就大致知道会发生什么。

现在的AI已经能写代码、能生成一段以假乱真的视频,但让同一套技术去控制机器人叠一件衣服、或者绕开一个没见过的障碍物,出错率还是高得多。因为它对”物理世界会怎么运作”这件事,没有真正的内部理解,这正是”世界模型”想要补上的部分。这个词这两年在具身智能的讨论里出现得越来越频繁,但经常被和别的概念混在一起说。这篇想把它讲清楚:它到底是什么、怎么运作、为什么 Physical AI 绕不开它。


一. 世界模型到底是什么

世界模型是一套内部预测机制:给定当前的状态和一个即将执行的动作,它能预测这个动作做下去之后,世界大概会变成什么样子。它不是三维地图,也不是场景重建,地图和重建记录的是”现在长什么样”,世界模型要回答的是”接下来会怎样”。

这个说法不是最近才冒出来的新词。2018年,研究者 David Ha 和 Jürgen Schmidhuber 发表了一篇题目直接叫《World Models》的论文,把”让智能体在自己’脑子里’学一个简化版的环境模型,再拿这个内部模型去训练决策”这套思路第一次系统化地提了出来——这也是”世界模型”这个词在AI语境下的直接起点。

它和现在几个高频出现的概念也不是一回事。LLM、VLM 处理的是语言和图像里的”模式”,见过足够多”杯子掉在地上会碎”的文字描述和画面,模型确实能说出、也能画出类似的内容,但这不代表它理解重力、惯性、碰撞这些物理规律具体是怎么共同起作用的;VLA 负责把”看到的东西”转成”该做的动作”,本身并不负责预判这个动作做下去后果会怎样。世界模型专门补的就是这一层——预判。拆开看,它的核心能力其实就三件事:理解当前状态、预测状态会怎么变化、模拟不同动作分别会导向什么结果。


二. 世界模型是怎么工作的

第一步是感知当前的环境状态。摄像头、雷达、力觉传感器这些采集来的原始信息,先要被”读进来”。

第二步,也是关键的一步,是在内部建立一套环境的”表示”:这不是把每一个像素都原样记下来,而是抽象出对决策真正有用的信息。这里有个物体、它大概多重、它和旁边的东西是什么空间关系、如果被碰到大概会往哪个方向移动。

有了这套内部表示,第三步才是真正的”预测”:如果执行动作A、动作B、动作C,几秒钟之后世界会分别变成什么样子。

最后一步,是把这几种预测结果放在一起比较,挑出后果最理想、风险最小的那个动作,交给执行层去真正做。整个过程可以理解成”先在脑子里跑几遍模拟,再动手”,而不是”看到什么立刻就做”。


三. 为什么 Physical AI 离不开世界模型

有两个绕不开的约束,指向了同一个答案。第一个约束是,现实世界不允许无限试错。机器人在物理世界里每失败一次,比如机械臂磕坏一次、货架撞倒一次,赔进去的是时间和硬件成本。

第二个约束是,语言知识不等于物理理解。一个模型可以说出”杯子从桌上掉下去会摔碎”,甚至能生成一段杯子摔碎的视频,但这不代表它理解重力怎么让物体加速下坠、惯性怎么决定它落地的角度、材质怎么决定它是碎成两半还是碎成一地——这些具体的物理因果关系,光靠”见过很多相关的文字和画面”是学不到位的。

这两条约束共同指向同一个解法:在真正让机器人动手之前,先在”脑子里”用极低的代价,把可能发生的后果预演一遍。这正是世界模型要做的事,也是为什么 Physical AI 系统里,光有”看到什么、做什么动作”这一层能力还不够。

没有这一层预判,机器人本质上还是一个”反应机器”,一步走错,后面很难挽回。


四. 世界模型和 VLA 是什么关系

两者的分工很清楚:VLA 负责”看到什么、该做什么动作”,是感知到动作的直接映射;世界模型负责”这个动作做下去,后果会怎样”,是动作到后果的预测。它们不是互相竞争、谁取代谁的关系,更像是配合关系。

拿一个具体场景走一遍会更直观:让机器人抓取一个易碎的玻璃杯,VLA 看到杯子的位置和形状,给出”伸手过去、以多大力度抓取”这样一套动作序列;如果系统里还接了一个世界模型,它会在动作真正执行前,先在内部预演”用这个力度抓下去,杯子会不会被捏碎”——如果预演结果显示风险偏高,这个信号就会反馈回去,让抓取力度做出调整。有没有这一步”预演”,直接决定了机器人是”看到什么就直接冲上去做”,还是”做之前先想一下”。这套分工,此前在《视觉语言动作模型(VLA)是什么》里已经做过介绍,世界模型被形容成”VLA的想象力”,说的正是这层关系。


五. 世界模型在 Physical AI 里能用在哪些场景

人形机器人要在复杂、非结构化的环境里做动作规划,比如在摆满家具的房间里挪动,需要不断预判”下一步这样走会不会撞到东西”。自动驾驶需要预判其他车辆、行人接下来可能的动作,提前做出反应,而不是等对方已经变道了才被动应对——DeepMind 的 Genie 系列世界模型,就已经被 Waymo 用来生成自动驾驶模拟场景,帮助测试各种真实路测里很难遇到、但一旦遇到就很危险的边界情况。无人机在没有预先建图的陌生空域里,需要实时判断往哪条路径飞更安全。家庭和服务机器人面对的环境远比工厂流水线更不可预测,小孩突然跑过、宠物突然冲出来,都需要机器人临场预判后果再决定怎么动作。工业机器人在做高精度操作(比如精密装配)之前,也需要先预判力度和路径会不会造成损伤,把试错成本降下来。


六. 世界模型目前的难点在哪

真实物理数据不足,是最基础的一个瓶颈。尤其是带力觉、触觉反馈的数据,采集成本很高,不像文本和图片那样能大规模从互联网上直接抓取。

长时序预测容易累积误差。预测下一步还比较准,但要预测再往后十步、二十步会发生什么,误差会像滚雪球一样越滚越大,”预演”很容易跑偏。

物理规律本身很难被精确建模。液体流动、材质形变、多个物体同时碰撞这类精细的物理现象,目前的模型普遍还原得不够准确。

实时推理的算力开销也不小。因为要在内部并行模拟好几种可能的动作结果再做选择,这个开销比单纯”看到什么就直接输出一个动作”的推理要大得多。

Sim-to-Real 的鸿沟依然存在。在虚拟环境里学会的预测能力,搬到真实世界时,会遇到训练时没见过的噪声、摩擦力、光线变化,预测准确率往往会打折扣,这也是 VLA 模型落地时同样会遇到的一个老问题。


七. 未来:Physical AI 会不会拥有真正的”内部世界”

一个比较明确的大方向,是从”反应式”机器人走向”预测式”机器人——不是看到什么就立刻做什么,而是先在内部过一遍、判断过后果,再真正动手。除了 NVIDIA 的 Cosmos、DeepMind 的 Genie 这类专门的世界模型平台,业内也在讨论把世界模型和 VLA、甚至更长期的记忆能力结合在一起,让机器人不仅能预判”接下来几秒会怎样”,还能记住”之前类似的情况是怎么处理的”。像 Yann LeCun 提出的 JEPA(联合嵌入预测架构)这类研究方向,探索的也是类似的问题——怎么让模型在一个抽象的表征空间里做预测,而不是逐像素地”脑补”画面。

不过这些探索目前大多还停留在研究和头部厂商的前沿阶段,谁的技术路线会真正跑通、成为行业标准,现在下结论还为时尚早。世界模型正在从一个学术概念,慢慢变成 Physical AI 绕不开的一块拼图,但这块拼图本身,也还在被不断修改和打磨。


延伸阅读:

什么是 Physical AI? 底层技术逻辑、应用场景和商业价值

视觉语言动作模型(VLA)是什么?具身智能的”大脑”如何运转

参考资料:

David Ha, Jürgen Schmidhuber. World Models. arXiv:1803.10122(2018)

NVIDIA 官网:Cosmos: World Foundation Models Powering Physical AI

Wikipedia:Genie (world model)

Meta AI 官网:V-JEPA / I-JEPA 相关介绍(Yann LeCun JEPA 研究方向)

在声网,连接无限可能

想进一步了解「对话式 AI 与 实时互动」?欢迎注册,开启探索之旅。

本博客为技术交流与平台行业信息分享平台,内容仅供交流参考,文章内容不代表本公司立场和观点,亦不构成任何出版或销售行为。