世界模型是什么?AI开始「脑补」物理世界的底层逻辑

王尘宇 科技百科 3

世界模型是什么?AI开始「脑补」物理世界的底层逻辑-第1张图片-王尘宇

去年看机器人视频还觉得它们笨手笨脚,今年宇树、智元的机器人在工厂里搬箱子、理货架,动作顺了很多。背后除了硬件进步,还靠一类新东西:世界模型。

世界模型简单说,就是让AI在脑子里建一个「虚拟世界」,能根据你给的画面,自己预测下一步会发生什么。比如给它一张桌子和一杯水的照片,它能推演出水杯被碰倒后水往哪流。以前的大模型只会接话茬,现在的世界模型会「脑补画面」。

2026年这块进展很快。谷歌的Genie 3能从一张图生成可玩的游戏场景,Meta的V-JEPA模型学会了不看标签自学物理规律,国内几家机器人公司也把世界模型装进了机器人,让它们能预判物体轨迹再伸手抓取。

对普通人和站长来说,世界模型最直观的落地是两处。一是视频生成,AI现在能生成几秒到几十秒连贯动作的视频,靠的就是对「物体怎么动」的建模;二是具身智能,机器人不再靠人遥控,而是自己规划动作。

它和传统仿真软件不一样。仿真要人手工建模、写物理公式,世界模型是直接从海量视频里学出来的,训练数据里看过一万次杯子掉落,它就「知道」杯子会碎。

短板也明显:生成的世界偶尔不合常理,比如杯子穿过桌面、人影重叠,说明它学的是「看起来像」而不是真物理。商用场景里,厂家一般让它只负责预测局部,关键动作仍靠传统算法兜底。

站长能沾什么光?做AI视频内容、数字人带货的,可以多留意世界模型驱动的生成工具,出片连贯度比一年前强不少。至于要不要追这个概念写文章,我的看法是:看懂原理、盯住落地,比追风口词更实在。

标签: 世界模型 AI科普 具身智能

发布评论 (0条评论)

  • Refresh code

还木有评论哦,快来抢沙发吧~