新闻中心

  • Home
  • 探讨世界模型的本质与其发展路径

探讨世界模型的本质与其发展路径

2026-09-11 9617

在2026年,"世界模型"成为人工智能领域内一个备受争议的概念。这个词涵盖了多种应用,包括能够连续生成逼真视频的模型、随时响应用户操作的数字环境、潜在空间中预测未来状态的系统,以及直接控制机器人动作的策略。尽管这些模型都涉及到信息处理,但它们的能力和应用范围却有所不同。比如,某些生成的视频虽然画质精美,但可能违反物理规律;而某些机器人虽然可以执行抓取动作,但只在特定的实验室环境中表现良好。通过单纯的演示很难确定一个系统究竟理解了多少关于视觉、物理结构、或者行动与结果之间的关联。

这种概念的模糊性使得技术评估变得复杂。不同的团队在比较画质、几何精度、预测能力和任务成功率时,可能实际上在讨论不同的问题。因此,世界模型的研究开始聚焦于一个基本问题:模型需要具备哪些能力,才能从生成内容迈向理解和改造世界的阶段?

李飞飞及其团队将世界模型按照不同功能进行了分类,划分为渲染器、模拟器和规划器,分别负责生成像素、定义世界状态和执行动作。而LeCun则强调在抽象潜空间中学习可预测的世界结构,重点是让模型能够保留促进理解、推理和规划有用的信息。

清华大学的朱军则提供了另一种视角。他在去年12月Motus发布时,首次提出"通用世界模型"的构想,并在今年3月将其定义为连接数字世界与物理世界的基础。他和他的团队在论文《General World Models from First-Principles》中进一步细化这一框架,确立了核心能力并绘制出五级进化的路线图。该论文总结通用世界模型的核心能力为理解、想象和行动。模型需要通过历史观测形成对当前情况的判断,推演不同选择可能导致的未来,然后采取行动,并通过新观测来修正自身。

在这个框架下,视频生成、实时交互、潜空间预测和机器人控制可以被视为能力进阶的不同阶段。关于世界模型距离通用智能还有多远,也可被具体化为不同的问题:它是否能够维持一个连贯的世界?能否预测干预所带来的后果?能否通过真实反馈不断学习?能够逐步形成目标并组织更复杂的行动吗?

理解世界模型的第一性原理,不妨回想一下学习骑自行车的过程。初学时,身体会变得不稳,看到车把向一侧偏离,重心下沉时,身体会自觉调整方向,随着不断练习,大脑逐渐学会预判某个动作可能导致的成果。这正是世界模型的基本内涵。1943年,Kenneth Craik提出人类会在脑海中构建关于现实的“小型模型”,以推演不同行为的后果。强化学习中的POMDP模型进一步描述了这一过程,智能体通过接受局部观察,评估世界状态,采取行动,并根据新观察更新判断。

朱军团队将这一逻辑归纳为通用世界模型的三项核心能力,它们相辅相成,形成一个持续更新的反馈回路:理解是对当前状态的信息整合,想象是推演多个未来可能性,而行动则是基于预测对环境进行干预,并通过新的观察反馈来验证和修正模型。即便是视频生成也并不足以代表整个世界模型,因为视频模型仅能预测下一个画面,而通用世界模型则需要考量“如果我改变某个条件、移动一个物体或施加某个动作,世界将会有什么不同?”这类带有行动条件的预测,恰恰涉及因果关系和反事实的思考。

朱军团队也提出了五级进化的路线,以此描述世界模型的演变过程,从生成世界(L1)到交互世界(L2),再到在世界中行动(L3),最终达到创造自主智能体(L4)与组织世界(L5)。举个例子,一只被推到桌边的玻璃杯可以用来理解这一过程。L1级别的模型生成杯子滑落和碎裂的连贯画面;L2则可以在用户改变视角或推动方向后继续演化;L3模型需要判断杯子是否会掉落,并预测抓取的时机,最终输出能够操作的动作。随着模型不断进化,L4不再仅依赖于人类的指令,而是能够主动观察和补充信息,甚至在失败后主动修正策略;而L5则涉及到多个智能体之间的协作,决定谁来抓杯子、谁来避免障碍,以及谁负责工具的调配。

发表评论