世界模型(World Model / WAM)¶
世界模型是智能体对环境的内部模拟器:它学习“现在是什么状态”“采取一个动作后会发生什么”“未来可能得到什么结果”,再用这些预测来规划、决策和学习。
一句话理解¶
如果 VLA 关注:
世界模型关注的是:
更形式化地说,世界模型学习:
\[
p_\theta(s_{t+1}, o_{t+1}, r_t \mid s_t, a_t)
\]
其中 \(s_t\) 是内部状态,\(o_t\) 是观测,\(a_t\) 是动作,\(r_t\) 是奖励或任务反馈。智能体可以在真实世界行动前,先在模型里“想象”很多种未来,然后选择更好的动作。
最重要的直觉
世界模型不是普通视频生成器,也不是单纯的物体识别器。它必须关心“动作会如何改变世界”,因为智能体要靠它做决策。
现有规划是否合理?¶
你原来的笔记把世界模型分成四派:抽象表征、显式 3D 表征、隐空间表征、视频表征。这个分类很有价值,但还需要补三块:
- 从 RL 角度补基础:状态、动作、转移模型、奖励模型、规划和 model-based RL。
- 从训练目标补细节:像素预测、隐空间预测、JEPA 特征预测、diffusion/flow 视频预测各自优化什么。
- 从决策闭环补实践:模型训练好后,如何用 MPC、CEM、MCTS、想象 rollout、actor-critic 来选择动作。
整理后更适合用下面这个学习框架:
| 路线 | 代表方法 | 重点问题 |
|---|---|---|
| 隐空间动力学 | World Models、PlaNet、Dreamer、TD-MPC2 | 如何压缩观测并在 latent state 中预测未来 |
| JEPA 表征 | I-JEPA、V-JEPA | 如何预测高层语义特征,而不是重建每个像素 |
| 显式 3D/空间模型 | NeRF、3D Gaussian、Occupancy、World Labs | 如何保持几何一致性和空间可编辑性 |
| 生成式视频世界 | Genie、GAIA-1、UniSim、Cosmos | 如何生成可交互、动作可控的未来画面 |
| 结构化模型 | 物体槽、场景图、粒子/图网络 | 如何利用对象、关系和物理结构提升泛化 |
世界模型的基本闭环¶
graph LR
A[真实环境] -->|观测 o_t| B[编码器]
B --> C[内部状态 s_t]
C --> D[动力学模型]
E[动作 a_t] --> D
D --> F[预测未来状态/观测/奖励]
F --> G[规划或策略学习]
G --> H[选择动作]
H --> A
一个完整世界模型通常包含:
| 模块 | 作用 |
|---|---|
| 表征模型 | 把图像、语言、状态压缩成内部状态 |
| 动力学模型 | 预测动作导致的状态变化 |
| 观测模型 | 可选,把 latent state 解码成图像或其他观测 |
| 奖励/价值模型 | 预测任务收益,帮助选择动作 |
| 规划器/策略 | 在模型里 rollout 多种未来,选择动作 |
关键部件速查¶
| 部件 | 必须学会什么 |
|---|---|
| MDP/POMDP | 状态、观测、动作、奖励、转移概率的区别 |
| 转移模型 | one-step prediction 和 multi-step rollout 为什么不同 |
| Latent State | 为什么要压缩图像,什么信息必须保留 |
| VAE/RSSM | prior、posterior、KL、重建和奖励预测如何一起训练 |
| Imagination | Dreamer 如何在模型里生成轨迹训练 actor/critic |
| MPC/CEM | 如何在模型里搜索动作序列,并只执行第一步 |
| JEPA | 为什么预测 embedding 能避免像素级细节负担 |
| 3D/对象表征 | 为什么几何一致性和物体关系对机器人重要 |
| 视频世界模型 | 动作条件、latent action、闭环生成为什么关键 |
知识地图¶
| 模块 | 你要搞懂的问题 | 对应笔记 |
|---|---|---|
| 基础概念 | 世界模型和 model-based RL 到底是什么? | 基础概念 |
| 隐空间动力学 | VAE/RSSM/Dreamer 如何训练?prior/posterior/KL/imagination 是什么? | 隐空间动力学 |
| JEPA 与 3D | 为什么有些模型不预测像素,而预测表征、3D 或对象关系? | JEPA 与空间表征 |
| 视频世界模型 | Genie/Cosmos 这类模型如何用 video token、latent action 和动作条件生成未来? | 视频与交互式世界模型 |
| 规划控制 | MPC/CEM/MCTS 如何真正用世界模型选动作?怎么评估和防模型漏洞? | 规划、控制与评估 |
| 实践路线 | 新手如何从低维转移模型做到图像 latent 和视频预测? | 实践路线 |
推荐学习路线¶
阶段 0:补齐前置知识¶
- 强化学习基础:MDP、状态、动作、奖励、策略、价值函数。
- 深度学习基础:自编码器、RNN/Transformer、概率模型、KL 散度。
- 视觉基础:图像编码、视频帧、光流、深度、3D 表示。
- 控制基础:MPC、轨迹 rollout、误差累积和安全约束。
阶段 1:理解 model-based RL¶
- 学会区分 model-free 和 model-based。
- 写一个简单环境的转移模型:输入 \((s_t,a_t)\),预测 \(s_{t+1}\)。
- 用预测模型做 5 到 20 步 rollout,看误差如何累积。
- 理解为什么世界模型既可以用于规划,也可以用于训练策略。
阶段 2:学习隐空间世界模型¶
- 读 World Models,理解 VAE + RNN + Controller。
- 读 PlaNet,理解 latent dynamics 和在线规划。
- 读 Dreamer,理解在想象轨迹中训练 actor-critic。
- 对比 TD-MPC2,理解 latent planning 和大规模多任务控制。
阶段 3:学习表征路线¶
- 学像素预测为什么昂贵:未来有很多细节不影响决策。
- 学 JEPA:预测 embedding,而不是重建图像。
- 学显式 3D 表征:NeRF、3D Gaussian、occupancy、scene graph。
- 思考:什么时候需要高保真渲染,什么时候只要任务相关状态?
阶段 4:学习生成式世界模拟器¶
- 读 Genie:无动作标签的视频如何学出 latent action。
- 读 GAIA-1/UniSim:自动驾驶和真实传感器模拟。
- 读 Cosmos:把语言、图像、视频、音频、动作接到同一个 physical AI 框架。
- 比较视频生成和可交互模拟:后者必须对动作有因果响应。
阶段 5:做自己的最小闭环¶
建议路线:
- 从 GridWorld 或 CartPole 训练一个小转移模型。
- 用 CEM/MPC 在模型里搜索动作。
- 扩展到图像输入:用 autoencoder 得到 latent state。
- 尝试 Dreamer 风格的 imagined rollout。
- 再看 Genie/Cosmos 这种大规模世界模型,不急着复现。
新手最容易混淆的概念¶
| 概念 | 容易误解 | 正确理解 |
|---|---|---|
| 世界模型 | 等于视频生成 | 视频生成只是其中一种表现,关键是动作条件预测 |
| 模型预测准 | 策略一定好 | 控制需要长期 rollout、奖励估计和分布外鲁棒性 |
| 隐空间 | 黑盒压缩 | 好的 latent state 应保留决策相关信息 |
| JEPA | 不生成画面所以不是世界模型 | 它预测未来表征,适合忽略无关细节 |
| 3D 模型 | 一定比 2D/latent 好 | 几何一致性强,但数据、重建和计算成本高 |
| 仿真器 | 和世界模型一样 | 传统仿真器通常手写物理规则,世界模型从数据中学习 |
参考资料¶
- World Models
- PlaNet: Learning Latent Dynamics for Planning from Pixels
- DreamerV3: Mastering Diverse Domains through World Models
- TD-MPC2: Scalable, Robust World Models for Continuous Control
- I-JEPA
- V-JEPA
- Genie: Generative Interactive Environments
- GAIA-1: A Generative World Model for Autonomous Driving
- UniSim: Learning Interactive Real-World Simulators
- Cosmos World Foundation Model Platform
- Cosmos 3