潜在动力学
为什么重要
像素空间的动力学既高维又充满无关细节。Latent dynamics 把世界模型拆成"学表示 + 在表示里学动力学"两步,是 PlaNet/Dreamer 到现代视频模型的共同骨架,也是你第一个亲手训练的世界模型。
直观理解
encoder 把观测 压成潜状态 ;动力学模型在潜空间中预 测 ;decoder 负责把潜状态翻译回观测以便监督。预测完全发生在低维潜空间——这是计算效率与可预测性的关键。
核心思想
Latent dynamics 模型由三个可学习组件构成:encoder (推断当前潜状态)、转移模型 (在潜空间预测)、decoder (提供训练信号)。整个系统用 VAE/ELBO 框架联合训练:重建项保证表示忠实,KL 项让后验与先验(即转移模型的预测)对齐。
这个结构回答了模块 02 的历史压缩问题: 就是学出来的 belief state——它压缩观测历史(经 RNN 或滤过序列),保留预测所需信息,维度远低于像素。
训练目标的选择决定了模型性格:one-step 目标(只预测下一帧)简单稳定但 rollout 时误差复合;multi-step 目标(训练时就开环滚动多步)直接优化部署场景但训练更难。这条 one-step vs rollout 的裂缝会在模块 12 全面爆发。
关键概念
- Encoder / Decoder:观测与潜状态之间的双向翻译器。
- 潜状态设计准则:可推断、可预测、信息充分——三者互相拉扯。
- ELBO:重建项与 KL 正则项的变分目标。
- One-step vs rollout 目标:训练目标与部署场景的失配。
- 误差累积:每步微小误差在递归 rollout 中复合放大。
核心公式
潜动力学的 ELBO:
大学课程
| 课程 | Lecture | 链接 |
|---|---|---|
| UPenn CIS 6280 World Models | L07 Latent-Variable and Adversarial Models(VAE/ELBO) | slides |
| UPenn CIS 6280 World Models | L08 Latent World Models | slides |
论文
- Must Read:Hafner et al. (2019), Learning Latent Dynamics for Planning from Pixels(PlaNet,arXiv:1811.04551)——latent dynamics 范式的确立之作。
- Recommended:Kingma & Welling (2014), Auto-Encoding Variational Bayes(arXiv:1312.6114)——ELBO 推导的原始出处。
- Optional:Deisenroth & Rasmussen (2011), PILCO(ICML,搜索论文名)——非图像域潜动力学 + 不确定性传播的先驱。
动手实践
Lab 2 是本模块的完整实践:在 Lab 0 环境采集的图像 rollout 上训练 encoder + MLP/GRU 动力学,画出 one-step 与 10-step open-loop 预测误差曲线——你会亲眼看到误差累积。
自测
- 为什么不在像素空间直接学 ?
- ELBO 的 KL 项在潜动力学里起什么作用?
- one-step 误差很小,为什么 10-step rollout 仍可能完全发散?
显示答案
- 像素空间高维且充满预测无关的随机细节(纹理、噪声),直接建模既浪费容量又让动力学学习面对无关的随机性;潜空间先压缩出"可预测的核心",动力学在低位空间更容易学。
- KL 项把后验 拉向先验 ,即强迫"能推断出来的状态"与"能被动力学预测的状态"一致——没有它,encoder 可以编码无法预测的信息,rollout 立刻失效。
- rollout 是闭环的:模型第 步的预测误差成为第 步的输入,误差被动力学复合放大;且 rollout 中的输入分布逐渐偏离训练分 布(OOD),one-step 精度无法保证多步稳定。
要点回顾
- Latent dynamics = encoder + 潜空间转移 + decoder, 即学出来的 belief state。
- ELBO 的 KL 项对齐"可推断"与"可预测",是潜动力学的隐形支柱。
- One-step 准确不等于 rollout 可用——误差累积是贯穿全课程的主题。
下一模块
模块 06:RSSM——给潜动力学加上"确定性记忆 + 随机性"的混合 结构。