跳到主要内容

World Models & Spatial Intelligence

10 秒理解这门课​

世界模型(World Model) 是智能体对世界的可预测的表征:给定当前状态与动作,它能回答"接下来会发生什么"。空间智能(Spatial Intelligence) 是把这种能力落到 3D/4D 物理世界:感知几何、估计自身状态、记住环境、在其中导航与行动。这门开源课把两者放进同一个框架:表征世界 → 预测世界 → 在世界中行动。

课程总览

上图是课程的全局地图:左半是"世界模型"主线(表征、预测、规划),右半是"空间智能"主线(几何、3D 表示、SLAM、机器人),两者在"行动与评估"处汇合。

两条路线,如何选择​

🧑‍🔬 路线 A · 世界模型科学家🤖 路线 B · 空间与具身智能
目标造模型:学会构建、训练、评估世界模型造系统:用世界模型与 3D 表示搭建空间智能系统
受众想做世界模型/生成模型/MBRL 研究的学习者机器人、自动驾驶、AR/VR、空间计算方向
主线内容表征学习 → 潜动力学 → RSSM/Dreamer → 规划 → 视频/交互式世界模型 → 评估相机几何 → 深度/点云 → NeRF/3DGS → 状态估计/SLAM → 导航/VLA
对应 LabLab 0–4、7、9、10Lab 0、1、5、6、8、9、10
出口能复现 Dreamer 级系统,完成 Capstone 世界模型能搭建"感知-状态估计-规划"闭环,完成空间 Capstone
建议时间14 个模块,约 8–10 周13 个模块,约 8–10 周

两轨是平行关系,不是先后关系:造视频世界模型的人不必学 SLAM,做 SLAM 的人不必学 diffusion。拿不准的话,两轨的前两个模块都读一遍再决定;也可以随时换轨。

如何使用每个模块​

每个模块遵循同一模板,按固定顺序阅读即可形成稳定预期:

  1. 为什么重要:一段话说明为什么值得学;
  2. 直观理解:先看图建立直觉,再看文字;
  3. 核心思想 / 关键概念 / 核心公式:核心原理、术语与公式;
  4. 大学课程:全球顶尖大学对应 lecture 的官方链接,可对照深挖;
  5. 论文:按 Must Read / Recommended / Optional 三档阅读,不必全读;
  6. 动手实践:对应 Colab Lab,动手是必选项而非可选项;
  7. 自测:自测题,答不出就回头重读;
  8. 要点回顾 / 下一模块:三句话总结 + 明确的下一步。

模块顶部的进度条(ModuleProgress)会跟踪你的学习进度。

先修自查清单​

本课程假设你具备研究生级机器学习基础。以下清单全部答"是"即可直接开学;否则先到基础部分按需补齐——基础部分是回查手册,不是强制起点:

  • 会做矩阵分解与最小二乘,理解特征值的几何意义 → 线性代数
  • 熟悉条件分布、贝叶斯、高斯分布与协方差 → 概率论
  • 能用 PyTorch 写训练循环、管理 DataLoader 与 GPU 显存 → PyTorch
  • 理解反向传播、VAE/ELBO、常见正则化手段 → 深度学习
  • 能解释注意力机制、因果掩码与 ViT 的 token 化 → Transformer
  • 会写针孔相机投影,理解对极几何与特征匹配 → 计算机视觉
  • 知道 MDP、Bellman 方程、policy gradient 的基本形式 → 强化学习

溯源说明​

本课程以 UPenn CIS 6280: World Models(2026 秋首次开课)为主骨架,融合 Stanford CS231A、CMU 16-825、MIT VNAV、ETH/UZH VAMR 等 11 门大学课程的 lecture 与作业设计。每个模块的 University Lecture 表格即溯源标注。

下一模块​