Reinforcement Learning(强化学习)
本页是回查手册。借用 CIS6280 的官方声明:这不是一门 RL 课。你只需要能听懂"世界模型如何服务决策"所需的词汇。
最小知识集
- MDP:五元组 ;POMDP 是其部分可观测版本(路线 A 模块 02 展开)。
- Bellman 方程:——value 函数的递归定义。
- Value / Policy:、、 三者的关系;TD-MPC 的"模型 + 值函数"组合就靠这个区分。
- Model-free vs Model-based:本课程的全部内容都属于 model-based 一侧;理解对照即可。
- Policy gradient 与 actor-critic:Dreamer 在 imagination 中训练 actor-critic,只需知道结构不需要会推导。
何时回查
| 主线模块 | 用到的 RL |
|---|---|
| 路线 A 02 | MDP/POMDP 形式化 |
| 路线 A 08 Dreamer | actor-critic、return 估计 |
| 路线 A 09 Planning | 回报最大化的轨迹优化视角 |
| 路线 A 11 世界模型 + 策略 | Dyna 架构、model bias |
最佳外部资源
- Sutton & Barto《Reinforcement Learning: An Introduction》(免费 PDF):第 1–6 章 + 第 8 章(Dyna)即覆盖全部所需。
- OpenAI Spinning Up(spinningup.openai.com):policy gradient 与 actor-critic 的最友好入门。
- CIS6280 L09–L10(课程主页):RL 机制在"使用世界模型"语境下的精讲。
自查
能写出 Bellman 方程并解释每一项、能说清 model-free 与 model-based 的样本效率差异来源、能画出 actor-critic 的两个网络各输出什么,即达标。
下一步
回到主线:路线 A 模块 02