世界模型 + 策略
为什么重要
前几个模块把模型与策略分开讲,本模块把它们接成闭环:真实数据训模型、模型 imagination 训策略、策略采集新数据再训模型。理解这个循环的动力学(包括它何时崩溃)是 MBRL 工程能力的核心。
直观理解
闭环有助推也有毒药:样本效率来自 imagination(绿线),但模型误差会经 imagination 直接毒害策略(红虚线)——model bias 是闭环的头号故障模式。
核心思想
MBRL 的系统图景从 Dyna(Sutton, 1991)开始:真实经验同时用于直接更新 value/policy 和训练模型,模型再生成虚拟经验辅助学习——"learning, planning, reacting"三位一体。现代系统把 Dyna 的每个部件都升级了:模型换成 RSSM,虚拟经验换成 imagination rollout,规划换成 actor-critic 或 MPC。
闭环的关键工程问题是交替节奏:模型与策略谁先训、多久更新一次、模型该在哪些状态分布上被评估。DayDreamer(2022)证明这套闭环可以直接跑在真实物理机器人上——四足行走、机械臂抓取在几小时真实交互内学会,样本效率远超 model-free——代价是严格的任务约束(自动复位、安全边界)。
Model bias 是闭环的结构性风险:策略优化器会主动寻找模型误差最大的方向("钻空子"),imagination 中的高回报在真实世界兑现不了。缓解手段构成一个工具箱:短 horizon rollout、概率 ensemble 的不确定性惩罚(PETS)、分支 rollout(MBPO)、value 函数兜底(TD-MPC)——模块 12 会把它们放进统一的评估框架。
关键概念
- Dyna 架构:真实经验与虚拟经验的混合学习。
- 交替训练:模型 ↔ 策略的更新节奏与数据分布漂移。
- Model bias / exploitation:策略钻模型空子(呼应模块 07 的梦境漏洞)。
- 分支 rollout(MBPO):从真实状态出发短程 rollout,限制误差复合。
- Real-world RL(DayDreamer):闭环直接跑在物理机器人上。
核心公式
MBPO 的分支 rollout 价值目标: