LESSON wm.1.1 · 研读 · 130 分钟

经典 World Models:VAE + RNN + Controller

经典 World Models:VAE + RNN + Controller:理解VAE、MDN-RNN、latent dynamics、controller、dream rollout,完成“复现一个小型 latent dynamics rollout”。属于「在想象中学习与规划」学习阶段。

学完你应该能够

  1. 能不用术语堆砌,解释「经典 World Models:VAE + RNN + Controller」解决了什么问题。
  2. 能围绕 VAE、MDN-RNN、latent dynamics 画出变量与因果关系。
  3. 能完成「复现一个小型 latent dynamics rollout」,并用证据而不是感觉判断结果。

核心概念

VAE

VAE位于经典 World Models 的“压缩—预测—控制”链路:VAE 把画面压成隐变量,MDN-RNN 预测动作条件下的下一隐状态分布,控制器在想象轨迹中选动作。最终仍要用真实环境回报检查策略是否利用了模型偏差。

MDN-RNN

MDN-RNN位于经典 World Models 的“压缩—预测—控制”链路:VAE 把画面压成隐变量,MDN-RNN 预测动作条件下的下一隐状态分布,控制器在想象轨迹中选动作。最终仍要用真实环境回报检查策略是否利用了模型偏差。

latent dynamics

latent dynamics位于经典 World Models 的“压缩—预测—控制”链路:VAE 把画面压成隐变量,MDN-RNN 预测动作条件下的下一隐状态分布,控制器在想象轨迹中选动作。最终仍要用真实环境回报检查策略是否利用了模型偏差。

controller

controller位于经典 World Models 的“压缩—预测—控制”链路:VAE 把画面压成隐变量,MDN-RNN 预测动作条件下的下一隐状态分布,控制器在想象轨迹中选动作。最终仍要用真实环境回报检查策略是否利用了模型偏差。

dream rollout

dream rollout位于经典 World Models 的“压缩—预测—控制”链路:VAE 把画面压成隐变量,MDN-RNN 预测动作条件下的下一隐状态分布,控制器在想象轨迹中选动作。最终仍要用真实环境回报检查策略是否利用了模型偏差。

实践任务

复现一个小型 latent dynamics rollout

  • 预测:在运行代码前,写下你预期的输出、趋势或失败位置。
  • 构建:先看入口与数据流,只保留回答核心问题所需的最小组件。
  • 验证:使用单步误差、不同长度 rollout、真实回报与 imagined return 偏差;保存参数、随机种子与原始结果。
  • 迁移:改变预测跨度、随机环境或奖励稀疏度后检查规划,说明原结论是否仍成立。

进入完整互动课程