LESSON wm.1.2 · 理论 · 150 分钟

Dreamer:让智能体在隐空间里做梦

Dreamer:让智能体在隐空间里做梦:理解RSSM、reconstruction、reward prediction、imagined trajectory、actor-critic,完成“比较真实轨迹训练与 imagined rollout 训练”。属于「在想象中学习与规划」学习阶段。

学完你应该能够

  1. 能不用术语堆砌,解释「Dreamer:让智能体在隐空间里做梦」解决了什么问题。
  2. 能围绕 RSSM、reconstruction、reward prediction 画出变量与因果关系。
  3. 能完成「比较真实轨迹训练与 imagined rollout 训练」,并用证据而不是感觉判断结果。

核心概念

RSSM

RSSM连接 Dreamer 的确定性记忆与随机隐状态:表示模型吸收新观察,动力学在没有新画面时展开想象,奖励与价值头为 actor-critic 提供训练信号。要比较 imagined return 与真实 return 随预测跨度增长的偏差。

reconstruction

reconstruction连接 Dreamer 的确定性记忆与随机隐状态:表示模型吸收新观察,动力学在没有新画面时展开想象,奖励与价值头为 actor-critic 提供训练信号。要比较 imagined return 与真实 return 随预测跨度增长的偏差。

reward prediction

reward prediction连接 Dreamer 的确定性记忆与随机隐状态:表示模型吸收新观察,动力学在没有新画面时展开想象,奖励与价值头为 actor-critic 提供训练信号。要比较 imagined return 与真实 return 随预测跨度增长的偏差。

imagined trajectory

imagined trajectory连接 Dreamer 的确定性记忆与随机隐状态:表示模型吸收新观察,动力学在没有新画面时展开想象,奖励与价值头为 actor-critic 提供训练信号。要比较 imagined return 与真实 return 随预测跨度增长的偏差。

actor-critic

actor-critic连接 Dreamer 的确定性记忆与随机隐状态:表示模型吸收新观察,动力学在没有新画面时展开想象,奖励与价值头为 actor-critic 提供训练信号。要比较 imagined return 与真实 return 随预测跨度增长的偏差。

实践任务

比较真实轨迹训练与 imagined rollout 训练

  • 预测:在运行代码前,写下你预期的输出、趋势或失败位置。
  • 构建:从具体反例建立动机,只保留回答核心问题所需的最小组件。
  • 验证:使用单步误差、不同长度 rollout、真实回报与 imagined return 偏差;保存参数、随机种子与原始结果。
  • 迁移:改变预测跨度、随机环境或奖励稀疏度后检查规划,说明原结论是否仍成立。

进入完整互动课程