LESSON wm.1.3 · 推导 · 140 分钟

MuZero:只学习规划真正需要的动力学

MuZero:只学习规划真正需要的动力学:理解representation、dynamics、prediction、MCTS、value与policy,完成“在玩具博弈中实现简化版模型规划”。属于「在想象中学习与规划」学习阶段。

学完你应该能够

  1. 能不用术语堆砌,解释「MuZero:只学习规划真正需要的动力学」解决了什么问题。
  2. 能围绕 representation、dynamics、prediction 画出变量与因果关系。
  3. 能完成「在玩具博弈中实现简化版模型规划」,并用证据而不是感觉判断结果。

核心概念

representation

representation属于 MuZero 的任务相关隐空间:representation 编码历史,dynamics 在动作条件下预测下一隐状态与奖励,prediction 输出 policy 和 value,MCTS 用这些量搜索。它不要求重建像素,因此隐状态不能直接当作真实物理状态解释。

dynamics

dynamics属于 MuZero 的任务相关隐空间:representation 编码历史,dynamics 在动作条件下预测下一隐状态与奖励,prediction 输出 policy 和 value,MCTS 用这些量搜索。它不要求重建像素,因此隐状态不能直接当作真实物理状态解释。

prediction

prediction属于 MuZero 的任务相关隐空间:representation 编码历史,dynamics 在动作条件下预测下一隐状态与奖励,prediction 输出 policy 和 value,MCTS 用这些量搜索。它不要求重建像素,因此隐状态不能直接当作真实物理状态解释。

MCTS

MCTS属于 MuZero 的任务相关隐空间:representation 编码历史,dynamics 在动作条件下预测下一隐状态与奖励,prediction 输出 policy 和 value,MCTS 用这些量搜索。它不要求重建像素,因此隐状态不能直接当作真实物理状态解释。

value与policy

value与policy属于 MuZero 的任务相关隐空间:representation 编码历史,dynamics 在动作条件下预测下一隐状态与奖励,prediction 输出 policy 和 value,MCTS 用这些量搜索。它不要求重建像素,因此隐状态不能直接当作真实物理状态解释。

实践任务

在玩具博弈中实现简化版模型规划

  • 预测:在运行代码前,写下你预期的输出、趋势或失败位置。
  • 构建:写出已知量与目标量,只保留回答核心问题所需的最小组件。
  • 验证:使用单步误差、不同长度 rollout、真实回报与 imagined return 偏差;保存参数、随机种子与原始结果。
  • 迁移:改变预测跨度、随机环境或奖励稀疏度后检查规划,说明原结论是否仍成立。

进入完整互动课程