LESSON wm.0.2 · 推导 · 110 分钟
POMDP:看不全的世界如何建模
POMDP:看不全的世界如何建模:理解隐藏状态、belief state、观测模型、奖励与策略,完成“手算一个部分可观察迷宫的 belief update”。属于「从语言走向世界」学习阶段。
学完你应该能够
- 能不用术语堆砌,解释「POMDP:看不全的世界如何建模」解决了什么问题。
- 能围绕 隐藏状态、belief state、观测模型 画出变量与因果关系。
- 能完成「手算一个部分可观察迷宫的 belief update」,并用证据而不是感觉判断结果。
核心概念
隐藏状态
隐藏状态属于部分可观察决策过程:环境隐藏状态经观测模型产生当前观察,智能体用历史动作与观察更新 belief state,再据此比较策略的预期累计回报。验证时要把真实状态、可见观察和 belief 估计分开记录。
belief state
belief state属于部分可观察决策过程:环境隐藏状态经观测模型产生当前观察,智能体用历史动作与观察更新 belief state,再据此比较策略的预期累计回报。验证时要把真实状态、可见观察和 belief 估计分开记录。
观测模型
观测模型属于部分可观察决策过程:环境隐藏状态经观测模型产生当前观察,智能体用历史动作与观察更新 belief state,再据此比较策略的预期累计回报。验证时要把真实状态、可见观察和 belief 估计分开记录。
奖励与策略
奖励与策略属于部分可观察决策过程:环境隐藏状态经观测模型产生当前观察,智能体用历史动作与观察更新 belief state,再据此比较策略的预期累计回报。验证时要把真实状态、可见观察和 belief 估计分开记录。
实践任务
手算一个部分可观察迷宫的 belief update
- 预测:在运行代码前,写下你预期的输出、趋势或失败位置。
- 构建:写出已知量与目标量,只保留回答核心问题所需的最小组件。
- 验证:使用状态转移表、手算 belief update 与多步 rollout 成功率;保存参数、随机种子与原始结果。
- 迁移:增加部分可观察性、随机性或新动作后重新规划,说明原结论是否仍成立。