LESSON wm.4.2 · 验收 · 150 分钟
如何评测世界模型:从好看走向可用
如何评测世界模型:从好看走向可用:理解controllability、long-horizon consistency、physics、planning utility、sim-to-real、安全,完成“建立跨 Genie、JEPA、Marble、Cosmos 的评测矩阵”。属于「Physical AI、评测与前沿」学习阶段。
学完你应该能够
- 能不用术语堆砌,解释「如何评测世界模型:从好看走向可用」解决了什么问题。
- 能围绕 controllability、long-horizon consistency、physics 画出变量与因果关系。
- 能完成「建立跨 Genie、JEPA、Marble、Cosmos 的评测矩阵」,并用证据而不是感觉判断结果。
核心概念
controllability
controllability是世界模型从“看起来真实”走向“可用于决策”的独立验收维度。评测应固定动作与初始条件,分别测响应、长时漂移、物理约束、规划收益和现实迁移,避免用一个综合观感分掩盖失败。
long-horizon consistency
long-horizon consistency是世界模型从“看起来真实”走向“可用于决策”的独立验收维度。评测应固定动作与初始条件,分别测响应、长时漂移、物理约束、规划收益和现实迁移,避免用一个综合观感分掩盖失败。
physics
physics是世界模型从“看起来真实”走向“可用于决策”的独立验收维度。评测应固定动作与初始条件,分别测响应、长时漂移、物理约束、规划收益和现实迁移,避免用一个综合观感分掩盖失败。
planning utility
planning utility是世界模型从“看起来真实”走向“可用于决策”的独立验收维度。评测应固定动作与初始条件,分别测响应、长时漂移、物理约束、规划收益和现实迁移,避免用一个综合观感分掩盖失败。
sim-to-real
sim-to-real是世界模型从“看起来真实”走向“可用于决策”的独立验收维度。评测应固定动作与初始条件,分别测响应、长时漂移、物理约束、规划收益和现实迁移,避免用一个综合观感分掩盖失败。
实践任务
建立跨 Genie、JEPA、Marble、Cosmos 的评测矩阵
- 预测:在运行代码前,写下你预期的输出、趋势或失败位置。
- 构建:闭卷解释核心机制,只保留回答核心问题所需的最小组件。
- 验证:使用覆盖度、物理约束、策略回报、现实小样本验证与故障注入;保存参数、随机种子与原始结果。
- 迁移:更换传感器、机器人本体或现实扰动后重新评估,说明原结论是否仍成立。