LESSON wm.4.2 · 验收 · 150 分钟

如何评测世界模型:从好看走向可用

如何评测世界模型:从好看走向可用:理解controllability、long-horizon consistency、physics、planning utility、sim-to-real、安全,完成“建立跨 Genie、JEPA、Marble、Cosmos 的评测矩阵”。属于「Physical AI、评测与前沿」学习阶段。

学完你应该能够

  1. 能不用术语堆砌,解释「如何评测世界模型:从好看走向可用」解决了什么问题。
  2. 能围绕 controllability、long-horizon consistency、physics 画出变量与因果关系。
  3. 能完成「建立跨 Genie、JEPA、Marble、Cosmos 的评测矩阵」,并用证据而不是感觉判断结果。

核心概念

controllability

controllability是世界模型从“看起来真实”走向“可用于决策”的独立验收维度。评测应固定动作与初始条件,分别测响应、长时漂移、物理约束、规划收益和现实迁移,避免用一个综合观感分掩盖失败。

long-horizon consistency

long-horizon consistency是世界模型从“看起来真实”走向“可用于决策”的独立验收维度。评测应固定动作与初始条件,分别测响应、长时漂移、物理约束、规划收益和现实迁移,避免用一个综合观感分掩盖失败。

physics

physics是世界模型从“看起来真实”走向“可用于决策”的独立验收维度。评测应固定动作与初始条件,分别测响应、长时漂移、物理约束、规划收益和现实迁移,避免用一个综合观感分掩盖失败。

planning utility

planning utility是世界模型从“看起来真实”走向“可用于决策”的独立验收维度。评测应固定动作与初始条件,分别测响应、长时漂移、物理约束、规划收益和现实迁移,避免用一个综合观感分掩盖失败。

sim-to-real

sim-to-real是世界模型从“看起来真实”走向“可用于决策”的独立验收维度。评测应固定动作与初始条件,分别测响应、长时漂移、物理约束、规划收益和现实迁移,避免用一个综合观感分掩盖失败。

实践任务

建立跨 Genie、JEPA、Marble、Cosmos 的评测矩阵

  • 预测:在运行代码前,写下你预期的输出、趋势或失败位置。
  • 构建:闭卷解释核心机制,只保留回答核心问题所需的最小组件。
  • 验证:使用覆盖度、物理约束、策略回报、现实小样本验证与故障注入;保存参数、随机种子与原始结果。
  • 迁移:更换传感器、机器人本体或现实扰动后重新评估,说明原结论是否仍成立。

进入完整互动课程