LESSON wm.2.1 · 理论 · 120 分钟

JEPA:为什么不直接预测像素

JEPA:为什么不直接预测像素:理解joint embedding、context encoder、target encoder、predictor、collapse prevention,完成“比较像素损失与表征预测损失”。属于「JEPA 与抽象世界表征」学习阶段。

学完你应该能够

  1. 能不用术语堆砌,解释「JEPA:为什么不直接预测像素」解决了什么问题。
  2. 能围绕 joint embedding、context encoder、target encoder 画出变量与因果关系。
  3. 能完成「比较像素损失与表征预测损失」,并用证据而不是感觉判断结果。

核心概念

joint embedding

joint embedding服务于表征空间预测:context encoder 只读取可见区域,target encoder 产生停止梯度的目标表征,predictor 根据上下文和位置预测被遮挡或未来内容。防坍塌设计必须阻止所有输入映射为同一常数表示。

context encoder

context encoder服务于表征空间预测:context encoder 只读取可见区域,target encoder 产生停止梯度的目标表征,predictor 根据上下文和位置预测被遮挡或未来内容。防坍塌设计必须阻止所有输入映射为同一常数表示。

target encoder

target encoder服务于表征空间预测:context encoder 只读取可见区域,target encoder 产生停止梯度的目标表征,predictor 根据上下文和位置预测被遮挡或未来内容。防坍塌设计必须阻止所有输入映射为同一常数表示。

predictor

predictor服务于表征空间预测:context encoder 只读取可见区域,target encoder 产生停止梯度的目标表征,predictor 根据上下文和位置预测被遮挡或未来内容。防坍塌设计必须阻止所有输入映射为同一常数表示。

collapse prevention

collapse prevention服务于表征空间预测:context encoder 只读取可见区域,target encoder 产生停止梯度的目标表征,predictor 根据上下文和位置预测被遮挡或未来内容。防坍塌设计必须阻止所有输入映射为同一常数表示。

实践任务

比较像素损失与表征预测损失

  • 预测:在运行代码前,写下你预期的输出、趋势或失败位置。
  • 构建:从具体反例建立动机,只保留回答核心问题所需的最小组件。
  • 验证:使用冻结表征的线性探针、视频检索、动作预测与规划任务;保存参数、随机种子与原始结果。
  • 迁移:更换遮挡策略、视频域或机器人本体后检查表征,说明原结论是否仍成立。

进入完整互动课程