LESSON wm.2.1 · 理论 · 120 分钟
JEPA:为什么不直接预测像素
JEPA:为什么不直接预测像素:理解joint embedding、context encoder、target encoder、predictor、collapse prevention,完成“比较像素损失与表征预测损失”。属于「JEPA 与抽象世界表征」学习阶段。
学完你应该能够
- 能不用术语堆砌,解释「JEPA:为什么不直接预测像素」解决了什么问题。
- 能围绕 joint embedding、context encoder、target encoder 画出变量与因果关系。
- 能完成「比较像素损失与表征预测损失」,并用证据而不是感觉判断结果。
核心概念
joint embedding
joint embedding服务于表征空间预测:context encoder 只读取可见区域,target encoder 产生停止梯度的目标表征,predictor 根据上下文和位置预测被遮挡或未来内容。防坍塌设计必须阻止所有输入映射为同一常数表示。
context encoder
context encoder服务于表征空间预测:context encoder 只读取可见区域,target encoder 产生停止梯度的目标表征,predictor 根据上下文和位置预测被遮挡或未来内容。防坍塌设计必须阻止所有输入映射为同一常数表示。
target encoder
target encoder服务于表征空间预测:context encoder 只读取可见区域,target encoder 产生停止梯度的目标表征,predictor 根据上下文和位置预测被遮挡或未来内容。防坍塌设计必须阻止所有输入映射为同一常数表示。
predictor
predictor服务于表征空间预测:context encoder 只读取可见区域,target encoder 产生停止梯度的目标表征,predictor 根据上下文和位置预测被遮挡或未来内容。防坍塌设计必须阻止所有输入映射为同一常数表示。
collapse prevention
collapse prevention服务于表征空间预测:context encoder 只读取可见区域,target encoder 产生停止梯度的目标表征,predictor 根据上下文和位置预测被遮挡或未来内容。防坍塌设计必须阻止所有输入映射为同一常数表示。
实践任务
比较像素损失与表征预测损失
- 预测:在运行代码前,写下你预期的输出、趋势或失败位置。
- 构建:从具体反例建立动机,只保留回答核心问题所需的最小组件。
- 验证:使用冻结表征的线性探针、视频检索、动作预测与规划任务;保存参数、随机种子与原始结果。
- 迁移:更换遮挡策略、视频域或机器人本体后检查表征,说明原结论是否仍成立。