LESSON wm.2.2 · 研读 · 150 分钟

V-JEPA 2:从视频理解到机器人规划

V-JEPA 2 首先用大量图像和无动作标签视频做自监督预训练:context encoder 读取可见视频块,predictor 在抽象表征空间预测被遮挡或未来部分的 target 表征。随后再用少量带机器人动作的数据训练 action-conditioned world model,使候选动作序列能够在隐空间滚动预测;规划器比较预测目标与期望目标的距离,

DIRECT ANSWER · VERIFIED SOURCES ·

V-JEPA 2 如何从无动作标签视频学习,最后又用于机器人规划?

V-JEPA 2 首先用大量图像和无动作标签视频做自监督预训练:context encoder 读取可见视频块,predictor 在抽象表征空间预测被遮挡或未来部分的 target 表征。随后再用少量带机器人动作的数据训练 action-conditioned world model,使候选动作序列能够在隐空间滚动预测;规划器比较预测目标与期望目标的距离,选择更合适的动作执行。

关键结论

  • 大规模预训练阶段学习视觉与运动表征,并不需要机器人动作标签。
  • 动作条件后训练把“理解视频”转成“预测某个动作会造成什么变化”。
  • 规划效用必须由新环境中的真实控制结果检验,视频 benchmark 不能替代机器人评测。

边界与常见误解

V-JEPA 2 展示的是特定机械臂设置中的零样本规划结果,不等于通用机器人智能;性能仍受本体、相机、动作空间、目标表示与规划搜索限制。

一手来源

学完你应该能够

  1. 能不用术语堆砌,解释「V-JEPA 2:从视频理解到机器人规划」解决了什么问题。
  2. 能围绕 self-supervised video、action conditioning、latent planning 画出变量与因果关系。
  3. 能完成「用官方模型做视频表征检索并设计规划评测」,并用证据而不是感觉判断结果。

核心概念

self-supervised video

self-supervised video连接 V-JEPA 2 的两个阶段:先从无动作标签视频学习视觉与运动表征,再用较少机器人数据训练动作条件世界模型,在隐空间比较候选动作的预测结果。规划价值必须由新环境中的真实控制成功率验证。

action conditioning

action conditioning连接 V-JEPA 2 的两个阶段:先从无动作标签视频学习视觉与运动表征,再用较少机器人数据训练动作条件世界模型,在隐空间比较候选动作的预测结果。规划价值必须由新环境中的真实控制成功率验证。

latent planning

latent planning连接 V-JEPA 2 的两个阶段:先从无动作标签视频学习视觉与运动表征,再用较少机器人数据训练动作条件世界模型,在隐空间比较候选动作的预测结果。规划价值必须由新环境中的真实控制成功率验证。

zero-shot control

zero-shot control连接 V-JEPA 2 的两个阶段:先从无动作标签视频学习视觉与运动表征,再用较少机器人数据训练动作条件世界模型,在隐空间比较候选动作的预测结果。规划价值必须由新环境中的真实控制成功率验证。

实践任务

用官方模型做视频表征检索并设计规划评测

  • 预测:在运行代码前,写下你预期的输出、趋势或失败位置。
  • 构建:先看入口与数据流,只保留回答核心问题所需的最小组件。
  • 验证:使用冻结表征的线性探针、视频检索、动作预测与规划任务;保存参数、随机种子与原始结果。
  • 迁移:更换遮挡策略、视频域或机器人本体后检查表征,说明原结论是否仍成立。

进入完整互动课程