LESSON wm.3.1 · 研读 · 160 分钟

Genie 1→3:从潜在动作到实时世界

Genie 1 的关键是从无动作标签视频中联合学习视频表示、潜在动作和动作条件动力学,让用户能控制生成的二维环境。Genie 2 把范围扩展到从图像生成多样的可控制三维环境,用于训练和评估智能体。Genie 3 进一步以文字生成可实时导航的世界,在720p、24 FPS下维持数分钟的一致性,并加入可提示的世界事件,但长期记忆与精确动作仍有限。

DIRECT ANSWER · VERIFIED SOURCES ·

Genie 1 到 Genie 3 的核心演进是什么?

Genie 1 的关键是从无动作标签视频中联合学习视频表示、潜在动作和动作条件动力学,让用户能控制生成的二维环境。Genie 2 把范围扩展到从图像生成多样的可控制三维环境,用于训练和评估智能体。Genie 3 进一步以文字生成可实时导航的世界,在720p、24 FPS下维持数分钟的一致性,并加入可提示的世界事件,但长期记忆与精确动作仍有限。

关键结论

  • 潜在动作模型从相邻视频变化中抽取可控制因素,避免依赖现成键盘标签。
  • 演进重点从短时二维交互走向更通用的三维、实时和更长一致性。
  • 评测必须分别观察动作响应、世界记忆、物体恒常性和长时漂移。

边界与常见误解

Genie 3 的公开材料主要是官方研究演示与产品原型信息,完整架构、训练数据和可复现实验尚不等同于开放论文与代码;课程不会把产品描述当成已独立验证的结论。

一手来源

学完你应该能够

  1. 能不用术语堆砌,解释「Genie 1→3:从潜在动作到实时世界」解决了什么问题。
  2. 能围绕 video tokenizer、latent action、autoregressive dynamics 画出变量与因果关系。
  3. 能完成「拆解 Genie 演进并设计动作可控性测试」,并用证据而不是感觉判断结果。

核心概念

video tokenizer

video tokenizer把连续视频压缩成离散的时空 token 网格,保留跨帧运动和场景结构,供动力学模型预测后续内容;它编码的是视觉时空模式,不是文本 tokenizer 的子词切分。应检查重建质量、压缩率和动作相关细节是否被保留。

latent action

latent action从无动作标签视频的相邻变化中学习离散控制变量,使动力学能够区分“世界自行变化”和“可由用户触发的变化”。它不是工具调用循环;可辨识性要通过同一初始画面下不同动作的响应方向与稳定性验证。

autoregressive dynamics

autoregressive dynamics根据过去的时空 token 与动作逐步预测下一帧或下一段隐表示。自回归展开让误差随时间累积,因此既要测短期像素或表征质量,也要测固定动作脚本下的长时漂移、失控和状态遗忘。

real-time interaction

real-time interaction要求系统在逐帧接收用户动作后,于交互延迟预算内生成对应的后续观察,并保持控制方向和世界状态连续。实时帧率只证明速度,仍需分别验证动作响应、回访一致性和长时间稳定性。

一致性

一致性要求已出现的物体、几何与事件在离开视野后仍能被正确恢复,并在持续交互中避免无因漂移。应使用闭环轨迹、回访位置和更长动作序列测量,而不能凭一段顺利演示判断。

实践任务

拆解 Genie 演进并设计动作可控性测试

  • 预测:在运行代码前,写下你预期的输出、趋势或失败位置。
  • 构建:先看入口与数据流,只保留回答核心问题所需的最小组件。
  • 验证:使用固定动作脚本、回访测试、视角闭环、几何一致性与人工盲评;保存参数、随机种子与原始结果。
  • 迁移:更换场景风格、相机轨迹或未见动作组合后检查世界一致性,说明原结论是否仍成立。

进入完整互动课程