LESSON wm.3.1 · 研读 · 160 分钟
Genie 1→3:从潜在动作到实时世界
Genie 1 的关键是从无动作标签视频中联合学习视频表示、潜在动作和动作条件动力学,让用户能控制生成的二维环境。Genie 2 把范围扩展到从图像生成多样的可控制三维环境,用于训练和评估智能体。Genie 3 进一步以文字生成可实时导航的世界,在720p、24 FPS下维持数分钟的一致性,并加入可提示的世界事件,但长期记忆与精确动作仍有限。
DIRECT ANSWER · VERIFIED SOURCES ·
Genie 1 到 Genie 3 的核心演进是什么?
Genie 1 的关键是从无动作标签视频中联合学习视频表示、潜在动作和动作条件动力学,让用户能控制生成的二维环境。Genie 2 把范围扩展到从图像生成多样的可控制三维环境,用于训练和评估智能体。Genie 3 进一步以文字生成可实时导航的世界,在720p、24 FPS下维持数分钟的一致性,并加入可提示的世界事件,但长期记忆与精确动作仍有限。
关键结论
- 潜在动作模型从相邻视频变化中抽取可控制因素,避免依赖现成键盘标签。
- 演进重点从短时二维交互走向更通用的三维、实时和更长一致性。
- 评测必须分别观察动作响应、世界记忆、物体恒常性和长时漂移。
边界与常见误解
Genie 3 的公开材料主要是官方研究演示与产品原型信息,完整架构、训练数据和可复现实验尚不等同于开放论文与代码;课程不会把产品描述当成已独立验证的结论。
一手来源
学完你应该能够
- 能不用术语堆砌,解释「Genie 1→3:从潜在动作到实时世界」解决了什么问题。
- 能围绕 video tokenizer、latent action、autoregressive dynamics 画出变量与因果关系。
- 能完成「拆解 Genie 演进并设计动作可控性测试」,并用证据而不是感觉判断结果。
核心概念
video tokenizer
video tokenizer把连续视频压缩成离散的时空 token 网格,保留跨帧运动和场景结构,供动力学模型预测后续内容;它编码的是视觉时空模式,不是文本 tokenizer 的子词切分。应检查重建质量、压缩率和动作相关细节是否被保留。
latent action
latent action从无动作标签视频的相邻变化中学习离散控制变量,使动力学能够区分“世界自行变化”和“可由用户触发的变化”。它不是工具调用循环;可辨识性要通过同一初始画面下不同动作的响应方向与稳定性验证。
autoregressive dynamics
autoregressive dynamics根据过去的时空 token 与动作逐步预测下一帧或下一段隐表示。自回归展开让误差随时间累积,因此既要测短期像素或表征质量,也要测固定动作脚本下的长时漂移、失控和状态遗忘。
real-time interaction
real-time interaction要求系统在逐帧接收用户动作后,于交互延迟预算内生成对应的后续观察,并保持控制方向和世界状态连续。实时帧率只证明速度,仍需分别验证动作响应、回访一致性和长时间稳定性。
一致性
一致性要求已出现的物体、几何与事件在离开视野后仍能被正确恢复,并在持续交互中避免无因漂移。应使用闭环轨迹、回访位置和更长动作序列测量,而不能凭一段顺利演示判断。
实践任务
拆解 Genie 演进并设计动作可控性测试
- 预测:在运行代码前,写下你预期的输出、趋势或失败位置。
- 构建:先看入口与数据流,只保留回答核心问题所需的最小组件。
- 验证:使用固定动作脚本、回访测试、视角闭环、几何一致性与人工盲评;保存参数、随机种子与原始结果。
- 迁移:更换场景风格、相机轨迹或未见动作组合后检查世界一致性,说明原结论是否仍成立。