LESSON wm.3.2 · 研读 · 140 分钟

李飞飞、Marble 与空间智能

空间智能要求模型理解并生成可导航、可回访、可编辑的三维环境,而不只是输出固定视角的视频。Marble 接受文字、图像、全景、多视图或视频输入,生成具有一定空间持久性的世界,并可在网页中探索或导出。它也不同于只还原已有场景的3D重建:生成式世界可以创造和扩展未被完整观测的空间,但同时引入几何与真实性的不确定性。

DIRECT ANSWER · VERIFIED SOURCES ·

World Labs 的空间智能与普通视频生成、3D重建有什么不同?

空间智能要求模型理解并生成可导航、可回访、可编辑的三维环境,而不只是输出固定视角的视频。Marble 接受文字、图像、全景、多视图或视频输入,生成具有一定空间持久性的世界,并可在网页中探索或导出。它也不同于只还原已有场景的3D重建:生成式世界可以创造和扩展未被完整观测的空间,但同时引入几何与真实性的不确定性。

关键结论

  • 视频生成主要优化时间上的画面序列,持久世界还要维护跨视角几何与对象状态。
  • 3D重建强调忠实恢复已有场景,生成式世界还承担补全、创造与编辑。
  • 真正的空间一致性要通过闭环相机轨迹、回访位置和几何测量验证。

边界与常见误解

可导航不等于具有完整物理动力学;Marble 的场景生成与机器人可交互世界模型仍是不同层级。空间持久性、几何准确度和下游仿真适用性需要按任务分别评测。

一手来源

学完你应该能够

  1. 能不用术语堆砌,解释「李飞飞、Marble 与空间智能」解决了什么问题。
  2. 能围绕 persistent 3D、multimodal world creation、navigation 画出变量与因果关系。
  3. 能完成「比较视频生成、3D重建与生成式世界」,并用证据而不是感觉判断结果。

核心概念

persistent 3D

persistent 3D要求世界在视角离开后仍保存几何和对象状态。可导航、可回访、可编辑比单段视频的局部逼真更强,也需要独立的闭环轨迹测试。

multimodal world creation

multimodal world creation把文字、图像、多视图或视频条件映射为可探索世界,并允许后续扩展或编辑。输入一致不保证生成几何正确;需要比较不同条件下的空间闭合、编辑局部性和未观察区域的不确定性。

navigation

navigation要求世界在视角离开后仍保存几何和对象状态。可导航、可回访、可编辑比单段视频的局部逼真更强,也需要独立的闭环轨迹测试。

editing

editing把文字、图像、多视图或视频条件映射为可探索世界,并允许后续扩展或编辑。输入一致不保证生成几何正确;需要比较不同条件下的空间闭合、编辑局部性和未观察区域的不确定性。

World API

World API要求世界在视角离开后仍保存几何和对象状态。可导航、可回访、可编辑比单段视频的局部逼真更强,也需要独立的闭环轨迹测试。

实践任务

比较视频生成、3D重建与生成式世界

  • 预测:在运行代码前,写下你预期的输出、趋势或失败位置。
  • 构建:先看入口与数据流,只保留回答核心问题所需的最小组件。
  • 验证:使用固定动作脚本、回访测试、视角闭环、几何一致性与人工盲评;保存参数、随机种子与原始结果。
  • 迁移:更换场景风格、相机轨迹或未见动作组合后检查世界一致性,说明原结论是否仍成立。

进入完整互动课程