跳到主要内容

什么是空间智能?

为什么重要​

"Spatial intelligence" 是 2024 年后 AI 领域最重要的新叙事之一:Fei-Fei Li 称之为 AI 的下一个前沿。不先厘清它指什么、不指什么,后面的 3D 视觉与机器人模块会失去方向感。

直观理解​

路线 B 路线图

本路线图是 路线 B 的全景:从相机几何(模块 02)与 3D 表示(03–05)出发,经状态估计与 SLAM(06–07)、空间记忆(08),走向行动——affordance、导航、机器人世界模型与 VLA(09–12)。

核心思想​

Fei-Fei Li 在 TED 2024 演讲中把空间智能定义为:AI 理解 3D 物理世界并在其中推理与行动的能力——"看见"只是起点,"在世界中行动"才是终点。她联合创立的 World Labs 把这个议程表述为"从像素到世界"(生成与理解持久的 3D 世界)。这与本课程的世界模型框架天然同构:空间智能就是世界模型在 3D/4D 物理世界的实例化。

需要注意两种互补视角。机器人/AI 视角(本课程主线)把空间智能当作工程问题:感知 → 状态估计 → 表示 → 行动,评价标准是任务成功率与估计精度。建筑/人本视角(Columbia Spatial AI、Harvard GSD)则关注空间对人的意义:可读性、寻路、空间行为——它提醒我们"地图是给人和机器共同使用的"。本课程以第一视角为主,模块 08–09 会借用第二视角的概念。

为什么空间智能不能只用 2D 视频模型解决?3D 结构带来多视角一致性这一免费监督信号与检验标准:一个真实世界状态必须能从任意视角一致地渲染出来。这个约束是模块 04(NeRF/3DGS)到模块 07(SLAM)所有方法的共同地基。

关键概念​

  • Spatial intelligence:感知、理解、推理并在 3D 物理世界中行动的能力。
  • 机器人视角 vs 人本视角:工程闭环 vs 空间认知,两条互补线索。
  • 多视角一致性:3D 世界模型的天然监督与检验信号。
  • 具身(embodiment):感知与行动由身体形态定义,空间智能是具身智能的地基。
  • 持久世界表示:空间智能的"存储层"(模块 08 展开)。

核心公式​

本模块以直觉为主。

大学课程​

课程Lecture链接
UPenn CIS 6280 World ModelsL15 Spatial World Models I(3D 表示与空间智能议程;Resources 收录 Fei-Fei Li TED 2024 与 World Labs 资料)课程主页

论文​

  • Must Read:Fei-Fei Li, TED 2024 演讲 With Spatial Intelligence, AI Will Understand the Real World(TED 官网);World Labs 官方博客的空间智能论述(worldlabs.ai)。
  • Recommended:Gibson (1979), The Ecological Approach to Visual Perception(经典著作,图书馆/搜索获取)——affordance 概念的源头,模块 09 的伏笔。

动手实践​

路线 B 的动手从 Lab 0 开始(见下一模块);本模块建议先做一件事:用手机绕一个物体拍一圈视频——这就是模块 04 的原始数据。

自测​

  1. 空间智能与"计算机视觉"的差别在哪?
  2. 为什么说多视角一致性是 3D 世界模型的免费监督信号?
  3. 机器人视角与人本视角的空间智能各自关心什么评价标准?
显示答案
  1. 计算机视觉以"从图像提取信息"为终点;空间智能以"在世界中行动"为终点——感知只是闭环的第一环,必须有状态估计、记忆与行动接口才构成空间智能系统。
  2. 真实 3D 场景的任何内部表示都必须与所有视角的观测同时一致;违反一致性的表示必然错误。这条约束不需要任何人工标注,因此 NeRF/SLAM 都能靠纯几何/光度误差自监督训练。
  3. 机器人视角:任务成功率、定位误差(ATE/RPE)、实时性;人本视角:空间可读性、寻路效率、人在空间中的行为与体验。前者优化机器性能,后者优化人与空间的关系。

要点回顾​

  • 空间智能 = 世界模型在 3D/4D 物理世界的实例化,终点是行动而非感知。
  • 机器人视角与人本视角互补,本课程以前者为主线。
  • 多视角一致性是贯穿 路线 B 的核心约束与监督信号。

下一模块​

模块 02:相机与几何——一切从"世界如何变成图像"开始。