空间记忆
为什么重要
没有记忆的智能体每帧都从零开始理解世界。空间记忆——记住"世界长什么样、我到过哪里"——是长期自主的前提,也是世界模型在开放世界中的存储层。
直观理解
空间记忆的三层结构:度量层(点云/占据栅格,精确但脆弱)、拓扑层(地点节点 + 边,鲁棒可扩展)、语义层(物体与场景标签,支持任务查询)。位置识别是跨层检索机制——看到熟悉的画面,唤醒对应的地图区域。
核心思想
位置识别(place recognition) 是空间记忆的经典核心:把当前观测检索到历史地图中最相似的位置。经典方法是 Bag of (Binary) Words——图像被编码为视觉词袋向量,DBoW2 做到毫秒级检索;FAB-MAP 用概率外观模型处理感知混叠。难点是外观变化(光照、季节、视角)下的召回率,与误检回环的灾难性代价(一次错误回环可以毁掉整张地图)之间的权衡。
持久场景表示回答"记忆存成什么格式":占据栅格/OctoMap 直接服务避障;神经场与高斯(模块 04–05)支持渲染查询;scene graph(物体节点 + 关系边)是语义层的结构化记忆,支持"杯子在桌上"式的符号查询。增量更新与遗忘是工程关键——地图不可能无限增长,变化检测与地图维护是开放问题。
认知科学的对照视角值得了解:人类的空间记忆是认知地图(cognitive map)——拓扑为主、度量为辅、海马体的 place cell 提供位置编码。Columbia Spatial AI 的寻路(way-finding)研究提示:机器地图的可读性在人机共处的空间(导览机器人、AR 导航)同样重要。这呼应模块 01 的人本视角。
关键概念
- Place recognition:外观检索唤醒地图记忆,回环检测的前端。
- BoW / DBoW2:视觉词袋的快速位置识别。
- 度量 vs 拓扑地图:精确几何 vs 鲁棒连通性的表示权衡。
- Scene graph:物体 + 关系的结构化语义记忆。
- 遗忘与地图维护:变化检测、增量更新、容量管理。
核心公式
词袋检索的相似度打分(TF-IDF 加权):
大学课程
| 课程 | Lecture | 链接 |
|---|---|---|
| MIT 16.485 VNAV | L21–L22 Place Recognition / Bag of Visual Words + Lab 8 | 课程主页 |
| UPenn CIS 6280 World Models | L15 Spatial World Models I(持久场景表示选项) | 课程主页 |