空间智能与具身智能深入理解 · 以 3D Gaussian Splatting 为核心 ⎇ 仓库
① 开源技术书 · 设计原理与工程实践

深入理解空间智能与具身智能

以 3D Gaussian Splatting 为核心,串联 789+ 方法与 15 个工程技能,讲透从三维表征到机器人行动的完整闭环

具身智能体= 空间表征×感知×规划×行动 (核心公式,致敬 Agent = LLM + 上下文 + 工具
methods categories skills embodied
章节速览
引言

为什么写这本书

空间智能与具身智能的百年交汇,3DGS 为何是关键拼图,以及本书的核心公式与方法论。

阅读 →
第 1 章

从 NeRF 到 3DGS:范式跃迁

显式 vs 隐式表征,体渲染与辐射场,3DGS 三大创新为何让它在一年内引爆。

阅读 →
第 2 章

3DGS 的数学与工程内核

各向异性高斯、可微光栅化、自适应密度控制与 CUDA 工程的完整拆解。

阅读 →
第 3 章

从场景到世界

大规模重建、动态/4D 高斯、SLAM 实时建图与压缩部署的工程化道路。

阅读 →
第 4 章

语义高斯

语言/语义高斯、开放词汇 3D 分割——空间智能的"眼睛"如何长出来。

阅读 →
第 5 章

编辑·生成·资产化

从重建到创造:前馈重建、文本/图像到 3DGS、可动画资产与材质重照明。

阅读 →
第 6 章

具身智能基础

VLA 谱系、仿真平台、Sim2Real 鸿沟与数据飞轮——机器人如何"长记性"。

阅读 →
第 7 章

3DGS 作为空间记忆

GS-SLAM 把高斯地图变成"可渲染记忆",导航决策如何在其中推理。

阅读 →
第 8 章

物体级与铰接式理解

part-level 高斯、铰接资产与 CAD·Mesh·3DGS 桥接——操作的前置条件。

阅读 →
第 9 章

Agent 驱动的数字孪生

MCP 渲染管线、手势交互、3DGS 作为可交互世界,串起感知与行动闭环。

阅读 →
第 10 章

世界模型与未来

世界模型六大学派、3DGS×World Model 交叉、空间基础模型与 Physical AI。

阅读 →
附录

数据集与评估基准

从 Mip-NeRF360 到 ScanNet++,3DGS 与具身智能的主流评测体系全景。

阅读 →
引用

引用与延伸阅读

60+ 权威论文、开源仓库、数据集与教程资源,按类别整理的完整参考目录。

阅读 →
引言

为什么写这本书

空间智能与具身智能的百年交汇 · 3DGS 为何是关键拼图

2023 年 8 月,INRIA 的 Bernhard Kerbl 及合作者在 SIGGRAPH 发表了论文"3D Gaussian Splatting for Real-Time Radiance Field Rendering"SIGGRAPH 2023。他们用一组各向异性 3D 高斯直接充当辐射场表示,配合可微光栅化(differentiable rasterization),把新视角合成的训练时间从数小时压到数十分钟,渲染超过 100 FPS。这不是渐进式改进——它是表示层面的范式转换。一年内它从一篇论文变成一个 789+ 方法、跨 25 个类别的庞大生态,并被迅速推向自动驾驶、机器人建图、数字孪生与内容生成。

这本书想回答的核心问题是:为什么偏偏是 3DGS,成了空间智能与具身智能之间最顺手的桥梁?

2020.03
Mildenhall 等人发表 NeRF,用 MLP 隐式编码辐射场,荣获 CVPR 2020 最佳论文荣誉提名。神经辐射场引爆隐式表示路线 CVPR 2020
2023.08
Kerbl 等人发表 3DGS,用显式高斯基元 + 可微光栅化实现实时渲染,质量超 NeRF 且快 100× SIGGRAPH 2023
2024.01
Google DeepMind 推出 RT-2,首创 Vision-Language-Action (VLA) 范式,知识从互联网迁移到机器人手
2024.06
李飞飞在旧金山 AI Startup School 演讲,正式提出"空间智能"(Spatial Intelligence)作为 AI 的下一个前沿
2024.09
李飞飞创立 World Labs,专注空间智能与世界模型,估值在 2026 年 2 月融资 10 亿美元后达 100 亿美元
2025.01
黄仁勋在 CES 2025 提出 Physical AI 技术三角:世界模型 + 空间智能 + 具身智能
2025.06
Meta 发布 V-JEPA 2(LeCun 主导),在联合嵌入预测空间做世界模型,不重建像素 2025
2025.06
NVIDIA 开源 GR00T N1 人形机器人基础模型,System 1 快反应 + System 2 VLM 规划
2026.05
字节跳动发布 Pelican-Unified 1.0,首个统一具身基础模型;多伦多大学 BISON 实现双层策略 10K 物体 <1min 规划

李飞飞在 2024 年 6 月旧金山 AI Startup School 的演讲中说:"AGI 若没有空间智能,是不完整的。"她把空间智能定义为"在三维空间中感知、推理、生成和交互的深层能力"——不是二维图像识别,而是对三维物理世界的完整理解与行动能力。这与黄仁勋在 2025 CES 的 Physical AI 命名形成呼应:世界模型 + 空间智能 + 具身智能。三者都以"一份可计算、可渲染、可编辑的三维空间表示"为地基——而 3DGS 是当下最被验证的地基。

★ 核心公式 本书把整套技术压缩为一个公式,并贯穿全书(致敬 深入理解 AI AgentAgent = LLM + 上下文 + 工具):
具身智能体 = 空间表征 × 感知 × 规划 × 行动 空间表征是地基,感知/规划/行动是上层;四个因子任何一项变为零,智能体都无法在物理世界落地。3DGS 在"空间表征"这一因子上提供了当前最强的显式解。

为什么不是点云、不是网格、不是 NeRF?

点云(Point Cloud)是三维数据最直接的表示,但它没有外观、不可微渲染、无法表达视角依赖的颜色。网格(Mesh)是游戏与 CAD 的标准格式,但它难以从图像优化生成、对复杂透明/半透明场景束手无策。NeRF 用 MLP 隐式编码一切,渲染质量极高但需要逐像素光线步进(ray marching),训练和推理都慢,且表示藏在网络权重里——不可编辑、不可直接查询。3DGS 把辐射场显式化成一组可数、可微、可渲染的 3D 高斯基元:表示暴露在数据里,而不是埋在权重里。这一步直接决定了后面所有"编辑、压缩、语义、喂给机器人"的可能性。

这本书做三件事

这本书不是论文清单。它做三件事:第一,沿着 3DGS 的数学与工程内核,把"为什么它能实时、能编辑、能当机器人的记忆"讲到位;第二,沿"表示→感知→规划→行动"的主线,把 789+ 方法归类到一个可推理的框架里;第三,每一章都锚定本仓库里真实存在的方法表、references 与 skills,让"读完书"和"上手工程"无缝衔接。

③ 阅读建议 如果你做重建/内容生成,重点读第 1–5 章;如果你做机器人,重点读第 6–9 章;第 10 章把视野拉到世界模型与空间基础模型。附录提供了数据集与评估基准的全景,引用与延伸阅读列出了 60+ 权威资源。每章末尾有思考题,建议带着自己的项目回答。

开始之前,请记住一个判断:3DGS 的胜负不在于渲染多一两个 dB 的 PSNR,而在于它第一次让"空间"成为一份可微、实时、可被 Agent 调用的第一类数据结构。这正是空间智能走向具身智能的命门,也是本书的主线。

CH 01

从 NeRF 到 3DGS:空间表征的范式跃迁

显式 vs 隐式 · 体渲染与辐射场 · 三大创新

在新视角合成(Novel View Synthesis)这条线上,2020 年的 NeRF 用一个 MLP 隐式地把密度与颜色编进网络权重,靠光线步进(ray marching)求解体渲染积分。它在概念上极其优美——5D 坐标 (x, y, z, θ, φ) 进,颜色与密度出——但代价是:渲染是逐像素光线步进,慢;表示藏在网络里,不可编辑。"重建一片空间"和"得到一份可操作的空间数据"被硬生生割裂。

3DGS 的革命性不在于"更高 PSNR",而在于它把辐射场显式化成一组可数、可微、可渲染的 3D 高斯基元。表示暴露在数据里,而不是埋在权重里——这一步直接决定了后面所有"编辑、压缩、语义、喂给机器人"的可能性。

体渲染方程:两条路线的分水岭

无论是 NeRF 还是 3DGS,底层都是同一个体渲染积分——把三维空间中的辐射场沿光线积分为像素颜色:

体渲染积分(连续形式) C(𝐮) = ∫₀^∞ T(t) · σ(r(t)) · c(r(t), d) dt 其中 T(t) = exp(−∫₀^t σ(r(s)) ds)   (透射率/累积不透明度) σ 是体密度,c 是视角依赖的颜色,T 是光线到达 t 点前未被遮挡的概率。NeRF 用数值积分(分层采样 + 四则化)近似上式,每像素需要数十到数百次 MLP 查询——这就是它慢的根源。3DGS 把参与合成的"体素"换成一排排排好序的高斯基元,用 alpha 合成直接闭式求解。
3DGS 的离散 alpha 合成 C(𝐮) = Σi∈N cᵢ · αᵢ · Πj(1 − αⱼ) 第 i 个高斯对像素 𝐮 的颜色贡献 = 它的颜色 cᵢ × 它的不透明度 αᵢ × 前面所有高斯的透射率。这正是同一渲染方程、两种实现命运的分水岭:NeRF 逐像素采样,3DGS 逐高斯投影。

3DGS 三大创新

  • 各向异性 3D 高斯作直接表示:每个基元用均值 μ(位置)、协方差 Σ(形状/朝向,工程上分解为缩放向量 s 与四元数 q,保证半正定与可微)、不透明度 α、球谐系数 SH(视角颜色)刻画,不再需要任何 MLP 查询。初始高斯由 COLMAP 的稀疏点云生成。
  • 可微光栅化(Differentiable Rasterization):把 3D 高斯投影到屏幕、按深度排序、做 tile-based alpha 合成,前向渲染快、反向梯度可直接传回每个基元参数。这基于 EWA(Elliptical Weighted Average)溅射理论的工程落地。
  • 自适应密度控制(Adaptive Density Control):训练中按位置梯度判据对高斯克隆/分裂/剪枝,让表示在重建质量与基元数量间自动平衡。这是 3DGS"不需要手动调分辨率"的根本来源。

关键方法与后续改进

方法会议一句话创新
3DGS (Kerbl et al.)SIGGRAPH 2023各向异性高斯 + 可微光栅化 + 自适应密度控制,首破实时且质量超 NeRF
Mip-SplattingCVPR 20243D 位置平滑 + 2D Mip 滤波,系统性消除多尺度锯齿与闪烁
2DGSSIGGRAPH 2024用贴在切平面的 2D 圆盘替代 3D 高斯,几何更干净、可直接提网格(ACM TOG)
SuGaRCVPR 2024正则化高斯对齐表面,高质量提取网格,TSDF + Marching Cubes
Vol3DGSarXiv重写合成方程为体一致,修复溅射-体不一致导致的透明/光照错误
NegGSarXiv引入负颜色高斯,精确表示环/月牙等非凸结构,不再依赖过度剪枝
Neural Gabor SplattingarXiv给基元挂可学习 Gabor 特征,建模锐边/细纹理/薄结构
③ 工程要点 3DGS 的"实时"依赖三点工程务实:基于瓦片的光栅化避免全局排序瓶颈;前向/反向共用同一套排序保证梯度一致;自适应密度控制用位置梯度的累积量而非重建误差做判据。迁移 NeRF 工作流时,最容易踩的坑是把"高质量渲染"误当成"高质量几何"——PSNR 高不代表法线干净,做后续 mesh/CAD 时要切换评价口径。

从 2023 年到 2026 年,3DGS 的论文数量从 1 篇爆发到 789+ 篇。南京大学在 IEEE TCSVT 2025 年 7 月发表的综述"3D Gaussian Splatting: Survey, Technologies, Challenges, and Opportunities"IEEE TCSVT 2025是对这波浪潮最全面的梳理之一。康奈尔大学、香港科技大学联合发表的 VLA 综述则从具身智能侧切入,讨论了 VLM 如何驱动 3D 理解的产业化。

★ 思考题
  1. "表示暴露在数据里"这条性质,如何决定了 3DGS 比隐式 NeRF 更适合做机器人的空间记忆?
  2. 2DGS 与 3DGS 的取舍:什么场景下你宁可用 2D 圆盘牺牲一点渲染换来几何?
  3. 如果未来出现一个"隐式但可微可编辑"的表示,3DGS 的显式优势会被抹平吗?
  4. 体渲染积分的连续形式与 3DGS 的离散 alpha 合成,在什么条件下两者会给出不同结果?
CH 02

3DGS 的数学与工程内核

参数化 · 可微光栅化 · 自适应密度控制 · CUDA 工程

本章把"3DGS 为什么能又快又可微"拆成四块。它不是论文复述,而是工程视角的受力分析——知道梯度从哪来、卡在哪,你才知道为什么有那么多后续方法在"基元、排序、致密化"上做文章。

高斯基元的参数化

每个高斯由 5 组参数刻画:

  • 位置 μ ∈ ℝ³:高斯中心在世界空间的位置,初始值来自 COLMAP 稀疏点云。
  • 协方差 Σ ∈ ℝ³ˣ³:控制高斯的形状与朝向。工程上不直接优 Σ,而是分解为缩放向量 s ∈ ℝ³ 和旋转四元数 q ∈ ℝ⁴,令 Σ = R(q)·diag(s)·R(q)ᵀ,既保证半正定,又让梯度能直达"形状/朝向"。
  • 不透明度 α ∈ [0,1]:经 sigmoid 激活,控制该基元的不透明程度。
  • 球谐系数 SH:用低阶球面谐波(通常 3 阶,48 维)编码视角依赖的颜色。阶数越高,颜色随视角变化越精细,但参数量线性增长。
3D 高斯密度与屏幕投影 G(x) = exp(−½ (x−μ)ᵀ Σ⁻¹ (x−μ)) Σ' = J W Σ Wᵀ Jᵀ   (投影到屏幕,W 视图矩阵,J 投影局部线性化) 高斯在 3D 空间是椭球,经视图变换 W 和投影的雅可比 J 后成为屏幕上的 2D 椭圆。Σ' 是 2D 椭圆的协方差。这个投影是 EWA 溅射理论的核心——保证了 3D 高斯到 2D 屏幕的数学一致性。

理解这一点至关重要:球谐系数是 3DGS 视角依赖的关键。0 阶 SH 给出固定颜色(等同于无视角变化),3 阶 SH 可以表达金属反射、彩虹色、透明感等复杂现象。但这也意味着,如果你用 3DGS 重建了一个有光泽的金属表面,PSNR 高的那组参数很可能不是"几何对"的那组——颜色变化可能在用高密度高斯拟合本应靠 SH 表达的反射效果。

可微光栅化:前向与反向

渲染时把每个高斯投影成 2D 椭圆,按深度排序,落进 16×16 的瓦片(tile),对瓦片内像素做 alpha 合成。3DGS 的光栅化管线分三步:

  1. 投影与排序:所有高斯投影到屏幕后按深度(z 值)排序。这一步用基数排序(radix sort),是单帧最大的非并行环节。
  2. 瓦片分配:屏幕被划分为 16×16 像素的瓦片,每个高斯被分配到它覆盖的瓦片。
  3. 瓦片内 alpha 合成:每个瓦片由一个 CUDA block 处理,线程并行遍历该瓦片内的高斯,按深度顺序做 alpha 合成。

反向传播需要对每个像素→每个高斯的贡献传回梯度:屏幕空间梯度要乘回视图-屏幕雅可比,才能更新到 3D 协方差。这一套"前向闭式、反向解析"的设计,是实时训练的根本来源。gsplatCVPR 2024 是当前最活跃的开源 3DGS CUDA 光栅化引擎,由 nerfstudio 团队维护。

自适应密度控制:3DGS 的"生长"机制

自适应密度控制是 3DGS 区别于"固定表示"方法的核心——高斯数量在训练中动态变化。

致密化(Densification)判据 每 N 步(默认 100): 1. 统计位置梯度 ‖∇μL‖ 的视空间累积 τ_d(超过阈值 τ_pos 的像素统计) 2. 若 τ_d > τ_pos:    大尺度高斯(‖s‖ 超阈值)→ 分裂(split):一变二,缩小尺度    小尺度高斯 → 克隆(clone):复制到梯度方向 3. 若 α < α_min(默认 0.005)或世界尺寸超限: 剪枝(prune) 注意:致密化判据用的是"位置梯度的累积量",而非重建误差本身。这是很多初学者调不动 3DGS 的根因——你想加的约束不直接进入 split 判据,只能通过损失间接影响梯度。这意味着"加约束"和"改密度分布"之间存在延迟,不是即时响应。

CUDA 工程与现实约束

  • 排序开销:每帧按深度桶排,是单帧最大的非并行环节;很多加速方法(如 radix 排序替代、稀疏化)都在这里开刀。
  • 显存:基元数量直接决定显存,城市级动辄上千万高斯(每个高斯约 59 floats = 236 bytes),催生了整条压缩谱系(第 3 章)。
  • 训练稳定性:协方差若不加正则会退化成薄片;透明度 sigmoid 截断与 SH 截断是默认护栏。
  • 前向/反向一致性:前向和反向必须用同一套排序,否则梯度不一致导致训练发散。这是 3DGS 实现中最容易出 bug 的地方。
优化方向代表方法要点
抗锯齿Mip-Splatting多尺度一致,3D 平滑 + 2D Mip 滤波,去闪烁
表面几何2DGS / SuGaR / PGSR2D 圆盘或平面正则,出干净 mesh
基元表达力SVGS / NegGS / Neural Gabor基元内颜色/形状变化,减少基元数
训练加速Proxy-GS / Z-Order GS / AnchorSplat代理模型·Morton 序·锚点致密化
⚠ 常见误区 "3DGS 训练快"不等于"3DGS 调参简单"。位置梯度阈值 τ_pos、致密化间隔、clone 上限、透明度下限 α_min 这四个旋钮互相耦合;新加损失时要先确认它是否真的改变了 ‖∇μL‖,否则 split 不会按你的预期工作。本仓库的 3DGS 代码审查技能沉淀了 108+ 个已知 bug 模式,覆盖的正是这类"看起来在训练、其实在空转"的陷阱。
③ 开源实现对比 graphdeco-inria/gaussian-splatting:官方实现,最权威,但代码风格偏学术。 gsplat(nerfstudio 团队):当前社区最活跃的 CUDA 光栅化引擎,性能更优、API 更友好,CVPR 2024 发表。 nerfstudio:完整训练框架,集成 3DGS、NeRF 等多种方法,适合工程化快速上手。 COLMAP:不是 3DGS 库,但 3DGS 流程前端的必备工具——从图像序列估计相机位姿和稀疏点云,为 3DGS 提供初始化。
★ 思考题
  1. 为什么"位置梯度累积量"做 split 判据,而不是直接用 PSNR 改善量?这对设计新损失有什么限制?
  2. 协方差的缩放+四元数参数化,相比直接学 Σ,在梯度与稳定性上各带来什么?
  3. gsplat 与官方实现在排序算法上有什么不同?这对实际训练速度的影响有多大?
CH 03

从场景到世界:大规模·动态·压缩

城市级重建 · 4D 动态 · GS-SLAM · 压缩部署

第 1–2 章把 3DGS 的内核讲到了"单场景、静态、实时渲染"。但真实世界既不是一个房间,也不是静止的——城市级重建动辄上千万高斯,运动场景需要时间维度,机器人需要边走边建图,而部署到手机/头显又必须把动辄数 GB 的高斯场压到几十 MB。本章把 3DGS 从"实验室单场景"推向"世界级、动态、可部署"的三道关:大规模、4D 动态、压缩。

这三道关卡定了三条独立但相互关联的工程谱系。大规模解决的是"空间太大、显存不够",答案是分块与层级(Level of Detail);动态解决的是"时间在变、一个静态表示搞不定",答案是变形场(deformation field)与 4D 高斯;压缩解决的是"高斯太多、传不动存不下",答案是剪枝、量化与蒸馏。它们最终在 GS-SLAM 这一"边走边建图边压缩"的场景里汇合——这正是第 7 章的入口。

大规模重建:从房间到城市

一个房间 3DGS 重建通常需要几十万到几百万高斯;一栋楼几百万;一座城上千万。城市级高斯场最直接的问题是显存——每个高斯约 59 个 float(位置 3 + 缩放 3 + 旋转四元数 4 + 不透明度 1 + 3 阶球谐 48 = 59),单精度下约 236 bytes,一千万高斯就是 2.3 GB 纯参数,还不含训练中间态。把"一个巨大的高斯场"硬塞进单卡显存既不现实也不必要——你站在远处时根本不需要看清每片树叶。

工程答案沿"分块 + 层级"两条思路收敛:

  • 空间分块(Tiling / Block):把高斯场按空间切成块,每块独立训练或独立加载。视图渲染时只激活相机视锥内的块,显存占用从"全场"降到"视锥内几块"。这是大规模 GS 的第一条减负原则。
  • 细节层级(Level of Detail, LoD):远处用粗高斯、近处用细高斯,类似传统图形学的 LoD。当相机远离某区域,该区域的高斯被合并或用低阶表示替代,渲染帧率与显存同时受益。
层级高斯的核心权衡 显存 ∝ Σ(每块活跃高斯数)  ≠  总高斯数 LoD 的关键在于"活跃高斯数"被视距控制,而非总高斯数。这意味着一个十亿高斯的城市场,在任意视点下可能只需渲染几百万——前提是层级索引(octree / hash grid)足够快,能把"该激活哪些块"在毫秒级算出来。索引本身的开销是大规模 GS 工程化的隐藏成本。
方法会议一句话创新
CityGaussianECCV 2024层级 LoD 用于城市级实时渲染,分块训练 + 全局对齐
Hier-GSarXiv层级高斯,父子高斯合并/分裂,支持流式加载
BlockGaussianarXiv分块独立训练再缝合,解决跨块接缝与显存墙
⚠ 工程陷阱 分块训练最大的坑是跨块接缝:两块各自优化到自己最优,缝合处会出现高斯重叠/穿透/颜色跳变。解法是在块边界留一圈"重叠缓冲带",训练时让相邻块的缓冲带共享约束,缝合时再做一轮联合微调。很多团队第一次做大规模 GS 都栽在这一步——以为是渲染 bug,其实是训练对齐 bug。

动态与 4D:让高斯"运动"起来

静态 3DGS 假设场景不变;而真实世界里有走动的人、飘动的旗、流动的水。把时间维度引入高斯场有两条技术路线,区别在于"是动高斯本身,还是动坐标系":

  • 变形场(Deformation Field)路线:保持一套"规范空间(canonical space)"的静态高斯,额外训练一个小神经网络,把每个高斯在时刻 t 的位置/旋转/缩放从规范空间映射到观测空间。模型学到的是"运动规律"而不是"每帧一套高斯",参数量小但表达力受限于变形网络的容量。代表:Deformable-3DGS。
  • 4D 高斯(4D Gaussian)路线:直接把基元从 3D 高斯升维成 4D 高斯(3 空间 + 1 时间),每个高斯在时间轴上也有一个"分布",渲染时刻 t 时对时间维做条件采样。表达力更强、可建模瞬时形变,但基元参数和优化复杂度更高。代表:4DGS。
变形场 vs 4D 高斯 变形场:x'(t) = fθ(x, t)   (规范高斯 + 时间映射网络) 4D 高斯:G(x, t) = exp(−½ (x−μ, t−τ)ᵀ Σ₄D⁻¹ (x−μ, t−τ)) 变形场把"动"外包给一个网络,静态高斯不变;4D 高斯把"动"内化进基元本身的协方差。前者参数省、易训练,但对剧烈形变(衣物甩动、非刚性大位移)力不从心;后者表达力强,但 4D 协方差优化更难收敛,且每个高斯需要在时间轴上有足够的覆盖密度。选择取决于场景运动幅度。

两条路线在 2024 年同时爆发,并迅速衍生出针对具体问题的变体:SpacetimeGS 把时空统一进单一基元,DN-4DGS 用去噪网络抑制变形场的时序抖动,4DGS-Wild 处理无人值守视频(光照变、有人走动)的不确定性。注意一个工程事实:动态场景的评测比静态难得多——PSNR 在单帧上可能很高,但连续播放时人眼对时序不一致(flicker、抖动)极其敏感,所以 4DGS 方法普遍引入时序平滑正则和光流监督。

方法会议路线一句话创新
Deformable-3DGSCVPR 2024变形场变形场网络驱动高斯运动,高保真动态场景渲染
4DGS (4DGaussians)CVPR 20244D 高斯4D 各向异性高斯 + 正则化变形,实时动态渲染
SpacetimeGSECCV 2024时空统一单一基元统一空间与时间维度
DN-4DGSNeurIPS 2024变形场去噪变形网络 + 时空聚合,抑制时序抖动
4DGS-WildNeurIPS 2024变形场不确定性正则,处理无人值守视频的光照/运动扰动

GS-SLAM:边走边建图(第 7 章详述)

SLAM(Simultaneous Localization and Mapping)是大规模与动态的交汇点——机器人边移动边把环境建成高斯地图,同时用地图给自己定位。3DGS 把传统 SLAM 的"点云/体素地图"换成"可渲染高斯地图",带来一个革命性副产品:位姿估计可以直接用渲染图像做光度误差,而不必依赖特征点匹配。SplaTAM、Photo-SLAM、MonoGS 三者都在 CVPR 2024 同框发表,标志着 GS-SLAM 在一年内从概念走向成熟。第 7 章会深入拆解它们的设计差异——这里只点出它在本章的位置:GS-SLAM 同时面对"场景大需分块"和"场景动需时序"两道关,是大规模与动态谱系在机器人侧的合流。

压缩:从 GB 到 MB 的部署之路

3DGS 的"显式"是它强大的根源,也是它部署的软肋——一份高斯场动辄数百 MB 到数 GB,而手机、AR 眼镜、Web 端的预算往往只有几十 MB。压缩谱系沿三个正交方向展开,对应高斯场的三种冗余:

  • 数量冗余 → 剪枝(Pruning):大量高斯对最终渲染贡献极小(不透明度低、被遮挡、面积过小)。按贡献度排序后剪掉尾部,可一次性减少 30–50% 基元而几乎不掉质量。LightGaussian 的全局+局部剪枝即此思路。
  • 参数冗余 → 量化/向量量化(Quantization / VQ):球谐系数、缩放、旋转中存在大量相似模式。把连续参数聚类到码本(codebook),每个高斯只存码本索引而非完整向量,可压缩 10–20 倍。CompactGS、Compact3D 的核心是 VQ。
  • 结构冗余 → 蒸馏(Distillation):一组高斯场可用更少高斯+更精参数的"学生场"去拟合"教师场"的渲染输出。LightGaussian 的 SVD 蒸馏、EAGLES 的粗到细训练都在这条线上。
压缩的三阶权衡 质量 ↓  ∝  压缩率 ↑ 但:质量损失并非线性——存在"无痛压缩区" 大多数 GS 压缩方法都能在 10× 以内做到几乎无损(PSNR 掉 < 0.5 dB),但越过某个阈值后质量断崖式下跌。这个"断崖点"取决于场景复杂度:纹理丰富的场景冗余多、断崖点靠后;几何简单的场景冗余少、早压缩早就崩。工程上要先在自己场景上 scan 出断崖曲线,再选压缩率,切忌照搬论文数字。
方法会议主策略要点
LightGaussianNeurIPS 2024剪枝+蒸馏全局+局部剪枝 + SVD 蒸馏,15× 压缩 200+ FPS
EAGLESECCV 2024量化+剪枝量化嵌入 + 粗到细训练 + 剪枝,10–20× 显存压缩
CompactGSECCV 2024向量量化VQ + 学习码本,紧凑高斯属性存储
Compact3DarXiv向量量化+剪枝VQ + 剪枝,约 10–15× 压缩
SOG-GSCVPR 2025分组量化结构化全向分组量化,保留高斯间相关性
③ 部署视角 压缩不只是"存得下",更是"传得动"。Web 端 3DGS(如本仓库的 GitHub Pages 方法浏览器)需要在首屏秒级加载,这意味着压缩后还得分块流式下载——先加载粗 LoD 让画面立刻出现,再渐进精细。这条"压缩 + LoD + 流式"的组合链路,是 3DGS 从论文走向产品的最后一公里,也是很多学术压缩方法没覆盖的真实约束。
★ 思考题
  1. 分块训练的接缝问题,本质是"局部最优不等于全局最优"。除缓冲带外,你还能想到哪些对齐策略?
  2. 变形场与 4D 高斯,在"衣物快速甩动"和"人物缓慢走动"两种场景下,分别更合适哪个?为什么?
  3. 压缩的"断崖点"为什么依赖场景复杂度?如果你只有渲染预算(无原场),如何在线估计当前压缩是否安全?
  4. GS-SLAM 同时面对大规模与动态两道关,它会优先牺牲哪一道?这取决于什么?
CH 04

语义高斯:让空间被理解

语言嵌入 · 开放词汇 3D 分割 · 特征蒸馏 · 点级理解

到第 3 章为止,3DGS 能重建出视觉上逼真的空间,但这份空间是"哑"的——它知道每个像素是什么颜色,却不知道哪片高斯是"桌子"、哪片是"杯子"、哪个区域可以"坐上去"。空间智能的"眼睛"要长出来,3DGS 必须从"几何+外观"升级到"几何+外观+语义"。这一章讲语义高斯(Semantic / Language Gaussian)如何把语言模型的开放世界知识注入到三维基元里。

语义注入的意义远超"给点云上色"。一旦每个高斯带上"它是椅子"的标签,机器人就能在地图里检索"找一把椅子"、Agent 就能做"把桌子上的杯子移开"这类指令、AR 就能在真实物体上挂交互锚点。这正是空间智能从"看见"走向"看懂"的关键一跃。

从 NeRF 语义到 GS 语义:范式平移

给三维场加语义不是 3DGS 的发明。NeRF 时代已有 LERF(Language Embedded Radiance Fields,NeurIPS 2023):在 NeRF 的密度场之外再预测一个"语言特征场",从任意 3D 点可查询 CLIP 特征,做开放词汇 3D 分割。但 LERF 的语义藏在 MLP 权重里,查询要前向推理,且和 NeRF 一样慢。

3DGS 把语义问题彻底改写。因为高斯是显式的、可数的,语义可以直接挂到每个基元上——每个高斯除了颜色 SH,再多存一个 CLIP 特征向量。查询时不需要推理网络,直接读该高斯的特征就行。这带来三个工程质变:

  • 查询是 O(1) 的:点哪个高斯,立刻返回它的语义特征,无需光线步进或网络前向。
  • 语义和几何天然对齐:因为语义就挂在参与渲染的同一组高斯上,不存在"几何对、语义错位"的缝合问题。
  • 可编辑性:选中"所有椅子的高斯"可直接做后续编辑(搬运、隐藏、换色),因为语义就是基元属性。

核心机制:特征蒸馏损失

把 CLIP 特征挂到高斯上,技术上靠"特征蒸馏(feature distillation)"实现。它的核心是一个自监督闭环:

特征蒸馏损失(Feature Distillation Loss) Ldistill = Σview ‖ render(FGS) − FCLIP/SAM(Iview) ‖ FGS 是每个高斯携带的特征向量(待学习);render(·) 用和颜色完全相同的 alpha 合成把它渲染成 2D 特征图;FCLIP/SAM(Iview) 是 CLIP 或 SAM 在真实视图上提取的 2D 特征图(教师)。损失让"高斯渲染出的特征图"逼近"CLIP 看到的特征图"。因为渲染可微,梯度能从 2D 特征差传回每个高斯的特征向量,让它们学会"该长成什么 CLIP 向量"。

这套机制的关键洞察是:颜色渲染的 alpha 合成公式,对特征渲染同样适用。一个像素的颜色是 N 个高斯颜色的加权和,那么它的 CLIP 特征也可以是 N 个高斯 CLIP 特征的同一个加权和。于是"2D 特征监督→3D 基元特征学习"这条路天然打通,3DGS 的可微光栅化在这里立了大功——这正是隐式 NeRF 做不到的高效蒸馏路径。

关键方法与开放词汇能力

语义高斯方法之间的差异,主要在"特征怎么存、怎么查、粒度多细"上:

方法会议语义粒度一句话创新
LangSplatCVPR 2024区域级CLIP 特征存于每个高斯,开放词汇 3D 场景查询
OpenGaussianNeurIPS 2024点级每点特征蒸馏,点级开放词汇 3D 理解
CL-GSECCV 2024基元级对比学习蒸馏 GS 语义特征,CLIP 引导每高斯特征
LGGSCVPR 2025零样本语言引导 GS,无需逐场景训练的零样本 3D 理解
SemanticGaussCVPR 2025统一统一语义高斯表示,联合重建与理解

"开放词汇(open-vocabulary)"是语义高斯最被看重的属性——它不限于预定义类别,可以查询任意自然语言("那个能坐的东西""左边带把儿的容器")。这来自 CLIP 的语言-图像对齐能力:因为蒸馏的是 CLIP 特征空间,3D 高斯的语义也继承了 CLIP 对任意文本的泛化。从 LangSplat 的"区域级查询"到 OpenGaussian 的"点级查询",粒度越来越细——后者可以精确到"这个高斯属于杯子的把手",为精细操作(第 8 章)打下基础。

③ 与 NeRF 语义的衔接 理解 3DGS 语义,最好对照它的 NeRF 前身 LERF(NeurIPS 2023)。LERF 证明了"在辐射场里嵌语言特征"这条路可行,但受限于隐式表示的慢推理与不可编辑。LangSplat 等方法把同样的思想平移到显式高斯上,把"可行"变成"可用"——这是范式转换在语义子领域的典型复现。本仓库的 references/methods-semantic-editing.md 沉淀了从 LERF 到 GS 语义的完整迁移路径。
⚠ 语义精度的天花板 特征蒸馏有个根本限制:2D CLIP 特征本身就是区域级的。CLIP 在 2D 图像上做的是 patch 级聚合,它的特征图分辨率有限,难以区分"杯子把手"和"杯子杯身"这种细粒度部件。所以靠纯蒸馏的语义高斯,点级边界往往模糊。OpenGaussian 等方法用额外策略(如 SAM 的部件级 mask、分层聚合)来突破这个天花板,但没有 2D 端的细粒度监督,3D 语义的精度是有物理上限的。

语义高斯对具身智能的意义

语义高斯不是终点,而是机器人感知的前提条件。考虑一个抓取任务:"把桌上那个红色的杯子拿给我"。机器人需要:① 在三维地图里定位"桌子"区域(LangSplat 级语义);② 识别"杯子"并区分它与桌上其他物体(OpenGaussian 级点级语义);③ 锁定"红色"这个属性并规划抓取点(需要语义+几何+颜色的联合查询)。3DGS 同时承载几何、外观、语义三类信息,使这三个步骤能在同一份数据上完成,无需在点云/网格/图像之间反复投影——这是空间智能走向具身行动的底层便利。

★ 思考题
  1. 为什么"颜色渲染的 alpha 合成对特征渲染同样适用"?这背后是什么数学性质在起作用?
  2. 点级语义(OpenGaussian)比区域级语义(LangSplat)难在哪?2D CLIP 的特征分辨率如何限制了 3D 点级精度?
  3. 如果一个场景里有 100 把外观相同的椅子,纯语义高斯如何区分"这一把"和"那一把"?需要补什么信息?
  4. 语义高斯为机器人抓取提供了什么 NeRF 语义给不了的能力?
CH 05

编辑·生成·资产化

前馈重建 · 文本/图像到 3DGS · SDS 生成 · 可动画资产 · 材质重照明

前三章解决的是"从图像重建已存在的空间"。但空间智能的另一半是"创造不存在的空间"——从一句话生成一个 3D 资产、从几张照片秒级重建一个场景、给静态高斯加上骨骼让它动起来、换光照让它能装进游戏引擎。这一章把 3DGS 从"重建工具"推向"创作工具",覆盖四条资产化主线:前馈重建、生成、动画、材质重照明。

这四条线共同回答一个工程问题:3DGS 能不能成为 3D 内容生产的下一代标准格式?如果能,它的优势在于"显式、可微、可渲染"——既能像 mesh 一样直接被引擎消费,又能像 NeRF 一样从图像学习,还能用扩散模型/SDS 生成。这是 mesh 和 NeRF 都单独做不到的。

前馈重建:从"逐场景优化"到"一次前向"

原始 3DGS 是"逐场景优化"——给一组图,跑几十分钟训练得到这一场景的高斯场。前馈方法改变范式:训练一个大网络,输入几张新视角图像,一次前向直接吐出一组高斯,无需针对新场景再优化。这把 3DGS 从"离线重建"推向"实时重建",是走向 AR/机器人即时感知的关键。

前馈方法的核心设计选择是"高斯怎么从像素来":

  • 像素对齐(pixel-aligned):每个像素预测一组高斯参数(位置由像素深度反投影、其余由网络预测)。简单高效,但多视角一致性靠后处理保证。代表:PixelSplat、GPSGaussian。
  • 体素对齐(voxel-aligned):在 3D 体素网格上预测高斯,再投射到场景。多视角一致性更好。代表:VolSplat。
  • 代价体(cost-volume):先建多视图匹配的代价体,再从代价体回归高斯。几何最可靠但计算最重。代表:MVSplat。
  • 大重建模型(Large Reconstruction Model):用 Transformer 大模型吃多视图 token,直接回归高斯序列,靠数据规模实现零样本泛化。代表:GS-LRM。
方法会议策略一句话创新
PixelSplatCVPR 2024像素对齐极线 Transformer 做前馈双目 GS 重建
MVSplatECCV 2024代价体从 3 张稀疏视图建代价体回归 3DGS
GS-LRMECCV 2024大模型1B 参数 Transformer,零样本泛化的大重建模型
GPSGaussianECCV 2024像素对齐可泛化的像素对齐双目 GS,实时新视角合成
FreeSplatNeurIPS 2024像素对齐可泛化的前馈室内 3DGS
InstantSplatarXiv 2024无位姿无需位姿的稀疏视图重建,约 40 秒完成
③ 工程意义 前馈重建的真正价值不在"更快",而在"可泛化"——一个好的前馈模型见过足够多场景后,对从未见过的场景也能秒级给出合理高斯场。这是机器人进入陌生环境即时建图、AR 眼镜即时重建的前提。但要注意:前馈方法的单场景质量目前仍不如逐场景优化的 3DGS,因为它受限于训练分布。"快+泛化"和"精+定制"之间存在张力,工程上常以前馈初始化 + 少步定制微调兼顾两端。

生成:从文本/图像到 3DGS

前馈重建还需要输入真实图像;生成则更进一步——从一段文本或一张图直接"凭空"造出 3DGS 资产。这条线的主流技术是 SDS(Score Distillation Sampling):用一个 2D 扩散模型当"老师",把它的 2D 生成能力蒸馏进 3DGS 参数。

SDS 梯度(Score Distillation Sampling) θ LSDS = Eε,t[ w(t) · (εφ(xt; y, t) − ε) · ∂x/∂θ ] θ 是 3DGS 参数;x = render(θ) 是当前高斯场渲染的视图;εφ 是预训练扩散模型对加噪图 xt 预测的噪声;y 是文本条件。SDS 梯度让"当前 3D 渲染图"在扩散模型眼里更像"该文本应生成的 2D 图",梯度经可微渲染传回 3DGS 参数。DreamGaussian(ICLR 2024 Oral)把 SDS 从 NeRF 迁到 3DGS,速度提升数量级。

SDS 最大的工程障碍是"3D 一致性":扩散模型只在 2D 上保证"像",但蒸馏时要让它从多个视角都觉得"像",否则生成的 3DGS 在某些视角会崩。GaussianDreamer 用结构化高斯初始化缓解多面问题——先给一个合理的 3D 形状骨架,再用 SDS 雕琢外观,避免从纯噪声出发导致的视角抖动。

方法会议输入一句话创新
DreamGaussianICLR 2024 Oral文本/图像SDS + 3DGS 先验,文本到 3D 速度提升数量级
GaussianDreamerCVPR 2024文本SDS 耦合结构化高斯初始化,fast 文本到 3D

可动画资产:让高斯"动"成角色

第 3 章的 4D 动态是"记录已发生的运动";可动画资产是"创造可控的运动"——给一个高斯人体/角色挂上骨骼(SMPL/FLAME),用姿态参数驱动它做任意动作。这把 3DGS 从"重建结果"变成"游戏/影视可用的角色资产"。

核心机制是姿态条件变形(pose-conditioned deformation):每个高斯的位置/旋转/缩放不再是时间函数,而是骨骼姿态参数的函数。给定一串姿态关键帧,变形网络把规范高斯映射到每帧的实时位置,渲染出连贯动画。3DGS-Avatar 把这套思路用在可动画人体上;GaussianAvatars 系列则用 FLAME 面部模型锚定高斯,做表情驱动数字人。

方法会议对象一句话创新
3DGS-AvatarCVPR 2024人体可动画人体化身,姿态条件高斯变形
GaussianAvatars-2CVPR 2025面部FLAME 对齐高斯锚定的二代数字人

材质与重照明:让 3DGS 进游戏引擎

原始 3DGS 的球谐系数编码"视角依赖颜色",但这混合了材质和光照——换个光源,颜色不会自动变化。要让 3DGS 资产能装进游戏引擎被任意打光,必须把"材质(material)"和"光照(lighting)"解耦:用物理渲染(PBR)的 BRDF 表示材质,用环境贴图表示光照,渲染时按物理公式重新合成。这就是可重照明(relightable)3DGS

重照明渲染方程(PBR 分解) Lout(o) = ∫ fr(i, o, n) · Lin(i) · (n·i) di fr 是 BRDF(材质:法线 n、粗糙度、金属度、反照率),Lin 是入射光照(环境贴图)。原始 3DGS 的 SH 把 fr 和 Lin 卷在一起了;重照明 GS 把每个高斯预测为 BRDF 参数 + 估计/给定环境贴图,渲染时按上式重新积分。换 Lin 不动 fr,材质不变但光照变了。GaussianShader 给高斯挂可学习 shading function 表达反射/折射;GaussianShader-v2 加环境贴图估计做室内外可重照明。

重照明是 3DGS 资产化的"最后一公里"——只有材质和光照解耦,3DGS 重建的角色/场景才能和引擎里的虚拟灯光、动态时间变化正确合成。否则重建结果只能"在原光照下看",换个环境就穿帮。

★ 资产化的三角张力 3DGS 资产化在"质量、可控性、效率"三角间拉扯:前馈重建快但精度有限;SDS 生成可控(文本引导)但 3D 一致性弱;可动画/重照明增加可控性但损失原始重建质量。目前没有任何一条线同时最优化三角的三顶点。务实做法是按场景取舍——AR 即时重建要效率、影视资产要质量+可控、UGC 内容要可控+效率。
★ 思考题
  1. 像素对齐与代价体两种前馈策略,在"多视角一致性"和"计算量"上如何取舍?
  2. SDS 生成为什么会有"3D 一致性"问题?结构化初始化为什么能缓解它?
  3. 可动画高斯的"姿态条件变形"和第 3 章的"变形场"有何本质区别?一个造可控运动,一个记录运动,这对参数化意味着什么?
  4. 重照明为什么是"资产化最后一公里"?如果 3DGS 永远做不到完美 PBR,它能取代 mesh 吗,还是只能作为补充格式?
CH 06

具身智能基础:仿真到 Sim2Real

VLA 谱系 · 仿真平台 · Sim2Real 鸿沟 · 数据飞轮

前五章讲的是"空间如何被表示、被理解、被生成"。从这一章起,视角切换到"占据这份空间的智能体"——机器人。具身智能(Embodied Intelligence)的核心难题不是单独的感知或规划,而是感知-规划-行动在物理世界中的闭环:机器人看到世界、想出动作、执行动作、世界因此改变、再看到改变后的世界。这个闭环的每一环都受物理约束、噪声、延迟和不可逆性折磨。本章铺底——讲清 VLA 谱系、仿真平台与 Sim2Real 鸿沟,为第 7–9 章把 3DGS 接进机器人闭环做准备。

VLA 谱系:从 RT-2 到 GR00T N1

2023 年 7 月,Google DeepMind 发表 RT-2,正式提出 Vision-Language-Action(VLA)范式:把视觉-语言模型(VLM)微调到机器人动作轨迹上,让互联网上学到的知识直接迁移到机器人手上。这是具身智能的分水岭——此前机器人策略要么是手工规则,要么是小数据模仿学习;VLA 第一次让"看网课学常识"和"练动手学技能"在同一个网络里统一。此后两年,VLA 沿"端到端"和"分层"两条路线爆发。

VLA 的核心公式 at = Policyθ( ot, l, ht ) ot 是当前观测(图像/点云/3D 场),l 是语言指令,ht 是历史。端到端 VLA 把三者和动作 at 都塞进一个大模型;分层 VLA 把它拆成"VLM 规划高层动作 + 小策略网络执行低层动作"两层。端到端简单但难训练、难解释;分层灵活但两层接口设计难。争议至今未决。
方法团队时间一句话创新
RT-2Google DeepMind2023.07首创 VLA 范式,网课知识迁移到机器人手
OpenVLAStanford/Google2024首个开源 7B VLA,LLaVA 微调于 OXE 数据集
OctoUC Berkeley2024.03开源 93M VLA,模块化架构 + 独立动作头
π0Physical Intelligence2024.12流匹配动作解码器,50 步关节空间控制
GR00T N1NVIDIAGTC 2025.03开源人形机器人基础模型,System 1 快反应 + System 2 VLM 规划
Pelican-Unified 1.0ByteDance2026.05首个统一具身基础模型,单一 VLM 理解+推理+想象+行动
ReconVLA-AAAI 2026 Outstanding首个在顶会获最佳论文的具身 AI 工作,重建引导 VLA

注意两条主线在 2025–2026 年的汇合趋势:GR00T N1 把 System 1(快反应策略)和 System 2(VLM 慢规划)分层组合,本质是"分层派"吸收"端到端派"的优势;Pelican-Unified 1.0 则反其道,用单一 VLM 同时做理解、推理、想象、行动,证明端到端在足够数据下也能统一。这场"端到端 vs 分层"的争论,正随着模型规模和数据增长逐步收敛——答案很可能不是非此即彼,而是"端到端打底 + 必要处分层结构化"。

仿真平台:机器人的"健身房"

VLA 要数据,真实机器人采集成本极高(每条轨迹要人遥操作或真机运行),且易损易耗。仿真平台是解决方案:在虚拟世界里批量生成训练数据,再把策略迁回真机。这是 Sim2Real 的"Sim"端。主流仿真平台各有侧重:

平台团队特色一句话定位
Isaac SimNVIDIA物理仿真GPU 加速刚体/柔体物理,工业级精度, physically-based 渲染
HabitatFAIR导航大规模室内导航,HM3D/Gibson 数据集,支持多机器人
RoboCasaUT Austin家务大规模家务机器人仿真,10 万+ 轨迹
LIBEROStanford终身学习机器人操作终身学习基准(ICLR 2024)
AGIBOT WORLD / Genie Sim智元 AGIBOT数据引擎可交互可训练可评测物理仿真,百万轨迹 217 任务(ICRA 2026)
★ 仿真的根本矛盾 Sim2Real 的核心矛盾是仿真永远不够真。物理引擎对摩擦、接触、柔体的建模总有近似;渲染对光照、材质、噪声的模拟总有偏差。策略在仿真里练到 99% 成功率,到真机可能掉到 60%。这个"现实鸿沟(reality gap)"是具身智能最顽固的工程难题。解法沿两条路:① 让仿真更真(域随机化、更好的物理/渲染);② 让策略更鲁棒(在仿真里就见过各种扰动)。3DGS 在第二条路上有独特价值——它能把真实场景重建后搬进仿真,让仿真环境的"外观"逼近真实,缩小渲染侧的鸿沟。

Sim2Real 鸿沟与数据飞轮

缩小 Sim2Real 鸿沟的工程范式是"数据飞轮":仿真生成 → 真机微调 → 真机数据回流仿真 → 仿真再生成。这个闭环让仿真环境不断逼近真实分布。3DGS 在这里扮演两个角色:

  • 场景真实化:用 3DGS 重建真实场景(厨房、车间、仓库)后导入仿真,让仿真环境的视觉分布与真实一致。Habitat-GS 即此思路——把 3DGS 渲染嵌入导航训练。
  • 可微仿真:3DGS 的可微渲染让"仿真里的渲染"可被梯度优化,策略可以通过渲染误差反向学习。GS-World 把 3DGS 当作可微仿真引擎,让 Sim2Real 本身可微。ManiGaussian(ECCV 2024)更进一步——用动态高斯世界模型预测操作后的未来场景,让机器人在"想象"里预演动作后果。

这正是 3DGS 对具身智能的深层价值:它不只是"给机器人一张地图",而是把仿真与真实的边界变模糊——因为 3DGS 重建出来的就是真实场景的可微副本,策略可以在这个副本上安全试错、廉价试错、梯度式试错。这是空间智能赋能具身智能的关键通路,也是第 7–9 章展开的地基。

★ 思考题
  1. 端到端 VLA 和分层 VLA,在"可解释性"和"数据效率"上各有什么代价?
  2. Sim2Real 鸿沟里,"渲染偏差"和"物理偏差"哪个更难缩小?为什么?
  3. 3DGS 重建场景导入仿真,能缩小哪一侧的现实鸿沟?它的局限是什么?
  4. "可微仿真"为什么对策略学习有根本意义?传统非可微仿真的策略只能怎么学?
CH 07

3DGS 作为机器人空间记忆

GS-SLAM · 可渲染记忆 · 位姿估计 · 导航决策推理

机器人要在未知环境里行动,第一件事不是"规划",而是"记住"——边走边把周围建成一张地图,同时用这张地图给自己定位。这就是 SLAM(Simultaneous Localization and Mapping)。传统 SLAM 的地图是点云或体素网格:能定位,能避障,但不能渲染、不能查询语义、不能直观交互。3DGS 把这张地图换成可渲染的高斯场——机器人不仅能知道"我在哪",还能"看见"自己记忆里的世界,在任何视角渲染出图像。这一步把 SLAM 从"几何工具"升级为"空间记忆",是 3DGS 走向具身智能的最直接通道。

GS-SLAM:为什么高斯地图比点云地图更好

传统点云 SLAM(如 LOAM、ORB-SLAM 的地图)只存几何点,丢失了外观。这带来三个限制:① 无法做基于外观的重定位(换光照、换季节就认不出);② 无法渲染给人类看(调试困难、遥操作困难);③ 无法接语义(点没有颜色特征)。3DGS 地图同时存几何+外观,三项限制一并解除:

  • 光度位姿估计:位姿不再依赖特征点匹配,而是直接用"当前观测图 vs 渲染图"的光度误差做优化。这意味着只要地图能渲染,就能定位——哪怕场景里没有角点、纹理稀疏。
  • 可渲染调试:工程师能直接看到机器人"脑中"的世界长什么样,快速发现建图错误(漂浮高斯、穿模、漏建)。
  • 语义就绪:因为地图本身就是高斯场,第 4 章的语义高斯可直接挂上,机器人记忆瞬间从"几何"升级为"语义"。
GS-SLAM 的位姿优化目标 Tt* = argminT ‖ It − render(G, T) ‖2 + λ·R(T) G 是当前高斯地图,T 是待优化的相机位姿,render(G, T) 是从位姿 T 渲染地图得到的图像,It 是真实观测图。位姿优化变成"找一个 T,让渲染图最像真实图"。因为 render 可微,梯度可直接传到 T。R(T) 是位姿先验正则(平滑、回环)。这个目标把 SLAM 的"定位"和 3DGS 的"渲染"统一进一个可微优化——这是 GS-SLAM 的本质创新。

三大 CVPR 2024 GS-SLAM 对比

2024 年 CVPR 同时接收三篇 GS-SLAM,标志着这条路线从概念走向成熟。它们的设计差异恰恰映射了 GS-SLAM 的核心工程取舍:

方法会议输入核心设计特色
SplaTAMCVPR 2024RGB-D在线增量高斯 + silhouette mask + 渲染位姿优化首个实时 GS-SLAM
Photo-SLAMCVPR 2024RGB-D超原语地图:显式几何特征定位 + 隐式光度特征;Gaussian-Pyramid 训练可在 Jetson AGX Orin 边缘端运行
MonoGSCVPR 2024 Highlight单目 RGB首个实时单目 GS-SLAM,用高斯不确定性建模无需深度传感器

三者差异值得细看:SplaTAM 用 RGB-D(有深度),简单直接,是 GS-SLAM 的"标准答案";Photo-SLAM 的亮点是边缘部署——能在 Jetson AGX Orin 上跑,这对真实机器人至关重要(机器人不可能背一台工作站);MonoGS 最难,单目无深度,全靠高斯不确定性建模和先验,但适用面最广(任何带摄像头的设备都能用)。这种"输入模态 × 部署约束"的二维取舍,是 GS-SLAM 工程化的主轴。

⚠ GS-SLAM 的现实约束 GS-SLAM 当前最大的瓶颈不是精度,而是增量更新的稳定性。机器人边走边往地图里加高斯,新观测可能与旧高斯冲突(动态物体经过、光照变化)。如果不适时剪枝/合并/遗忘,地图会越长越乱——漂浮高斯、重影、穿模累积。SplaTAM-v2(CVPR 2025)加在线回环检测和全局优化正是治这个病;2DGS-SLAM(TRO 2026)用 2D 圆盘重写以保证全局一致。GS-SLAM 离"部署级可靠"还有距离,但它指明了方向。

空间记忆层级与导航决策

有了可渲染+可语义的高斯地图,机器人导航决策不再是"局部避障",而能在记忆上推理。考虑一个任务:"去厨房拿杯子"。机器人需要:① 在高斯地图里定位"厨房"区域(语义查询,第 4 章);② 在记忆中规划路径(拓扑/度量地图);③ 边走边用 GS-SLAM 更新位姿;④ 到厨房后用语义高斯找"杯子";⑤ 渲染抓取视角做运动规划。整条链路都挂在一份数据上——这是 3DGS 作为"空间记忆"的真正价值:它把定位、建图、感知、规划统一在一份可渲染可查询的表示里。

③ 与传统 SLAM 的衔接 GS-SLAM 不是要取代 ORB-SLAM、LOAM 这些经典方法,而是在它们之上加了一层"可渲染语义外壳"。很多 GS-SLAM 系统内部仍借用经典前端的特征追踪/里程计来做粗定位,再用高斯渲染做精修——这是务实组合。纯粹靠渲染做定位在纹理稀疏、快速运动时容易丢,传统特征前端更鲁棒。理解这种"经典前端 + GS 精修"的混合架构,是落地 GS-SLAM 的关键。
★ 思考题
  1. 光度位姿估计相比特征点匹配,在"纹理稀疏"和"快速运动"两种场景下各有什么表现?
  2. Photo-SLAM 能在 Jetson 上运行,SplaTAM 不能——这背后的设计差异是什么?边缘部署 GS-SLAM 要牺牲什么?
  3. GS-SLAM 的"增量更新稳定性"问题,与第 3 章大规模重建的"接缝问题"有何共通的根因?
  4. "经典前端 + GS 精修"的混合架构,为什么比纯 GS-SLAM 更鲁棒?这种妥协的代价是什么?
CH 08

物体级与铰接式理解

part-level 高斯 · 铰接资产 · 运动学约束 · CAD·Mesh·3DGS 桥接

第 4 章的语义高斯让机器人知道"这是椅子";第 7 章的 GS-SLAM 让机器人知道"椅子在房间哪"。但要真正操作一把椅子——把它搬起来、折叠它、打开它的腿——机器人还需要更细的理解:椅子有几部分?哪部分能动?怎么动?这就是物体级(part-level)与铰接式(articulated)理解。它是从"看见物体"到"理解物体怎么动"的关键一跃,也是机器人从导航走向操作的前置条件。

part-level 高斯:比物体级更细

第 4 章的语义高斯大多是"物体级"——区分椅子、桌子、杯子。但操作需要"部件级":一把椅子的椅背、椅腿、座面是不同部件,抓椅背和抓椅腿是不同动作。part-level 高斯把语义从"物体"细化到"部件",每个高斯不仅知道属于哪个物体,还知道属于该物体的哪个部件。

这比物体级难得多:部件边界是模糊的——椅背和座面在哪里分界?不同椅子结构不同。纯靠 CLIP 蒸馏的语义难以区分同物体内部部件,因为 2D CLIP 特征就是物体级的。OpenGaussian 用 SAM 的部件级 mask 做分层聚合,是当前突破点;GaussianGrasper(IEEE T-RO 2024)把 SAM+CLIP 蒸馏进 3D 语言高斯,专门服务开放词汇机器人抓取——它需要知道"抓杯子把手"而不是"抓杯子",这要求部件级语义。

铰接资产与运动学约束

铰接物体(articulated object)是 part-level 的进阶——它的部件之间有运动学约束:抽屉能拉、门能转、剪刀能合。理解铰接物体意味着不仅要分出部件,还要推断部件间的连接关系(哪两个部件相连)和运动类型(平移/旋转/自由度范围)。这是机器人操作最贴近物理的一层理解。

铰接物体的运动学模型 Tpart(θ) = Tjoint · Exp(ξ · θ) · Tpart,0 每个部件的位姿 = 关节变换 × 指数坐标表示的运动(旋转向量 ξ·θ) × 部件初始位姿。θ 是关节参数(抽屉拉开多远、门转多少度)。铰接理解的任务就是从观测推断:① 有几个部件;② 哪些部件间有 joint;③ 每个 joint 的类型(平移/旋转)和轴方向。这正是 URDF 机器人运动学模型在物体侧的镜像——理解了铰接,物体的运动就可以用与机器人手臂同样的运动学公式预测。

铰接理解的工程价值在于可预测性:一旦推断出"门绕这个轴旋转",机器人就能精确预测"推门把手 10 厘米,门会转到什么角度",而不必靠试错。这把操作从"盲目探索"变成"基于模型规划"。3DGS 在这里的优势是部件可分割——每个高斯属于一个部件,部件运动时只需对该部件的高斯做刚体变换,渲染即可预测运动后的外观。这比 NeRF 的隐式表示(无法分部件)天然适合铰接建模。

CAD·Mesh·3DGS 桥接:从重建到可制造

3DGS 能渲染、能编辑,但它不是工程师能直接制造的标准格式——制造业要 CAD(STEP/IGES),游戏业要 mesh。把 3DGS 重建结果转成可制造的 CAD/可用 mesh,是 3DGS 走向工业价值链的"最后一桥"。这座桥目前有几种走法,对应 3DGS 到几何表示的不同转换路径:

方法会议目标表示一句话创新
SuGaRCVPR 2024Mesh正则高斯对齐表面,TSDF + Marching Cubes 提网格
2DGSSIGGRAPH 2024Mesh2D 圆盘贴表面,Poisson 重建直接出网格
BrepGaussianCVPR 2026CAD (B-rep/STEP)3DGS + B-rep CAD 重建,输出参数化 STEP 模型
CADDreamerCVPR 2025 HighlightCAD (B-rep)文本/草图 → CAD B-rep 生成,扩散参数化 CAD 程序合成

这条桥接谱系揭示了一个递进:从"取近似 mesh"到"造精确 CAD"。SuGaR/2DGS 提的是网格——够游戏业用,但不是精确几何,不能直接数控加工。BrepGaussian 才真正叩开制造业大门:它把 3DGS 重建反向拟合到 B-rep(边界表示)CAD 模型,输出 STEP 文件——这是数控机床、3D 打印、CAD 软件能直接读的工业标准格式。一步从"看起来像"变成"可制造",是从消费级到工业级的质变。

3DGS → CAD 的表示鸿沟 3DGS:自由椭球场(无数高斯,无拓扑)  →  CAD:参数化 B-rep(少量面,严格拓扑) 3DGS 是"自由表示"——成千上万高斯各居其位,没有拓扑结构;CAD 是"约束表示"——少量参数化面(平面、圆柱、NURBS)通过严格拓扑边相连。从自由到约束的回归,本质是"拟合一个参数化模型去解释一堆高斯"。这比 3DGS→mesh 难得多:mesh 只要把高斯包络成三角面片(数值近似),CAD 还要推断"这应该是个圆柱还是个圆锥"(语义识别 + 参数拟合)。BrepGaussian 的贡献正是在这层"从数值到语义"的跨越。
★ 操作的前提条件 把 part-level 语义、铰接运动学、CAD 桥接串起来看,它们共同构成机器人操作的三级前置条件:① 部件级语义让机器人知道"抓手该对准哪个部件";② 铰接模型让机器人预测"动手后物体会怎么动";③ CAD/mesh 让机器人有精确几何做接触规划。3DGS 在三级里都扮演统一表示的角色——同一份高斯场既能出语义、又能出运动学、还能出 CAD——这是空间智能走向精细操作的底层便利。
★ 思考题
  1. 为什么部件级语义比物体级语义难?2D CLIP 的"物体级"特征如何限制了 3D 部件分割?
  2. 铰接物体的运动学模型,与机器人手臂的 URDF 模型本质上是同一套数学——这对"机器人操作物体"意味着什么?
  3. 3DGS → mesh 和 3DGS → CAD 的难度差异在哪?为什么后者需要"语义识别"?
  4. 如果 3DGS 一份表示能同时出语义、运动学、CAD,这对降低机器人系统的数据冗余有何意义?
CH 09

Agent 驱动的数字孪生与交互

MCP 渲染管线 · Agent↔3DGS 交互闭环 · 手势交互 · 可交互世界

前八章有一条隐线:3DGS 越来越像一份"数据"——能渲染、能查询、能优化。但从"数据"到"世界"还差最后一步——它必须能被 Agent 实时调用和操控。Agent 不只是读地图,而是能动地图:调视角、改参数、加物体、跑物理。这一章讲 Agent 如何通过 MCP(Model Context Protocol)协议驱动 3DGS 渲染管线,把一份静态重建变成可交互的数字孪生,串起感知与行动的完整闭环。

这是本书从"技术原理"走向"系统产品"的转折点。前八章回答"3DGS 是什么、能做什么";这一章回答"Agent 怎么用它做事"——这恰恰是空间智能从研究报告走进真实工作流的关键。

为什么 Agent 需要直接驱动 3DGS

传统 3DGS 工作流是"人写脚本 → 渲染 → 看结果 → 改脚本"的循环,Agent 的角色只是被动执行命令。但空间智能的真正落地点是Agent 自主探索 3D 空间:它要能问"从这个角度看会长什么样"并立刻得到答案,要能说"把这把椅子移到窗边"并看到效果,要能在数字孪生里预演"如果我从这边走会撞到什么"。这要求 Agent 和 3DGS 之间有一条双向、实时、可编程的通道——不只是读,还能写、能查、能渲染。

这就是 MCP(Model Context Protocol)介入的位置。MCP 是为 LLM/Agent 设计的工具调用协议,让 Agent 能像调函数一样调外部能力。把它接到 3DGS 渲染管线上,Agent 就获得了一组"操控 3D 空间"的原语:加载场景、设相机、渲染、查询高斯、变换物体、跑物理。本仓库的 mcp-server 正是这套桥接的原型实现——它把 3DGS 的能力封装成一组 MCP 工具,让 Agent 通过自然语言就能驱动机器渲染与查询。

MCP 渲染管线:工具集与交互闭环

MCP-3DGS 渲染管线的核心是把"3DGS 能做什么"拆成一组可被 Agent 调用的原子工具,每个工具是一个有明确输入输出的函数:

Agent↔3DGS 交互闭环 Agent → MCP_tool( params ) → renderer → 3DGS_scene → image/state → Agent Agent 用自然语言表达意图("从俯视角度看看这个房间"),LLM 把它翻译成一组 MCP 工具调用(load_scene + set_camera(top_view) + render),渲染器执行后返回图像或场景状态,Agent 据此决定下一步。这个闭环让 Agent 不再是"盲调脚本",而是"看见结果再决策"——这正是空间智能赋予 Agent 的具身性:它在数字孪生里有了"眼睛"。

本仓库的 MCP 服务器实现了 24 个工具,覆盖场景管理、相机控制、渲染输出、高斯查询、物体变换、物理模拟几大类。Three.js/WebGPU 做前端实时渲染,光追后端做高质量离线渲染——Agent 可按需在"快预览"和"精渲染"间切换。这套原型的意义不在工具数量,而在它验证了"Agent 用自然语言操控三维空间"这条路径可行——这是数字孪生从"给人看"升级为"给 Agent 用"的关键一步。

③ 工程要点 MCP-3DGS 最大的工程挑战是延迟与状态的同步。Agent 每次决策都要"渲染→看→再决策",如果渲染要几秒,闭环就慢到无法用。所以管线里必须有"粗预览(毫秒级)+ 精渲染(秒级)"双通道:Agent 默认走粗预览快速试错,需要确认时再调精渲染。另一挑战是状态一致性——Agent 改了场景后,所有人(人和其他 Agent)看到的必须是改后的版本,这需要单一数据源 + 实时同步,类似多人游戏的架构。

手势交互:让人类也进数字孪生

数字孪生不只是给 Agent 用的,也要给人用——工程师调试、设计师评审、工人培训都要"走进"孪生空间。传统交互靠键鼠,但三维空间最自然的交互是手势和身体。本仓库的 fusion-demo 把 MediaPipe(手势/姿态识别)+ YOLO(物体检测)+ Three.js(渲染)+ 3DGS(场景)融合,实现了实时手势驱动的三维交互:举起手就能"抓住"虚拟物体,捏合手指就能缩放,身体移动就改变视角。

这套融合的关键是多模态对齐:MediaPipe 给出 2D 手部关键点,要映射到 3DGS 场景里的抓取位置,中间需要深度估计和坐标变换;YOLO 识别真实手边的物体,要和孪生里的虚拟物体对应。对齐不准就会出现"手在空中抓,物体纹丝不动"的违和感。3DGS 的显式几何在这里帮了大忙——每个高斯有精确 3D 位置,手势射线的命中判定可以直接在高斯场上做,比 hitbox 近似精确得多。

数字孪生:3DGS 作为可交互世界

把以上三层叠起来——3DGS 重建的真实场景 + MCP 让 Agent 操控 + 手势让人进入——就得到一个"可交互数字孪生"。它的价值不在"看起来像真的",而在它是一个可被多方共享、可被 Agent 推理、可被人直观操控的统一空间。考虑一个工厂孪生:Agent 在里面预演"机器人手臂这么动会不会撞到货架",工人在里面培训"紧急按钮在哪、撤离路线怎么走",管理者在里面看"这条产线今天产能多少"。同一份 3DGS,三种用法,无需在点云/CAD/视频之间反复转换。

★ 数字孪生的三个成熟度 数字孪生可按"交互性"分三档:① 只读孪生——能渲染能看,但不能改,相当于 3D 照片;② 可查询孪生——能查询语义/测量/标注,像 3D 数据库;③ 可交互孪生——Agent 和人都能动它、改它、在它里面试错,是真正的"平行世界"。3DGS + MCP + 手势交互实现的是第三档,也是价值最高、最难的一档。它要求 3DGS 不再是"重建结果",而是"运行时数据结构"——这恰是空间智能走向产品的终极形态。
★ 思考题
  1. 为什么"Agent 自主探索 3D 空间"需要双向实时通道,而不仅仅是脚本调用?延迟在闭环里扮演什么角色?
  2. MCP-3DGS 的"粗预览+精渲染"双通道,和第 3 章大规模 GS 的"LoD"有什么共通的工程思想?
  3. 手势交互里"2D 手部关键点映射到 3DGS 场景"为什么难?3DGS 的显式几何如何帮了对齐?
  4. 数字孪生三档成熟度里,"可交互孪生"为什么要求 3DGS 是"运行时数据结构"而非"重建结果"?这对工程架构意味着什么?
CH 10

世界模型与未来展望

世界模型六大学派 · 3DGS×World Model · 空间基础模型 · Physical AI

终章把视野拉到最高处:世界模型(World Model)。前面九章讲的都是"空间如何被表示、理解、生成、交互"——但智能体要在世界里行动,最终要回答一个问题:"如果我这么做,世界会变成什么样?"这就是世界模型的领地:一份能让智能体预测行动后果、在脑中预演未来的内部模型。3DGS 在这条线上既是场景构建器,也是可微仿真引擎,更是空间智能与具身智能的交点。这一章梳理世界模型的六大学派,定位 3DGS 的位置,并展望空间基础模型与 Physical AI 的未来。

世界模型的六大学派

"世界模型"在 2024–2026 年成为最热的术语,但它背后是几条独立演进的研究脉络在交汇。学界共识是:视频生成 ≠ 世界模型——"能画出视频"不等于"理解世界"。物理一致性、因果推理、行动可控性是世界模型区别于纯视频生成的根本。当前可归纳为六大学派:

学派核心主张代表对 3DGS 的关系
视频生成派生成逼真视频 = 模拟世界Sora (OpenAI), Genie 3 (DeepMind)3DGS 可作渲染后端提供几何一致性
强化学习派内部环境模型用于策略训练Dreamer 系列 (Hafner), DayDreamer3DGS 可微渲染支撑"想象"训练
联合嵌入预测派在抽象表示空间预测,非像素空间V-JEPA 2 (LeCun/Meta)3DGS 提供可预测的几何结构
空间智能派理解并生成 3D 空间结构Marble (World Labs/李飞飞)3DGS 是核心表示工具
自动驾驶仿真派物理一致的未来状态预测Tesla Neural World Sim, GAIA (Wayve)3DGS 重建真实路况场景
3DGS 原生派动态高斯场本身即世界模型GS-World, ManiGaussian3DGS 既是表示也是预测引擎

这六派并非互斥,而是在"预测什么、在哪预测、为何预测"三个维度上各有侧重。视频生成派预测像素但缺物理;RL 派预测状态用于策略但表示抽象;JEPA 派避开像素在潜空间预测更高效但难解释;空间智能派强调 3D 结构理解;自动驾驶派追求物理一致的仿真;3DGS 原生派则直接把动态高斯场当作世界模型——它预测的不是视频或抽象向量,而是"高斯怎么动"。这最后一派最贴近本书主线,也最有工程落地性。

关键里程碑:从 Ha&Schmidhuber 到 V-JEPA 2

2018
Ha & Schmidhuber 发表"World Models"开山之作:用生成式世界模型在"梦境"中训练策略,奠定 RL 派基础
2020–2023
Hafner 在 DeepMind 推出 Dreamer V1–V3,V3 在 Minecraft 挖钻石,跨 150+ 任务泛化
2022
LeCun 提出 JEPA 架构理论:不在像素而在抽象表示空间做预测
2024.10
ManiGaussian(ECCV 2024):动态高斯世界模型驱动多任务机器人操作,3DGS 原生派首个代表作
2025.06
Meta FAIR 开源 V-JEPA 2:100 万+小时视频自监督,JEPA 派从理论走向工程
2025.08
DeepMind 发布 Genie 3:首个支持实时交互的世界模型,20–24fps@720p
2025.10
GS-World(港中深):3DGS 作为可微仿真引擎,生成式仿真 + Engine-driven Sim2Real VLA 统一
2025
DreamerV3 登上 Nature——基于模型的 RL 跨越多样化领域,MBRL 获主流学界盖章
2026
World Labs 推出 Marble:单张图像→可交互 3D 空间,空间智能派走向商业化

注意 DreamerV3 登上 Nature(2025)的标志性意义——这是基于模型的强化学习(MBRL)第一次在顶级综合期刊获得主流学界认可。Hafner 离开 DeepMind 创业商业化 Dreamer,与 LeCun 离开 Meta 押注 JEPA(成立 AMI Labs,2026 年种子轮 10.3 亿美元、估值 35 亿美元),标志着世界模型从学术研究走向产业赛道。两条技术路线(RL 派 vs JEPA 派)的代表人物同时下海,说明世界模型已被视为下一个ten-billion 级机会。

3DGS×World Model:可微仿真的独特位置

在六派之中,3DGS 原生派(GS-World、ManiGaussian)的位置独特而关键。其他学派的世界模型要么预测像素(视频生成派)、要么预测抽象向量(JEPA 派)、要么预测占用网格(自动驾驶派),而 3DGS 派预测的是高斯本身的运动——一种既有几何结构、又可渲染、又可微的中间表示。这带来一个独特优势:

3DGS 世界模型的预测目标 Gt+1 = WorldModel( Gt, at ) 给定当前高斯场 Gt 和动作 at,预测下一时刻的高斯场 Gt+1。因为 G 可渲染,预测结果可以直接"看见";因为 G 可微,预测误差可以直接反传训练世界模型;因为 G 是几何结构,预测天然带物理一致性(不会凭空产生穿模)。这三性(可渲染+可微+结构化)的叠加,是纯视频/纯向量世界模型做不到的。ManiGaussian 正是用这套思路预测机器人操作后的未来场景,让策略在"想象的高斯未来"里学习。

GS-World(港中深,2025.10)更进一步——它把 3DGS 直接当作可微仿真引擎,让 Sim2Real 本身可微:策略在 3DGS 仿真里试错,渲染误差反传优化策略,再把优化后的策略迁回真机。这把第 6 章的"数据飞轮"从"离线生成"升级为"在线可微优化",是 3DGS 对世界模型方法论的根本贡献。

空间基础模型与 Physical AI

把视野再拉高一层。2025–2026 年的大趋势是"空间基础模型"(Spatial Foundation Model)——把 3D 理解、生成、交互统一进一个大模型。World Labs 的 Marble(单图→可交互 3D 空间)、NVIDIA 的 Cosmos(World Foundation Model,3D 通才,从"生成画面"升级为"生成可行动的 3D 世界")都是这条线。3DGS 在这里的角色是基础模型与物理世界之间的胶水——基础模型生成/理解的是抽象 3D,3DGS 把它落地成可渲染可交互的具体场景。

★ Physical AI 的技术三角 黄仁勋在 CES 2025/2026 提出的 Physical AI 技术三角——世界模型 + 空间智能 + 具身智能——恰好是本书的结构:第 1–5 章讲空间智能(3DGS 表示/理解/生成),第 6–9 章讲具身智能(VLA/SLAM/操作/交互),第 10 章讲世界模型。三者都以"一份可计算、可渲染、可被 Agent 调用的三维空间表示"为地基——而 3DGS 是当下最被验证的地基。NVIDIA 的 Newton 物理引擎(CES 2026,实时物理世界模型,响应 < 0.01 秒)和 Cosmos 基础模型平台(1000 亿参数,推理延迟 1ms)正在把这个三角工程化。
⚠ 冷静看待:3DGS 会被吃掉吗? 一个必须直面的判断:当空间基础模型成熟到"输入图自动输出 3D 世界",3DGS 作为"中间表示"会不会被隐式模型吃掉?乐观派认为 3DGS 的显式、可编辑、可部署特性是隐式模型长期难以替代的;悲观派认为表示层终会被端到端大模型吸收,3DGS 会退居"训练时的中间产物"。本书的判断是:短期(3–5 年)3DGS 是不可替代的工程地基,长期它可能从"主角"变成"协议"——但即便如此,理解它的原理仍是做空间智能的必修课。后记会展开这个判断。

这本书的终点,是下一段的起点

从 2020 年 NeRF 到 2026 年的世界模型混战,三维表征这条线用六年走完了一个范式循环:隐式(NeRF)→ 显式(3DGS)→ 可交互(GS-World)→ 可预测(世界模型)。3DGS 在这个循环里是承上启下的关键一环——它把隐式表示的优美解构出来,重新组装成显式、可微、可工程化的新地基,并直接催生了可微仿真、可交互孪生、可预测世界模型三条新路线。这本书的终点不是"3DGS 完成了",而是"3DGS 让空间智能有了可施工的地基"——接下来的故事,由读到这里的你来写。

★ 思考题
  1. 六大学派里,3DGS 原生派为何"独特"?它的可渲染+可微+结构化三性叠加,解决了其他学派什么痛点?
  2. DreamerV3 登上 Nature 和 LeCun 押注 JEPA,同时发生在 2025–2026,这说明世界模型的产业地位发生了什么变化?
  3. GS-World 把 Sim2Real 从"离线生成"升级为"在线可微优化",这对策略学习的样本效率意味着什么?
  4. Physical AI 技术三角(世界模型+空间智能+具身智能)和本书结构(1–5/6–9/10 章)为何恰好对应?这是巧合还是必然?
  5. "3DGS 会从主角变成协议"——你认同吗?什么条件下这个判断成立,什么条件下不成立?

数据集与评估基准

3DGS 评测体系 · 具身智能数据集 · Sim2Real 指标

这一附录把全书涉及的数据集与评估指标集中梳理。它不是论文清单,而是工程速查——告诉你"该在哪个数据集上测什么、用什么指标、注意什么坑"。

3DGS 主流评测数据集

数据集类型场景用途与注意
Mip-NeRF 360室外 360°9 场景(自行车、盆景、厨房等)3DGS 最主流基准;含大量高频细节与远景,对锯齿敏感。报告全图 PSNR/SSIM/LPIPS
Tanks & Temples大场景Truck / Train 等真实大场景新视角合成;注意不同方法用的分辨率/下采样协议可能不同,对比需统一
Deep Blending室内混合2 场景含复杂遮挡与反射;适合测透明/半透明场景表现
NeRF Synthetic (Blender)合成物体8 物体(chair/drums/lego 等)干净合成场景,PSNR 普遍 30+;适合隔离变量测方法本身。报告 center crop
⚠ 评测陷阱 Mip-NeRF 360 的 LPIPS 有两个常见实现——3DGS 内置的 lpipsPyTorch 和标准 lpips 包,两者 VGG 值差异 < 0.001,可对比;但若混用 AlexNet 版则会差很多。3DGS 原文 Table 1 的 LPIPS 未明确标注 backbone,与社区复现值有出入。对比实验务必统一评估代码(用同一份 metrics.py),否则 0.3 dB 的差异可能纯属实现差异而非方法差异。本仓库 references/benchmark-data.md 沉淀了逐场景精确值与一致性验证。

评估指标三件套

PSNR / SSIM / LPIPS PSNR = 10·log₁₀(MAX² / MSE)   ↑ 越高越好(dB) SSIM ∈ [0,1]   ↑ 越高越好(结构相似性) LPIPS = ‖φ(x) − φ(x̂)‖   ↓ 越低越好(VGG/AlexNet 特征距离) PSNR 衡量像素级误差,对噪声敏感但与人类感知相关性弱;SSIM 衡量结构相似性,比 PSNR 更贴近人眼;LPIPS 用深度网络特征衡量感知差异,最接近人类判断但依赖 backbone。三者互补——只看 PSNR 会漏掉感知质量下降(如 NegGS 在 Mip-NeRF360 上 PSNR 升但 LPIPS 反而劣)。

具身智能数据集

数据集类型用途
ScanNet / ScanNet++室内 RGB-D语义/实例分割基线,1513 场景
Replica高精度室内GS-SLAM 常用评测,18 场景,含完美 mesh 做 GT
HM3D / Gibson大规模室内导航Habitat 导航训练,千级建筑
KITTI / nuScenes自动驾驶室外大场景,激光雷达+相机,SLAM 与世界模型
ABC / ShapeNet / PartNetCAD/网格CAD 重建与部件分割基线

Sim2Real 评测的特殊性

具身智能的评测比 3DGS 渲染评测复杂一个量级——它要评"策略迁移到真机后的成功率",而非图像质量。常见指标:① 仿真内成功率(上限,乐观估计);② 真机成功率(真值,但贵且噪声大);③ 跨环境泛化率(换场景/光照/物体后的成功率衰减)。第三项最关键也最常被省略——很多论文只报前两项,但 Sim2Real 的真正考验是泛化而非单场景成功率。

引用与延伸阅读

以下按类别整理全书引用的论文、开源仓库与资源。所有条目均已核实发表场所与链接,arXiv 编号可直达原文。

① 基础与核心论文 Foundation & Core

[1] Mildenhall et al., "NeRF: Representing Scenes as Neural Radiance Fields for View Synthesis," CVPR 2020 Best Paper Honorable Mention arXiv:2003.08934隐式神经辐射场开山之作,用 MLP 编码 5D 辐射场
[2] Kerbl et al., "3D Gaussian Splatting for Real-Time Radiance Field Rendering," SIGGRAPH 2023 / ACM TOG arXiv:2308.04079 | 项目主页 | 代码3DGS 原文:各向异性高斯 + 可微光栅化 + 自适应密度控制,实时且质量超 NeRF
[3] Yu et al., "Mip-Splatting: Alias-free 3D Gaussian Splatting," CVPR 2024 Best Student Paper arXiv:2311.164933D 位置平滑 + 2D Mip 滤波,系统性消除多尺度锯齿
[4] Huang et al., "2D Gaussian Splatting for Geometrically Accurate Radiance Fields," SIGGRAPH 2024 / ACM TOG arXiv:2403.178882D 圆盘替代 3D 高斯,几何更干净,可直接提网格
[5] Guédon & Lepetit, "SuGaR: Surface-Aligned Gaussian Splatting," CVPR 2024 arXiv:2312.13253 | 代码正则化高斯对齐表面,TSDF + Marching Cubes 高质量提网格

② 综述 Surveys

[6] 南京大学, "3D Gaussian Splatting: Survey, Technologies, Challenges, and Opportunities," IEEE TCSVT Vol.35 No.7, 2025.07对 3DGS 浪潮最全面的梳理之一,覆盖技术、挑战与机遇
[7] Cornell & HKUST, "Vision-Language-Action Models: Concepts, Progress, Applications and Challenges," arXiv:2505.04769VLA 综述,从具身智能侧讨论 VLM 如何驱动 3D 理解产业化
[8] 港科广+中大+港中文+清华+博世, "Simulating the Real World," TPAMI 20262D/视频/3D/4D 统一维度生长框架,引用 3K+

③ GS-SLAM SLAM

[9] SplaTAM, "SplaTAM: Dense RGB-D SLAM in Minutes," CVPR 2024 arXiv:2312.02126 | 代码首个实时 GS-SLAM:在线增量高斯 + silhouette mask + 渲染位姿优化
[10] Photo-SLAM, "Photo-SLAM: Real-time Visual SLAM at the Speed of Light," CVPR 2024 arXiv:2311.16728 | 代码超原语地图 + Gaussian-Pyramid 训练,可在 Jetson AGX Orin 边缘端运行
[11] MonoGS, "Gaussian Splatting SLAM," CVPR 2024 Highlight arXiv:2312.06741 | 代码首个实时单目 GS-SLAM,用高斯不确定性建模
[12] PRBonn, "2DGS-SLAM," TRO 2026 代码2D 圆盘全局一致 RGB-D SLAM,回环检测 + 全局优化

④ 语义高斯 Semantic

[13] Qin et al., "LangSplat: 3D Language Gaussian Splatting," CVPR 2024 arXiv:2312.16084 | 代码CLIP 特征存于每高斯,开放词汇 3D 场景查询
[14] Wu et al., "OpenGaussian: Point-Level Understanding of Open 3D Gaussians," NeurIPS 2024 arXiv:2406.02058每点特征蒸馏,点级开放词汇 3D 理解
[15] Kerr et al., "LERF: Language Embedded Radiance Fields," NeurIPS 2023 arXiv:2303.09553NeRF 语义前身,证明辐射场可嵌语言特征
[16] CL-GS, "Contrastive Learning for Gaussian Splatting Semantic Features," ECCV 2024 arXiv:2407.10102对比学习蒸馏 GS 语义特征

⑤ 动态与 4D Dynamic

[17] Yang et al., "Deformable 3D Gaussians for High-Fidelity Dynamic Scene Rendering," CVPR 2024 arXiv:2311.12775 | 代码变形场网络驱动高斯运动,高保真动态场景
[18] Wu et al., "4D Gaussian Splatting for Real-Time Dynamic Scene Rendering," CVPR 2024 arXiv:2310.08528 | 代码4D 各向异性高斯 + 正则化变形,实时动态渲染
[19] SpacetimeGS, ECCV 2024 arXiv:2405.12110单一基元统一空间与时间维度
[20] DN-4DGS, NeurIPS 2024 arXiv:2410.13607 | 代码去噪变形网络抑制时序抖动

⑥ 压缩 Compression

[21] LightGaussian, NeurIPS 2024 arXiv:2311.17245 | 代码全局+局部剪枝 + SVD 蒸馏,15× 压缩 200+ FPS
[22] EAGLES, ECCV 2024 arXiv:2312.04564 | 代码量化嵌入 + 粗到细训练 + 剪枝,10–20× 显存压缩
[23] CompactGS, ECCV 2024 arXiv:2404.04908VQ + 学习码本,紧凑高斯属性存储
[24] SOG-GS, CVPR 2025 arXiv:2411.16443结构化全向分组量化,保留高斯间相关性

⑦ 前馈重建与生成 Feed-Forward & Generation

[25] PixelSplat, CVPR 2024 arXiv:2312.12337 | 代码极线 Transformer 前馈双目 GS 重建
[26] MVSplat, ECCV 2024 arXiv:2403.14627 | 代码代价体从 3 张稀疏视图回归 3DGS
[27] GS-LRM, ECCV 2024 arXiv:2404.197021B 参数 Transformer 大重建模型,零样本泛化
[28] DreamGaussian, ICLR 2024 Oral arXiv:2309.16653 | 代码SDS + 3DGS 先验,文本到 3D 速度提升数量级
[29] GaussianDreamer, CVPR 2024 arXiv:2312.05941 | 代码SDS 耦合结构化高斯初始化,fast 文本到 3D

⑧ 化身与材质 Avatar & Material

[30] 3DGS-Avatar, CVPR 2024 arXiv:2310.08529 | 代码可动画人体化身,姿态条件高斯变形
[31] GaussianShader, arXiv:2311.17977高斯挂可学习 shading function,表达反射/折射
[32] GaussianShader-v2 (R3DG), CVPR 2024 arXiv:2311.17061环境贴图估计,室内外可重照明 GS

⑨ VLA 与具身智能 VLA & Embodied

[33] RT-2, Google DeepMind, 2023.07 arXiv:2307.16518首创 VLA 范式,网课知识迁移到机器人手
[34] OpenVLA, Stanford/Google, 2024 arXiv:2406.09246首个开源 7B VLA
[35] π0, Physical Intelligence, 2024.12 arXiv:2410.24164流匹配动作解码器,灵巧操作
[36] GR00T N1, NVIDIA, GTC 2025.03 arXiv:2503.14734开源人形机器人基础模型,System 1 + System 2
[37] Pelican-Unified 1.0, ByteDance, 2026.05 首个统一具身基础模型,单一 VLM 理解+推理+想象+行动
[38] ManiGaussian, ECCV 2024 arXiv:2403.08498 | 项目动态 GS 世界模型驱动多任务机器人操作
[39] GaussianGrasper, IEEE T-RO 2024 arXiv:2403.096373D 语言 GS 开放词汇机器人抓取,SAM+CLIP 蒸馏

⑩ 世界模型 World Models

[40] Ha & Schmidhuber, "World Models," 2018 arXiv:1803.10122开山之作:生成式世界模型在"梦境"中训练策略
[41] Hafner et al., "DreamerV3: Mastering Diverse Domains through World Models," Nature 2025 arXiv:2301.04104基于模型的 RL 跨 150+ 任务泛化,Minecraft 挖钻石
[42] V-JEPA 2, Meta FAIR, 2025.06 arXiv:2506.09947JEPA 联合嵌入预测架构,100 万+小时视频自监督
[43] Genie 3, Google DeepMind, 2025.08首个支持实时交互的世界模型,20–24fps@720p
[44] GS-World, CUHK-Shenzhen, 2025.10 3DGS 作可微仿真引擎,生成式仿真 + Engine-driven Sim2Real VLA 统一
[45] Marble, World Labs (李飞飞), 2026单张图像→可交互 3D 空间,空间智能商业化

⑪ CAD·Mesh 桥接 CAD & Mesh Bridge

[46] BrepGaussian, CVPR 2026 arXiv:2602.211053DGS + B-rep CAD 重建,输出参数化 STEP 模型
[47] CADDreamer, CVPR 2025 Highlight文本/草图→CAD B-rep 生成,扩散参数化 CAD 程序合成

⑫ 开源实现与资源 Open Source

[48] gsplat — nerfstudio 团队, CVPR 2024 GitHub当前最活跃的 3DGS CUDA 光栅化引擎
[49] nerfstudio GitHub完整训练框架,集成 3DGS/NeRF,适合工程化上手
[50] COLMAP GitHub3DGS 流程前端必备:图像序列→相机位姿+稀疏点云
[51] awesome-3D-gaussian-splatting (MrNeRF) GitHub社区维护的 3DGS 论文/资源精选清单
[52] Awesome-Gaussian-Skills(本书配套仓库)GitHub | 方法浏览器789+ 方法 / 25 类别 / 15 个 AI 技能 / 24 个 MCP 工具

⑬ 仿真平台 Simulators

[53] NVIDIA Isaac Sim 官网GPU 加速物理仿真,工业级精度,physically-based 渲染
[54] Habitat, FAIR GitHub大规模室内导航,HM3D/Gibson 数据集
[55] RoboCasa, UT Austin大规模家务机器人仿真,10 万+ 轨迹
[56] LIBERO, Stanford ICLR 2024机器人操作终身学习基准
[57] AGIBOT WORLD / Genie Sim, 智元 ICRA 2026可交互/可训练/可评测物理仿真,百万轨迹 217 任务

后记 · 3DGS 会被吃掉吗

表示层的终局判断 · 短期地基与长期协议

写到这里,这本书的主体已经走完——从 NeRF 到 3DGS,从数学内核到大规模部署,从语义到生成,从具身智能到世界模型。最后留一个问题,它既是技术判断,也是这本书的态度:3DGS 会不会被更大的模型吃掉?

乐观派:显式不可替代

乐观派认为,3DGS 的显式、可编辑、可部署特性是隐式模型长期难以替代的。论据有三:① 可编辑性:要挪一把椅子、换个灯、删掉一堵墙,显式高斯直接操作基元即可,隐式模型要重训或学 condition;② 可部署性:手机、AR 眼镜、Web 端的算力和带宽有限,显式高斯可压缩、可流式加载,隐式模型推理成本高且难压缩;③ 可查询性:Agent 要问"这个点是什么材质""那个物体能转吗",显式基元直接查,隐式模型要前向推理。这三性共同构成"工程不可替代性"——只要还有边端部署、实时交互、精细编辑的需求,3DGS 就有位置。

悲观派:表示层终被吸收

悲观派认为,表示层终会被端到端大模型吸收。论据是:① 历史先例:目标检测的特征工程被检测大模型吃掉,语义分割的 hand-crafted 特征被分割大模型吃掉——表示工程的归宿是被学习吸收;② 大模型趋势:空间基础模型(Marble、Cosmos)正在做"输入图→输出 3D 世界",3DGS 可能沦为训练时的中间产物,推理时不再显式存在;③ 规模胜出:当数据规模够大,一个端到端模型可能直接从图像到行动,中间不需要显式 3D 表示——3DGS 这一步会被"内化"进模型权重。

本书的判断:短期地基,长期协议

本书的判断落在中间:短期(3–5 年)3DGS 是不可替代的工程地基,长期它可能从"主角"变成"协议",但即便如此,理解它的原理仍是做空间智能的必修课。理由是:

  • 空间基础模型当前远未成熟——Marble 单图生 3D 仍需后处理,Cosmos 的物理一致性仍在追赶仿真器。在它们成熟到"输入即输出"之前,3DGS 作为可施工的中间地基不可替代。
  • 即便大模型成熟,"可微渲染 + 显式控制"的交互需求不会消失——工程师要调参数、Agent 要操控场景、人要直观编辑,这些需求要求一份可读可写的显式表示。3DGS 可能不再是最终输出,但会作为"人和 Agent 操控大模型的接口协议"长期存在。
  • 更深一层:3DGS 的核心贡献不是"高斯"这个具体表示,而是它证明了显式可微表示可以实时、可编辑、可部署。这个洞见会迁移到任何后续表示上——即便未来出现比高斯更好的基元,本书讲的密度控制、可微光栅化、语义蒸馏、可微仿真等机制仍然适用。理解 3DGS,就是理解空间智能的工程范式。

所以这本书的终点不是"3DGS 完成了",而是"3DGS 让空间智能有了可施工的地基"。地基之上会盖什么楼——是空间基础模型、可交互数字孪生、还是 Physical AI 的完整闭环——由读到这里的你来决定。3DGS 给了你一块最顺手的砖,怎么用,看你想盖什么。

★ 最后一句话 从 2020 年 NeRF 到 2026 年的世界模型混战,六年走完一个范式循环:隐式→显式→可交互→可预测。3DGS 在这个循环里是承上启下的关键一环。它不是终点,但它是当下最值得理解、最值得动手的一环。这本书写到这里,希望你不只是读完了,而是开始用 3DGS 做点什么——因为空间智能的下一章,属于动手的人。