空间智能与具身智能深入理解 · 以 3D Gaussian Splatting 为核心 ⎇ 仓库
① 开源技术书 · 设计原理与工程实践

深入理解空间智能与具身智能

以 3D Gaussian Splatting 为核心,串联 819+ 方法与 15 个工程技能,讲透从三维表征到机器人行动的完整闭环

具身智能体= 空间表征×感知×规划×行动 (核心公式,致敬 Agent = LLM + 上下文 + 工具
methods categories skills embodied
章节速览
引言

为什么写这本书

空间智能与具身智能的百年交汇,3DGS 为何是关键拼图,以及本书的核心公式与方法论。

阅读 →
第 1 章

从 NeRF 到 3DGS:范式跃迁

显式 vs 隐式表征,体渲染与辐射场,3DGS 三大创新为何让它在一年内引爆。

阅读 →
第 2 章

3DGS 的数学与工程内核

各向异性高斯、可微光栅化、自适应密度控制与 CUDA 工程的完整拆解。

阅读 →
第 3 章

从场景到世界

大规模重建、动态/4D 高斯、SLAM 实时建图与压缩部署的工程化道路。

阅读 →
第 4 章

语义高斯

语言/语义高斯、开放词汇 3D 分割——空间智能的"眼睛"如何长出来。

阅读 →
第 5 章

编辑·生成·资产化

从重建到创造:前馈重建、文本/图像到 3DGS、可动画资产与材质重照明。

阅读 →
第 6 章

具身智能基础

VLA 谱系、仿真平台、Sim2Real 鸿沟与数据飞轮——机器人如何"长记性"。

阅读 →
第 7 章

3DGS 作为空间记忆

GS-SLAM 把高斯地图变成"可渲染记忆",导航决策如何在其中推理。

阅读 →
第 8 章

物体级与铰接式理解

part-level 高斯、铰接资产与 CAD·Mesh·3DGS 桥接——操作的前置条件。

阅读 →
第 9 章

Agent 驱动的数字孪生

MCP 渲染管线、手势交互、3DGS 作为可交互世界,串起感知与行动闭环。

阅读 →
第 10 章

世界模型与未来

世界模型六大学派、3DGS×World Model 交叉、空间基础模型与 Physical AI。

阅读 →
第 11 章

安全、溯源与版权保护

3DGS 水印谱系、GaussTrace 溯源、对抗攻击面、IP 管理与工业合规。

阅读 →
附录

数据集与评估基准

从 Mip-NeRF360 到 ScanNet++,3DGS 与具身智能的主流评测体系全景。

阅读 →
引用

引用与延伸阅读

60+ 权威论文、开源仓库、数据集与教程资源,按类别整理的完整参考目录。

阅读 →
引言

为什么写这本书

空间智能与具身智能的百年交汇 · 3DGS 为何是关键拼图

2023 年 8 月,INRIA 的 Bernhard Kerbl 及合作者在 SIGGRAPH 发表了论文"3D Gaussian Splatting for Real-Time Radiance Field Rendering"SIGGRAPH 2023。他们用一组各向异性 3D 高斯直接充当辐射场表示,配合可微光栅化(differentiable rasterization),把新视角合成的训练时间从数小时压到数十分钟,渲染超过 100 FPS。这不是渐进式改进——它是表示层面的范式转换。一年内它从一篇论文变成一个 819+ 方法、跨 23 个类别的庞大生态,并被迅速推向自动驾驶、机器人建图、数字孪生与内容生成。

这本书想回答的核心问题是:为什么偏偏是 3DGS,成了空间智能与具身智能之间最顺手的桥梁?

2020.03
Mildenhall 等人发表 NeRF,用 MLP 隐式编码辐射场,荣获 CVPR 2020 最佳论文荣誉提名。神经辐射场引爆隐式表示路线 CVPR 2020
2023.08
Kerbl 等人发表 3DGS,用显式高斯基元 + 可微光栅化实现实时渲染,质量超 NeRF 且快 100× SIGGRAPH 2023
2023.07
Google DeepMind 推出 RT-2,首创 Vision-Language-Action (VLA) 范式,知识从互联网迁移到机器人手
2024.06
李飞飞在旧金山 AI Startup School 演讲,正式提出"空间智能"(Spatial Intelligence)作为 AI 的下一个前沿
2024.09
李飞飞创立 World Labs,专注空间智能与世界模型,估值在 2026 年 2 月融资 10 亿美元后达 100 亿美元
2025.01
黄仁勋在 CES 2025 提出 Physical AI 技术三角:世界模型 + 空间智能 + 具身智能
2025.06
Meta 发布 V-JEPA 2(LeCun 主导),在联合嵌入预测空间做世界模型,不重建像素 2025
2025.06
NVIDIA 开源 GR00T N1 人形机器人基础模型,System 1 快反应 + System 2 VLM 规划
2026.05
字节跳动发布 Pelican-Unified 1.0,首个统一具身基础模型;多伦多大学 BISON 实现双层策略 10K 物体 <1min 规划

李飞飞在 2024 年 6 月旧金山 AI Startup School 的演讲中说:"AGI 若没有空间智能,是不完整的。"她把空间智能定义为"在三维空间中感知、推理、生成和交互的深层能力"——不是二维图像识别,而是对三维物理世界的完整理解与行动能力。这与黄仁勋在 2025 CES 的 Physical AI 命名形成呼应:世界模型 + 空间智能 + 具身智能。三者都以"一份可计算、可渲染、可编辑的三维空间表示"为地基——而 3DGS 是当下最被验证的地基。

★ 核心公式 本书把整套技术压缩为一个公式,并贯穿全书(致敬 深入理解 AI AgentAgent = LLM + 上下文 + 工具):
具身智能体 = 空间表征 × 感知 × 规划 × 行动 空间表征是地基,感知/规划/行动是上层;四个因子任何一项变为零,智能体都无法在物理世界落地。3DGS 在"空间表征"这一因子上提供了当前最强的显式解。

为什么不是点云、不是网格、不是 NeRF?

点云(Point Cloud)是三维数据最直接的表示,但它没有外观、不可微渲染、无法表达视角依赖的颜色。网格(Mesh)是游戏与 CAD 的标准格式,但它难以从图像优化生成、对复杂透明/半透明场景束手无策。NeRF 用 MLP 隐式编码一切,渲染质量极高但需要逐像素光线步进(ray marching),训练和推理都慢,且表示藏在网络权重里——不可编辑、不可直接查询。3DGS 把辐射场显式化成一组可数、可微、可渲染的 3D 高斯基元:表示暴露在数据里,而不是埋在权重里。这一步直接决定了后面所有"编辑、压缩、语义、喂给机器人"的可能性。

这本书做三件事

这本书不是论文清单。它做三件事:第一,沿着 3DGS 的数学与工程内核,把"为什么它能实时、能编辑、能当机器人的记忆"讲到位;第二,沿"表示→感知→规划→行动"的主线,把 819+ 方法归类到一个可推理的框架里;第三,每一章都锚定本仓库里真实存在的方法表、references 与 skills,让"读完书"和"上手工程"无缝衔接。

③ 阅读建议 如果你做重建/内容生成,重点读第 1–5 章;如果你做机器人,重点读第 6–9 章;第 10 章把视野拉到世界模型与空间基础模型。附录提供了数据集与评估基准的全景,引用与延伸阅读列出了 60+ 权威资源。每章末尾有思考题,建议带着自己的项目回答。

开始之前,请记住一个判断:3DGS 的胜负不在于渲染多一两个 dB 的 PSNR,而在于它第一次让"空间"成为一份可微、实时、可被 Agent 调用的第一类数据结构。这正是空间智能走向具身智能的命门,也是本书的主线。

CH 01

从 NeRF 到 3DGS:空间表征的范式跃迁

显式 vs 隐式 · 体渲染与辐射场 · 三大创新

在新视角合成(Novel View Synthesis)这条线上,2020 年的 NeRF 用一个 MLP 隐式地把密度与颜色编进网络权重,靠光线步进(ray marching)求解体渲染积分。它在概念上极其优美——5D 坐标 (x, y, z, θ, φ) 进,颜色与密度出——但代价是:渲染是逐像素光线步进,慢;表示藏在网络里,不可编辑。"重建一片空间"和"得到一份可操作的空间数据"被硬生生割裂。

3DGS 的革命性不在于"更高 PSNR",而在于它把辐射场显式化成一组可数、可微、可渲染的 3D 高斯基元。表示暴露在数据里,而不是埋在权重里——这一步直接决定了后面所有"编辑、压缩、语义、喂给机器人"的可能性。

体渲染方程:两条路线的分水岭

无论是 NeRF 还是 3DGS,底层都是同一个体渲染积分——把三维空间中的辐射场沿光线积分为像素颜色:

体渲染积分(连续形式) C(𝐮) = ∫₀^∞ T(t) · σ(r(t)) · c(r(t), d) dt 其中 T(t) = exp(−∫₀^t σ(r(s)) ds)   (透射率/累积不透明度) σ 是体密度,c 是视角依赖的颜色,T 是光线到达 t 点前未被遮挡的概率。NeRF 用数值积分(分层采样 + 四则化)近似上式,每像素需要数十到数百次 MLP 查询——这就是它慢的根源。3DGS 把参与合成的"体素"换成一排排排好序的高斯基元,用 alpha 合成直接闭式求解。
3DGS 的离散 alpha 合成 C(𝐮) = Σi∈N cᵢ · αᵢ · Πj(1 − αⱼ) 第 i 个高斯对像素 𝐮 的颜色贡献 = 它的颜色 cᵢ × 它的不透明度 αᵢ × 前面所有高斯的透射率。这正是同一渲染方程、两种实现命运的分水岭:NeRF 逐像素采样,3DGS 逐高斯投影。

3DGS 三大创新

  • 各向异性 3D 高斯作直接表示:每个基元用均值 μ(位置)、协方差 Σ(形状/朝向,工程上分解为缩放向量 s 与四元数 q,保证半正定与可微)、不透明度 α、球谐系数 SH(视角颜色)刻画,不再需要任何 MLP 查询。初始高斯由 COLMAP 的稀疏点云生成。
  • 可微光栅化(Differentiable Rasterization):把 3D 高斯投影到屏幕、按深度排序、做 tile-based alpha 合成,前向渲染快、反向梯度可直接传回每个基元参数。这基于 EWA(Elliptical Weighted Average)溅射理论的工程落地。
  • 自适应密度控制(Adaptive Density Control):训练中按位置梯度判据对高斯克隆/分裂/剪枝,让表示在重建质量与基元数量间自动平衡。这是 3DGS"不需要手动调分辨率"的根本来源。

关键方法与后续改进

方法会议一句话创新
3DGS (Kerbl et al.)SIGGRAPH 2023各向异性高斯 + 可微光栅化 + 自适应密度控制,首破实时且质量超 NeRF
Mip-SplattingCVPR 20243D 位置平滑 + 2D Mip 滤波,系统性消除多尺度锯齿与闪烁
2DGSSIGGRAPH 2024用贴在切平面的 2D 圆盘替代 3D 高斯,几何更干净、可直接提网格(ACM TOG)
SuGaRCVPR 2024正则化高斯对齐表面,高质量提取网格,TSDF + Marching Cubes
Vol3DGSarXiv重写合成方程为体一致,修复溅射-体不一致导致的透明/光照错误
NegGSarXiv引入负颜色高斯,精确表示环/月牙等非凸结构,不再依赖过度剪枝
Neural Gabor SplattingarXiv给基元挂可学习 Gabor 特征,建模锐边/细纹理/薄结构
③ 工程要点 3DGS 的"实时"依赖三点工程务实:基于瓦片的光栅化避免全局排序瓶颈;前向/反向共用同一套排序保证梯度一致;自适应密度控制用位置梯度的累积量而非重建误差做判据。迁移 NeRF 工作流时,最容易踩的坑是把"高质量渲染"误当成"高质量几何"——PSNR 高不代表法线干净,做后续 mesh/CAD 时要切换评价口径。

从 2023 年到 2026 年,3DGS 的论文数量从 1 篇爆发到 819+ 篇。南京大学在 IEEE TCSVT 2025 年 7 月发表的综述"3D Gaussian Splatting: Survey, Technologies, Challenges, and Opportunities"IEEE TCSVT 2025是对这波浪潮最全面的梳理之一。康奈尔大学、香港科技大学联合发表的 VLA 综述则从具身智能侧切入,讨论了 VLM 如何驱动 3D 理解的产业化。

★ 思考题
  1. "表示暴露在数据里"这条性质,如何决定了 3DGS 比隐式 NeRF 更适合做机器人的空间记忆?
  2. 2DGS 与 3DGS 的取舍:什么场景下你宁可用 2D 圆盘牺牲一点渲染换来几何?
  3. 如果未来出现一个"隐式但可微可编辑"的表示,3DGS 的显式优势会被抹平吗?
  4. 体渲染积分的连续形式与 3DGS 的离散 alpha 合成,在什么条件下两者会给出不同结果?
CH 02

3DGS 的数学与工程内核

参数化 · 可微光栅化 · 自适应密度控制 · CUDA 工程

本章把"3DGS 为什么能又快又可微"拆成四块。它不是论文复述,而是工程视角的受力分析——知道梯度从哪来、卡在哪,你才知道为什么有那么多后续方法在"基元、排序、致密化"上做文章。

高斯基元的参数化

每个高斯由 5 组参数刻画:

  • 位置 μ ∈ ℝ³:高斯中心在世界空间的位置,初始值来自 COLMAP 稀疏点云。
  • 协方差 Σ ∈ ℝ³ˣ³:控制高斯的形状与朝向。工程上不直接优 Σ,而是分解为缩放向量 s ∈ ℝ³ 和旋转四元数 q ∈ ℝ⁴,令 Σ = R(q)·diag(s)·R(q)ᵀ,既保证半正定,又让梯度能直达"形状/朝向"。
  • 不透明度 α ∈ [0,1]:经 sigmoid 激活,控制该基元的不透明程度。
  • 球谐系数 SH:用低阶球面谐波(通常 3 阶,48 维)编码视角依赖的颜色。阶数越高,颜色随视角变化越精细,但参数量线性增长。
3D 高斯密度与屏幕投影 G(x) = exp(−½ (x−μ)ᵀ Σ⁻¹ (x−μ)) Σ' = J W Σ Wᵀ Jᵀ   (投影到屏幕,W 视图矩阵,J 投影局部线性化) 高斯在 3D 空间是椭球,经视图变换 W 和投影的雅可比 J 后成为屏幕上的 2D 椭圆。Σ' 是 2D 椭圆的协方差。这个投影是 EWA 溅射理论的核心——保证了 3D 高斯到 2D 屏幕的数学一致性。

理解这一点至关重要:球谐系数是 3DGS 视角依赖的关键。0 阶 SH 给出固定颜色(等同于无视角变化),3 阶 SH 可以表达金属反射、彩虹色、透明感等复杂现象。但这也意味着,如果你用 3DGS 重建了一个有光泽的金属表面,PSNR 高的那组参数很可能不是"几何对"的那组——颜色变化可能在用高密度高斯拟合本应靠 SH 表达的反射效果。

可微光栅化:前向与反向

渲染时把每个高斯投影成 2D 椭圆,按深度排序,落进 16×16 的瓦片(tile),对瓦片内像素做 alpha 合成。3DGS 的光栅化管线分三步:

  1. 投影与排序:所有高斯投影到屏幕后按深度(z 值)排序。这一步用基数排序(radix sort),是单帧最大的非并行环节。
  2. 瓦片分配:屏幕被划分为 16×16 像素的瓦片,每个高斯被分配到它覆盖的瓦片。
  3. 瓦片内 alpha 合成:每个瓦片由一个 CUDA block 处理,线程并行遍历该瓦片内的高斯,按深度顺序做 alpha 合成。

反向传播需要对每个像素→每个高斯的贡献传回梯度:屏幕空间梯度要乘回视图-屏幕雅可比,才能更新到 3D 协方差。这一套"前向闭式、反向解析"的设计,是实时训练的根本来源。gsplatCVPR 2024 是当前最活跃的开源 3DGS CUDA 光栅化引擎,由 nerfstudio 团队维护。

自适应密度控制:3DGS 的"生长"机制

自适应密度控制是 3DGS 区别于"固定表示"方法的核心——高斯数量在训练中动态变化。

致密化(Densification)判据 每 N 步(默认 100): 1. 统计位置梯度 ‖∇μL‖ 的视空间累积 τ_d(超过阈值 τ_pos 的像素统计) 2. 若 τ_d > τ_pos:    大尺度高斯(‖s‖ 超阈值)→ 分裂(split):一变二,缩小尺度    小尺度高斯 → 克隆(clone):复制到梯度方向 3. 若 α < α_min(默认 0.005)或世界尺寸超限: 剪枝(prune) 注意:致密化判据用的是"位置梯度的累积量",而非重建误差本身。这是很多初学者调不动 3DGS 的根因——你想加的约束不直接进入 split 判据,只能通过损失间接影响梯度。这意味着"加约束"和"改密度分布"之间存在延迟,不是即时响应。

CUDA 工程与现实约束

  • 排序开销:每帧按深度桶排,是单帧最大的非并行环节;很多加速方法(如 radix 排序替代、稀疏化)都在这里开刀。
  • 显存:基元数量直接决定显存,城市级动辄上千万高斯(每个高斯约 59 floats = 236 bytes),催生了整条压缩谱系(第 3 章)。
  • 训练稳定性:协方差若不加正则会退化成薄片;透明度 sigmoid 截断与 SH 截断是默认护栏。
  • 前向/反向一致性:前向和反向必须用同一套排序,否则梯度不一致导致训练发散。这是 3DGS 实现中最容易出 bug 的地方。
优化方向代表方法要点
抗锯齿Mip-Splatting多尺度一致,3D 平滑 + 2D Mip 滤波,去闪烁
表面几何2DGS / SuGaR / PGSR2D 圆盘或平面正则,出干净 mesh
基元表达力SVGS / NegGS / Neural Gabor基元内颜色/形状变化,减少基元数
训练加速Proxy-GS / Z-Order GS / AnchorSplat代理模型·Morton 序·锚点致密化
⚠ 常见误区 "3DGS 训练快"不等于"3DGS 调参简单"。位置梯度阈值 τ_pos、致密化间隔、clone 上限、透明度下限 α_min 这四个旋钮互相耦合;新加损失时要先确认它是否真的改变了 ‖∇μL‖,否则 split 不会按你的预期工作。本仓库的 3DGS 代码审查技能沉淀了 108+ 个已知 bug 模式,覆盖的正是这类"看起来在训练、其实在空转"的陷阱。
③ 开源实现对比 graphdeco-inria/gaussian-splatting:官方实现,最权威,但代码风格偏学术。 gsplat(nerfstudio 团队):当前社区最活跃的 CUDA 光栅化引擎,性能更优、API 更友好,CVPR 2024 发表。 nerfstudio:完整训练框架,集成 3DGS、NeRF 等多种方法,适合工程化快速上手。 COLMAP:不是 3DGS 库,但 3DGS 流程前端的必备工具——从图像序列估计相机位姿和稀疏点云,为 3DGS 提供初始化。
★ 思考题
  1. 为什么"位置梯度累积量"做 split 判据,而不是直接用 PSNR 改善量?这对设计新损失有什么限制?
  2. 协方差的缩放+四元数参数化,相比直接学 Σ,在梯度与稳定性上各带来什么?
  3. gsplat 与官方实现在排序算法上有什么不同?这对实际训练速度的影响有多大?

训练实践:损失、阶梯与密度控制

前面的数学推导告诉你 3DGS 为什么 能工作。这一节告诉你它为什么会在你的数据上不工作,以及怎么修。内容提炼自本仓库 3dgs-training-debugger(60+ 运行时失败模式)和 3dgs-code-reviewer(104 个已知 bug 模式)两个工程技能。

损失函数设计

原始 3DGS 使用 (1−λ)·L₁ + λ·D-SSIM 组合损失,经验值 λ=0.2。L₁ 项负责像素级保真度,D-SSIM 项(结构相异性)补充结构相似性感知。这不是唯一选择——以下是决策树:

  • 常规场景:λ=0.2 默认值即可。增大 λ→ 更锐利但可能过拟合高频噪声;减小 λ→ 更平滑但细节丢失。
  • 稀疏视角(<20 张):加入深度先验正则(DN-Splatter, [arXiv:2403.17822])或法线一致性损失(DNGaussian, [arXiv:2403.06912])。λ 可降至 0.1,给正则项更多梯度空间。
  • 无纹理区域(白墙、天空):加入感知损失(LPIPS)或深度平滑正则。注意 LPIPS 会增加 ~30% 训练时间。
  • 动态场景:变形场正则(L₂ 流平滑、刚性约束)。4DGS 和 Deformable-GS 使用不同的变形正则策略。

SH 阶梯训练

球谐函数(SH)表达视角依赖颜色。原始实现在训练前 1000 步仅使用 SH degree 0(DC 分量,即平均颜色),之后切换到完整 degree 3(48 维 SH 系数)。为什么要阶梯?因为早期训练的几何不稳定,如果一开始就让高 SH 阶自由优化,高斯会用视角依赖颜色"作弊"拟合噪声——几何还没长好,颜色已经在画"假视角",后续收敛会陷入局部最优。

实践中,这个阶梯可以更细:degree 0(0-1000 步)→ degree 1(1000-7000 步)→ degree 3(7000+ 步)。在低纹理或反射场景中,永远不要在几何稳定前解锁高 SH 阶——这是 3DGS 训练中最常见的"看起来收敛了但视角一转就崩"的根因。

密度控制阈值

自适应密度控制(ADC)是 3DGS 的核心"生长"机制,但它的四个旋钮是训练不稳定的主要来源:

参数默认值过大 → 问题过小 → 问题
τ_pos(位置梯度阈值)0.0002欠拟合区域无法致密化高斯数量爆炸(OOM)
α_min(透明度剪枝阈值)0.005大量半透明"幽灵"高斯残留误删有效高斯(空洞)
致密化间隔100 步生长缓慢,收敛慢频繁重建空间索引,训练卡顿
clone 上限无上限 = OOM 风险(大场景必须设)

调参建议:先跑默认参数到 7000 步,观察 PSNR 曲线和高斯数量曲线。如果高斯数在 7K 后仍线性增长 → 降 τ_pos 到 0.0001;如果 PSNR 在 15K 后停滞且高斯数平稳 → 检查是否欠拟合(提升 τ_pos);如果出现 floater → 升 α_min 到 0.01 并在最后 5000 步加大剪枝频率。

常见失败模式排查表

以下症状→原因→修复的映射提炼自 60+ 运行时失败模式库。这些不是理论推导——是真实训练崩溃的田野经验。

症状常见根因修复
Floater(漂浮高斯)α_min 过低;致密化产生的大高斯未被剪枝升 α_min 到 0.01;最后 5K 步每 100 步剪枝一次;加深度正则
天空/背景塌缩无界场景背景高斯无限膨胀设 scale 上限(如 10.0);使用 Mip-Splatting 的 3D 平滑滤波器
PSNR 在致密化后突降新 clone 的高斯初始化过大,遮挡有效区域减小 clone 后的 scale 初值;加 clone 上限
NaN loss协方差退化(scale→0);SH 系数爆炸设 scale 下限 0.0001;梯度裁剪 max_norm=1.0;检查输入图像归一化
OOM(显存溢出)高斯数 >2M;batch_size 过大;SH degree=3 全程设 clone 上限;降 batch_size;前 1000 步用 SH degree 0
模糊重建λ 过大(D-SSIM 主导);SH degree 被锁在 0降 λ 到 0.1;检查 SH degree 阶梯切换时机
视角一转就崩高 SH 阶在几何稳定前解锁;训练视角覆盖不足推迟 SH degree 3 到 7000 步;增加训练视角数量
⚠ 实践陷阱:很多失败模式不是代码 bug,而是输入数据问题——COLMAP 位姿错误、图像曝光不一致、背景运动物体(行人/车辆)未掩蔽。在调参之前,先用 3dgs-code-reviewer 技能检查代码实现,再用 3dgs-training-debugger 诊断训练症状。本仓库的知识库记录了 104 个静态代码 bug 模式和 60 个运行时失败模式——覆盖了 3DGS 训练实践中 90% 以上的常见问题。
CH 03

从场景到世界:大规模·动态·压缩

城市级重建 · 4D 动态 · GS-SLAM · 压缩部署

第 1–2 章把 3DGS 的内核讲到了"单场景、静态、实时渲染"。但真实世界既不是一个房间,也不是静止的——城市级重建动辄上千万高斯,运动场景需要时间维度,机器人需要边走边建图,而部署到手机/头显又必须把动辄数 GB 的高斯场压到几十 MB。本章把 3DGS 从"实验室单场景"推向"世界级、动态、可部署"的三道关:大规模、4D 动态、压缩。

这三道关卡定了三条独立但相互关联的工程谱系。大规模解决的是"空间太大、显存不够",答案是分块与层级(Level of Detail);动态解决的是"时间在变、一个静态表示搞不定",答案是变形场(deformation field)与 4D 高斯;压缩解决的是"高斯太多、传不动存不下",答案是剪枝、量化与蒸馏。它们最终在 GS-SLAM 这一"边走边建图边压缩"的场景里汇合——这正是第 7 章的入口。

大规模重建:从房间到城市

一个房间 3DGS 重建通常需要几十万到几百万高斯;一栋楼几百万;一座城上千万。城市级高斯场最直接的问题是显存——每个高斯约 59 个 float(位置 3 + 缩放 3 + 旋转四元数 4 + 不透明度 1 + 3 阶球谐 48 = 59),单精度下约 236 bytes,一千万高斯就是 2.3 GB 纯参数,还不含训练中间态。把"一个巨大的高斯场"硬塞进单卡显存既不现实也不必要——你站在远处时根本不需要看清每片树叶。

工程答案沿"分块 + 层级"两条思路收敛:

  • 空间分块(Tiling / Block):把高斯场按空间切成块,每块独立训练或独立加载。视图渲染时只激活相机视锥内的块,显存占用从"全场"降到"视锥内几块"。这是大规模 GS 的第一条减负原则。
  • 细节层级(Level of Detail, LoD):远处用粗高斯、近处用细高斯,类似传统图形学的 LoD。当相机远离某区域,该区域的高斯被合并或用低阶表示替代,渲染帧率与显存同时受益。
层级高斯的核心权衡 显存 ∝ Σ(每块活跃高斯数)  ≠  总高斯数 LoD 的关键在于"活跃高斯数"被视距控制,而非总高斯数。这意味着一个十亿高斯的城市场,在任意视点下可能只需渲染几百万——前提是层级索引(octree / hash grid)足够快,能把"该激活哪些块"在毫秒级算出来。索引本身的开销是大规模 GS 工程化的隐藏成本。
方法会议一句话创新
CityGaussianECCV 2024层级 LoD 用于城市级实时渲染,分块训练 + 全局对齐
Hier-GSarXiv层级高斯,父子高斯合并/分裂,支持流式加载
BlockGaussianarXiv分块独立训练再缝合,解决跨块接缝与显存墙
⚠ 工程陷阱 分块训练最大的坑是跨块接缝:两块各自优化到自己最优,缝合处会出现高斯重叠/穿透/颜色跳变。解法是在块边界留一圈"重叠缓冲带",训练时让相邻块的缓冲带共享约束,缝合时再做一轮联合微调。很多团队第一次做大规模 GS 都栽在这一步——以为是渲染 bug,其实是训练对齐 bug。

动态与 4D:让高斯"运动"起来

静态 3DGS 假设场景不变;而真实世界里有走动的人、飘动的旗、流动的水。把时间维度引入高斯场有两条技术路线,区别在于"是动高斯本身,还是动坐标系":

  • 变形场(Deformation Field)路线:保持一套"规范空间(canonical space)"的静态高斯,额外训练一个小神经网络,把每个高斯在时刻 t 的位置/旋转/缩放从规范空间映射到观测空间。模型学到的是"运动规律"而不是"每帧一套高斯",参数量小但表达力受限于变形网络的容量。代表:Deformable-3DGS。
  • 4D 高斯(4D Gaussian)路线:直接把基元从 3D 高斯升维成 4D 高斯(3 空间 + 1 时间),每个高斯在时间轴上也有一个"分布",渲染时刻 t 时对时间维做条件采样。表达力更强、可建模瞬时形变,但基元参数和优化复杂度更高。代表:4DGS。
变形场 vs 4D 高斯 变形场:x'(t) = fθ(x, t)   (规范高斯 + 时间映射网络) 4D 高斯:G(x, t) = exp(−½ (x−μ, t−τ)ᵀ Σ₄D⁻¹ (x−μ, t−τ)) 变形场把"动"外包给一个网络,静态高斯不变;4D 高斯把"动"内化进基元本身的协方差。前者参数省、易训练,但对剧烈形变(衣物甩动、非刚性大位移)力不从心;后者表达力强,但 4D 协方差优化更难收敛,且每个高斯需要在时间轴上有足够的覆盖密度。选择取决于场景运动幅度。

两条路线在 2024 年同时爆发,并迅速衍生出针对具体问题的变体:SpacetimeGS 把时空统一进单一基元,DN-4DGS 用去噪网络抑制变形场的时序抖动,4DGS-Wild 处理无人值守视频(光照变、有人走动)的不确定性。注意一个工程事实:动态场景的评测比静态难得多——PSNR 在单帧上可能很高,但连续播放时人眼对时序不一致(flicker、抖动)极其敏感,所以 4DGS 方法普遍引入时序平滑正则和光流监督。

方法会议路线一句话创新
Deformable-3DGSCVPR 2024变形场变形场网络驱动高斯运动,高保真动态场景渲染
4DGS (4DGaussians)CVPR 20244D 高斯4D 各向异性高斯 + 正则化变形,实时动态渲染
SpacetimeGSECCV 2024时空统一单一基元统一空间与时间维度
DN-4DGSNeurIPS 2024变形场去噪变形网络 + 时空聚合,抑制时序抖动
4DGS-WildNeurIPS 2024变形场不确定性正则,处理无人值守视频的光照/运动扰动

GS-SLAM:边走边建图(第 7 章详述)

SLAM(Simultaneous Localization and Mapping)是大规模与动态的交汇点——机器人边移动边把环境建成高斯地图,同时用地图给自己定位。3DGS 把传统 SLAM 的"点云/体素地图"换成"可渲染高斯地图",带来一个革命性副产品:位姿估计可以直接用渲染图像做光度误差,而不必依赖特征点匹配。SplaTAM、Photo-SLAM、MonoGS 三者都在 CVPR 2024 同框发表,标志着 GS-SLAM 在一年内从概念走向成熟。第 7 章会深入拆解它们的设计差异——这里只点出它在本章的位置:GS-SLAM 同时面对"场景大需分块"和"场景动需时序"两道关,是大规模与动态谱系在机器人侧的合流。

压缩:从 GB 到 MB 的部署之路

3DGS 的"显式"是它强大的根源,也是它部署的软肋——一份高斯场动辄数百 MB 到数 GB,而手机、AR 眼镜、Web 端的预算往往只有几十 MB。压缩谱系沿三个正交方向展开,对应高斯场的三种冗余:

  • 数量冗余 → 剪枝(Pruning):大量高斯对最终渲染贡献极小(不透明度低、被遮挡、面积过小)。按贡献度排序后剪掉尾部,可一次性减少 30–50% 基元而几乎不掉质量。LightGaussian 的全局+局部剪枝即此思路。
  • 参数冗余 → 量化/向量量化(Quantization / VQ):球谐系数、缩放、旋转中存在大量相似模式。把连续参数聚类到码本(codebook),每个高斯只存码本索引而非完整向量,可压缩 10–20 倍。CompactGS、Compact3D 的核心是 VQ。
  • 结构冗余 → 蒸馏(Distillation):一组高斯场可用更少高斯+更精参数的"学生场"去拟合"教师场"的渲染输出。LightGaussian 的 SVD 蒸馏、EAGLES 的粗到细训练都在这条线上。
压缩的三阶权衡 质量 ↓  ∝  压缩率 ↑ 但:质量损失并非线性——存在"无痛压缩区" 大多数 GS 压缩方法都能在 10× 以内做到几乎无损(PSNR 掉 < 0.5 dB),但越过某个阈值后质量断崖式下跌。这个"断崖点"取决于场景复杂度:纹理丰富的场景冗余多、断崖点靠后;几何简单的场景冗余少、早压缩早就崩。工程上要先在自己场景上 scan 出断崖曲线,再选压缩率,切忌照搬论文数字。
方法会议主策略要点
LightGaussianNeurIPS 2024剪枝+蒸馏全局+局部剪枝 + SVD 蒸馏,15× 压缩 200+ FPS
EAGLESECCV 2024量化+剪枝量化嵌入 + 粗到细训练 + 剪枝,10–20× 显存压缩
CompactGSECCV 2024向量量化VQ + 学习码本,紧凑高斯属性存储
Compact3DarXiv向量量化+剪枝VQ + 剪枝,约 10–15× 压缩
SOG-GSCVPR 2025分组量化结构化全向分组量化,保留高斯间相关性
③ 部署视角 压缩不只是"存得下",更是"传得动"。Web 端 3DGS(如本仓库的 GitHub Pages 方法浏览器)需要在首屏秒级加载,这意味着压缩后还得分块流式下载——先加载粗 LoD 让画面立刻出现,再渐进精细。这条"压缩 + LoD + 流式"的组合链路,是 3DGS 从论文走向产品的最后一公里,也是很多学术压缩方法没覆盖的真实约束。
★ 思考题
  1. 分块训练的接缝问题,本质是"局部最优不等于全局最优"。除缓冲带外,你还能想到哪些对齐策略?
  2. 变形场与 4D 高斯,在"衣物快速甩动"和"人物缓慢走动"两种场景下,分别更合适哪个?为什么?
  3. 压缩的"断崖点"为什么依赖场景复杂度?如果你只有渲染预算(无原场),如何在线估计当前压缩是否安全?
  4. GS-SLAM 同时面对大规模与动态两道关,它会优先牺牲哪一道?这取决于什么?

3DGS 的局限性与失败模式

前面四节讲了 3DGS 如何扩展到大规模、动态、SLAM 和压缩场景——每一节都在展示"3DGS 能做什么"。但一个同样重要的问题是:3DGS 在哪些场景下不工作?本节从 Awesome-3D-Gaussian-Splatting 仓库中 Robustness(鲁棒性)类别的 11 个方法中系统提炼,讨论 3DGS 的六类典型失败模式、根因分析和代表性改进方案。理解边界不是为了否定方法,而是为了在工程实践中知道何时该用 3DGS、何时该换路线、何时需要引入额外正则化。

① 透明与半透明材质。3DGS 用 3 阶球谐函数(SH)表示视角依赖的颜色,但 SH 是低阶基函数,本质上是颜色的低通近似——它无法表达折射(refraction)这一需要追踪光线在介质内部弯折路径的物理现象。当训练数据中存在玻璃杯、水面、透明塑料等物体时,优化器会"投机取巧":既然 SH 无法拟合折射产生的复杂视角色变,它就通过增大高斯的尺度(scale)和透明度(alpha)来用密度弥散地覆盖这片区域,结果是从不同视角看,高斯团的密度分布勉强"平均"出了正确颜色,但底层的几何形状完全错误——玻璃杯的壁可能变成一团半透明的云雾,而非薄壳曲面。SpecTRe-GS(CVPR 2025)提出了光线追踪(ray tracing)方案来应对这一问题:它不再依赖 SH 的颜色近似,而是为每条视线追踪多次折射/反射路径,让高斯参与物理意义明确的光线传播计算,从而在透明材质上同时恢复正确的外观与几何。这类方法的代价是渲染时需要额外的光线追踪 pass,速度比 vanilla 3DGS 慢一个数量级。

② 镜面反射。镜面反射(specular reflection)是另一个 SH 表达力不足的场景。与透明材质不同,镜面反射的核心问题是视角依赖颜色与几何的解耦失败:一个闪亮的金属表面在不同视角下会反射出环境的不同部分,颜色剧烈变化,但几何位置不变。3DGS 的 SH 试图把这种强烈的视角色变编码到高斯的颜色参数里,但低阶 SH 的带宽不够,于是优化器会再次走捷径——把一个物理上的平坦镜面拆成多个位置略有偏移的高斯,每个高斯负责一小段视角范围的颜色。结果是渲染尚可,但几何变成了"碎玻璃"状的杂乱点云。GaussianShader(SIGGRAPH 2024)引入了逐高斯法线(normal)和可微球面追踪(sphere tracing),将反射方向显式建模,提升了金属/镜面场景的渲染质量。但其局限边界在于:它假设反射表面是刚性的、法线可估计的,对于多次反射(如两面镜子相对)或曲率极高的表面,法线估计会退化,改善有限。

③ 无界场景边缘伪影。在室外大场景或"中心物体+远处背景"的无界(unbounded)设置中,3DGS 常在图像边缘出现高斯"爆炸"——巨大的半透明高斯团从画面边缘延伸到无穷远,严重破坏渲染质量。根因在于 SfM 初始化的稀疏点云在远景区域极为稀疏,少数高斯被赋予极大的尺度以覆盖大片背景像素,而视角稀疏的区域梯度信号弱,优化器无法有效约束这些"巨型高斯"。Mip-Splatting(CVPR 2024)从信号处理角度分析了这一问题:原始 3DGS 的光栅化没有对采样率做约束,单个高斯在屏幕上的投影可能跨越大量像素,本质上是对高分辨率信号的欠采样混叠。它引入了3D 平滑滤波器(3D smoothing filter)——在训练前对高斯的尺度施加一个与采样率匹配的低通滤波,强制每个高斯不能小于一个场景相关的最小尺寸,从根源上消除了巨型高斯的产生条件。同时配合 2D Mip 滤波器处理屏幕空间的混叠,使无界场景的边缘伪影得到显著缓解。

④ 稀疏视角退化。3DGS 依赖 COLMAP 的 SfM 点云作为初始化,并需要足够密集的多视角图像来约束每个高斯的位置和颜色。当输入只有少量视角(如 3-9 张)时,未观测区域的梯度趋近于零,高斯在这些区域自由漂移、膨胀,产生大量"floater"浮空伪影,几何与外观双双退化。DNGaussian[arXiv:2403.06912] 提出了全局-局部深度归一化(global-local depth normalization)策略:利用预训练的深度估计网络(如 MiDaS)为每个视角提供深度伪标签,然后在全局尺度上对齐预测深度与渲染深度,在局部尺度上逐像素施加深度平滑约束,两层级联约束有效抑制了稀疏视角下高斯的随意膨胀。CoR-GS[arXiv:2405.12110] 则采用协同正则(collaborative regularization)思路:在训练过程中动态地进行高斯的增密(densify)和剪枝(prune),并通过一致性损失确保不同视角下同一区域的高斯分布稳定,减少因视角缺失导致的"幽灵"基元。两种方法都显著提升了稀疏视角下的重建质量,但前者依赖外部深度先验的精度,后者引入了额外的训练开销。

⑤ 内存与显存爆炸。vanilla 3DGS 的自适应密度控制(adaptive density control)在训练中不断分裂和克隆高斯,却缺少有效的全局数量上限。在纹理丰富的场景中,高斯数量可轻松膨胀到数百万甚至上千万,每个高斯需要存储位置(3)、旋转(4)、缩放(3)、不透明度(1)和 SH 系数(48,3 阶×3 通道+DC),总内存占用可达 GB 级别,使得移动端部署和实时渲染变得不现实。Compact-3DGS 通过对 SH 系数做低秩矩阵分解、对几何属性做矢量量化(vector quantization),在不损失渲染质量的前提下将存储压缩到原始的 5%-10%。LightGS 则从另一个角度切入:在训练后阶段对高斯做重要性评分(基于对渲染像素的贡献量),剪枝低贡献高斯并对剩余高斯的 SH 做精度量化,实现"轻量化部署"。两类方法各有取舍——Compact-3DGS 的压缩率更高但训练时仍需完整内存,LightGS 的后处理剪枝适合已有模型的部署压缩但不降低训练成本。

失败模式 根因 代表性改进方法 改进程度
透明/半透明材质 SH 3 阶无法表达折射;高斯用密度拟合透明→几何错误 SpecTRe-GS(CVPR 2025)光线追踪 显著改善
镜面反射 视角依赖颜色与几何解耦失败;SH 带宽不足 GaussianShader(SIGGRAPH 2024) 部分解决
无界场景边缘伪影 远景高斯尺度爆炸;光栅化采样率不受约束 Mip-Splatting(CVPR 2024)3D 平滑滤波器 显著改善
稀疏视角退化 SfM 初始化稀疏;未观测区梯度为零→浮空伪影 DNGaussian [arXiv:2403.06912];CoR-GS [arXiv:2405.12110] 显著改善
内存/显存爆炸 高斯数量无控制增长;无全局数量上限 Compact-3DGS 低秩分解;LightGS 重要性剪枝 部分解决
动态场景大运动 变形场表达能力有限;大位移与拓扑变化难建模 4D-GS、Deformable-3DGS(见第 2 节) 仍开放
上述六类失败模式有一个共性:根因都可追溯到 3DGS 的核心设计假设被打破。SH 表达力假设(透明/镜面)、采样率一致性假设(无界场景)、多视角充分性假设(稀疏视角)、内存可控性假设(显存爆炸)。这意味着——没有一种"通用补丁"能同时解决所有问题,改进方法都是针对特定假设违反而设计的局部正则化。在选择方法时,先判断你的场景违反了哪个假设,再对症下药。

结语:在 3DGS 的生态中,"知道边界比知道能力更重要"。3DGS 在 2023-2025 年间被证明是一个极具表达力的表示方法,但它的能力边界并非无限——透明材质的折射、镜面的多次反射、无界场景的混叠、稀疏视角的欠约束、内存的无序膨胀,每一道边界都对应着一个活跃的研究方向。Robustness 类别的 11 个方法正是这些边界的"守门人",它们各自针对一个被打破的假设设计正则化或物理建模策略。作为工程实践者,你需要做的不是记住"3DGS 能做什么",而是记住"3DGS 在什么条件下会失败"——因为失败模式决定了你的项目能否落地,而能力只决定了上限能飞多高。

CH 04

语义高斯:让空间被理解

语言嵌入 · 开放词汇 3D 分割 · 特征蒸馏 · 点级理解

到第 3 章为止,3DGS 能重建出视觉上逼真的空间,但这份空间是"哑"的——它知道每个像素是什么颜色,却不知道哪片高斯是"桌子"、哪片是"杯子"、哪个区域可以"坐上去"。空间智能的"眼睛"要长出来,3DGS 必须从"几何+外观"升级到"几何+外观+语义"。这一章讲语义高斯(Semantic / Language Gaussian)如何把语言模型的开放世界知识注入到三维基元里。

语义注入的意义远超"给点云上色"。一旦每个高斯带上"它是椅子"的标签,机器人就能在地图里检索"找一把椅子"、Agent 就能做"把桌子上的杯子移开"这类指令、AR 就能在真实物体上挂交互锚点。这正是空间智能从"看见"走向"看懂"的关键一跃。

从 NeRF 语义到 GS 语义:范式平移

给三维场加语义不是 3DGS 的发明。NeRF 时代已有 LERF(Language Embedded Radiance Fields,NeurIPS 2023):在 NeRF 的密度场之外再预测一个"语言特征场",从任意 3D 点可查询 CLIP 特征,做开放词汇 3D 分割。但 LERF 的语义藏在 MLP 权重里,查询要前向推理,且和 NeRF 一样慢。

3DGS 把语义问题彻底改写。因为高斯是显式的、可数的,语义可以直接挂到每个基元上——每个高斯除了颜色 SH,再多存一个 CLIP 特征向量。查询时不需要推理网络,直接读该高斯的特征就行。这带来三个工程质变:

  • 查询是 O(1) 的:点哪个高斯,立刻返回它的语义特征,无需光线步进或网络前向。
  • 语义和几何天然对齐:因为语义就挂在参与渲染的同一组高斯上,不存在"几何对、语义错位"的缝合问题。
  • 可编辑性:选中"所有椅子的高斯"可直接做后续编辑(搬运、隐藏、换色),因为语义就是基元属性。

核心机制:特征蒸馏损失

把 CLIP 特征挂到高斯上,技术上靠"特征蒸馏(feature distillation)"实现。它的核心是一个自监督闭环:

特征蒸馏损失(Feature Distillation Loss) Ldistill = Σview ‖ render(FGS) − FCLIP/SAM(Iview) ‖ FGS 是每个高斯携带的特征向量(待学习);render(·) 用和颜色完全相同的 alpha 合成把它渲染成 2D 特征图;FCLIP/SAM(Iview) 是 CLIP 或 SAM 在真实视图上提取的 2D 特征图(教师)。损失让"高斯渲染出的特征图"逼近"CLIP 看到的特征图"。因为渲染可微,梯度能从 2D 特征差传回每个高斯的特征向量,让它们学会"该长成什么 CLIP 向量"。

这套机制的关键洞察是:颜色渲染的 alpha 合成公式,对特征渲染同样适用。一个像素的颜色是 N 个高斯颜色的加权和,那么它的 CLIP 特征也可以是 N 个高斯 CLIP 特征的同一个加权和。于是"2D 特征监督→3D 基元特征学习"这条路天然打通,3DGS 的可微光栅化在这里立了大功——这正是隐式 NeRF 做不到的高效蒸馏路径。

关键方法与开放词汇能力

语义高斯方法之间的差异,主要在"特征怎么存、怎么查、粒度多细"上:

方法会议语义粒度一句话创新
LangSplatCVPR 2024区域级CLIP 特征存于每个高斯,开放词汇 3D 场景查询
OpenGaussianNeurIPS 2024点级每点特征蒸馏,点级开放词汇 3D 理解
CL-GSECCV 2024基元级对比学习蒸馏 GS 语义特征,CLIP 引导每高斯特征
LGGSCVPR 2025零样本语言引导 GS,无需逐场景训练的零样本 3D 理解
SemanticGaussCVPR 2025统一统一语义高斯表示,联合重建与理解

"开放词汇(open-vocabulary)"是语义高斯最被看重的属性——它不限于预定义类别,可以查询任意自然语言("那个能坐的东西""左边带把儿的容器")。这来自 CLIP 的语言-图像对齐能力:因为蒸馏的是 CLIP 特征空间,3D 高斯的语义也继承了 CLIP 对任意文本的泛化。从 LangSplat 的"区域级查询"到 OpenGaussian 的"点级查询",粒度越来越细——后者可以精确到"这个高斯属于杯子的把手",为精细操作(第 8 章)打下基础。

③ 与 NeRF 语义的衔接 理解 3DGS 语义,最好对照它的 NeRF 前身 LERF(NeurIPS 2023)。LERF 证明了"在辐射场里嵌语言特征"这条路可行,但受限于隐式表示的慢推理与不可编辑。LangSplat 等方法把同样的思想平移到显式高斯上,把"可行"变成"可用"——这是范式转换在语义子领域的典型复现。本仓库的 references/methods-semantic-editing.md 沉淀了从 LERF 到 GS 语义的完整迁移路径。
⚠ 语义精度的天花板 特征蒸馏有个根本限制:2D CLIP 特征本身就是区域级的。CLIP 在 2D 图像上做的是 patch 级聚合,它的特征图分辨率有限,难以区分"杯子把手"和"杯子杯身"这种细粒度部件。所以靠纯蒸馏的语义高斯,点级边界往往模糊。OpenGaussian 等方法用额外策略(如 SAM 的部件级 mask、分层聚合)来突破这个天花板,但没有 2D 端的细粒度监督,3D 语义的精度是有物理上限的。

语义高斯对具身智能的意义

语义高斯不是终点,而是机器人感知的前提条件。考虑一个抓取任务:"把桌上那个红色的杯子拿给我"。机器人需要:① 在三维地图里定位"桌子"区域(LangSplat 级语义);② 识别"杯子"并区分它与桌上其他物体(OpenGaussian 级点级语义);③ 锁定"红色"这个属性并规划抓取点(需要语义+几何+颜色的联合查询)。3DGS 同时承载几何、外观、语义三类信息,使这三个步骤能在同一份数据上完成,无需在点云/网格/图像之间反复投影——这是空间智能走向具身行动的底层便利。

★ 思考题
  1. 为什么"颜色渲染的 alpha 合成对特征渲染同样适用"?这背后是什么数学性质在起作用?
  2. 点级语义(OpenGaussian)比区域级语义(LangSplat)难在哪?2D CLIP 的特征分辨率如何限制了 3D 点级精度?
  3. 如果一个场景里有 100 把外观相同的椅子,纯语义高斯如何区分"这一把"和"那一把"?需要补什么信息?
  4. 语义高斯为机器人抓取提供了什么 NeRF 语义给不了的能力?
CH 05

编辑·生成·资产化

前馈重建 · 文本/图像到 3DGS · SDS 生成 · 可动画资产 · 材质重照明

前三章解决的是"从图像重建已存在的空间"。但空间智能的另一半是"创造不存在的空间"——从一句话生成一个 3D 资产、从几张照片秒级重建一个场景、给静态高斯加上骨骼让它动起来、换光照让它能装进游戏引擎。这一章把 3DGS 从"重建工具"推向"创作工具",覆盖四条资产化主线:前馈重建、生成、动画、材质重照明。

这四条线共同回答一个工程问题:3DGS 能不能成为 3D 内容生产的下一代标准格式?如果能,它的优势在于"显式、可微、可渲染"——既能像 mesh 一样直接被引擎消费,又能像 NeRF 一样从图像学习,还能用扩散模型/SDS 生成。这是 mesh 和 NeRF 都单独做不到的。

前馈重建:从"逐场景优化"到"一次前向"

原始 3DGS 是"逐场景优化"——给一组图,跑几十分钟训练得到这一场景的高斯场。前馈方法改变范式:训练一个大网络,输入几张新视角图像,一次前向直接吐出一组高斯,无需针对新场景再优化。这把 3DGS 从"离线重建"推向"实时重建",是走向 AR/机器人即时感知的关键。

前馈方法的核心设计选择是"高斯怎么从像素来":

  • 像素对齐(pixel-aligned):每个像素预测一组高斯参数(位置由像素深度反投影、其余由网络预测)。简单高效,但多视角一致性靠后处理保证。代表:PixelSplat、GPSGaussian。
  • 体素对齐(voxel-aligned):在 3D 体素网格上预测高斯,再投射到场景。多视角一致性更好。代表:VolSplat。
  • 代价体(cost-volume):先建多视图匹配的代价体,再从代价体回归高斯。几何最可靠但计算最重。代表:MVSplat。
  • 大重建模型(Large Reconstruction Model):用 Transformer 大模型吃多视图 token,直接回归高斯序列,靠数据规模实现零样本泛化。代表:GS-LRM。
方法会议策略一句话创新
PixelSplatCVPR 2024像素对齐极线 Transformer 做前馈双目 GS 重建
MVSplatECCV 2024代价体从 3 张稀疏视图建代价体回归 3DGS
GS-LRMECCV 2024大模型1B 参数 Transformer,零样本泛化的大重建模型
GPSGaussianECCV 2024像素对齐可泛化的像素对齐双目 GS,实时新视角合成
FreeSplatNeurIPS 2024像素对齐可泛化的前馈室内 3DGS
InstantSplatarXiv 2024无位姿无需位姿的稀疏视图重建,约 40 秒完成
③ 工程意义 前馈重建的真正价值不在"更快",而在"可泛化"——一个好的前馈模型见过足够多场景后,对从未见过的场景也能秒级给出合理高斯场。这是机器人进入陌生环境即时建图、AR 眼镜即时重建的前提。但要注意:前馈方法的单场景质量目前仍不如逐场景优化的 3DGS,因为它受限于训练分布。"快+泛化"和"精+定制"之间存在张力,工程上常以前馈初始化 + 少步定制微调兼顾两端。

生成:从文本/图像到 3DGS

前馈重建还需要输入真实图像;生成则更进一步——从一段文本或一张图直接"凭空"造出 3DGS 资产。这条线的主流技术是 SDS(Score Distillation Sampling):用一个 2D 扩散模型当"老师",把它的 2D 生成能力蒸馏进 3DGS 参数。

SDS 梯度(Score Distillation Sampling) θ LSDS = Eε,t[ w(t) · (εφ(xt; y, t) − ε) · ∂x/∂θ ] θ 是 3DGS 参数;x = render(θ) 是当前高斯场渲染的视图;εφ 是预训练扩散模型对加噪图 xt 预测的噪声;y 是文本条件。SDS 梯度让"当前 3D 渲染图"在扩散模型眼里更像"该文本应生成的 2D 图",梯度经可微渲染传回 3DGS 参数。DreamGaussian(ICLR 2024 Oral)把 SDS 从 NeRF 迁到 3DGS,速度提升数量级。

SDS 最大的工程障碍是"3D 一致性":扩散模型只在 2D 上保证"像",但蒸馏时要让它从多个视角都觉得"像",否则生成的 3DGS 在某些视角会崩。GaussianDreamer 用结构化高斯初始化缓解多面问题——先给一个合理的 3D 形状骨架,再用 SDS 雕琢外观,避免从纯噪声出发导致的视角抖动。

方法会议输入一句话创新
DreamGaussianICLR 2024 Oral文本/图像SDS + 3DGS 先验,文本到 3D 速度提升数量级
GaussianDreamerCVPR 2024文本SDS 耦合结构化高斯初始化,fast 文本到 3D

可动画资产:让高斯"动"成角色

第 3 章的 4D 动态是"记录已发生的运动";可动画资产是"创造可控的运动"——给一个高斯人体/角色挂上骨骼(SMPL/FLAME),用姿态参数驱动它做任意动作。这把 3DGS 从"重建结果"变成"游戏/影视可用的角色资产"。

核心机制是姿态条件变形(pose-conditioned deformation):每个高斯的位置/旋转/缩放不再是时间函数,而是骨骼姿态参数的函数。给定一串姿态关键帧,变形网络把规范高斯映射到每帧的实时位置,渲染出连贯动画。3DGS-Avatar 把这套思路用在可动画人体上;GaussianAvatars 系列则用 FLAME 面部模型锚定高斯,做表情驱动数字人。

方法会议对象一句话创新
3DGS-AvatarCVPR 2024人体可动画人体化身,姿态条件高斯变形
GaussianAvatars-2CVPR 2025面部FLAME 对齐高斯锚定的二代数字人

材质与重照明:让 3DGS 进游戏引擎

原始 3DGS 的球谐系数编码"视角依赖颜色",但这混合了材质和光照——换个光源,颜色不会自动变化。要让 3DGS 资产能装进游戏引擎被任意打光,必须把"材质(material)"和"光照(lighting)"解耦:用物理渲染(PBR)的 BRDF 表示材质,用环境贴图表示光照,渲染时按物理公式重新合成。这就是可重照明(relightable)3DGS

重照明渲染方程(PBR 分解) Lout(o) = ∫ fr(i, o, n) · Lin(i) · (n·i) di fr 是 BRDF(材质:法线 n、粗糙度、金属度、反照率),Lin 是入射光照(环境贴图)。原始 3DGS 的 SH 把 fr 和 Lin 卷在一起了;重照明 GS 把每个高斯预测为 BRDF 参数 + 估计/给定环境贴图,渲染时按上式重新积分。换 Lin 不动 fr,材质不变但光照变了。GaussianShader 给高斯挂可学习 shading function 表达反射/折射;GaussianShader-v2 加环境贴图估计做室内外可重照明。

重照明是 3DGS 资产化的"最后一公里"——只有材质和光照解耦,3DGS 重建的角色/场景才能和引擎里的虚拟灯光、动态时间变化正确合成。否则重建结果只能"在原光照下看",换个环境就穿帮。

★ 资产化的三角张力 3DGS 资产化在"质量、可控性、效率"三角间拉扯:前馈重建快但精度有限;SDS 生成可控(文本引导)但 3D 一致性弱;可动画/重照明增加可控性但损失原始重建质量。目前没有任何一条线同时最优化三角的三顶点。务实做法是按场景取舍——AR 即时重建要效率、影视资产要质量+可控、UGC 内容要可控+效率。
★ 思考题
  1. 像素对齐与代价体两种前馈策略,在"多视角一致性"和"计算量"上如何取舍?
  2. SDS 生成为什么会有"3D 一致性"问题?结构化初始化为什么能缓解它?
  3. 可动画高斯的"姿态条件变形"和第 3 章的"变形场"有何本质区别?一个造可控运动,一个记录运动,这对参数化意味着什么?
  4. 重照明为什么是"资产化最后一公里"?如果 3DGS 永远做不到完美 PBR,它能取代 mesh 吗,还是只能作为补充格式?

前馈基础模型 GS 完整谱系

2024–2025 年,前馈 3DGS 经历了一次深刻的范式跃迁:从"逐场景优化"走向"一次前馈"。早期前馈方法(pixelSplat、MVSplat)虽然把推理时间从数十分钟压缩到秒级,但仍有一个前置依赖——输入图像的相机位姿必须已知,而这通常需要先跑一遍 COLMAP 做 SfM。这意味着"前馈"并非真正端到端:SfM 这一步仍是离线的、耗时的、且在弱纹理/重复结构场景容易失败的瓶颈。CVPR 2025 上爆发的"无位姿前馈"路线正是要砍掉这最后一道前置工序——网络直接从原始多视图图像同时回归相机位姿和 3DGS 参数,实现真正的"图像进、高斯出"。这一跃迁是 3DGS 从"重建工具"走向"空间基础模型"的关键过渡。

当前前馈 GS 领域形成了三大技术路线,它们在"如何从 2D 图像提取 3D 几何"这一核心问题上给出了截然不同的答案:

  • DUSt3R 系族(点图回归):不走传统 SfM 流水线,而是用网络直接回归成对图像的点图(pointmap)——每个像素直接预测其在统一坐标系下的 3D 坐标。DUSt3R [arXiv:2304.03652] 开创了这条路线;Spann3R [arXiv:2408.16961] 引入空间记忆机制,把逐对回归扩展为增量式全局重建;CUT3R [arXiv:2501.12326] 进一步加入持久状态,支持任意长度视频流的在线 3D 重建;MonST3R [arXiv:2410.03735] 专攻动态场景,在点图回归中分离静态与动态点,实现单目视频的运动估计与重建。
  • 直接预测 GS 参数:网络直接输出 3DGS 的原始参数(位置、协方差、不透明度、颜色 SH 系数)。pixelSplat [arXiv:2312.12337] 采用像素对齐策略 + epipolar transformer 跨视图通信;MVSplat [arXiv:2403.14627] 用 cost volume 替代 epipolar attention,几何更可靠;NoPoSplat [arXiv:2406.06221] 彻底去除位姿输入,网络内部隐式估计相对位姿;GS-LRM [arXiv:2406.06521] 以大规模预训练(1B 参数 Transformer)实现零样本泛化,是"大重建模型"路线的代表。
  • VGGT(CVPR 2025 Best Paper) [arXiv:2503.11651]:用一个单一 Transformer 同时处理任意数量的输入视图,一次性输出相机位姿、深度图、点云和 3DGS 场。无需 SfM、无需逐对推理、无需递归式增量重建。VGGT 的意义在于它把"多视图几何"压缩进了一个端到端的前馈网络,标志着前馈 3D 重建从"专用任务模型"走向"通用基础模型"。
方法Venue输入位姿需求输出格式核心创新
DUSt3RCVPR 2024图像对无需点图成对点图回归,替代传统 SfM 特征匹配
Spann3RarXiv 2024多视图无需点图空间记忆机制,逐对扩展为全局增量重建
CUT3RarXiv 2025视频流无需点图 + GS持久状态记忆,任意长度在线 3D 重建
MonST3RNeurIPS 2024单目视频无需点图(动/静分离)动态场景点图回归,分离静态与动态几何
pixelSplatCVPR 2024双目图像需要3DGS像素对齐 + epipolar transformer 跨视图通信
MVSplatECCV 2024稀疏多视图需要3DGScost volume 替代 epipolar attention,几何更可靠
NoPoSplatarXiv 2024多视图无需3DGS + 隐式位姿去除位姿输入,网络内部隐式估计相对位姿
GS-LRMECCV 2024多视图需要3DGS1B 参数 Transformer 大规模预训练,零样本泛化
VGGTCVPR 2025 Best Paper任意多视图无需位姿 + 深度 + 点云 + GS单一 Transformer 端到端,无需 SfM,全量输出
★ "无位姿"路线的深层意义 从需要 COLMAP 预处理到端到端前馈,不只是"少了一步"——它改变了 3DGS 的应用边界。需要位姿意味着前馈 GS 只能在"已标定"场景使用(实验室、专业采集);去掉位姿后,任意手机拍的照片、网络爬取的图片、机器人实时视频流都能直接输入,3DGS 才真正具备"基础模型"所需的输入泛化性。DUSt3R 系族和 NoPoSplat/VGGT 从两个方向逼近同一目标:前者用点图回归绕过显式位姿估计,后者在网络内部隐式消化位姿。两条路在 CVPR 2025 汇合,标志着前馈 GS 从"学术 demo"走向"可用基础模型"的临界点。后续若结合大规模多模态预训练,空间基础模型的轮廓将逐渐清晰。

GS × 扩散模型:两条路线的交叉

3DGS 与扩散模型的结合是 2024 年 3D 生成领域最活跃的交叉地带。两条技术路线从不同方向逼近同一目标——用 2D 扩散先验生成 3D 资产——但在工程哲学上几乎对立。

路线一:SDS 直接优化。DreamGaussian [arXiv:2309.16653](ICLR 2024 Oral)是这条路线的里程碑。它用 3DGS 替代 NeRF 作为 SDS(Score Distillation Sampling)的优化载体:扩散模型在每个优化步骤对 3DGS 渲染图评分,梯度经可微光栅化传回高斯参数。由于 3DGS 的光栅化比 NeRF 的体积渲染快约一个数量级,DreamGaussian 把文本到 3D 的生成时间从 NeRF 时代的数十分钟压缩到约 1 分钟,速度提升约 10 倍。但代价是 SDS 固有的两个问题:梯度噪声(扩散模型的 score 估计本身有方差,导致优化方向抖动)和过平滑(SDS 倾向抹平高频细节,生成结果常缺乏纹理锐度)。这两个问题源于 SDS 的本质——它没有显式的似然函数,而是在高维参数空间用噪声梯度做随机游走。

路线二:多视图扩散先验。CAT3D [arXiv:2405.10314](NeurIPS 2024)走了另一条路:不直接用 SDS 优化 3DGS,而是先用多视图扩散模型从单张输入图生成一组多视角图像,再用标准 3DGS 重建 pipeline 从这些生成图重建 3DGS 场。因为重建阶段用的是成熟的 per-scene optimization(第 1 章的方法),不涉及 SDS 梯度,所以完全规避了梯度噪声问题,生成质量显著高于 SDS 路线。代价是:① 多视图扩散模型本身的采样开销(数十步去噪 × 多个视角);② 生成视图之间的 3D 一致性仍不完美(扩散模型逐图生成,视角间几何可能冲突),需要重建阶段的正则化来吸收不一致。

维度SDS 直接优化(DreamGaussian)多视图扩散先验(CAT3D)
速度快(~1 min),3DGS 光栅化加速慢(~10 min),扩散采样 × 多视角
质量中等,受梯度噪声 + 过平滑限制较高,规避 SDS 噪声,靠重建保几何
3D 一致性弱,依赖多视角 SDS 叠加收敛中等,生成图间一致性靠重建正则
核心瓶颈score 梯度方差大,高频细节丢失扩散采样开销,生成视角几何冲突
③ 未来方向:从"扩散像素"到"扩散高斯" 当前两条路线的共同局限是:扩散模型仍在 2D 像素空间运作,3DGS 只是"消费者"——要么被 SDS 梯度拉扯,要么被生成图重建。下一步的突破点在于让扩散模型直接生成高斯场:把扩散的噪声-去噪过程从像素空间搬到 3DGS 参数空间,直接生成高斯的位置/协方差/颜色/不透明度。这条路线已有早期探索(如 GaussianCube 用体素化高斯做扩散生成),但离实用还有距离。另一个方向是GS 作为扩散先验的条件:给定一个粗略 3DGS 场作为条件,扩散模型在其基础上做细节增强或风格变换——这把 3DGS 从"生成结果"变成"生成条件",可能在可控 3D 编辑上打开新空间。两条路最终可能在"扩散生成高斯场 + GS 条件引导"的统一框架下汇合。
CH 06

具身智能基础:仿真到 Sim2Real

VLA 谱系 · 仿真平台 · Sim2Real 鸿沟 · 数据飞轮

前五章讲的是"空间如何被表示、被理解、被生成"。从这一章起,视角切换到"占据这份空间的智能体"——机器人。具身智能(Embodied Intelligence)的核心难题不是单独的感知或规划,而是感知-规划-行动在物理世界中的闭环:机器人看到世界、想出动作、执行动作、世界因此改变、再看到改变后的世界。这个闭环的每一环都受物理约束、噪声、延迟和不可逆性折磨。本章铺底——讲清 VLA 谱系、仿真平台与 Sim2Real 鸿沟,为第 7–9 章把 3DGS 接进机器人闭环做准备。

VLA 谱系:从 RT-2 到 GR00T N1

2023 年 7 月,Google DeepMind 发表 RT-2,正式提出 Vision-Language-Action(VLA)范式:把视觉-语言模型(VLM)微调到机器人动作轨迹上,让互联网上学到的知识直接迁移到机器人手上。这是具身智能的分水岭——此前机器人策略要么是手工规则,要么是小数据模仿学习;VLA 第一次让"看网课学常识"和"练动手学技能"在同一个网络里统一。此后两年,VLA 沿"端到端"和"分层"两条路线爆发。

VLA 的核心公式 at = Policyθ( ot, l, ht ) ot 是当前观测(图像/点云/3D 场),l 是语言指令,ht 是历史。端到端 VLA 把三者和动作 at 都塞进一个大模型;分层 VLA 把它拆成"VLM 规划高层动作 + 小策略网络执行低层动作"两层。端到端简单但难训练、难解释;分层灵活但两层接口设计难。争议至今未决。
方法团队时间一句话创新
RT-2Google DeepMind2023.07首创 VLA 范式,网课知识迁移到机器人手
OpenVLAStanford/Google2024首个开源 7B VLA,LLaVA 微调于 OXE 数据集
OctoUC Berkeley2024.03开源 93M VLA,模块化架构 + 独立动作头
π0Physical Intelligence2024.12流匹配动作解码器,50 步关节空间控制
GR00T N1NVIDIAGTC 2025.03开源人形机器人基础模型,System 1 快反应 + System 2 VLM 规划
Pelican-Unified 1.0ByteDance2026.05首个统一具身基础模型,单一 VLM 理解+推理+想象+行动
ReconVLA-AAAI 2026 Outstanding首个在顶会获最佳论文的具身 AI 工作,重建引导 VLA

注意两条主线在 2025–2026 年的汇合趋势:GR00T N1 把 System 1(快反应策略)和 System 2(VLM 慢规划)分层组合,本质是"分层派"吸收"端到端派"的优势;Pelican-Unified 1.0 则反其道,用单一 VLM 同时做理解、推理、想象、行动,证明端到端在足够数据下也能统一。这场"端到端 vs 分层"的争论,正随着模型规模和数据增长逐步收敛——答案很可能不是非此即彼,而是"端到端打底 + 必要处分层结构化"。

仿真平台:机器人的"健身房"

VLA 要数据,真实机器人采集成本极高(每条轨迹要人遥操作或真机运行),且易损易耗。仿真平台是解决方案:在虚拟世界里批量生成训练数据,再把策略迁回真机。这是 Sim2Real 的"Sim"端。主流仿真平台各有侧重:

平台团队特色一句话定位
Isaac SimNVIDIA物理仿真GPU 加速刚体/柔体物理,工业级精度, physically-based 渲染
HabitatFAIR导航大规模室内导航,HM3D/Gibson 数据集,支持多机器人
RoboCasaUT Austin家务大规模家务机器人仿真,10 万+ 轨迹
LIBEROStanford终身学习机器人操作终身学习基准(ICLR 2024)
AGIBOT WORLD / Genie Sim智元 AGIBOT数据引擎可交互可训练可评测物理仿真,百万轨迹 217 任务(ICRA 2026)
★ 仿真的根本矛盾 Sim2Real 的核心矛盾是仿真永远不够真。物理引擎对摩擦、接触、柔体的建模总有近似;渲染对光照、材质、噪声的模拟总有偏差。策略在仿真里练到 99% 成功率,到真机可能掉到 60%。这个"现实鸿沟(reality gap)"是具身智能最顽固的工程难题。解法沿两条路:① 让仿真更真(域随机化、更好的物理/渲染);② 让策略更鲁棒(在仿真里就见过各种扰动)。3DGS 在第二条路上有独特价值——它能把真实场景重建后搬进仿真,让仿真环境的"外观"逼近真实,缩小渲染侧的鸿沟。

Sim2Real 鸿沟与数据飞轮

缩小 Sim2Real 鸿沟的工程范式是"数据飞轮":仿真生成 → 真机微调 → 真机数据回流仿真 → 仿真再生成。这个闭环让仿真环境不断逼近真实分布。3DGS 在这里扮演两个角色:

  • 场景真实化:用 3DGS 重建真实场景(厨房、车间、仓库)后导入仿真,让仿真环境的视觉分布与真实一致。Habitat-GS 即此思路——把 3DGS 渲染嵌入导航训练。
  • 可微仿真:3DGS 的可微渲染让"仿真里的渲染"可被梯度优化,策略可以通过渲染误差反向学习。GS-World 把 3DGS 当作可微仿真引擎,让 Sim2Real 本身可微。ManiGaussian(ECCV 2024)更进一步——用动态高斯世界模型预测操作后的未来场景,让机器人在"想象"里预演动作后果。

这正是 3DGS 对具身智能的深层价值:它不只是"给机器人一张地图",而是把仿真与真实的边界变模糊——因为 3DGS 重建出来的就是真实场景的可微副本,策略可以在这个副本上安全试错、廉价试错、梯度式试错。这是空间智能赋能具身智能的关键通路,也是第 7–9 章展开的地基。

本章 Paper List

与正文对照表互为补充的具身智能关键论文,出处见本仓库 references 素材库。

论文会议一句话贡献
π0.52025.06VLA-Flow 模型:流匹配动作解码 + 灵巧操作与泛化提升(Physical Intelligence)
VoxPoserCoRL 2023LLM+VLM 组合 3D 价值图,零样本操作规划(Stanford)
Diffusion PolicyRSS 2023扩散去噪生成动作序列,轨迹平滑度与多模态性优于行为克隆(CMU)
ALOHA 2RSS 2024低成本双臂遥操作平台 + 60Hz 扩散策略,灵巧操作基准(Stanford)
RoboCasa2024大规模家务仿真环境,10 万+ 遥操作轨迹(UT Austin)
LIBEROICLR 2024机器人操作终身学习基准,评估跨任务知识迁移
WorldArena 2.0arXiv 2026.05具身世界模型评测:视觉→触觉、策略评测→交互 RL、仿真→真机全链路升级
★ 思考题
  1. 端到端 VLA 和分层 VLA,在"可解释性"和"数据效率"上各有什么代价?
  2. Sim2Real 鸿沟里,"渲染偏差"和"物理偏差"哪个更难缩小?为什么?
  3. 3DGS 重建场景导入仿真,能缩小哪一侧的现实鸿沟?它的局限是什么?
  4. "可微仿真"为什么对策略学习有根本意义?传统非可微仿真的策略只能怎么学?
CH 07

3DGS 作为机器人空间记忆

GS-SLAM · 可渲染记忆 · 位姿估计 · 导航决策推理

机器人要在未知环境里行动,第一件事不是"规划",而是"记住"——边走边把周围建成一张地图,同时用这张地图给自己定位。这就是 SLAM(Simultaneous Localization and Mapping)。传统 SLAM 的地图是点云或体素网格:能定位,能避障,但不能渲染、不能查询语义、不能直观交互。3DGS 把这张地图换成可渲染的高斯场——机器人不仅能知道"我在哪",还能"看见"自己记忆里的世界,在任何视角渲染出图像。这一步把 SLAM 从"几何工具"升级为"空间记忆",是 3DGS 走向具身智能的最直接通道。

GS-SLAM:为什么高斯地图比点云地图更好

传统点云 SLAM(如 LOAM、ORB-SLAM 的地图)只存几何点,丢失了外观。这带来三个限制:① 无法做基于外观的重定位(换光照、换季节就认不出);② 无法渲染给人类看(调试困难、遥操作困难);③ 无法接语义(点没有颜色特征)。3DGS 地图同时存几何+外观,三项限制一并解除:

  • 光度位姿估计:位姿不再依赖特征点匹配,而是直接用"当前观测图 vs 渲染图"的光度误差做优化。这意味着只要地图能渲染,就能定位——哪怕场景里没有角点、纹理稀疏。
  • 可渲染调试:工程师能直接看到机器人"脑中"的世界长什么样,快速发现建图错误(漂浮高斯、穿模、漏建)。
  • 语义就绪:因为地图本身就是高斯场,第 4 章的语义高斯可直接挂上,机器人记忆瞬间从"几何"升级为"语义"。
GS-SLAM 的位姿优化目标 Tt* = argminT ‖ It − render(G, T) ‖2 + λ·R(T) G 是当前高斯地图,T 是待优化的相机位姿,render(G, T) 是从位姿 T 渲染地图得到的图像,It 是真实观测图。位姿优化变成"找一个 T,让渲染图最像真实图"。因为 render 可微,梯度可直接传到 T。R(T) 是位姿先验正则(平滑、回环)。这个目标把 SLAM 的"定位"和 3DGS 的"渲染"统一进一个可微优化——这是 GS-SLAM 的本质创新。

三大 CVPR 2024 GS-SLAM 对比

2024 年 CVPR 同时接收三篇 GS-SLAM,标志着这条路线从概念走向成熟。它们的设计差异恰恰映射了 GS-SLAM 的核心工程取舍:

方法会议输入核心设计特色
SplaTAMCVPR 2024RGB-D在线增量高斯 + silhouette mask + 渲染位姿优化首个实时 GS-SLAM
Photo-SLAMCVPR 2024RGB-D超原语地图:显式几何特征定位 + 隐式光度特征;Gaussian-Pyramid 训练可在 Jetson AGX Orin 边缘端运行
MonoGSCVPR 2024 Highlight单目 RGB首个实时单目 GS-SLAM,用高斯不确定性建模无需深度传感器

三者差异值得细看:SplaTAM 用 RGB-D(有深度),简单直接,是 GS-SLAM 的"标准答案";Photo-SLAM 的亮点是边缘部署——能在 Jetson AGX Orin 上跑,这对真实机器人至关重要(机器人不可能背一台工作站);MonoGS 最难,单目无深度,全靠高斯不确定性建模和先验,但适用面最广(任何带摄像头的设备都能用)。这种"输入模态 × 部署约束"的二维取舍,是 GS-SLAM 工程化的主轴。

⚠ GS-SLAM 的现实约束 GS-SLAM 当前最大的瓶颈不是精度,而是增量更新的稳定性。机器人边走边往地图里加高斯,新观测可能与旧高斯冲突(动态物体经过、光照变化)。如果不适时剪枝/合并/遗忘,地图会越长越乱——漂浮高斯、重影、穿模累积。SplaTAM-v2(CVPR 2025)加在线回环检测和全局优化正是治这个病;2DGS-SLAM(TRO 2026)用 2D 圆盘重写以保证全局一致。GS-SLAM 离"部署级可靠"还有距离,但它指明了方向。

空间记忆层级与导航决策

有了可渲染+可语义的高斯地图,机器人导航决策不再是"局部避障",而能在记忆上推理。考虑一个任务:"去厨房拿杯子"。机器人需要:① 在高斯地图里定位"厨房"区域(语义查询,第 4 章);② 在记忆中规划路径(拓扑/度量地图);③ 边走边用 GS-SLAM 更新位姿;④ 到厨房后用语义高斯找"杯子";⑤ 渲染抓取视角做运动规划。整条链路都挂在一份数据上——这是 3DGS 作为"空间记忆"的真正价值:它把定位、建图、感知、规划统一在一份可渲染可查询的表示里。

③ 与传统 SLAM 的衔接 GS-SLAM 不是要取代 ORB-SLAM、LOAM 这些经典方法,而是在它们之上加了一层"可渲染语义外壳"。很多 GS-SLAM 系统内部仍借用经典前端的特征追踪/里程计来做粗定位,再用高斯渲染做精修——这是务实组合。纯粹靠渲染做定位在纹理稀疏、快速运动时容易丢,传统特征前端更鲁棒。理解这种"经典前端 + GS 精修"的混合架构,是落地 GS-SLAM 的关键。

本章 Paper List

GS-SLAM 家族与空间记忆的扩展论文,覆盖定位、融合、动态场景与导航推理。

论文会议一句话贡献
SplatLocCVPR 2025高斯锚定地图表示,视觉定位新范式
GaussFusionCVPR 2025多会话 GS-SLAM 子图对齐融合,跨会话一致性建图
ULF-LocCVPR 2026 Highlight揭示高斯 alpha 合成的特征偏置,几何加权聚合 + 关键点共识采样重定位
Flow4DGS-SLAMCVPR 2026光流引导 4D 高斯 SLAM:自监督动静态分离,免语义标签(NUS)
GGD-SLAMICRA 2026单目动态场景可泛化运动模型,无需语义标签与深度输入
GaussNav-2CVPR 2025分层语义高斯地图导航,语言引导具身探索增强
GaussRoverCVPR 2025地形感知高斯表示,星表漫游器导航
GSMemarXiv 20263DGS 作为持久空间记忆,零样本具身探索与再定位
★ 思考题
  1. 光度位姿估计相比特征点匹配,在"纹理稀疏"和"快速运动"两种场景下各有什么表现?
  2. Photo-SLAM 能在 Jetson 上运行,SplaTAM 不能——这背后的设计差异是什么?边缘部署 GS-SLAM 要牺牲什么?
  3. GS-SLAM 的"增量更新稳定性"问题,与第 3 章大规模重建的"接缝问题"有何共通的根因?
  4. "经典前端 + GS 精修"的混合架构,为什么比纯 GS-SLAM 更鲁棒?这种妥协的代价是什么?
CH 08

物体级与铰接式理解

part-level 高斯 · 铰接资产 · 运动学约束 · CAD·Mesh·3DGS 桥接

第 4 章的语义高斯让机器人知道"这是椅子";第 7 章的 GS-SLAM 让机器人知道"椅子在房间哪"。但要真正操作一把椅子——把它搬起来、折叠它、打开它的腿——机器人还需要更细的理解:椅子有几部分?哪部分能动?怎么动?这就是物体级(part-level)与铰接式(articulated)理解。它是从"看见物体"到"理解物体怎么动"的关键一跃,也是机器人从导航走向操作的前置条件。

part-level 高斯:比物体级更细

第 4 章的语义高斯大多是"物体级"——区分椅子、桌子、杯子。但操作需要"部件级":一把椅子的椅背、椅腿、座面是不同部件,抓椅背和抓椅腿是不同动作。part-level 高斯把语义从"物体"细化到"部件",每个高斯不仅知道属于哪个物体,还知道属于该物体的哪个部件。

这比物体级难得多:部件边界是模糊的——椅背和座面在哪里分界?不同椅子结构不同。纯靠 CLIP 蒸馏的语义难以区分同物体内部部件,因为 2D CLIP 特征就是物体级的。OpenGaussian 用 SAM 的部件级 mask 做分层聚合,是当前突破点;GaussianGrasper(IEEE T-RO 2024)把 SAM+CLIP 蒸馏进 3D 语言高斯,专门服务开放词汇机器人抓取——它需要知道"抓杯子把手"而不是"抓杯子",这要求部件级语义。

铰接资产与运动学约束

铰接物体(articulated object)是 part-level 的进阶——它的部件之间有运动学约束:抽屉能拉、门能转、剪刀能合。理解铰接物体意味着不仅要分出部件,还要推断部件间的连接关系(哪两个部件相连)和运动类型(平移/旋转/自由度范围)。这是机器人操作最贴近物理的一层理解。

铰接物体的运动学模型 Tpart(θ) = Tjoint · Exp(ξ · θ) · Tpart,0 每个部件的位姿 = 关节变换 × 指数坐标表示的运动(旋转向量 ξ·θ) × 部件初始位姿。θ 是关节参数(抽屉拉开多远、门转多少度)。铰接理解的任务就是从观测推断:① 有几个部件;② 哪些部件间有 joint;③ 每个 joint 的类型(平移/旋转)和轴方向。这正是 URDF 机器人运动学模型在物体侧的镜像——理解了铰接,物体的运动就可以用与机器人手臂同样的运动学公式预测。

铰接理解的工程价值在于可预测性:一旦推断出"门绕这个轴旋转",机器人就能精确预测"推门把手 10 厘米,门会转到什么角度",而不必靠试错。这把操作从"盲目探索"变成"基于模型规划"。3DGS 在这里的优势是部件可分割——每个高斯属于一个部件,部件运动时只需对该部件的高斯做刚体变换,渲染即可预测运动后的外观。这比 NeRF 的隐式表示(无法分部件)天然适合铰接建模。

CAD·Mesh·3DGS 桥接:从重建到可制造

3DGS 能渲染、能编辑,但它不是工程师能直接制造的标准格式——制造业要 CAD(STEP/IGES),游戏业要 mesh。把 3DGS 重建结果转成可制造的 CAD/可用 mesh,是 3DGS 走向工业价值链的"最后一桥"。这座桥目前有几种走法,对应 3DGS 到几何表示的不同转换路径:

方法会议目标表示一句话创新
SuGaRCVPR 2024Mesh正则高斯对齐表面,TSDF + Marching Cubes 提网格
2DGSSIGGRAPH 2024Mesh2D 圆盘贴表面,Poisson 重建直接出网格
BrepGaussianCVPR 2026CAD (B-rep/STEP)3DGS + B-rep CAD 重建,输出参数化 STEP 模型
CADDreamerCVPR 2025 HighlightCAD (B-rep)文本/草图 → CAD B-rep 生成,扩散参数化 CAD 程序合成

这条桥接谱系揭示了一个递进:从"取近似 mesh"到"造精确 CAD"。SuGaR/2DGS 提的是网格——够游戏业用,但不是精确几何,不能直接数控加工。BrepGaussian 才真正叩开制造业大门:它把 3DGS 重建反向拟合到 B-rep(边界表示)CAD 模型,输出 STEP 文件——这是数控机床、3D 打印、CAD 软件能直接读的工业标准格式。一步从"看起来像"变成"可制造",是从消费级到工业级的质变。

3DGS → CAD 的表示鸿沟 3DGS:自由椭球场(无数高斯,无拓扑)  →  CAD:参数化 B-rep(少量面,严格拓扑) 3DGS 是"自由表示"——成千上万高斯各居其位,没有拓扑结构;CAD 是"约束表示"——少量参数化面(平面、圆柱、NURBS)通过严格拓扑边相连。从自由到约束的回归,本质是"拟合一个参数化模型去解释一堆高斯"。这比 3DGS→mesh 难得多:mesh 只要把高斯包络成三角面片(数值近似),CAD 还要推断"这应该是个圆柱还是个圆锥"(语义识别 + 参数拟合)。BrepGaussian 的贡献正是在这层"从数值到语义"的跨越。
★ 操作的前提条件 把 part-level 语义、铰接运动学、CAD 桥接串起来看,它们共同构成机器人操作的三级前置条件:① 部件级语义让机器人知道"抓手该对准哪个部件";② 铰接模型让机器人预测"动手后物体会怎么动";③ CAD/mesh 让机器人有精确几何做接触规划。3DGS 在三级里都扮演统一表示的角色——同一份高斯场既能出语义、又能出运动学、还能出 CAD——这是空间智能走向精细操作的底层便利。

本章 Paper List

part-level 高斯、铰接资产与 CAD 桥接的扩展论文,与正文三级前置条件一一对应。

论文会议一句话贡献
ArtSplatarXiv 2026首个前馈铰接 3DGS:逐像素关节图 + 跨状态注意力,比优化快 400 倍
GraspSplatsCoRL 20243D 特征 splatting 零样本操作,端到端优于 NeRF 抓取管线
GaussianGrasperT-RO 2024SAM+CLIP 蒸馏 3D 语言高斯,开放词汇部件级抓取
SuGaRCVPR 2024正则高斯贴合表面,TSDF+Marching Cubes 提网格
BrepGaussianCVPR 20263DGS 反向拟合 B-rep CAD,输出参数化 STEP 可制造模型
CADDreamerCVPR 2025 Highlight文本/草图 → CAD B-rep 扩散参数化程序合成
★ 思考题
  1. 为什么部件级语义比物体级语义难?2D CLIP 的"物体级"特征如何限制了 3D 部件分割?
  2. 铰接物体的运动学模型,与机器人手臂的 URDF 模型本质上是同一套数学——这对"机器人操作物体"意味着什么?
  3. 3DGS → mesh 和 3DGS → CAD 的难度差异在哪?为什么后者需要"语义识别"?
  4. 如果 3DGS 一份表示能同时出语义、运动学、CAD,这对降低机器人系统的数据冗余有何意义?
CH 09

Agent 驱动的数字孪生与交互

MCP 渲染管线 · Agent↔3DGS 交互闭环 · 手势交互 · 可交互世界

前八章有一条隐线:3DGS 越来越像一份"数据"——能渲染、能查询、能优化。但从"数据"到"世界"还差最后一步——它必须能被 Agent 实时调用和操控。Agent 不只是读地图,而是能动地图:调视角、改参数、加物体、跑物理。这一章讲 Agent 如何通过 MCP(Model Context Protocol)协议驱动 3DGS 渲染管线,把一份静态重建变成可交互的数字孪生,串起感知与行动的完整闭环。

这是本书从"技术原理"走向"系统产品"的转折点。前八章回答"3DGS 是什么、能做什么";这一章回答"Agent 怎么用它做事"——这恰恰是空间智能从研究报告走进真实工作流的关键。

为什么 Agent 需要直接驱动 3DGS

传统 3DGS 工作流是"人写脚本 → 渲染 → 看结果 → 改脚本"的循环,Agent 的角色只是被动执行命令。但空间智能的真正落地点是Agent 自主探索 3D 空间:它要能问"从这个角度看会长什么样"并立刻得到答案,要能说"把这把椅子移到窗边"并看到效果,要能在数字孪生里预演"如果我从这边走会撞到什么"。这要求 Agent 和 3DGS 之间有一条双向、实时、可编程的通道——不只是读,还能写、能查、能渲染。

这就是 MCP(Model Context Protocol)介入的位置。MCP 是为 LLM/Agent 设计的工具调用协议,让 Agent 能像调函数一样调外部能力。把它接到 3DGS 渲染管线上,Agent 就获得了一组"操控 3D 空间"的原语:加载场景、设相机、渲染、查询高斯、变换物体、跑物理。本仓库的 mcp-server 正是这套桥接的原型实现——它把 3DGS 的能力封装成一组 MCP 工具,让 Agent 通过自然语言就能驱动机器渲染与查询。

MCP 渲染管线:工具集与交互闭环

MCP-3DGS 渲染管线的核心是把"3DGS 能做什么"拆成一组可被 Agent 调用的原子工具,每个工具是一个有明确输入输出的函数:

Agent↔3DGS 交互闭环 Agent → MCP_tool( params ) → renderer → 3DGS_scene → image/state → Agent Agent 用自然语言表达意图("从俯视角度看看这个房间"),LLM 把它翻译成一组 MCP 工具调用(load_scene + set_camera(top_view) + render),渲染器执行后返回图像或场景状态,Agent 据此决定下一步。这个闭环让 Agent 不再是"盲调脚本",而是"看见结果再决策"——这正是空间智能赋予 Agent 的具身性:它在数字孪生里有了"眼睛"。

本仓库的 MCP 服务器实现了 24 个工具,覆盖场景管理、相机控制、渲染输出、高斯查询、物体变换、物理模拟几大类。Three.js/WebGPU 做前端实时渲染,光追后端做高质量离线渲染——Agent 可按需在"快预览"和"精渲染"间切换。这套原型的意义不在工具数量,而在它验证了"Agent 用自然语言操控三维空间"这条路径可行——这是数字孪生从"给人看"升级为"给 Agent 用"的关键一步。

③ 工程要点 MCP-3DGS 最大的工程挑战是延迟与状态的同步。Agent 每次决策都要"渲染→看→再决策",如果渲染要几秒,闭环就慢到无法用。所以管线里必须有"粗预览(毫秒级)+ 精渲染(秒级)"双通道:Agent 默认走粗预览快速试错,需要确认时再调精渲染。另一挑战是状态一致性——Agent 改了场景后,所有人(人和其他 Agent)看到的必须是改后的版本,这需要单一数据源 + 实时同步,类似多人游戏的架构。

手势交互:让人类也进数字孪生

数字孪生不只是给 Agent 用的,也要给人用——工程师调试、设计师评审、工人培训都要"走进"孪生空间。传统交互靠键鼠,但三维空间最自然的交互是手势和身体。本仓库的 fusion-demo 把 MediaPipe(手势/姿态识别)+ YOLO(物体检测)+ Three.js(渲染)+ 3DGS(场景)融合,实现了实时手势驱动的三维交互:举起手就能"抓住"虚拟物体,捏合手指就能缩放,身体移动就改变视角。

这套融合的关键是多模态对齐:MediaPipe 给出 2D 手部关键点,要映射到 3DGS 场景里的抓取位置,中间需要深度估计和坐标变换;YOLO 识别真实手边的物体,要和孪生里的虚拟物体对应。对齐不准就会出现"手在空中抓,物体纹丝不动"的违和感。3DGS 的显式几何在这里帮了大忙——每个高斯有精确 3D 位置,手势射线的命中判定可以直接在高斯场上做,比 hitbox 近似精确得多。

数字孪生:3DGS 作为可交互世界

把以上三层叠起来——3DGS 重建的真实场景 + MCP 让 Agent 操控 + 手势让人进入——就得到一个"可交互数字孪生"。它的价值不在"看起来像真的",而在它是一个可被多方共享、可被 Agent 推理、可被人直观操控的统一空间。考虑一个工厂孪生:Agent 在里面预演"机器人手臂这么动会不会撞到货架",工人在里面培训"紧急按钮在哪、撤离路线怎么走",管理者在里面看"这条产线今天产能多少"。同一份 3DGS,三种用法,无需在点云/CAD/视频之间反复转换。

★ 数字孪生的三个成熟度 数字孪生可按"交互性"分三档:① 只读孪生——能渲染能看,但不能改,相当于 3D 照片;② 可查询孪生——能查询语义/测量/标注,像 3D 数据库;③ 可交互孪生——Agent 和人都能动它、改它、在它里面试错,是真正的"平行世界"。3DGS + MCP + 手势交互实现的是第三档,也是价值最高、最难的一档。它要求 3DGS 不再是"重建结果",而是"运行时数据结构"——这恰是空间智能走向产品的终极形态。
★ 思考题
  1. 为什么"Agent 自主探索 3D 空间"需要双向实时通道,而不仅仅是脚本调用?延迟在闭环里扮演什么角色?
  2. MCP-3DGS 的"粗预览+精渲染"双通道,和第 3 章大规模 GS 的"LoD"有什么共通的工程思想?
  3. 手势交互里"2D 手部关键点映射到 3DGS 场景"为什么难?3DGS 的显式几何如何帮了对齐?
  4. 数字孪生三档成熟度里,"可交互孪生"为什么要求 3DGS 是"运行时数据结构"而非"重建结果"?这对工程架构意味着什么?

3DGS 自动驾驶仿真:从重建到闭环

自动驾驶是 3DGS 最大的工业应用场景之一。真实路测成本高昂、长尾场景难以复现、仿真保真度不足——这三个痛点恰好对应 3DGS 的三大工程优势:照片级真实感、实时渲染速率、可编辑可组合的场景结构。本仓库知识库目前收录了 33 个自动驾驶方向的 3DGS 方法,覆盖从街景重建、城市级生成到闭环仿真训练的完整链路。下面按"重建 → 生成 → 闭环训练"的递进逻辑梳理这条线的关键节点。

街景重建是整条链路的起点。真实道路数据中既有静态背景(路面、建筑、交通标志),也有大量动态物体(行驶车辆、行人、骑行者),朴素地把所有高斯一起优化会导致动态物体在重建中出现"幽灵拖影"。Street Gaussians [arXiv:2401.01339] 给出的解法是将动态街景分解为两层:静态背景用一组常规 3DGS 表征,每个动态物体则用一个独立的刚体高斯组(rigid Gaussian group)表征,并附加 3D 包围盒和可追踪的姿态参数。渲染时先按物体姿态变换对应的刚体高斯组,再与背景合成,从而干净地分离动静态、消除拖影。S³Gaussian [arXiv:2405.20323] 更进一步——它不需要人工标注动态物体掩码,而是在训练过程中引入自监督的动静态分离机制:通过高斯的不透明度统计和残差分析自动识别动态像素,让静态背景和动态物体各自收敛到最优表征。两条路线的共同洞察是:街景重建的核心难点不在渲染质量,而在"动静态解耦"——3DGS 的显式高斯结构让这种解耦天然可做(每颗高斯有独立位置和属性),而 NeRF 的隐式表示做不到逐物体分离。

城市级生成把重建的视野从单条街道拓展到整座城市。GaussianCity(CVPR 2025, [arXiv:2406.06526])提出了一套从语义点云先验出发、用渐进式扩散生成城市级 3DGS 的方法。它的关键设计是:先从粗糙的语义点云(如来自地图服务的 LOD 数据)获取城市的拓扑结构骨架,再用扩散模型逐区域填充高斯细节——先粗后精,逐层提升分辨率和语义丰富度。这种"结构先验 + 渐进扩散"的策略避免了一步到位生成整座城市的不可控性,也让生成结果可以按区域增量更新。对于自动驾驶仿真而言,这意味着不必逐一重建每条道路——只需给出城市的语义地图骨架,就能自动生成大面积可供训练的 3DGS 场景。

闭环仿真训练是这条链路的终点站,也是 3DGS 价值跃迁的关键节点。GSDrive [arXiv:2604.28111] 将 3DGS 重建的街景直接作为闭环仿真环境:驾驶策略 Agent 在其中行驶,每一步动作触发相机视角变化,3DGS 实时渲染出新视角图像,Agent 据此决策下一步。更关键的是,GSDrive 引入了多模式轨迹探测机制——在每个决策点采样多条候选轨迹,分别渲染结果并评估安全性与合规性,用强化信号回传优化驾驶策略。这使 3DGS 从"重建工具"升级为"仿真训练平台":它不再只回答"这条路长什么样",而是回答"如果我这么开,会发生什么"。

3DGS 自动驾驶仿真全链路 采集车数据 → 街景重建(Street Gaussians / S³Gaussian)→ 城市生成(GaussianCity)→ 闭环仿真训练(GSDrive) 重建:从原始多视角图像恢复可渲染的 3DGS 街景,分离动静态。生成:从语义先验扩散出城市级场景,扩展训练覆盖面。仿真:在 3DGS 场景中实时渲染 Agent 视角,闭环训练驾驶策略。3DGS 在每个环节都有独特价值——可微渲染让仿真梯度可回传策略、实时速率(>30fps)满足闭环延迟要求、照片级真实感让 Sim2Real gap 最小化。这三性的叠加是传统仿真器(如 CARLA 的网格渲染)无法同时提供的。

链路总结:重建 → 感知 → 仿真 → 闭环训练。3DGS 在每个环节都扮演不可替代的角色——重建阶段的动静态解耦依赖显式高斯结构,感知阶段的高质量渲染缩小 Sim2Real gap,仿真阶段的实时速率满足闭环延迟约束,闭环训练阶段的可微渲染让仿真梯度可直接回传优化策略。这条从"看路"到"练车"的链路,正是 3DGS 从学术重建方法走向工业仿真平台的核心通路。

多 Agent 协作与技能编排

本章前四节只讲了单 Agent 驱动 3DGS——一个 Agent 通过 MCP 调用渲染工具完成探索、编辑、查询。但真实的空间智能平台远比这复杂:一个完整的数字孪生项目需要多个 Agent 协作。典型分工是三个角色:建图 Agent负责从原始数据重建 3DGS 场景;编辑 Agent负责在场景中增删改物体、调整光照、标注语义;验证 Agent负责检查编辑结果的物理合理性、渲染质量、语义一致性。三个 Agent 各有专长,各自调用不同的工具集,但它们必须在同一份 3DGS 场景上协同工作——这要求一套跨 Agent 的交接机制。

本仓库用技能编排契约(Skill Orchestration Contract)解决这个交接问题。在 skills/_contracts/ 目录下定义了三份 JSON Schema,每份契约规定了一个技能的输出格式和下游技能的输入期望:

契约文件产出技能消费技能交接内容
paper-insight.jsonpaper-readermethod-compare论文核心贡献、方法摘要、关键指标、可对比维度
comparison-report.jsonmethod-compareexperiment-planner方法对比矩阵、优劣分析、推荐实验方向
experiment-plan.jsonexperiment-plannerbenchmark arena实验配置、数据集选择、评估指标、预期基线

契约的核心价值是把"Agent 之间的交接"从自然语言的模糊约定变成机器可验证的结构化协议。上游技能的输出必须通过对应 JSON Schema 的校验才能被下游技能接收——字段缺失、类型不匹配、枚举值越界都会在交接时被拦截,而不是等到下游 Agent 拿到错误数据后产生连锁幻觉。

让这套契约真正"可执行"的是 scripts/router_load.py——Router 加载器。它把 Router manifest 从一份"提示词层面的约定文档"变成一个可执行的运行时机制,做三件事:① 轴值校验——检查 manifest 中声明的每个轴(如 domain、task_type、scale)的值是否在预定义枚举范围内,拒绝非法值;② 片段存在性检查——验证 manifest 引用的每个技能片段文件(SKILL.md、模板 HTML、契约 JSON)确实存在于仓库中,拒绝悬空引用;③ 上下文拼接——根据当前请求的轴值组合,从对应技能片段中提取内容并拼接成完整的 Agent 系统提示词。这三步确保了"声明即真"——manifest 里写了什么,运行时就一定能加载到什么。

由此可以勾勒出一条标准流水线

技能编排标准流水线 paper-reader →(paper-insight 契约)→ method-compare →(comparison-report 契约)→ experiment-planner →(experiment-plan 契约)→ benchmark arena 实测 每个箭头代表一次契约校验的交接:上游技能产出结构化结果,通过 JSON Schema 校验后传递给下游技能。paper-reader 从论文 PDF 提取洞察并以 paper-insight 格式输出;method-compare 消费多份 paper-insight 生成对比报告;experiment-planner 基于对比报告规划实验方案;最终 benchmark arena 按实验方案在真实数据上跑评测。整条链路无需人工中间介入——契约保证每一步的输入都是结构合法的。

最后澄清这套契约机制与 MCP 的关系。MCP(Model Context Protocol)是Agent 与工具之间的协议——它定义了 Agent 如何调用渲染器、查询数据库、操作文件系统等外部能力。而技能编排契约是Agent 与 Agent 之间的协议——它定义了上游 Agent 的产出如何被下游 Agent 消费。两者互补:MCP 解决"一个 Agent 怎么用工具",契约解决"多个 Agent 怎么接力"。一个完整的多 Agent 空间智能生态需要两层协议同时就位——MCP 让每个 Agent 有手(能操作 3DGS),契约让 Agent 之间有嘴(能结构化交接)。本仓库的 mcp-server + _contracts + router_load 三件套,正是这两层协议的原型实现。

★ 从单 Agent 到多 Agent 的工程跃迁 单 Agent 系统的瓶颈不在能力,而在上下文窗口——一个 Agent 同时做重建、编辑、验证,上下文很快被填满,注意力被稀释。多 Agent 架构通过契约交接把长链路任务拆成多个短上下文,每个 Agent 只关注自己的子任务,上下文精简、注意力集中。这和软件工程里"微服务"的思路一致:不是把所有功能塞进一个进程,而是用明确的 API 契约把功能拆成可独立部署的服务。技能编排契约之于多 Agent,正如 OpenAPI 之于微服务——它是分布式智能的接口规范。

本章 Paper List

Agent 驱动数字孪生与自动驾驶仿真的关键论文,覆盖街景重建、城市生成、闭环训练与多智能体协作。

论文会议一句话贡献
Street GaussiansECCV 2024刚体高斯组 + 3D 包围盒动静态分离,消除街景重影
S³GaussianarXiv 2024自监督动静态分离,无需人工动态掩码
GaussianCityCVPR 2025语义点云先验 + 渐进扩散生成城市级 3DGS
GSDrivearXiv 20263DGS 闭环仿真训练 + 多模式轨迹探测,强化信号回传驾驶策略
SplatADCVPR 2025动态物体分解 + 多传感器仿真,驾驶 3DGS 全链路
HERMESICCV 2025首个统一 3D 场景理解+生成自动驾驶世界模型
X-World2026可控多视角生成式驾驶世界模型(视频扩散 + 3DGS 仿真,小鹏)
RADNeurIPS 20253DGS 数字孪生 + 闭环 RL 训练端到端驾驶,克服模仿学习因果混淆
CH 10

世界模型与未来展望

世界模型六大学派 · 3DGS×World Model · 空间基础模型 · Physical AI

终章把视野拉到最高处:世界模型(World Model)。前面九章讲的都是"空间如何被表示、理解、生成、交互"——但智能体要在世界里行动,最终要回答一个问题:"如果我这么做,世界会变成什么样?"这就是世界模型的领地:一份能让智能体预测行动后果、在脑中预演未来的内部模型。3DGS 在这条线上既是场景构建器,也是可微仿真引擎,更是空间智能与具身智能的交点。这一章梳理世界模型的六大学派,定位 3DGS 的位置,并展望空间基础模型与 Physical AI 的未来。

世界模型的六大学派

"世界模型"在 2024–2026 年成为最热的术语,但它背后是几条独立演进的研究脉络在交汇。学界共识是:视频生成 ≠ 世界模型——"能画出视频"不等于"理解世界"。物理一致性、因果推理、行动可控性是世界模型区别于纯视频生成的根本。当前可归纳为六大学派:

学派核心主张代表对 3DGS 的关系
视频生成派生成逼真视频 = 模拟世界Sora (OpenAI), Genie 3 (DeepMind)3DGS 可作渲染后端提供几何一致性
强化学习派内部环境模型用于策略训练Dreamer 系列 (Hafner), DayDreamer3DGS 可微渲染支撑"想象"训练
联合嵌入预测派在抽象表示空间预测,非像素空间V-JEPA 2 (LeCun/Meta)3DGS 提供可预测的几何结构
空间智能派理解并生成 3D 空间结构Marble (World Labs/李飞飞)3DGS 是核心表示工具
自动驾驶仿真派物理一致的未来状态预测Tesla Neural World Sim, GAIA (Wayve)3DGS 重建真实路况场景
3DGS 原生派动态高斯场本身即世界模型GS-World, ManiGaussian3DGS 既是表示也是预测引擎

这六派并非互斥,而是在"预测什么、在哪预测、为何预测"三个维度上各有侧重。视频生成派预测像素但缺物理;RL 派预测状态用于策略但表示抽象;JEPA 派避开像素在潜空间预测更高效但难解释;空间智能派强调 3D 结构理解;自动驾驶派追求物理一致的仿真;3DGS 原生派则直接把动态高斯场当作世界模型——它预测的不是视频或抽象向量,而是"高斯怎么动"。这最后一派最贴近本书主线,也最有工程落地性。

关键里程碑:从 Ha&Schmidhuber 到 V-JEPA 2

2018
Ha & Schmidhuber 发表"World Models"开山之作:用生成式世界模型在"梦境"中训练策略,奠定 RL 派基础
2020–2023
Hafner 在 DeepMind 推出 Dreamer V1–V3,V3 在 Minecraft 挖钻石,跨 150+ 任务泛化
2022
LeCun 提出 JEPA 架构理论:不在像素而在抽象表示空间做预测
2024.10
ManiGaussian(ECCV 2024):动态高斯世界模型驱动多任务机器人操作,3DGS 原生派首个代表作
2025.06
Meta FAIR 开源 V-JEPA 2:100 万+小时视频自监督,JEPA 派从理论走向工程
2025.08
DeepMind 发布 Genie 3:首个支持实时交互的世界模型,20–24fps@720p
2025.10
GS-World(港中深):3DGS 作为可微仿真引擎,生成式仿真 + Engine-driven Sim2Real VLA 统一
2025
DreamerV3 登上 Nature——基于模型的 RL 跨越多样化领域,MBRL 获主流学界盖章
2026
World Labs 推出 Marble:单张图像→可交互 3D 空间,空间智能派走向商业化

注意 DreamerV3 登上 Nature(2025)的标志性意义——这是基于模型的强化学习(MBRL)第一次在顶级综合期刊获得主流学界认可。Hafner 离开 DeepMind 创业商业化 Dreamer,与 LeCun 离开 Meta 押注 JEPA(成立 AMI Labs,2026 年种子轮 10.3 亿美元、估值 35 亿美元),标志着世界模型从学术研究走向产业赛道。两条技术路线(RL 派 vs JEPA 派)的代表人物同时下海,说明世界模型已被视为下一个ten-billion 级机会。

3DGS×World Model:可微仿真的独特位置

在六派之中,3DGS 原生派(GS-World、ManiGaussian)的位置独特而关键。其他学派的世界模型要么预测像素(视频生成派)、要么预测抽象向量(JEPA 派)、要么预测占用网格(自动驾驶派),而 3DGS 派预测的是高斯本身的运动——一种既有几何结构、又可渲染、又可微的中间表示。这带来一个独特优势:

3DGS 世界模型的预测目标 Gt+1 = WorldModel( Gt, at ) 给定当前高斯场 Gt 和动作 at,预测下一时刻的高斯场 Gt+1。因为 G 可渲染,预测结果可以直接"看见";因为 G 可微,预测误差可以直接反传训练世界模型;因为 G 是几何结构,预测天然带物理一致性(不会凭空产生穿模)。这三性(可渲染+可微+结构化)的叠加,是纯视频/纯向量世界模型做不到的。ManiGaussian 正是用这套思路预测机器人操作后的未来场景,让策略在"想象的高斯未来"里学习。

GS-World(港中深,2025.10)更进一步——它把 3DGS 直接当作可微仿真引擎,让 Sim2Real 本身可微:策略在 3DGS 仿真里试错,渲染误差反传优化策略,再把优化后的策略迁回真机。这把第 6 章的"数据飞轮"从"离线生成"升级为"在线可微优化",是 3DGS 对世界模型方法论的根本贡献。

空间基础模型与 Physical AI

把视野再拉高一层。2025–2026 年的大趋势是"空间基础模型"(Spatial Foundation Model)——把 3D 理解、生成、交互统一进一个大模型。World Labs 的 Marble(单图→可交互 3D 空间)、NVIDIA 的 Cosmos(World Foundation Model,3D 通才,从"生成画面"升级为"生成可行动的 3D 世界")都是这条线。3DGS 在这里的角色是基础模型与物理世界之间的胶水——基础模型生成/理解的是抽象 3D,3DGS 把它落地成可渲染可交互的具体场景。

★ Physical AI 的技术三角 黄仁勋在 CES 2025/2026 提出的 Physical AI 技术三角——世界模型 + 空间智能 + 具身智能——恰好是本书的结构:第 1–5 章讲空间智能(3DGS 表示/理解/生成),第 6–9 章讲具身智能(VLA/SLAM/操作/交互),第 10 章讲世界模型。三者都以"一份可计算、可渲染、可被 Agent 调用的三维空间表示"为地基——而 3DGS 是当下最被验证的地基。NVIDIA 的 Newton 物理引擎(CES 2026,实时物理世界模型,响应 < 0.01 秒)和 Cosmos 基础模型平台(1000 亿参数,推理延迟 1ms)正在把这个三角工程化。
⚠ 冷静看待:3DGS 会被吃掉吗? 一个必须直面的判断:当空间基础模型成熟到"输入图自动输出 3D 世界",3DGS 作为"中间表示"会不会被隐式模型吃掉?乐观派认为 3DGS 的显式、可编辑、可部署特性是隐式模型长期难以替代的;悲观派认为表示层终会被端到端大模型吸收,3DGS 会退居"训练时的中间产物"。本书的判断是:短期(3–5 年)3DGS 是不可替代的工程地基,长期它可能从"主角"变成"协议"——但即便如此,理解它的原理仍是做空间智能的必修课。后记会展开这个判断。

这本书的终点,是下一段的起点

从 2020 年 NeRF 到 2026 年的世界模型混战,三维表征这条线用六年走完了一个范式循环:隐式(NeRF)→ 显式(3DGS)→ 可交互(GS-World)→ 可预测(世界模型)。3DGS 在这个循环里是承上启下的关键一环——它把隐式表示的优美解构出来,重新组装成显式、可微、可工程化的新地基,并直接催生了可微仿真、可交互孪生、可预测世界模型三条新路线。这本书的终点不是"3DGS 完成了",而是"3DGS 让空间智能有了可施工的地基"——接下来的故事,由读到这里的你来写。

本章 Paper List

世界模型六大学派与 3DGS×World Model 交叉的关键论文,与正文 timeline 互为补充。

论文会议一句话贡献
DreamerV3Nature 2025基于模型的 RL 跨 150+ 任务泛化,MBRL 获顶级期刊盖章
V-JEPA 22025.06100 万+ 小时视频自监督 JEPA 世界模型,环境理解+零样本规划+机器人控制
Genie 32025.08首个实时交互世界模型,24fps@720p,应用于机器人仿真
Marble2026单张图像 → 可交互 3D 空间,空间智能商业化产品(World Labs/李飞飞)
GWMarXiv 2025高斯世界模型:3DGS 作为环境动力学建模基元,自回归预测未来状态
FlashWorldarXiv 2025前馈 3DGS 世界模型:单次前向生成动态 3D 场景,桥接视频生成与 3D 重建
DLWMCVPR 2026双潜变量世界模型:面向自动驾驶的 3DGS 中心自监督预训练
CosmosNVIDIA世界基础模型平台,从"生成画面"升级为"生成可行动的 3D 世界"
NewtonCES 2026实时物理世界模型,响应时间 <0.01 秒,Physical AI 技术三角落地
ESI-BencharXiv 2026.05首个具身空间智能基准:强制感知-行动回路闭合,"具身智能的 ImageNet"
★ 思考题
  1. 六大学派里,3DGS 原生派为何"独特"?它的可渲染+可微+结构化三性叠加,解决了其他学派什么痛点?
  2. DreamerV3 登上 Nature 和 LeCun 押注 JEPA,同时发生在 2025–2026,这说明世界模型的产业地位发生了什么变化?
  3. GS-World 把 Sim2Real 从"离线生成"升级为"在线可微优化",这对策略学习的样本效率意味着什么?
  4. Physical AI 技术三角(世界模型+空间智能+具身智能)和本书结构(1–5/6–9/10 章)为何恰好对应?这是巧合还是必然?
  5. "3DGS 会从主角变成协议"——你认同吗?什么条件下这个判断成立,什么条件下不成立?
CH 11

安全、溯源与版权保护

水印 · 溯源 · 篡改检测 · 对抗攻击 · IP 管理

当 3DGS 模型从研究产物变成工业资产——自动驾驶仿真场景、数字孪生城市、可交互 3DGS 电商展示——谁创建了它、谁拥有它、它是否被篡改过就不再是可有可无的问题。本章从本仓库知识库 Security 类别的 14 个方法中提炼,系统梳理 3DGS 的安全攻击面与防护技术谱系。

为什么 3DGS 需要独立的安全研究

3DGS 的安全挑战与 2D 图像/视频不同,根植于其表征结构:

  • 参数即资产:一个 3DGS 模型 = 数百万高斯的 (μ, Σ, α, SH) 参数组。这些参数是训练数据+计算资源的结晶,直接复制 .ply 文件即完成"盗窃"。
  • 渲染即提取:从 3DGS 模型可以渲染任意视角图像——这意味着 3DGS 包含的视觉信息远多于单张图片,但水印只需在渲染输出中可检测即可。
  • 编辑即篡改:3DGS 天然可编辑(移动高斯、改颜色、删区域)。合法编辑 vs 恶意篡改的边界模糊,传统密码学签名不适用。
  • 扩散模型攻击:2D/3D 扩散模型可以"重绘"3DGS 渲染图或直接编辑场景——这绕过了传统像素级水印检测。

水印谱系:从参数嵌入到几何扰动

3DGS 水印的核心矛盾:嵌入信息要不影响渲染质量,同时对裁剪/压缩/编辑具有鲁棒性。现有方法分四派:

技术路线代表方法嵌入位置鲁棒性
参数嵌入3D-GSW (CVPR 2025, [arXiv:2409.13222])不透明度 + 颜色参数抗裁剪/压缩;可微渲染保证视觉无损
几何扰动GeometryCloak (NeurIPS 2024)高斯位置微扰抗重渲染;但对致密化敏感
隐写术GS-Hider (NeurIPS 2024)高斯参数隐写编码可嵌入大量信息;但增加存储
扩散编辑鲁棒RDSplat ([arXiv:2512.06774])多层级冗余嵌入抗 2D/3D 扩散编辑——填补最大漏洞

RDSplat 的意义在于:当攻击者用 Stable Diffusion 编辑 3DGS 渲染图,或用 3D 扩散模型直接修改场景后,传统水印会失效——而 RDSplat 通过多层级冗余嵌入,确保水印在扩散编辑后仍可检测。这是"水印 vs 生成式编辑"军备竞赛中的关键一步。

溯源与篡改检测

GaussTrace (ICML 2026, [arXiv:2606.10612]) 是首个针对 3DGS 模型的来源溯源方法。它不嵌入水印——而是分析现有模型参数的统计特征来推断来源:

  • 分析高斯协方差矩阵的分布模式(不同训练代码/数据会产生不同的统计指纹)
  • SH 系数的统计特征可区分原始 3DGS vs Mip-Splatting vs Scaffold-GS 训练产物
  • 结合 LLM 进行证据链推理:给定一个 3DGS 模型,输出"该模型很可能由 X 代码库在 Y 数据集上训练"

这对于 IP 取证意义重大:当你在市场上发现一个可疑的 3DGS 模型,GaussTrace 可以提供"它是否源自你的训练数据"的证据链——无需预先嵌入水印。

对抗攻击面

GaussianUnderAttack (NeurIPS 2024) 首次系统分析了 3DGS 的对抗脆弱性:

  • 参数扰动攻击:微小修改少量关键高斯的位置/不透明度,即可在渲染图中产生大面积伪影
  • 致密化劫持:攻击训练过程中的 ADC 阈值,诱导生成大量恶意高斯
  • 渲染投毒:在 GS-SLAM 场景中,篡改 3DGS 地图可导致机器人定位错误——这是具身智能的物理安全风险
⚠ 具身安全警示:当 3DGS 作为机器人空间记忆或自动驾驶仿真环境时,地图篡改不仅是版权问题——它是物理安全威胁。一个被恶意修改的 3DGS 场景可以诱导自动驾驶系统在仿真中学习错误行为,或引导机器人碰撞。安全研究必须从"保护资产"升级到"保护物理实体"。

版权保护与访问控制

除了水印和溯源,3DGS 还需要主动访问控制——不是所有用户都应看到完整场景:

  • FenceGS (CVPR 2025):在 3DGS 模型上叠加访问控制层,不同权限用户渲染不同细节等级
  • IP-GS (CVPR 2025):知识产权保护框架,将版权信息与模型参数绑定,支持许可证验证
  • GauSec (CVPR 2025):首个 3DGS 安全评估基准,系统量化水印鲁棒性、溯源准确率、攻击成本
  • 3DEditSafe ([arXiv:2605.15398]):防御 3DGS 编辑管道生成不当内容(NSFW/有害 3D 场景)

工业合规意义

3DGS 安全不是纯学术问题——它直接关系到工业部署的合规性:

  • 数字孪生:工业设备的 3DGS 模型包含商业秘密,需要水印+访问控制防止泄露
  • 自动驾驶仿真:用于安全认证的仿真场景必须是可信的——地图篡改可能导致认证失效
  • 3D 电商/元宇宙:品牌 3D 展示需要版权保护,防止竞品复制 3DGS 资产
  • AI 生成内容标识:随着 3DGS 生成方法普及,监管要求标识"AI 生成"——GaussTrace 的溯源能力可服务于此

本仓库的 patent-software-ip 技能已覆盖 3DGS 相关的专利撰写与软件著作权登记流程——安全技术与法律保护的结合,才是完整的 IP 护城河。

★ 思考题
  1. 如果一个 3DGS 模型经过 5 次合法编辑(致密化+剪枝+颜色调整),最初嵌入的水印还能存活吗?这取决于什么?
  2. GaussTrace 的"统计指纹"方法能否区分"同一代码库在不同 GPU 上训练的两个模型"?为什么?
  3. 当 3DGS 作为 GS-SLAM 地图被篡改时,机器人有没有可能在运行时检测到?需要什么机制?

本章 Paper List

安全、溯源与版权保护谱系的扩展论文,按参数嵌入/几何扰动/隐写/攻击分析/编辑鲁棒/统一防护排列。

论文会议一句话贡献
3D-GSWCVPR 2025不透明度+颜色参数嵌入,可微渲染保证视觉无损,抗裁剪/压缩
GeometryCloakNeurIPS 2024高斯位置微扰水印,抗重渲染但对致密化敏感
GS-HiderNeurIPS 2024高斯参数隐写编码,可嵌入大量信息但增加存储
RDSplatarXiv 2025多层级冗余嵌入,抗 2D/3D 扩散编辑——填补最大漏洞
GaussianUnderAttackNeurIPS 2024首次系统分析 3DGS 对抗脆弱性:参数扰动/致密化劫持/渲染投毒
Splat-SecurityECCV 2024首个 GS 管道系统性安全分析:训练数据与渲染攻击面
GauSecCVPR 2025首个 3DGS 安全评估基准:量化水印鲁棒性/溯源准确率/攻击成本
GaussTraceICML 2026无需预嵌水印的模型溯源:统计指纹 + LLM 证据链推理
FenceGSCVPR 2025叠加访问控制层,不同权限渲染不同细节等级
IP-GSCVPR 2025版权信息与模型参数绑定,许可证验证
3DEditSafearXiv 2026首个安全正则化 3D 编辑框架,抑制 NSFW 语义传播
GuardMarkGSarXiv 2026首个统一水印+编辑阻止框架,版权防护与篡改威慑一体
BitC-3DGSarXiv 2026位压缩高容量 3DGS 水印:128-bit 消息 + 双分支块解压
4D-GSWarXiv 2026运动学感知的 4DGS 水印,时空一致性 STC 度量 + HMM-MRF

数据集与评估基准

3DGS 评测体系 · 具身智能数据集 · Sim2Real 指标

这一附录把全书涉及的数据集与评估指标集中梳理。它不是论文清单,而是工程速查——告诉你"该在哪个数据集上测什么、用什么指标、注意什么坑"。

3DGS 主流评测数据集

数据集类型场景用途与注意
Mip-NeRF 360室外 360°9 场景(自行车、盆景、厨房等)3DGS 最主流基准;含大量高频细节与远景,对锯齿敏感。报告全图 PSNR/SSIM/LPIPS
Tanks & Temples大场景Truck / Train 等真实大场景新视角合成;注意不同方法用的分辨率/下采样协议可能不同,对比需统一
Deep Blending室内混合2 场景含复杂遮挡与反射;适合测透明/半透明场景表现
NeRF Synthetic (Blender)合成物体8 物体(chair/drums/lego 等)干净合成场景,PSNR 普遍 30+;适合隔离变量测方法本身。报告 center crop
⚠ 评测陷阱 Mip-NeRF 360 的 LPIPS 有两个常见实现——3DGS 内置的 lpipsPyTorch 和标准 lpips 包,两者 VGG 值差异 < 0.001,可对比;但若混用 AlexNet 版则会差很多。3DGS 原文 Table 1 的 LPIPS 未明确标注 backbone,与社区复现值有出入。对比实验务必统一评估代码(用同一份 metrics.py),否则 0.3 dB 的差异可能纯属实现差异而非方法差异。本仓库 references/benchmark-data.md 沉淀了逐场景精确值与一致性验证。

评估指标三件套

PSNR / SSIM / LPIPS PSNR = 10·log₁₀(MAX² / MSE)   ↑ 越高越好(dB) SSIM ∈ [0,1]   ↑ 越高越好(结构相似性) LPIPS = ‖φ(x) − φ(x̂)‖   ↓ 越低越好(VGG/AlexNet 特征距离) PSNR 衡量像素级误差,对噪声敏感但与人类感知相关性弱;SSIM 衡量结构相似性,比 PSNR 更贴近人眼;LPIPS 用深度网络特征衡量感知差异,最接近人类判断但依赖 backbone。三者互补——只看 PSNR 会漏掉感知质量下降(如 NegGS 在 Mip-NeRF360 上 PSNR 升但 LPIPS 反而劣)。

具身智能数据集

数据集类型用途
ScanNet / ScanNet++室内 RGB-D语义/实例分割基线,1513 场景
Replica高精度室内GS-SLAM 常用评测,18 场景,含完美 mesh 做 GT
HM3D / Gibson大规模室内导航Habitat 导航训练,千级建筑
KITTI / nuScenes自动驾驶室外大场景,激光雷达+相机,SLAM 与世界模型
ABC / ShapeNet / PartNetCAD/网格CAD 重建与部件分割基线

Sim2Real 评测的特殊性

具身智能的评测比 3DGS 渲染评测复杂一个量级——它要评"策略迁移到真机后的成功率",而非图像质量。常见指标:① 仿真内成功率(上限,乐观估计);② 真机成功率(真值,但贵且噪声大);③ 跨环境泛化率(换场景/光照/物体后的成功率衰减)。第三项最关键也最常被省略——很多论文只报前两项,但 Sim2Real 的真正考验是泛化而非单场景成功率。

扩充数据集与训练资源

除前述主流基准外,以下数据集在 3DGS 研究中日益重要:

数据集类型场景数特点
DL3DV-10K自然场景10K+目前最大的 3DGS 评测集;覆盖室内外多样场景;4K 分辨率
MatrixCity城市仿真大尺度合成城市;可控光照/天气;支持大规模 GS 评测
KITTI-360自动驾驶73km含 LiDAR + 多相机;街景 GS 重建标准
Waymo Open自动驾驶1150 段多传感器融合;动态场景标注完整
Google Scanned Objects物体级1K+高质量物体扫描;物体级 GS 重建与编辑
ABO商品级398Amazon 商品 3D 模型;含材质纹理;电商 3DGS 应用

训练资源参考

以下为代表性方法的训练时间与资源消耗参考值(来自各论文报告,实际值因场景复杂度而异):

方法GPU训练时间高斯数显存峰值
3DGS (30K)RTX 3090~6 min1-3M~8 GB
Mip-SplattingRTX 3090~8 min1-3M~10 GB
Scaffold-GSRTX 3090~15 min1-2M (锚点+高斯)~12 GB
2DGSRTX 3090~7 min1-2M~9 GB
FastGS (CVPR 2026)RTX 4090~100 sec0.5-1M~6 GB

注意:以上数据来自论文报告,实际训练时间受场景复杂度、图像分辨率、视角数量、致密化策略等多因素影响。建议以本仓库 bench/leaderboard.json 中的 [S] 实测值为准——该文件记录了本仓库服务器复现的精确数字,附 GPU 型号、迭代数与评估实现版本。

引用与延伸阅读

以下按类别整理全书引用的论文、开源仓库与资源。所有条目均已核实发表场所与链接,arXiv 编号可直达原文。

① 基础与核心论文 Foundation & Core

[1] Mildenhall et al., "NeRF: Representing Scenes as Neural Radiance Fields for View Synthesis," CVPR 2020 Best Paper Honorable Mention arXiv:2003.08934隐式神经辐射场开山之作,用 MLP 编码 5D 辐射场
[2] Kerbl et al., "3D Gaussian Splatting for Real-Time Radiance Field Rendering," SIGGRAPH 2023 / ACM TOG arXiv:2308.04079 | 项目主页 | 代码3DGS 原文:各向异性高斯 + 可微光栅化 + 自适应密度控制,实时且质量超 NeRF
[3] Yu et al., "Mip-Splatting: Alias-free 3D Gaussian Splatting," CVPR 2024 Best Student Paper arXiv:2311.164933D 位置平滑 + 2D Mip 滤波,系统性消除多尺度锯齿
[4] Huang et al., "2D Gaussian Splatting for Geometrically Accurate Radiance Fields," SIGGRAPH 2024 / ACM TOG arXiv:2403.178882D 圆盘替代 3D 高斯,几何更干净,可直接提网格
[5] Guédon & Lepetit, "SuGaR: Surface-Aligned Gaussian Splatting," CVPR 2024 arXiv:2312.13253 | 代码正则化高斯对齐表面,TSDF + Marching Cubes 高质量提网格

② 综述 Surveys

[6] 南京大学, "3D Gaussian Splatting: Survey, Technologies, Challenges, and Opportunities," IEEE TCSVT Vol.35 No.7, 2025.07对 3DGS 浪潮最全面的梳理之一,覆盖技术、挑战与机遇
[7] Cornell & HKUST, "Vision-Language-Action Models: Concepts, Progress, Applications and Challenges," arXiv:2505.04769VLA 综述,从具身智能侧讨论 VLM 如何驱动 3D 理解产业化
[8] 港科广+中大+港中文+清华+博世, "Simulating the Real World," TPAMI 20262D/视频/3D/4D 统一维度生长框架,引用 3K+

③ GS-SLAM SLAM

[9] SplaTAM, "SplaTAM: Splat, Track & Map 3D Gaussians for Dense RGB-D SLAM," CVPR 2024 arXiv:2312.02126 | 代码首个实时 GS-SLAM:在线增量高斯 + silhouette mask + 渲染位姿优化
[10] Photo-SLAM, "Photo-SLAM: Real-time Visual SLAM at the Speed of Light," CVPR 2024 arXiv:2311.16728 | 代码超原语地图 + Gaussian-Pyramid 训练,可在 Jetson AGX Orin 边缘端运行
[11] MonoGS, "Gaussian Splatting SLAM," CVPR 2024 Highlight arXiv:2312.06741 | 代码首个实时单目 GS-SLAM,用高斯不确定性建模
[12] PRBonn, "2DGS-SLAM," TRO 2026 代码2D 圆盘全局一致 RGB-D SLAM,回环检测 + 全局优化

④ 语义高斯 Semantic

[13] Qin et al., "LangSplat: 3D Language Gaussian Splatting," CVPR 2024 arXiv:2312.16084 | 代码CLIP 特征存于每高斯,开放词汇 3D 场景查询
[14] Wu et al., "OpenGaussian: Point-Level Understanding of Open 3D Gaussians," NeurIPS 2024 arXiv:2406.02058每点特征蒸馏,点级开放词汇 3D 理解
[15] Kerr et al., "LERF: Language Embedded Radiance Fields," NeurIPS 2023 arXiv:2303.09553NeRF 语义前身,证明辐射场可嵌语言特征
[16] CL-GS, "Contrastive Learning for Gaussian Splatting Semantic Features," ECCV 2024 arXiv:2407.10102对比学习蒸馏 GS 语义特征

⑤ 动态与 4D Dynamic

[17] Yang et al., "Deformable 3D Gaussians for High-Fidelity Dynamic Scene Rendering," CVPR 2024 arXiv:2311.12775 | 代码变形场网络驱动高斯运动,高保真动态场景
[18] Wu et al., "4D Gaussian Splatting for Real-Time Dynamic Scene Rendering," CVPR 2024 arXiv:2310.08528 | 代码4D 各向异性高斯 + 正则化变形,实时动态渲染
[19] SpacetimeGS, ECCV 2024 arXiv:2405.12110单一基元统一空间与时间维度
[20] DN-4DGS, NeurIPS 2024 arXiv:2410.13607 | 代码去噪变形网络抑制时序抖动

⑥ 压缩 Compression

[21] LightGaussian, NeurIPS 2024 arXiv:2311.17245 | 代码全局+局部剪枝 + SVD 蒸馏,15× 压缩 200+ FPS
[22] EAGLES, ECCV 2024 arXiv:2312.04564 | 代码量化嵌入 + 粗到细训练 + 剪枝,10–20× 显存压缩
[23] CompactGS, ECCV 2024 arXiv:2404.04908VQ + 学习码本,紧凑高斯属性存储
[24] SOG-GS, CVPR 2025 arXiv:2411.16443结构化全向分组量化,保留高斯间相关性

⑦ 前馈重建与生成 Feed-Forward & Generation

[25] PixelSplat, CVPR 2024 arXiv:2312.12337 | 代码极线 Transformer 前馈双目 GS 重建
[26] MVSplat, ECCV 2024 arXiv:2403.14627 | 代码代价体从 3 张稀疏视图回归 3DGS
[27] GS-LRM, ECCV 2024 arXiv:2404.197021B 参数 Transformer 大重建模型,零样本泛化
[28] DreamGaussian, ICLR 2024 Oral arXiv:2309.16653 | 代码SDS + 3DGS 先验,文本到 3D 速度提升数量级
[29] GaussianDreamer, CVPR 2024 arXiv:2312.05941 | 代码SDS 耦合结构化高斯初始化,fast 文本到 3D

⑧ 化身与材质 Avatar & Material

[30] 3DGS-Avatar, CVPR 2024 arXiv:2310.08529 | 代码可动画人体化身,姿态条件高斯变形
[31] GaussianShader, arXiv:2311.17977高斯挂可学习 shading function,表达反射/折射
[32] GaussianShader-v2 (R3DG), CVPR 2024 arXiv:2311.17061环境贴图估计,室内外可重照明 GS

⑨ VLA 与具身智能 VLA & Embodied

[33] RT-2, Google DeepMind, 2023.07 arXiv:2307.15818首创 VLA 范式,网课知识迁移到机器人手
[34] OpenVLA, Stanford/Google, 2024 arXiv:2406.09246首个开源 7B VLA
[35] π0, Physical Intelligence, 2024.12 arXiv:2410.24164流匹配动作解码器,灵巧操作
[36] GR00T N1, NVIDIA, GTC 2025.03 arXiv:2503.14734开源人形机器人基础模型,System 1 + System 2
[37] Pelican-Unified 1.0, ByteDance, 2026.05 首个统一具身基础模型,单一 VLM 理解+推理+想象+行动
[38] ManiGaussian, ECCV 2024 arXiv:2403.08498 | 项目动态 GS 世界模型驱动多任务机器人操作
[39] GaussianGrasper, IEEE T-RO 2024 arXiv:2403.096373D 语言 GS 开放词汇机器人抓取,SAM+CLIP 蒸馏

⑩ 世界模型 World Models

[40] Ha & Schmidhuber, "World Models," 2018 arXiv:1803.10122开山之作:生成式世界模型在"梦境"中训练策略
[41] Hafner et al., "DreamerV3: Mastering Diverse Domains through World Models," Nature 2025 arXiv:2301.04104基于模型的 RL 跨 150+ 任务泛化,Minecraft 挖钻石
[42] V-JEPA 2, Meta FAIR, 2025.06 arXiv:2506.09985JEPA 联合嵌入预测架构,100 万+小时视频自监督
[43] Genie 3, Google DeepMind, 2025.08首个支持实时交互的世界模型,20–24fps@720p
[44] GS-World, CUHK-Shenzhen, 2025.10 3DGS 作可微仿真引擎,生成式仿真 + Engine-driven Sim2Real VLA 统一
[45] Marble, World Labs (李飞飞), 2026单张图像→可交互 3D 空间,空间智能商业化

⑪ CAD·Mesh 桥接 CAD & Mesh Bridge

[46] BrepGaussian, CVPR 2026 arXiv:2602.211053DGS + B-rep CAD 重建,输出参数化 STEP 模型
[47] CADDreamer, CVPR 2025 Highlight文本/草图→CAD B-rep 生成,扩散参数化 CAD 程序合成

⑫ 开源实现与资源 Open Source

[48] gsplat — nerfstudio 团队, CVPR 2024 GitHub当前最活跃的 3DGS CUDA 光栅化引擎
[49] nerfstudio GitHub完整训练框架,集成 3DGS/NeRF,适合工程化上手
[50] COLMAP GitHub3DGS 流程前端必备:图像序列→相机位姿+稀疏点云
[51] awesome-3D-gaussian-splatting (MrNeRF) GitHub社区维护的 3DGS 论文/资源精选清单
[52] Awesome-Gaussian-Skills(本书配套仓库)GitHub | 方法浏览器819+ 方法 / 23 类别 / 15 个 AI 技能 / 24 个 MCP 工具

⑬ 仿真平台 Simulators

[53] NVIDIA Isaac Sim 官网GPU 加速物理仿真,工业级精度,physically-based 渲染
[54] Habitat, FAIR GitHub大规模室内导航,HM3D/Gibson 数据集
[55] RoboCasa, UT Austin大规模家务机器人仿真,10 万+ 轨迹
[56] LIBERO, Stanford ICLR 2024机器人操作终身学习基准
[57] AGIBOT WORLD / Genie Sim, 智元 ICRA 2026可交互/可训练/可评测物理仿真,百万轨迹 217 任务

后记 · 3DGS 会被吃掉吗

表示层的终局判断 · 短期地基与长期协议

写到这里,这本书的主体已经走完——从 NeRF 到 3DGS,从数学内核到大规模部署,从语义到生成,从具身智能到世界模型。最后留一个问题,它既是技术判断,也是这本书的态度:3DGS 会不会被更大的模型吃掉?

乐观派:显式不可替代

乐观派认为,3DGS 的显式、可编辑、可部署特性是隐式模型长期难以替代的。论据有三:① 可编辑性:要挪一把椅子、换个灯、删掉一堵墙,显式高斯直接操作基元即可,隐式模型要重训或学 condition;② 可部署性:手机、AR 眼镜、Web 端的算力和带宽有限,显式高斯可压缩、可流式加载,隐式模型推理成本高且难压缩;③ 可查询性:Agent 要问"这个点是什么材质""那个物体能转吗",显式基元直接查,隐式模型要前向推理。这三性共同构成"工程不可替代性"——只要还有边端部署、实时交互、精细编辑的需求,3DGS 就有位置。

悲观派:表示层终被吸收

悲观派认为,表示层终会被端到端大模型吸收。论据是:① 历史先例:目标检测的特征工程被检测大模型吃掉,语义分割的 hand-crafted 特征被分割大模型吃掉——表示工程的归宿是被学习吸收;② 大模型趋势:空间基础模型(Marble、Cosmos)正在做"输入图→输出 3D 世界",3DGS 可能沦为训练时的中间产物,推理时不再显式存在;③ 规模胜出:当数据规模够大,一个端到端模型可能直接从图像到行动,中间不需要显式 3D 表示——3DGS 这一步会被"内化"进模型权重。

本书的判断:短期地基,长期协议

本书的判断落在中间:短期(3–5 年)3DGS 是不可替代的工程地基,长期它可能从"主角"变成"协议",但即便如此,理解它的原理仍是做空间智能的必修课。理由是:

  • 空间基础模型当前远未成熟——Marble 单图生 3D 仍需后处理,Cosmos 的物理一致性仍在追赶仿真器。在它们成熟到"输入即输出"之前,3DGS 作为可施工的中间地基不可替代。
  • 即便大模型成熟,"可微渲染 + 显式控制"的交互需求不会消失——工程师要调参数、Agent 要操控场景、人要直观编辑,这些需求要求一份可读可写的显式表示。3DGS 可能不再是最终输出,但会作为"人和 Agent 操控大模型的接口协议"长期存在。
  • 更深一层:3DGS 的核心贡献不是"高斯"这个具体表示,而是它证明了显式可微表示可以实时、可编辑、可部署。这个洞见会迁移到任何后续表示上——即便未来出现比高斯更好的基元,本书讲的密度控制、可微光栅化、语义蒸馏、可微仿真等机制仍然适用。理解 3DGS,就是理解空间智能的工程范式。

所以这本书的终点不是"3DGS 完成了",而是"3DGS 让空间智能有了可施工的地基"。地基之上会盖什么楼——是空间基础模型、可交互数字孪生、还是 Physical AI 的完整闭环——由读到这里的你来决定。3DGS 给了你一块最顺手的砖,怎么用,看你想盖什么。

★ 最后一句话 从 2020 年 NeRF 到 2026 年的世界模型混战,六年走完一个范式循环:隐式→显式→可交互→可预测。3DGS 在这个循环里是承上启下的关键一环。它不是终点,但它是当下最值得理解、最值得动手的一环。这本书写到这里,希望你不只是读完了,而是开始用 3DGS 做点什么——因为空间智能的下一章,属于动手的人。