空间智能新作,影石开源户外全景重建算法
本文作者 Weijian Chen 时为 Insta360 研究院算法实习生。Lu Qi 为本文通讯作者。
近日,来自 Insta360 研究院的研究人员,联合武汉大学、中山大学等高校科研人员,提出了 PanoLOG—— 首个面向全景输入的大规模户外三维重建工作。依托 Insta360 X5 手持全景相机与 Antigravity A1 全景无人机等设备,他们团队构建了一套全新的 3D 高斯重建方案,并同步开源了首个大规模全景户外重建基准 Pano360。
过去,城市级的三维重建大多依赖大量窄视场照片和分块训练,采集与计算成本都很高。全景相机能够一次拍摄覆盖 360° 视野,本可以显著降低采集成本,但它带来的处处可见特性,又让沿用已久的分区策略失效。
PanoLOG 正是针对这一矛盾提出的:它把大场景重建中的分区判据,从传统的空间可见性转换为梯度贡献,让分块并行训练在全景条件下重新成立。在自建的 Pano360 以及公开的 Ricoh360、360Roam 基准上,PanoLOG 均取得了当前领先的渲染质量,同时保持了更小的模型体积。这项工作也为户外场景的具身智能与世界模型实践,提供了一条新的技术思路。用一句话概括这项工作,那就是:用全景输入,重建一个可感知的物理世界。
代码、模型与 Pano360 数据集逐步开源中。
GitHub 仓库:https://github.com/Insta360-Research-Team/GGPS
arXiv 论文:https://arxiv.org/abs/2607.08769
项目主页:https://insta360-research-team.github.io/GGPS-Website/
Hugging Face:https://huggingface.co/Insta360-Research/GGPS
关键问题:全景让采集变简单,
却让分区失效
近年来,新视角合成已经成为计算机视觉的一项基础能力,支撑着从自动驾驶到具身智能的众多应用。3DGS 之所以成为主流范式,是因为它用各向异性的显式高斯基元配合高效的可微光栅化,把照片级重建的渲染速度提到了很高的水平。
但要把 3DGS 铺到城市级、自然风光级的大户外,两项成本立刻凸显出来:
采集成本高 。 传统流程需要用窄视场(FoV)相机拍摄成千上万张照片,再用分而治之的策略把场景切块。这不仅费人费时,还容易在拼接边界处产生结构不一致。
计算开销大 。 场景一大,单张显卡的显存装不下,必须切块训练,否则无法完成。
全景 ERP 图像本可以直接缓解第一项成本:一次拍摄覆盖 360° 视野,采集端的人力和时间大幅下降。问题在于,复杂度并没有消失,只是从采集端转移到了分区端,而且形成了一个结构性矛盾。
传统分区方法依赖针孔相机的局部可见性 —— 每块区域只被一部分相机看到,系统才能据此把相机分派给对应的块。而全景相机是 360° 视角,几乎每一台相机都能观测到几乎每一个块。这样一来,基于可见性的分区判据失去了区分度,本应分块进行的优化退化成了高开销的全局优化。
于是问题变成:能不能设计一套专门适配全景图像的分区策略?这正是 PanoLOG 要回答的核心问题,也是把全景真正用于大规模重建的前提。
创新之举:
Two Stage 与 G²PS 方法的实践
PanoLOG 是一个两阶段、由粗到精的框架,核心是 G²PS(即 GGPS)。它的基本思路是:既然处处可见让可见性判据失效,那就不再判断某个区域能否被看到,而是评估每台相机对每个块贡献了多少优化梯度。贡献大的区域参与训练,贡献小、遥远或被遮挡的区域被忽略。这样即便在处处可见的环境下,也能重新建立清晰的相机与区域的分配关系,恢复分块并行训练的计算优势。
阶段一:全局粗训练
如果直接对原始 SfM 点云做分区,会在块外区域留下大量漂浮物,并且由于渲染质量不高,导致相机与块的分派不可靠。因此 PanoLOG 先对所有输入全景做一次全局粗优化,建立稳定的几何先验。与只依赖光度监督的主流框架不同,PanoLOG 率先引入全景单目深度监督,为后续基于梯度的分区提供可靠的几何锚点。这一阶段还包含两项针对户外场景的关键设计:
显式天空球。 天空区域没有有效的 SfM 几何,会诱使近场高斯向外漂移并产生飞屑。PanoLOG 在半径为场景尺度 10 倍的远处球面上均匀初始化 10 万个专用天空高斯。粗训练时,天空高斯的位置梯度被置零以防漂移,仅优化颜色、旋转、不透明度等外观参数,并且不参与致密化。
全景深度监督。 ERP 图像的两极区域存在严重的像素拉伸,会降低 SfM 三角化质量,使初始点云稀疏且不可靠。PanoLOG 采用原生支持 ERP 输入的深度模型 DAP 生成单目逆深度图,并按每张图像的仿射参数对齐到 SfM 稀疏深度。深度损失的权重随训练指数衰减,早期提供较强的几何引导,后期平滑过渡到以光度为主的优化,避免深度估计误差影响最终质量。
阶段二:分块精修与 G²PS
G²PS 通过两个互补机制解决全景下的分区问题:基于几何的空间分区,以及基于梯度的相机与块分派。
1. 基于几何的空间分区。
无界的户外空间如果直接均匀切网格,会切出大量近乎为空的块,造成负载严重失衡。G²PS 先根据相机分布和三角化可靠性,把场景收缩进一个自适应的轴对齐包围盒(AABB)。具体来说,它先由相机质心和各轴基础半径圈定相机轨迹范围;由于全景场景内容会延伸到相机之外,再依据相邻全景之间的视差不确定性估计有效重建范围,自适应地扩展边界,取代人工设定的固定边界。随后把收缩后的空间均匀切块,得到分布更均衡的高斯。
2. 基于梯度的相机与块分派。
阶段一收敛后,PanoLOG 对所有训练视角做一次前向 - 反向传播,统计每台相机对每个块内高斯的平均梯度幅值。相机与块的分派同时考虑几何归属和梯度重要性:一台相机只要几何上落在某个块内,或者它的归一化梯度得分超过阈值(默认 0.8),就会被分派给该块。这样即便某台相机物理上位于相邻块,只要它对该块有显著的观测贡献,也不会被漏掉。
3. 分块优化与合并。
每个块都以阶段一得到的完整高斯集合作为初始化,再用分派给它的相机独立优化。天空高斯在此阶段全程冻结,以保持跨块的外观一致。为了自适应地确定每个块的有效空间范围,PanoLOG 借助周期性的不透明度重置:重置后所有场景高斯的不透明度被压到较低值,只有持续收到足够光度梯度的高斯才会恢复高不透明度,其余则保持透明并被剪枝。由于相邻块共享部分重叠的相机集合,块边界附近的高斯能够得到跨边界的一致监督,因此无需显式拼接就能在块交界处得到连贯的几何和外观。
最后,在渲染表示上,PanoLOG 采用 ERP 投影:把三维点的球面坐标映射到像素坐标,并通过 ERP 雅可比把三维协方差投影为二维协方差。与针孔流程不同,这里的二维协方差由非线性的 ERP 雅可比给出,而非透视投影矩阵,从而正确处理 360° 视野。
下图中,无论是全景整体还是局部细节,PanoLOG 都稳定优于四种现有方法。优势最明显的是两类城市场景中的常见难点:远处物体和复杂玻璃幕墙。这两处也最能反映一个重建结果是否经得起走近观察。