登录

北航团队让AI开始“造地球”:一句话生成无界三维世界


速读:北航团队让AI开始“造地球”:一句话生成无界三维世界2026年09月06日09:53DeepTech深科技生成引擎能为空间智能体生成无穷无尽的、带标签的训练数据了! 在这项研究中,研究人员开发了一个面向广域地球观测场景的生成式基础模型MetaEarth3D,首次将生成式基础模型从二维遥感影像扩展到大规模三维场景生成。 MetaEarth3D不局限于生成三维地球场景,也为广域空天平台的空间智能提供了可规模化拓展的生成式数据引擎。 近期,来自北京航空航天大学史振威教授和邹征夏教授团队的一项研究,将视觉生成式基础模型拓展到空间维度,让AI生成世界尺度三维场景成为可能。 不止于生成地球:为空间智能制造训练数据。
2026年09月06日 09:5

生成引擎能为空间智能体生成无穷无尽的、带标签的训练数据了!

近期,来自北京航空航天大学史振威教授和邹征夏教授团队的一项研究,将视觉生成式基础模型拓展到空间维度,让 AI 生成世界尺度三维场景成为可能。

过去,生成式 AI 不断扩大参数、数据和模态规模,却很少有人把空间尺度作为基础模型新的扩展维度。在这项研究中,研究人员开发了一个面向广域地球观测场景的生成式基础模型 MetaEarth3D,首次将生成式基础模型从二维遥感影像扩展到大规模三维场景生成。

只需要给定文字或卫星图,它就能生成从大规模地形到中等尺度城市再到精细尺度街区无界且连续一致的三维世界,并支持虚拟相机自由飞行。更关键的是,生成场景自带高度、距离等原生空间标注,可直接用于训练无人机等空天 AI 模型,实测空间理解能力平均提升 22.85%。

该技术为数字地球、空间智能与具身智能仿真打造了一个可无限扩展的生成式模拟器,且无需依赖昂贵难以获取的真实三维数据。

近日,相关论文以《MetaEarth3D:通过空间可扩展的生成式建模解锁全球尺度的 3D 生成》(Metaearth3D: Unlocking World-Scale 3D Generation With Spatially Scalable Generative Modeling)为题在预印本网站  arXiv  放出 ,并已经被《国家科学评论》( National Science Review )正式接收。北京航空航天大学史振威教授和邹征夏教授为本文的共同通讯作者。

图丨相关论文(来源:arXiv) 图丨相关论文(来源: arXiv )

3D 生成,如何突破数据与范式瓶颈?

需要明确的是,MetaEarth3D 与谷歌地球在技术路径上有本质区别。谷歌地球的核心逻辑,是将真实世界预先重建并“搬”进计算机:通过航拍、卫星遥感和三维重建等方式生成场景数据,再以三角网格、点云等特定格式存储在服务器中。

当用户查看某一区域时,系统会调用对应的数据,将其加载并渲染到屏幕上。因此,谷歌地球本质上是一套预先采集、重建并存储的三维世界数据库。它能够高度还原真实环境,但其建设依赖大规模数据采集和重建,制备流程复杂,成本高昂。

而 MetaEarth3D 采用的是完全基于神经网络驱动的 AI 范式,相当于用生成式 AI 造出一个超大范围空间尺度的、“不存在”的三维世界。与此同时,这些生成的世界在地形结构、空间关系和视觉分布等统计特征上符合真实世界规律。

这意味着,研究人员不仅验证了生成效果的视觉真实性,也验证了生成场景在地貌高度、地理语义等统计分布上与真实世界保持一致。它原生于神经网络内部,并且具有可控性:用户可根据需求描述期望的场景,模型即可生成对应场景,且生成结果多样,无穷无尽。

(来源: arXiv )

值得关注的是,尽管该模型拥有 46 亿参数,但在推理时并不需要庞大的算力支持。论文数据显示, 在一张消费级显卡(NVIDIA RTX 3090)上,模型可在约 2 小时内生成约 17 平方公里的城区级三维场景。

其基于约 1,000 万全球分布图像训练,给定文本描述或卫星影像,即可生成多层级、空间一致连续、可无界扩展的显式 3D 地球场景,覆盖山脉、沙漠、雪地、海岸线等大尺度自然地貌,也包括城市街区、道路和建筑群等精细尺度结构。 

(来源: (来源: arXiv )

这套世界尺度三维生成能力并非一蹴而就,而是团队在前序研究基础上迭代优化而来。据了解,MetaEarth3D 是该团队在研究成果 MetaEarth 基础模型(IEEE TPAMI 2025, 47(3) ) 的三维拓展。

首先,这是一个此前几乎没有成熟范式可循的问题,面向世界尺度三维生成的生成式框架尚属空白。当前大范围三维场景表示和生成方法包括神经辐射场(NeRF)、三维高斯泼溅 (3DGS)、体素或点云表示,以及视频式世界模型等,但这些方法各自存在不足,不论可扩展能力、场景容量以及空间连续一致性都容易出现问题。

为了解决上述问题,研究团队提出了渐进式概率分布转移的框架,以此为基础构建生成式方案。该框架将问题解耦为空间维度、尺度维度的生成,并在概率转移框架下完成模型构建。框架确立后,研究人员收集了大量实测数据进行训练,并在数据收集、清洗、整理等环节都投入了大量精力。

从范式上来看,现有的三维空间生成范式并不适用于超大空间尺度的生成问题,核心卡点是大规模三维实景数据采集、标注成本极高。在算法层面,由于三维空间需要依赖于大量三维实拍的数据作为训练样本,制作成本昂贵。

(来源: arXiv )

为绕开该数据瓶颈,研究团队采用了一个很巧妙的方法:将三维场景转换为二维图像监督信号进行训练。通过这一思路,大量二维图像便于采集和积累的优势得以充分发挥。与此同时,在本次研究的生成式范式框架的支撑下,既能够实现数据量的有效扩充,也能够推动场景规模与尺度的持续扩展。

基于这一创新生成范式,MetaEarth3D 能够生成便于工程部署的显式三维场景,可直接导入 UE、Unity 等通用图形引擎,支持后续的渲染、编辑与交互。不同于依赖视频生成的技术路线,它直接构建空间一致的三维表示,避免了误差累积导致的长程漂移。

此外,未来可在此之上向物理属性进一步扩展。例如,对于不同的生成建筑物、地物等空间要素,包括材质及其他物理参数在内的物理属性,均可通过这种显式方式在其中进行生成。MetaEarth3D 不局限于生成三维地球场景,也为广域空天平台的空间智能提供了可规模化拓展的生成式数据引擎。

不 止于生成 地球:为空间智能制造训练数据

与当前生成式世界模型多聚焦于机械臂、四足机器人进行桌面操作等受限环境不同, 这项技术在空间智能方向具有应用潜力,特别是涉及低空无人机、无人驾驶车辆等跨场景、跨尺度作业,为空间智能和“黑天鹅”场景提供生成底座的能力。

另一方面,基于生成式方法,有望为“黑天鹅场景”难题提供解决方案,即那些虽然罕见,却一旦发生便产生重大影响的、稀缺且关键的场景。物理世界中有各式各样的无人系统、智能体、智能感知任务,如果可以用生成式手段,把“黑天鹅”事件和数据场景源源不断地生成出来,有望基于此找到领域内的共性问题。

主题:三维世界|生成场景|谷歌地球