GPT 6-Astra搭的3 D场景总和原图对不齐?Mira
GPT6-Astra搭的3D场景总和原图对不齐?Mira-Scene来解决!
GPT6-Astra搭的3D场景总和原图对不齐?Mira-Scene来解决!
2026年09月30日 07:3
本文的主要作者包括香港大学博士生孙阳天,刘天嘉和 VAST 黄泽桓;通讯作者为 VAST 首席科学家曹炎培和香港大学副教授齐晓娟。
现在的大模型如 GPT-6 Astra,已经越来越会 “搭 3D 场景” 了。但真正把结果拿来用时,却发现 前景物体的几何形状、相对尺度与 layout 仍与输入图像存在偏差 。香港大学和 VAST 推出了 Mira-Scene : 通过 pixel-aligned 的 layout 表示,保证重建出的 3D 场景和原图严格一致。
从左至右,分别为 Condition 图像、Mira-Scene + GPT-6 Astra 和 GPT-6 Astra From Scratch。
近来,单图 3D 生成模型在 object-level generation 上取得了令人瞩目的进展。给定一张物体图片,生成模型如 Tripo 已经能够恢复出相当精细的三维几何。然而,当问题从 “生成一个物体” 进一步扩展到 “重建整个场景” 时,需要解决一个新的难题:物体生成出来以后,到底应该放在哪里?
针对这一问题,论文 Mira-Scene: Pixel-Aligned Layouts for Generative 3D Scene Reconstruction 提出了一种新的生成式 3D 场景重建框架。它不再直接回归物体的旋转、平移和尺度,而是将场景布局转化为一个 稠密、像素对齐的 3D 对应关系恢复问题 。仅仅使用 80k 开源数据,Mira-Scene 相比 SAM3D 取得了 39.8% 的 3D IoU 精度提升和 16.5% 的投影 2D IoU 提升。