港科大(广州)联合腾讯AI平台部开源VibeWorlding,3 D世界构建迎来Vibe Coding时刻?
如果说 Vibe Coding 让「写代码」这件事从「敲键盘」变成了「和 AI 对话」,那么今天要介绍的这项工作,可能正在把同样的故事在 3D 世界构建 领域重演一遍。
香港科技大学(广州)联合腾讯 AI 平台部团队,提出了 VibeWorlding: 一个可以像 Agent 写代码一样,通过多轮对话、调用工具、观察渲染反馈来 自主构建和编辑交互式 3D 世界 的多模态智能体框架。只需要说一句「给我造一个阴森的荒漠神殿」,或者「把桌子旁边的那把椅子往前挪两米」,剩下的检索 3D 资产、摆放物体、避免碰撞、渲染确认,统统交给 Agent 完成。
论文标题:VibeWorlding: Can Multimodal Agents Construct 3D Open Worlds End-to-End?
作者团队:Yansong Ning, Jingwen Ye, Zhongkai Wu, Yang Sun, Yiqin Zhu, Xingyi Li, Weidong Zhang, Hao Liu
机构:香港科技大学(广州)、腾讯 AI 平台部
项目主页:https://usail-hkust.github.io/VibeWorlding-Gym/
Code(沙盒环境与训练框架):https://github.com/usail-hkust/VibeWorlding-Gym
Dataset(VWE-Bench 评测基准):https://huggingface.co/datasets/usail-hkust/VWE-Bench
Model(VibeWorlder 模型合集):https://huggingface.co/collections/usail-hkust/vibeworlder
这套系统的核心不是又一个「文本转 3D」的生成模型,而是一整套 可训练、可验证、可复现 的基准与强化学习框架 —— 团队同时开源了 6828 条多模态用户 query、 2616 个高质量 3D 资产、 323 个人工标注的种子 3D 世界,以及一整套沙盒环境和双重约束验证器。
实验结果显示,经过强化学习后训练的开源模型 VibeWorlder-30B-A3B,在综合 Pass@1 指标上 反超了 GPT-5.5 和 Qwen3.8-Max, 成为目前该任务上表现最好的模型。
图 1:VWE-Bench 与 VibeWorlding-Gym 总览 为什么造 3D 世界需要一次范式转移?
游戏关卡、数字孪生、具身智能仿真环境…… 这些场景都依赖大量 可交互、可编辑的 3D 世界, 但传统的人工搭建方式效率极低。近年来,随着多模态大模型(MLLM)的兴起,学界开始探索用 AI 智能体自动化完成这一过程,大致分为两条路线:
固定工作流(Fixed Workflow): 如 SceneCraft、3D-GPT,把构建过程拆成「规划 - 生成 - 评审」的流水线,每个阶段配一个专门的子智能体;
自主智能体(Autonomous Agentic): 如 SAGE、SceneWeaver、SceneReVis,把 3D 资产检索、编辑、渲染都封装成工具集,让智能体自主决策、多轮交互、自我修正。
但这些工作普遍存在两个尴尬的现实:一是评测用的查询过 于理想化和简单, 难以反映真实用户天马行空、模糊不清、甚至互相矛盾的表达;二是几乎所有框架 都不开源, 学界既无法公平对比,也无法系统研究「训练是否真的能提升这些底层能力」这个更根本的问题。
一个可行的 3D 世界,既要「物理上站得住」(不悬空、不穿模),也要「语义上说得通」(符合用户意图、风格协调)。这种多维度的正确性,仅靠人工规则或者一个通用的 LLM 裁判都很难兼顾 —— 这正是 VibeWorlding 团队要解决的核心难题。
VibeWorlding 到底是什么?
团队把整个「3D 世界构建」任务,形式化为一个 多轮、多模态、工具集成的推理过程: 给定一个多模态请求(纯文本描述,或者「现有世界 + 编辑指令」),智能体需要自主推断用户意图、规划场景布局、调用 3D 工具(检索 / 添加 / 旋转 / 平移 / 删除 3D 资产),并在每一轮结束后观察沙盒返回的多模态反馈(3D 地图文本 + 五视角渲染图),如此循环,直到最终产出一个完整的交互式 3D 世界。
这套框架包含两大组件:
VWE-Bench(VibeWorlding Evaluation Benchmark): 一个覆盖 2616 个高质量 3D 资产、323 个人工标注种子世界、6828 条逆向合成用户查询的评测基准,同时区分「有标准答案可验证」与「开放式需靠规则打分」两类任务。
VibeWorlding-Gym: 一套联合多模态强化学习后训练框架,把 3D 资产检索、编辑、渲染统一封装为 MCP 工具,并配套一个「双重约束验证器」,同时支撑公平评测和可扩展的 RL 奖励计算。
6828 条查询是怎么「反向」造出来的?
VWE-Bench 的构建走的是「人机协作」路线,分三步走:
第一步,高质量 3D 资产合成: 美术标注员先确定 3148 个概念 3D 资产的名称与类别,用 Gemini 3.1-flash-image 生成参考图,再用腾讯混元 3D(Hunyuan3D 3.1)把图片转成 3D 网格,经质量过滤和真实尺度标注后,最终沉淀 2616 个可检索、跨越 20 个语义类别的高质量 3D 资产。
第二步,种子世界标注: 专业美术用这批 3D 资产手工搭建了 323 个「粗糙但功能完整」的种子 3D 世界,资产数量从 8 个到 258 个不等,覆盖不同复杂度。
第三步,逆向查询合成: 让 MLLM「倒着看」种子世界 —— 既可以读一个世界然后写出「如何从零构建它」的描述(对应从零构建任务),也可以对世界挑毛病、给建议、复述目标(对应世界编辑任务),甚至故意扰动 3D 资产再让模型描述这个变化,从而拿到有精确标准答案的编辑指令。
图 2:VWE-Bench 数据样例。(a) 按物理尺寸从小到大排列的 3D 资产样例;(b) 按复杂度从低到高排列的种子世界样例 最终,团队沉淀出六大类查询,其中「精确资产级编辑」类查询因为有明确的扰动过程可以直接对比 Ground-truth 地图,被归为 Verified(可验证); 剩下五类模糊表达、场景批判、引导、重申和复杂场景描述等更贴近真实用户口吻的查询,则归为 Unverified(不可验证), 交给精心设计的 Rubric 由 MLLM 裁判打分。
既要「立得住」又要「听得懂」:双重约束验证器
一个 3D 世界能不能算「过关」,VibeWorlding 团队给出了两条硬性标准:
物理可行性验证: 用纯 Python 几何检测碰撞(物体不能互相穿模)和高度(物体不能悬空),不依赖任何模型判断;
意图满足验证: 由 MLLM 裁判从生态合理性、3D 理解、3D 推理、检索合理性四个维度综合评估 —— 既要看智能体是否理解了用户想要什么,也要看它是否真的用对了工具、放对了位置。
对于 Unverified 查询,只有物理可行性和四个意图维度全部通过才算成功;对于 Verified 查询,则直接和 Ground-truth 地图比对,按正确编辑的 3D 资产比例打分。
在此基础上,团队搭建了 VibeWorlding-Gym 训练管线:先用 Gemini 3.1-pro 反向合成冷启动 SFT 轨迹,再用 GRPO 算法在双重约束验证器提供的奖励信号下做多模态强化学习 —— 让智能体同时从「纯文本从零构建」和「多模态图文编辑」两类任务中联合学习,而不是像以往工作那样只训练单一模态。
实验结果:开源模型如何反超 GPT-5.5?
团队在 VWE-Bench 上系统评测了 8 个前沿闭源模型(GPT-5.5、Gemini 3.1-Pro/3.5-Flash、Kimi-K3、Qwen3.8-Max 等)、3 套 3D-Scene 智能体框架(SceneWeaver、SAGE、SceneAssistant),以及经过冷启动 SFT 和强化学习后训练的开源模型 VibeWorlder 系列。核心结论可以概括为三句话:
现有模型远未解决这个任务。 即便是最强的 GPT-5.5 和 Qwen3.8-Max,整体 Pass@1 也不到 60%;而未经训练的开源基座 Qwen3-VL-8B / 30B-A3B 更是只有 5.3% 和 13.6%。
多模态强化学习显著缩小了与前沿模型的差距。 30B-A3B 模型从基座的 13.6% 一路提升到冷启动 SFT 后的 34.5%,再到强化学习后的 59.3%;8B 模型也从近乎不可用提升到 41.4%。
旗舰模型 VibeWorlder-30B-A3B 拿下了全场最高分 。以 59.3% 的整体 Pass@1 超过 GPT-5.5(57.3%)和 Qwen3.8-Max(56.9%),在 Verified 赛道上优势更明显(64.5% vs. GPT-5.5 的 60.4%);而更小的 VibeWorlder-8B(41.4%)已经追平 Gemini 3.1-pro(42.7%),并在 Verified 赛道反超(59.3% vs. 44.4%)。
瓶颈到底在哪?六维能力拆解揭晓答案
团队进一步把「过关」拆解成六个能力维度:碰撞无冲突、高度合理性、生态合理性、3D 理解、3D 推理、检索合理性,逐一打分对比。
图 3:各模型在六个能力维度上的通过率对比 结果非常有意思: 碰撞无冲突 是所有模型(包括强化学习后的旗舰模型)共同的瓶颈,即便经过 RL 训练,通过率也只有 59%~68%。相比之下,强化学习对 3D 推理 能力的提升最为显著 —— 从基座模型的 6%~20% 一跃提升到 56%~85%,VibeWorlder-30B-A3B 更是达到 85%,超过 Gemini 3.1-pro(62%);同时检索能力被提升到 91%~99%,甚至超过前沿闭源模型。团队的结论是:
强化学习让模型「看懂」场景、「找对」3D 资产的能力大幅跃升,但要把 3D 资产精确地摆到不产生碰撞的位置 —— 这种精细的空间操控能力,仍然是当前所有模型(无论开源闭源)共同的天花板。
翻车现场:两种最典型的失败模式
为了搞清楚「精确编辑」到底难在哪,团队人工审查了大量失败案例,归纳出两种最常见、最顽固的错误:
第一类,不精确的 3D 距离编辑 —— 方向反了。 用户要求把一块岩石「向前移动 7 米」,模型准确算出了位移的量级,却把方向搞反了,最终产生了高达 14 米的位置误差。这不是数值算错,而是坐标系理解错了。
第二类,过度编辑 —— 顺手删了不该删的东西。 用户只要求「在箱子旁边加一棵树」,模型正确添加了新树,却在执行过程中「顺手」把场景里原有的一棵大树删掉了 —— 计划是对的,但工具执行阶段对「哪些元素不该动」的状态保持能力不足。
这两个案例共同指向一个结论:多模态智能体在 语义理解 上已经相当成熟,但在 精确空间执行 与 跨轮状态保持 上仍有明显短板 —— 这也是团队认为未来最值得投入的方向之一。
像 Vibe Coding 一样,
Vibe Worlding:一个真实可用的 CLI 原型
为了验证这套系统不只是「刷榜工具」,团队还提供了一个真正能用的 命令行交互原型, 配上浏览器端的实时 3D 渲染视图 —— 你敲一句自然语言指令,Agent 立刻思考、调用工具、执行编辑,浏览器里的 3D 世界同步刷新。
场景一:从零造一个农场。 用户输入「Create a simple farm with a barn, crop fields, fences, and a few trees」。Agent 从一张空地图开始,检索谷仓、树木、栅栏、作物等资产,规划出「农舍 + 围栏菜地 + 树丛」的三区布局,中途还根据渲染图自我修正 —— 发现栅栏太高像一堵墙,就调低高度;发现树冠过大盖住了农舍,就把树整体缩小。
从零构建场景 —— 左侧终端展示 Agent 的完整推理与自我修正过程,右侧为实时渲染出的农场
场景二:编辑一个已有的城市。 面对一个繁忙的城市街区,用户说「Remove the car in the middle of the road and delete the two green buildings」。Agent 先从 3D 地图中枚举出场景里的摩天楼、军事建筑、汽车、路灯、绿化树,精确定位到目标对象,连发三次删除调用,再重新渲染多视角画面确认「只删掉了该删的,其余元素原封不动」,最后用自然语言总结改动与修改。
多轮编辑场景 ——Agent 定位并删除指定车辆与建筑,同时严格保持其余元素不变。
整个「思考 - 执行 - 渲染确认 - 回复」的闭环,与训练时使用的多模态反馈机制完全一致。 目前,团队已经开源了这个 CLI 原型,希望社区能在此基础上开发出更强的智能体框架、更专业的技能插件。
离真正的「Vibe Worlding」还有多远?
论文在讨论部分列出了几条尚待跨越的门槛:
工具还太「原子化」。 目前的沙盒只提供检索、增、删、平移、旋转这几个底层操作,未来需要更高级、可组合的技能(比如「直接铺一个足球场」「在矩形区域内随机撒一片森林」),而不是靠低级操作一件件拼出场景。
场景规模仍偏小。 VWE-Bench 中最复杂的世界也只有 258 种 3D 资产,真正开放式的世界构建需要更大规模的场景,也许要靠多智能体协同分工来实现。
结果导向的奖励仍然稀疏。 当前 RL 训练用整条轨迹打一个结果奖励,未来引入更细粒度的过程级信用分配(比如具体告诉模型是哪一轮发生了碰撞)可能会让训练更高效。
数据来源与美术风格有限。 当前 3D 资产库偏卡通风格,也还没有覆盖「以图生世界」「以视频生世界」这类更丰富的多模态设定。
更深层的挑战在于:即便有了完整的多模态反馈闭环, 精确的空间推理能力 (距离、角度等量化空间关系)仍是当前所有 MLLM(无论是否经过强化学习)的共性短板。
团队认为,这可能最终需要从预训练 / 中训练阶段就注入更多 3D 空间数据,才能让基础模型真正具备扎实的空间世界理解能力。
写在最后
VibeWorlding 给出的答案并不是「3D 世界构建已经被解决」,恰恰相反 —— 论文用实验证明, 即便是 GPT-5.5、Qwen3.8-Max 这样的顶级闭源模型,在这项任务上的整体成功率也不到 60%。 但它同时证明了一件更重要的事: 只要有可靠的验证器和奖励信号,开源的中小规模模型完全可以通过强化学习后训练反超闭源前沿模型, 这与「Vibe Coding」在编程领域走过的路径高度相似 —— 先有工具化的沙盒环境,再有可验证的奖励,最后是开源模型的规模化追赶。
或许,3D 世界构建领域的「Vibe Coding 时刻」,才刚刚拉开序幕。