李飞飞新动作新一代世界模型发布
李飞飞新动作 新一代世界模型发布
2026年09月03日 00:09
北京时间9月2日, 人工智能 科学家李飞飞旗下 人工智能 公司World Labs宣布,推出新一代世界模型Atlas,可用于视觉特效、 机器人 模型训练等领域。该模型能结合图像、视频等输入,生成具备精准镜头控制的图像和长视频,并通过输入的图像重建3D空间。
发布新一代世界模型
李飞飞曾创建图像识别数据集ImageNet,推动了 计算机 视觉算法的发展。2024年,李飞飞创办AI公司World Labs,今年2月,公司宣布获得10亿美元融资,投资者包括AMD、 英伟达 、 富达 投资等。
根据World Labs介绍,世界模型能够生成、重建并模拟任意可能的世界,它能理解世界的呈现方式、行为规律与演化逻辑。在此基础上,这一模型既可为创意工作者渲染出想象中的虚拟世界,也能高保真地模拟现实世界,还可辅助 机器人 完成动作规划。
World Labs披露的资料显示,通过输入单张或多张图像,Atlas最高可输出1440p分辨率、时长1分钟的视频。依据一张至数十张输入图像,Atlas可以重建现实世界场景,并可输出显式三维结果。此外,Atlas可对输入的视频进行空间与时间上的建模, 重绘视频画面。
赋能创意工作者和 机器人 训练
World Labs网站展示的效果视频显示,通过一张或几张图片,Atlas可以重建一个3D空间,并生成任意视角的空间画面。对于影视工作者来说,这意味着,用几张照片就可以还原一个空间场景,大幅开拓了创作空间。
在工作原理上,与大语言模型LLM类似,Atlas首先将各类输入信息编码为上下文,再依据该上下文生成输出内容。每一张图像都会锚定在三维空间中的对应位置,由此构建出空间上下文。这使得Atlas模型具备世界认知能力与创造力,它甚至可以把两张毫无关联的参考图像放入上下文,并在三维空间中设定好二者的位置,随后就能生成一个在两张图像的内容之间实现平滑过渡的世界。
对于 机器人 模型训练而言,Atlas提供了新方案。为了提升 机器人 的泛化性,行业从业者除了在真实世界采集数据供 机器人 进行模型训练,也在数字世界构建仿真环境,让仿真机器人在其中训练。
World Labs表示,在机器人模型训练过程中,要将真实场景还原到数字世界,传统方式需要研究人员采集环境图像上传,需要复杂且昂贵的专业设备。而Atlas仅依靠少量简易录制素材,就可以辅助搭建仿真环境,同时还原物体的运动方式与交互行为。
李飞飞曾在公开采访中表示,语言模型有局限,而物理世界的理解和互动能力是AGI(通用 人工智能 )的关键一环。空间智能最直接的应用是机器人技术,此外也会赋能开发游戏、制作特效、虚拟制片、室内设计等领域。
清华大学智能产业研究院助理教授赵昊对记者表示:“多模态世界模型的难点包括表征怎么定义、数据怎么积累、架构怎么设计。从呈现的效果看,Atlas的泛化性很强,对于行业具有突破性意义。”
AI大模型已经从大语言模型、视频生成模型向世界模型发展。在世界模型与空间智能领域,国内企业 群核科技 已在港股上市,多家具身智能企业正在推进世界模型的研究,极佳视界、考拉悠然、三岳数维等公司也在开展相关研发工作。
(文章来源:中国证券报)