登录

让AI Agent「试玩」世界模型,长程目标评测有了新基准PlayWorld


速读:然而,要完成这些“长程操控目标”,不同模型所需的操作序列并不相同。 走入水中,观察是否激起水花; 为什么固定动作轨迹不够公平? 让AIAgent「试玩」世界模型,长程目标评测有了新基准PlayWorld2026年08月23日17:32机器之心Pro本文第一作者为香港大学博士生丁凯欣。
2026年08月23日 17:3

本文第一作者为香港大学博士生丁凯欣。团队成员包括香港大学博士生陈汐、徐致远、汪逸阳、陆宇翔、李俊奕,香港中文大学蔡明宏,浙江大学陈书扬,以及快手可灵团队的高远、陶鑫和万鹏飞。通讯作者为香港大学助理教授赵恒爽。

世界模型应该如何评测?答案是:像真实用户一样去 “玩” 它。

例如,在虚拟世界中绕房子一周,回到原点后检查场景是否一致;走入水中,观察是否激起水花;或在不同房间之间来回穿梭,看看每次返回时,客厅里画画的人是否取得了新的进展。然而,要完成这些 “长程操控目标”,不同模型所需的操作序列并不相同。

为此,来自香港大学、香港中文大学、浙江大学和 快手可灵团队的研究者使用 Agent Player 操作世界模型:只给定 “场景” 和 “长程目标”,由 Agent Player 在交互过程中观察生成视频的几何一致性、交互正确性和事物演化的合理性。他们对多个 SOTA 模型进行了系统评测与分析,并已开源评测集和代码。

论文标题: PlayWorld: Benchmarking World Models with Agent Players over Long-Horizon Objectives

论文链接:https://arxiv.org/abs/2608.13552

项目主页:https://kxding.github.io/project/PlayWorld/

测评集:https://huggingface.co/datasets/jocelynd/playworld-bench

开源代码:https://github.com/kxding/PlayWorld

为什么固定动作轨迹不够公平?

人类试玩世界模型时,通常不会关心 “是否严格执行了三次右转”,而会关心 “是否完成了绕场一周并回到原来的地标”。这两种评测思路看似接近,实则回答的是不同问题。以 “围绕中心雕塑转一圈” 为例,固定轨迹只能保证所有模型收到相同的按键,却不能保证它们都到达相同的视角。如果模型并未真正到达目标视角,后续的几何一致性评分就失去了可比性。

PlayWorld 因此把评测单位从 “固定动作序列” 升级为 “场景相关的长期目标”:所有模型面对同一个初始世界、同一个目标,但允许 Agent Player 根据实时观察作出必要调整。

图为围绕中心雕塑转一圈,再观测雕塑形状有无改变:

核心创新:

会观察、会调整、会喊停的 Agent Player

Agent Player 由多模态模型与接口转换器组成。每一步,它都会查看生成帧、已执行的动作、场景描述和长期目标,再从五种决策中选择一种:

Keep:按计划继续当前动作,或进入下一个动作;

Stop:目标视觉状态已经出现,提前结束当前动作;

Extend:运动还不够,延长当前动作的持续时间;

Correct:当前状态偏离基础动作序列,修正下一步;

End:目标已经达成,且所需观察已完成,结束本次评测。

接口转换器则将 WASD 代表的当前 action 序列转换为各个模型自适应的输入形式。考虑到 Agent 的决策需要一定时间,研究者不要求 Agent 从零规划整条轨迹,而是让它基于共享先验进行针对性修正。这套设计既保留了基础动作序列带来的可比性,又能适应不同模型的动作粒度。

四大维度:

从 “看起来不错” 走向 “世界真的成立”

PlayWorld 为每个场景设计了任务相关的 VQA 问题,并从四个核心维度评估世界模型:

1. 几何一致性(Geometry Consistency)

模型在移动镜头、绕行和重访之后,能否保持物体身份、数量、纹理、材质、颜色以及相对位置?例如,完成 360° 旋转后,原来的建筑、文字或雕塑是否仍然位于正确位置,还是被重新 “生成” 成另一个版本?

2. 交互保真度(Interaction Fidelity)

用户的动作是否产生符合物理规律的反馈?例如,人物走入水中时是否会激起水花和涟漪;从水塘岸边走向深处时,水位是否会逐渐升高;撞向障碍物时是否会合理停下,而不是直接穿模或悬浮。

3. 视野外演化(Out-of-sight Evolution)

目标离开画面后,世界是否仍在继续演化?当镜头再次转回,目标是否保持身份与位置,并呈现符合因果关系的状态变化,而不是恢复原状、突然消失或被另一个物体替代?例如,正在写字的人书写的内容是否会增多,火箭腾空后是否会持续上升,倒出的液体是否会持续增多。

4. 视野内演化(Insight Evolution)

在长达 60 秒的持续观察中,人物或过程是否真正向前发展?例如,远处爆竹响起时,周围的人是否会四散离开;夜市上的行人是否会突然静止;收银台前的顾客结账后是否会离开,而不是重复动作或长时间停留在原地?

主题:模型|世界|目标