让AI Agent「试玩」世界模型,长程目标评测有了新基准PlayWorld
本文第一作者为香港大学博士生丁凯欣。团队成员包括香港大学博士生陈汐、徐致远、汪逸阳、陆宇翔、李俊奕,香港中文大学蔡明宏,浙江大学陈书扬,以及快手可灵团队的高远、陶鑫和万鹏飞。通讯作者为香港大学助理教授赵恒爽。
世界模型应该如何评测?答案是:像真实用户一样去 “玩” 它。
例如,在虚拟世界中绕房子一周,回到原点后检查场景是否一致;走入水中,观察是否激起水花;或在不同房间之间来回穿梭,看看每次返回时,客厅里画画的人是否取得了新的进展。然而,要完成这些 “长程操控目标”,不同模型所需的操作序列并不相同。
为此,来自香港大学、香港中文大学、浙江大学和 快手可灵团队的研究者使用 Agent Player 操作世界模型:只给定 “场景” 和 “长程目标”,由 Agent Player 在交互过程中观察生成视频的几何一致性、交互正确性和事物演化的合理性。他们对多个 SOTA 模型进行了系统评测与分析,并已开源评测集和代码。
论文标题: PlayWorld: Benchmarking World Models with Agent Players over Long-Horizon Objectives
论文链接:https://arxiv.org/abs/2608.13552
项目主页:https://kxding.github.io/project/PlayWorld/
测评集:https://huggingface.co/datasets/jocelynd/playworld-bench
开源代码:https://github.com/kxding/PlayWorld
为什么固定动作轨迹不够公平?
人类试玩世界模型时,通常不会关心 “是否严格执行了三次右转”,而会关心 “是否完成了绕场一周并回到原来的地标”。这两种评测思路看似接近,实则回答的是不同问题。以 “围绕中心雕塑转一圈” 为例,固定轨迹只能保证所有模型收到相同的按键,却不能保证它们都到达相同的视角。如果模型并未真正到达目标视角,后续的几何一致性评分就失去了可比性。
PlayWorld 因此把评测单位从 “固定动作序列” 升级为 “场景相关的长期目标”:所有模型面对同一个初始世界、同一个目标,但允许 Agent Player 根据实时观察作出必要调整。
图为围绕中心雕塑转一圈,再观测雕塑形状有无改变:
核心创新:
会观察、会调整、会喊停的 Agent Player
Agent Player 由多模态模型与接口转换器组成。每一步,它都会查看生成帧、已执行的动作、场景描述和长期目标,再从五种决策中选择一种:
Keep:按计划继续当前动作,或进入下一个动作;
Stop:目标视觉状态已经出现,提前结束当前动作;
Extend:运动还不够,延长当前动作的持续时间;
Correct:当前状态偏离基础动作序列,修正下一步;
End:目标已经达成,且所需观察已完成,结束本次评测。
接口转换器则将 WASD 代表的当前 action 序列转换为各个模型自适应的输入形式。考虑到 Agent 的决策需要一定时间,研究者不要求 Agent 从零规划整条轨迹,而是让它基于共享先验进行针对性修正。这套设计既保留了基础动作序列带来的可比性,又能适应不同模型的动作粒度。
四大维度:
从 “看起来不错” 走向 “世界真的成立”
PlayWorld 为每个场景设计了任务相关的 VQA 问题,并从四个核心维度评估世界模型:
1. 几何一致性(Geometry Consistency)
模型在移动镜头、绕行和重访之后,能否保持物体身份、数量、纹理、材质、颜色以及相对位置?例如,完成 360° 旋转后,原来的建筑、文字或雕塑是否仍然位于正确位置,还是被重新 “生成” 成另一个版本?
2. 交互保真度(Interaction Fidelity)
用户的动作是否产生符合物理规律的反馈?例如,人物走入水中时是否会激起水花和涟漪;从水塘岸边走向深处时,水位是否会逐渐升高;撞向障碍物时是否会合理停下,而不是直接穿模或悬浮。
3. 视野外演化(Out-of-sight Evolution)
目标离开画面后,世界是否仍在继续演化?当镜头再次转回,目标是否保持身份与位置,并呈现符合因果关系的状态变化,而不是恢复原状、突然消失或被另一个物体替代?例如,正在写字的人书写的内容是否会增多,火箭腾空后是否会持续上升,倒出的液体是否会持续增多。
4. 视野内演化(Insight Evolution)
在长达 60 秒的持续观察中,人物或过程是否真正向前发展?例如,远处爆竹响起时,周围的人是否会四散离开;夜市上的行人是否会突然静止;收银台前的顾客结账后是否会离开,而不是重复动作或长时间停留在原地?