Einsia AI发布世界模型终极大考!直面「物理规律理解」,最高仅57分
机器之心发布
一个小球从空中落下,一束光照向镜面,一块包着石头的浮冰慢慢融化。对人来说,这些都是熟悉的物理现象。对模型来说,它们却是一场并不轻松的考试。
现在的模型,画面可以生成的很清晰,物体可以生成的很连贯,运动也可以看上去很顺畅。但小球是否遵循自由落体规律?反射光线的角度是否正确?冰融化之后,液面又会怎样变化?这些问题,需要从视频里真正测量。
Einsia AI 旗下 Navers Lab 的最新工作 「World Models' Last Exam in Physics」,用 40 个任务、9 类物理现象,对 8 个视频生成模型展开测试。当前模型中,Seedance 2.5 排名第一,但平均分也只有 57.76 / 100 。
它想探究的本质是:
「现有的视频生成模型,是否能够遵守物理规律?」
论文题目:World Models’ Last Exam in Physics
项目主页:https://lab.einsia.ai/phys-last-exam
GitHub:https://github.com/Einsia/phys-last-exam
arXiv: https://arxiv.org/pdf/2610.08791
画面连贯了,物理就对了吗?
要判断画面连贯的背后,物理规律是否同样成立,研究团队构建了 40 个视频生成任务,覆盖 9 类物理现象 ,涵盖力学、光学、流体、相变、电磁等方向。从小球下落到单摆振荡,从光线反射到浮冰融化,每道题都要求模型生成一个具体的物理过程,并接受相应物理关系的检验。
对模型来说,任务非常直接:
「给定一张初始图像和一段生成提示,生成接下来发生的物理过程。」
输入规定了场景的初始状态,以及接下来需要发生的事件的 Prompt;输出则是一段由模型生成的视频。模型需要保留图像中的物体与场景关系,让指定过程持续发生,并使其中的运动和变化符合相应的物理规律。
从确定的初始状态出发,生成一个在物理上成立的后续过程,正是模型需要完成的任务。
难点也恰恰在这里。
视频里的物理,究竟怎么测?
评测一段生成视频,需要分别回答两个问题: 视频是否完整、连贯地呈现了要求的场景?场景中的过程是否符合物理规律?
这套评测因此将评分分为两部分: 一致性分数 C 和 物理分数 P ,两者均采用 0—100 分制。
一致性分数 C,衡量视频中的主体、事件和场景能否保持连贯,并提供完成任务所需的观察依据。
例如,评测自由落体时,小球应当持续可见,不能突然消失、变成另一个物体,或出现无法连续跟踪的位置跳变。评测两根单摆时,需要能辨认两根摆、观察释放和摆动过程,并看清比较周期与摆长所需的部分。
一致性分数由视觉语言模型 Qwen3.6-27B 给出。评测为每道任务设置专门的提示词,引导模型检查所需主体是否存在、关键事件是否出现,以及画面中的对象和过程是否保持连续,最终输出一个 0—100 分的分数。
一致性分数 C 反映的是视频是否呈现了可辨认、可观察的任务过程。
一个小球可以始终沿着连续轨迹下落,但它的位置随时间变化的关系仍然可能不符合自由落体规律;两根单摆可以平稳地摆动,但周期与摆长之间的关系仍然可能是错的。
这种差别会影响视频模型的下游应用。例如,机器人如果借助生成视频预演推动物体的后果,就需要模型正确描述受力和摩擦。预测的滑行距离一旦有误,机器人就可能选择错误的推动力度,使物体偏离目标。
因此,还需要物理分数 P,该指标衡量从视频中测出的物理量,与预先定义的物理关系有多大程度的一致。
「物理分数由测量结果决定,无需与参考视频比较,也不依赖视觉语言模型直接判断物理正确性。」
这套方法覆盖光学、流体、相变、电磁等不同领域,让多类物理现象都有具体的检验依据。
它的核心思路是:把视频中的「物理量」测出来,再检查它们是否满足相应的物理关系。
程序通过分割、跟踪、几何拟合和事件检测,从视频中提取轨迹、周期、角度、液面等可观察量,再按照各任务的指标计算误差和得分。物理分数由这些测量结果决定,无需与参考视频比较,也不依赖视觉语言模型直接判断物理正确性。
以两根长短不同的单摆为例,在小角度近似、重力条件相同的情况下, 周期之比的平方,应当等于摆长之比 。程序从视频中测出两根单摆的周期 T₁、T₂ 和摆长 L₁、L₂,计算这一关系的相对误差: