西交大提出QQWorld:仅需10行代码,世界模型成功率提升5.33个百分点
2026 年 3 月,Yann LeCun 等人提出 LeWorldModel(LeWM)。它采用联合嵌入预测架构(JEPA),从原始像素中学习环境动力学,并通过高斯分布正则抑制表示坍塌,使端到端世界模型可以使用更为简洁的目标稳定训练。
然而, 西安交通大学研究团队 发现,即使施加了高斯正则,模型学习到的潜变量分布仍可能呈现明显的重尾现象,即少量潜变量远离主体分布,形成极端表示。
进一步分析表明,LeWM 使用的 Epps–Pulley(EP)正态性目标存在一个容易被忽略的「尾部盲区」:它能够判断整体分布是否偏离高斯,却难以持续纠正少量已经远离主体分布的极端潜变量。对于这类样本,EP 目标产生的校正梯度会迅速减弱,使其在训练过程中难以被有效拉回。这些远离主体分布的重尾样本落入训练数据稀疏的潜空间区域后,模型难以从中学习可靠的场景特征表征,进而影响后续的动力学预测与规划。
针对这一问题, 研究团队提出了 QQWorld: 用 quantile–quantile matching,也就是分位数 — 分位数匹配,替换 LeWM 原有的 EP 正则。
它的核心思想非常直接: 不再通过核函数间接衡量两种分布的差异,而是对潜变量的随机投影进行排序,让每个样本直接向其次序对应的标准高斯分位点移动。
换句话说,模型不再只问「当前潜变量整体分布与高斯分布有多大差异」?而是进一步回答「每个样本应该移动到哪个位置」?
这种直接的分位点匹配机制能够在分布尾部持续提供有效梯度,从而更好地抑制极端潜变量并改善潜空间结构。
实验显示,在 Two-Room、Reacher、PushT 和 OGBench-Cube 四个控制环境中,QQWorld 将平均规划成功率 从 79.75% 提升至 85.08%,增加 5.33 个百分点。 与此同时,该方法实现极为简洁,核心代码不足 10 行。
此外,论文提出了 Cross-Batch QQ,通过引入少量历史批次的投影特征,辅助当前批次计算更加稳定的样本次序。历史特征仅用于排序,并不参与反向传播,因此几乎不会增加额外的训练显存开销。
实验表明,即使将物理训练批次缩小至原来的四分之一、显存占用降低约 73%,Cross-Batch QQ 仍能使模型的平均规划成功率显著超过 LeWM。该结果表明, QQWorld 不仅能够改善潜变量分布和规划性能,也为更大规模世界模型的高效训练提供了一种简单而可扩展的方案。
主题:模型