登录

世界模型不再「盲搜」9000次:浙大、清华等团队提出INTACT,直接从意图生成动作


速读:INTACT(INtent-To-ACTion),一种基于端到端JEPA的无搜索世界模型控制方法,试图改变这一范式:直接利用离线轨迹中已有的状态、动作与未来结果,将运动意图转化为动作模型可以读取的语义接口,使模型无需搜索候选动作序列,就能直接生成动作计划;
2026年07月31日 16:5

浙大清华新作 INTACT,同构算子学习意图动作映射新范式

Junhan Sun・Hao Zhao・Guofeng Zhang|浙江大学・清华 AIR・InSpatio・RoboParty Lab

只训练 1 个 epoch,不采样任何候选动作序列,INTACT 在四项 LeWM 官方任务上取得  9 5.33 %  的平均成功率;需要时,小规模局部验证还能进一步提升到  96.86% ,同比相关模型耗时降至  1/300 。

世界模型已经能够预测 “执行一个动作后,世界会发生什么”,但真正部署时,它往往仍然无法直接回答另一个更关键的问题: 现在应该怎么做?

传统方法通常依赖 CEM 或 MPPI,从大量随机生成的候选动作中反复预测、筛选答案。也就是说,世界模型虽然会预测未来,却仍然需要通过大规模搜索才能决定下一步行动。

浙江大学、清华大学智能产业研究院、影溯 InSpatio、RoboParty Lab 等团队提出的  INTACT(INtent-To-ACTion) ,一种基于端到端 JEPA 的无搜索世界模型控制方法,试图改变这一范式:直接利用离线轨迹中已有的状态、动作与未来结果,将运动意图转化为动作模型可以读取的语义接口,使模型无需搜索候选动作序列,就能直接生成动作计划;只有在精细接触或局部修正等复杂场景中,才引入小规模搜索进行验证。

论文标题:Isomorphic Intent-to-Action Learning for Search-Free World Models

论文地址:https://arxiv.org/abs/2607.26056

项目主页:https://zju3dv.github.io/INTACT-JEPA/

Github 主页:https://github.com/zju3dv/INTACT-JEPA

影溯 InSpatio: https://www.inspatio.com/

RoboParty Lab :https://lab.roboparty.com/

背景

传统方案通常前向只是做了未来预测器亦或者是 mask 中间 latent 的还原器,把这个反问题交给 CEM 或 MPPI:随机生成大量动作序列,让世界模型逐条预测,再从中选出最接近目标的一条。

以 LeWM 的典型设置为例,CEM 在一次规划中最多评估 300×30,即 9000 条候选序列。搜索本身并没有错,但它会带来额外延迟,也让世界模型学到的动作信息在部署时无法被直接读取。

与此同时,VLA 训练过程冻结 Encoder 去训练 Actor 的方式,只是将多模态过滤去进行动作生成,却并没有考虑到编码后的潜空间和动作空间的语义信息对齐。这种没有进行明确意图族和动作族正确映射关系的训练方式,会让模型在生成意图和意图完整生成动作上存在明显 GAP。

相关工作

潜在世界模型与搜索式控制

LeWM 一类方法首先训练视觉编码器与 Forward Predictor,让模型在潜在空间中预测动作后的未来状态。部署时,世界模型主要充当 “候选动作的裁判”:CEM 或 MPPI 提议动作,Forward Predictor 展开未来,目标代价再对候选进行排序。

逆动力学与目标条件策略

局部逆动力学可以从真实相邻状态恢复动作,目标条件策略则可以根据当前状态和未来目标直接输出控制。前者具有物理锚点却无法在行动前获得下一状态,后者可部署却容易退化成单独的目标条件行为克隆。INTACT 关注的正是这两类条件如何 通过同一个动作算子建立一致语义 。

从搜索先验到直接动作接口

已有工作也会训练动作先验来辅助采样,但搜索仍然承担寻找主方向的职责。INTACT 的区别在于,它让目标 意图本身处在训练支持上 ,并将同一个 INTACT Predictor 直接保留为部署接口,使搜索从必选项变成可选验证器。

方法

系统概述

如图 1 所示,INTACT 在原有 Forward Predictor 之外增加一个共享的条件动作算子。训练时,真实局部变化和未来目标变化被巧妙地以相同的输入结构和不同的梯度传播策略进行 INTACT Predict;推理时,目标分支直接生成动作块,Forward Predictor 继续负责未来展开、重规划与可选验证。

主题:动作|世界模型