动作
分类
算子
INTACT关注的正是这两类条件如何通过同一个动作算子建立一致语义。
文章
如图1所示,INTACT在原有ForwardPredictor之外增加一个共享的条件动作算子。
文章
空间
与此同时,VLA训练过程冻结Encoder去训练Actor的方式,只是将多模态过滤去进行动作生成,却并没有考虑到编码后的潜空间和动作空间的语义信息对齐。
文章
模型
INTACT(INtent-To-ACTion),一种基于端到端JEPA的无搜索世界模型控制方法,试图改变这一范式:直接利用离线轨迹中已有的状态、动作与未来结果,将运动意图转化为动作模型可以读取的语义接口,使模型无需搜索候选动作序列,就能直接生成动作计划;
文章
接口
信息
搜索本身并没有错,但它会带来额外延迟,也让世界模型学到的动作信息在部署时无法被直接读取。
文章