接触
分类
阶段
Facet-0因此分别在接触阶段和自由空间阶段进行信用筛选,把学习重点重新拉回对齐、插入、卡滞和恢复这些真正决定结果的瞬间。
文章
进入接触阶段后,精化专家结合实时力觉,把它进一步转化为更细粒度的动作,使「要完成什么」和「接触时应该怎样调整」连接起来。
文章
状态
力觉作为独立信号进入模型,让接触状态在模型内部能够被明确表示。
文章
经过筛选的高价值接触经验被用于强化动作专家,使模型不仅知道哪些轨迹成功,还逐渐形成对「接下来应该产生怎样的动作和接触状态」的判断。
文章
操作
控制
Facet-0因此建立了一条从VLA语义决策到接触控制的对齐通路:
文章
动作
如果把所有时刻放在一起排序,大量自由空间运动会淹没那些短暂但关键的接触动作。
文章
效果
过大的接触力会降低信用,因此即使两个动作都完成了插入,温和对齐也会获得比强行顶撞更高的价值。
文章