看一遍就会,三星&上交提出RoboICL新方法,GPT-6 Astra多项机器人操控评测全面领先
机器人学习通常意味着收集数据、训练策略、再部署模型。RoboICL 走了另一条路线:冻结 GPT-6 Astra,不训练任务专用 VLA,只在推理时向模型提供少量示范,并持续保留机器人刚刚执行过什么、环境发生了什么。当前项目页给出了 30 项 RoboDojo 任务的完整结果入口,以及 929 条可播放、可逐布局核查的三视角执行记录。
论文:RoboICL: Embodied In-Context Learning with GPT-6 Astra
arXiv:https://arxiv.org/abs/2609.34261
项目主页:https://mosi-ai.github.io/RoboICL-GPT6-Astra.github.io/
代码:https://github.com/Mosi-AI/RoboICL
如果不训练模型参数,只给机器人看一段同任务示范,它能否学会精密插入、长程双臂协作和依赖初始状态的操作?
这正是 RoboICL 想回答的问题。
通用视觉语言模型已经能识别物体、理解自然语言指令,并在开放式操作中展现出很强的推理能力。但机器人控制不只要求 “知道该做什么”,还要求模型把意图转换成连续动作,并根据接触、抓取失败和环境变化不断修正。一次看似合理的抓取可能没有夹住物体,一段轨迹可能被控制器提前中断,长程任务后半段还可能需要重新查看最初的目标状态。
RoboICL 的核心思路很直接:把示范和机器人自己的执行历史都组织为模型能够读取的具身上下文,让冻结的 GPT-6 Astra 在每次决策时参考这些经验,直接输出下一段双臂动作。
30 项任务:Open 零样本,其余类别只用一段示范
RoboICL 在 RoboDojo 的 30 项双臂操作任务上进行评测。任务分为 Open、Memory、Precision 和 Long-Horizon 四类:Open 任务没有可用的任务专属训练示范,因此采用零样本;其余三类统一采用一段示范。
其中 RoboProbe https://robodojo-benchmark.com/report-gpt-6-astra-eval 就是 robodojo 官方团队做的一个 GPT-6 Astra zero-shot 结果。PhysicalRSI、Simate-beta 和 VPP2-Preview 是最新的榜单前三名。
在当前项目页纳入的对比方法中,RoboICL 的 30-task Overall 为 50.64,高于更新后最强对比方法 PhysicalRSI 的 39.56。与官方零样本 GPT-6 Astra 控制器 RoboProbe 相比,RoboICL 在四类任务中分别提高约 20—27 个 progress-score points:
这里的 progress score 是 RoboDojo 原生评分器给出的阶段性任务得分,范围为 0—100。它能区分 “完全没有进展”“完成了若干子目标” 和 “完整成功”,因此不能直接等同于任务成功率。论文中的 Overall 是 30 个任务均值的非加权平均。
Open 类结果尤其值得关注。这里没有专家示范,RoboICL 只能依靠任务描述、当前视觉状态和机器人在本次 episode 中积累的交互记忆。其 54.75 分说明,如何保存和组织在线经验,本身就能明显改变同一个冻结模型的控制能力。
不只公开均值:929 条执行记录可以逐布局查看
机器人论文常用一张表汇总结果,但均值无法回答很多关键问题:模型是从一开始就做错了,还是在接触阶段失败?它有没有识别出错误并重新抓取?得分为 0 的轨迹是否完全没有动作能力?
为此,项目页公开了当前 30 项任务的 929 条可播放记录,覆盖全部 30 个任务。其中 880 条属于完整评测计划,另有 49 条标为 partial evaluation 的参考轨迹。后者用于透明展示已经执行的记录,主榜单仍按当前正式评测口径计算。
网页中可以先选任务大类,再选 task 和 layout,在同一个面板内查看:
左腕、头部和右腕三个同步视角;
该布局的 official score、结果状态和评测协议;
与视频进度对齐的 GPT-6 Astra 执行说明;
播放、暂停、回到开头和 0.5×—4× 倍速控制。
RoboICL 做了什么:让 TRAIN 和 LIVE 使用同一种交互语法
RoboICL 不训练新的机器人基础模型,也不让另一个 VLA 先生成动作提议。系统中的学习组件是冻结的 GPT-6 Astra,外部控制框架负责准备上下文、校验动作格式、执行逆运动学和返回控制器反馈。
模型看到的经验分为两部分:
Demonstration context(示范上下文):来自同任务的已记录轨迹,在一个 episode 内保持不变。
Interaction memory(交互记忆):来自机器人当前 rollout,随着动作执行不断更新。
两类经验使用同一种 “观察 → 动作 → 执行回执 → 结果观察” 语法。示范中的回执描述记录下来的专家动作区间;在线回执则告诉模型,刚才提出的动作实际执行了多少、哪些后缀没有执行、是否发生控制器中断,以及执行后的新观测。
这个设计解决了一个常被忽略的问题:模型提出的动作,不等于机器人真实完成的动作。如果只保存模型原先的计划,后续决策可能建立在错误状态上;加入 execution receipt 后,模型能够把动作和实际后果对应起来。
在 RoboDojo 中,每次观察由左腕、头部和右腕三张 640×480 RGB 图像横向拼成一张 1920×480 triptych,同时提供机器人本体状态。GPT-6 Astra 通过一个受约束的 Act 接口输出 H × 14 的动作矩阵,描述双臂逐步的笛卡尔增量与夹爪目标。
长任务不能只记最近几步
如果完整保存所有历史图像,请求会随着 episode 变长,很快超过多模态上下文预算;如果只保留最近几步,模型又会遗忘任务初始状态和早期关键操作。
RoboICL 使用 bounded anchored memory:固定保留最初的交互,在整个任务时间轴上设置若干锚点,同时保留最近完成的一次交互。两个被保留片段之间如果省略了内容,系统会插入明确的 ,避免模型误以为两帧是连续发生的。
示范也不会被整条塞入上下文,而是从轨迹不同阶段抽取不重叠的动作块。这样,模型能同时看到任务早期、中期和末期的程序性信息。
论文对这部分做了两组对照。单示范设置固定总预算 J + B = 24,其中 J 是示范块数量,B 是交互记忆槽位。四种分配 (8, 16)、(12, 12)、(16, 8)、(22, 2) 的四任务均分分别为 57.50、80.25、80.00、60.75。示范塞得最密、只留下两个在线记忆槽时,表现反而明显下降。主实验因此采用平衡的 J = B = 12。
在相同的一示范配置下,锚点记忆得到 80.25,只保留第一段加最近历史的方案得到 73.50。差异主要来自 Build Tower、Put Bottles into Dustbin 和 Insert Tubes,说明长程任务既需要最新反馈,也需要早期视觉证据。
Deposit Coin:从反复掉落到毫米级插入
Deposit Coin 要求机器人抓起一枚薄硬币,对准存钱罐上的狭窄投币口,完成插入后还要让双臂回到原位。在当前 50-layout 结果中,RoboICL 平均得分为 78.00,其中 37 条轨迹得到满分;当前项目页上的次高方法 PhysicalRSI 为 62.27。
公开的 layout 0 轨迹展示了模型如何利用最新腕部视角修正操作。此前几次夹取没有稳定保留硬币,模型改变了覆盖位置和抓取高度;在 step 205,它从右腕画面判断投币口位于硬币右侧,先做横向移动和偏航角修正。随后几轮继续校准前后与左右偏差,在 step 225 松开夹爪,step 230 确认硬币已离开夹爪并进入槽内,最终 official score 为 100。
这一案例并不是 “照着示范重放”。示范提供的是任务过程和动作先验,当前观察与交互记忆则负责处理本次布局中的抓取失败、物体偏移和插入误差。
与 GPT-as-Policy 的十任务对照:只用 GPT-6 Astra 接近混合系统
论文还保留了一组独立的十任务比较,每个任务请求五个布局。该面板用于和 GPT-as-Policy 的公开结果对照,评测规模与 30-task 主榜单不同,因此两者不能混为同一次实验。
RoboICL 的一示范结果比 Direct 高 22.10 分,与 π₀.₅ + GPT-6 Astra 混合方案相差 2.00 分。区别在于,RoboICL 没有使用学习到的 VLA 动作提议,动作由 GPT-6 Astra 通过单一接口直接生成。
Build Tower 能直观体现示范的作用:在这个五布局面板中,RoboICL 从零样本的 16 提升到一示范的 100。扩大到 50 个布局后,当前主榜单中的一示范均分为 80.60,说明小面板结果不能代替更宽布局的评测,但提升并不只出现在单个示例上。
从仿真到真实机械臂:三段示范平均达到 78.89
研究还在 Franka Research 3 单臂机器人上测试 Peg in Hole、Folding Towel 和 Building Bridge。每个任务使用 GELLO 采集三条人类示范,观测来自腕部 D405 与外部 D515 相机;零样本、一示范和三示范条件各进行五次随机化试验。
三个真实机器人任务的平均 progress score 从零样本的 14.45 提升到一示范的 63.33,三示范进一步达到 78.89。三个任务都呈现 0-shot < 1-shot < 3-shot 的趋势。Peg in Hole 的三示范条件中有 2/5 次完成插入;Building Bridge 从一示范到三示范又提高 26.67 分。
论文还测试了毛巾折叠的实例外泛化。三示范模型在已见毛巾上得 100,在一条未见毛巾上得 90,但换成更大的未见毛巾后下降到 40。这个结果一方面表明示范能把通用模型已有的折叠知识落到具体机器人与动作空间,另一方面也显示模型可能过度沿用示范中的运动尺度。
上下文很长,但大部分前缀可以复用
多模态具身上下文会带来推理成本。论文选择 Build Tower、Classify Objects 和 Put Bottles into Dustbin 的零样本 / 一示范配对,共 30 个 episode,统计了 token、模型调用、API 时间和端到端时间。
在 1810 次完成的模型请求中,输入 token 为 1.2251 亿,其中 1.1315 亿命中缓存,token 加权 KV-cache hit rate 为 92.4%。这来自请求结构的稳定性:任务指令、示范、相机标定和已经固定的锚点构成稳定前缀,只有最新交互及其附近的 gap 继续变化。
论文另在两个开发任务上测试可选的 Jev 动作复用门控。它不生成动作,只判断是否继续执行 GPT-6 Astra 已提出但尚未执行的动作后缀。Align Blocks 的 GPT-6 Astra 请求数从 181 降到 121,General Pickup 从 116 降到 60,即减少约 33% 和 48%。不过成功率影响依赖任务:General Pickup 从 4/5 提升到 5/5,Align Blocks 则从 3/5 降到 2/5。因此这部分被明确定位为开发集实验,而不是已经解决的通用加速方案。
这项工作说明了什么?
RoboICL 的结果支持一个具体判断:对具备视觉理解与数值动作生成能力的通用多模态模型,少量示范的价值不只在于给出 “正确答案”,更在于提供可执行的过程结构;而机器人自身的在线经验必须以动作和真实后果配对的形式保留下来。
它也有清晰的边界:
仿真主结果使用 seed 0,不同方法的训练数据与评测协议并不完全相同;
progress score 衡量阶段性进展,不能当作完整成功率;
真实机器人实验只有三个任务、每个设置五次试验;
当前验证围绕 GPT-6 Astra 展开,跨模型、跨机器人形态的普适性仍需进一步实验。
但与只发布一个平均分相比,论文和项目页已经提供了更完整的证据链:30-task 类别结果说明覆盖面,十任务面板给出与直接控制和混合系统的对照,真实机器人实验检验跨 embodiment 的示范适应,929 条 Episodes 则让读者可以直接查看每个布局中机器人到底做了什么。
当演示和执行历史被组织为同一种 “观察 — 动作 — 回执 — 观察” 语言时,机器人无需等待下一轮参数更新,就能在上下文中利用少量经验调整行为。RoboICL 展示的不是一个新的机器人预训练模型,而是一种让现有通用模型在部署时继续学习的方法。
项目主页:https://mosi-ai.github.io/RoboICL-GPT6-Astra.github.io/
论文:https://arxiv.org/abs/2609.34261
代码:https://github.com/Mosi-AI/RoboICL
作者信息
值得一提的是,这篇工作的作者团队也颇有看点。三位第一作者刘方程、沈叶青、程安达目前均为三星大模型研究员,分别毕业于北京大学、清华大学和中国科学院自动化研究所,此前也都有头部基础模型团队的研发经历。
通讯作者唐业辉博士则是三星大模型负责人。据公开信息,他组建并领导 AI MODEL TF,面向三星全球生态,负责从数字世界到物理世界的基础模型训练及核心技术研发。TF(Task Force)是三星面向公司级战略任务设立的核心攻坚组织,由三星集团 CTO 直接推动成立,聚焦关系公司未来核心竞争力的关键技术方向。
主题:示范|机器人|模型|GPT-6Astra