具身智能仿真「竞技场」RoboColiseum来了:真机对齐度近90%,已有40+团队同场打擂
当前,具身智能领域正经历着模型架构与算法的快速迭代。然而,在模型数量激增的同时,“评测标尺缺位”的痛点也日益凸显:行业缺乏统一、可复现且能真实反映模型能力的评测基准,开发者往往难以准确衡量模型的真实边界与具体短板。
针对这一行业共性难题, 8 月 14 日,常态化具身智能仿真评测平台 RoboColiseum 发布。该平台旨在构建多维度的系统评测体系,以与真机表现高度一致的仿真评测,帮助开发者识别模型的能力优势与短板,持续迭代提升。平台面向全球高校、科研机构、模型企业与研究者开放,实时更新评测结果,致力于构建一套结果可信、过程可复现的具身模型评测标尺。
RoboColiseum 自内测上线以来,已有海内外 40 多支队伍在平台开展模型训练与评测。
仿真评测平台:http://robocoliseum.ai/
聚焦 Sim2Real 瓶颈
建立高保真仿真与实机对齐
模型在仿真环境中的优异表现,能否延续到真实物理世界?进入现实场景后,光照、材质、相机噪声、物体接触以及机器人初始位置和姿态的变化,都可能导致模型性能下降。因此,如何通过仿真评测准确衡量模型的真实能力,仍是一个关键难题。
RoboColiseum 基于高保真仿真环境构建,在环境渲染和物理交互方面高度还原真实世界。经实测验证, 仿真评测与实机部署的相关性达到 89.5%,相同模型在仿真环境与真实世界中的评测差异小于 10% 。仿真评测由此可以作为真机表现的可靠参考,帮助开发者在进入成本更高、周期更长的真机测试前,快速完成模型筛选与问题定位。
这一验证链路也是双向的:使用真机数据训练的模型可以直接提交仿真评测,仿真数据训练的模型也能够通过真实机器人验证迁移效果。虚拟环境与真实世界由此实现双向打通,让开发者能够以更低成本获得高置信度结论,显著缩短 “训练 — 评测 — 改进 — 部署” 的迭代周期。
仿真环境高度还原真实世界
Sim2Real 实验对比 告别单一成功率指标
构建四维细粒度归因体系
传统评测往往用一套综合成功率概括模型表现,RoboColiseum 则围绕不同能力维度设置多个任务集,考察模型在各个维度中的表现。目前, 平台已推出 4 类能力子榜、78 个高保真仿真评测任务。未来还会结合产学研需求,持续更新任务和评测维度 。
4 类能力子榜:
指令跟随(Instruction Following),考察模型能否理解颜色、数量、形状、尺寸、类别、逻辑与常识等自然语言信息,找对目标并执行正确动作。
空间理解(Spatial Reasoning),检验模型对绝对位置、相对关系、尺寸与序号排序、堆叠和空间对齐等信息的理解能力。
扰动适应(Robustness),通过改变背景、光照、材质、机器人初始状态、相机位置与图像质量,并对指令进行多样化改写,检验模型在非理想环境中的稳定性与泛化能力。
通用操作(General Manipulation),覆盖开门、倾倒、舀取、上货、分拣、整理桌面和双臂协作等多步骤任务,衡量模型组合运用原子操作技能的能力。
为了让失败原因可追溯,每项任务都会被进一步拆解为多个子步骤。评测平台不仅判断最终任务是否成功,也会记录模型完成了哪些步骤、在哪一步失败以及在不同场景中的泛化能力。
在评测设计上,RoboColiseum 通过大规模、多样化样本降低单次测试的偶然性,并采用域随机化、训练集与测试集隔离、分布内与分布外测试等机制,减少模型依赖固定布局或数据规律 “走捷径” 的可能,提高评测结果的稳定性。