把人类双手的「手感」移植给机器人:500小时真实操作数据,任务成功率翻番
速读:过去几年,在学术界,第一视角人类视频已经快速扩展到数万小时,越来越多工作也开始看到数据规模增长带来的收益。
拿起一枚生鸡蛋,手指需要施加恰到好处的力:既要防止滑落,又不能捏碎。拧一条湿毛巾,指尖的力道也要随着水分挤出不断调整。对人类而言,这些操作几乎出于本能。但如果只依赖视觉,摄像头拍得下手部轨迹,却捕捉不到手指接触的位置与按压的力度。
过去几年,在学术界,第一视角人类视频已经快速扩展到数万小时,越来越多工作也开始看到数据规模增长带来的收益。视觉 — 触觉数据却远没有达到这样的规模:此前公开的人类视触觉数据集大多只有几小时到几十小时。若简单将多个小数据集合并,各家的触觉传感器、采集流程和数据格式又不相同。数据量虽然上去了,硬件和流程也跟着变化,“更多数据” 究竟贡献了多少反而难以单独判断。
近日,来自德州农工大学(Texas A&M)、Google DeepMind、卡内基梅隆大学(CMU)、斯坦福大学、加州大学伯克利分校、耶鲁大学、微软、英伟达(NVIDIA)、利物浦大学、Meta、华盛顿大学、西北大学、索尼、佐治亚理工学院(Georgia Tech)以及 Overfit Lab (数据供应商) 等 15 家机构的研究者发布了 TouchScale :一个在统一传感器、统一采集与同步流程下构建的 500 小时人类视觉 - 触觉数据集 。
团队希望借此回答一个关键问题:如果不再拼接不同来源的数据,而是在 同一套传感与采集体系下 ,把 高质量 的第一视角视觉 — 触觉数据真正扩展到数百小时,它是否也会像大规模视频一样,显现出随数据规模增长而来的 Scaling 收益?这些 Scaling 收益 ,又有多少能够进一步转化为机器人的操作能力?
主题:规模