SiMDex:挖掘相似第一人称视角视频以实现跨具身灵巧操作
原标题:SiMDex: Mining Similar Egocentric Videos for Cross-Embodiment Dexterous Manipulation
arXiv:2608.04196v1 公告类型:新发布 摘要:近年来,将第一人称视角(ego-centric)的人类视频规模化用于机器人操作已成为一个爆发性趋势,但究竟哪些数据真正有益于灵巧操作仍不明确。我们提出 SiMDex,一个基于相似度的数据挖掘框架,将灵巧操作中 VLA 后训练的人类数据选择问题转化为一个推荐问题。针对每条机器人演示数据,SiMDex 采用"召回—排序—重排序"的三层流水线,从约 3200 万条第一人称人类样本池中提取任务相关子集,该过程在与形态无关的(morphology-agnostic)动作空间中运行,无需对 VLA 架构或训练流程做任何改动。与使用等量随机采样人类数据训练的强基线相比,SiMDex 仅使用约 149 万条挖掘出的样本(不足样本池的 5%),却将整体成功率从 47.7% 提升至 61.1%,这表明选择性数据筛选优于不加区分的数据混合。