EMBODIED DAILY

τ:从未来视觉监督中学习触觉增强的视觉-语言-动作(VLA)模型

原标题:{\tau}: Learning Touch-Augmented Vision-Language-Action Models from Future Visual Supervision

将触觉感知融入视觉-语言-动作(VLA)模型,为接触密集型操作(contact-rich manipulation)带来了广阔前景,因为在此类任务中,仅靠视觉观测往往无法捕捉有关物理交互的关键线索。然而,在任务特定数据有限的情况下,如何学习信息丰富的触觉表征,并将其有效地适配到预训练的 VLA 模型中,仍然是一项挑战。现有方法要么聚焦于瞬时接触状态,要么使用 6D 力/力矩(wrench)序列来建模时间维度的交互动态,高维触觉信号仍未得到充分探索。

为应对这些挑战,我们提出了 τ——一个触觉增强的 VLA 框架。该框架受 Joint-Embedding Predictive Architecture(JEPA)启发,从未来视觉监督中学习以动作为条件的时空触觉表征,并将其与视觉-语言特征融合以生成动作。这种监督在潜空间(latent space)中进行,且仅在训练阶段使用,不会带来任何部署开销。

我们还发布了 TacAura 数据集,其中包含在四项代表性接触密集型操作任务中同步采集的视觉、本体感知(proprioception)和基于视觉的触觉信号。实验表明,τ 优于现有模型,并能泛化到未见过的物体和场景,在操作性能与鲁棒性方面均有提升。

← 返回第 1 期 阅读原文(arXiv cs.RO)↗