为什么造出一只类人的灵巧手如此困难
人形机器人(humanoid robot)可以奔跑、跳跃、跳舞,甚至表演后空翻,但让它折叠一件衬衫、拿起一块湿海绵或转动一把钥匙,问题突然就变得困难得多。这听起来有违直觉。后空翻看起来比拿起一件衬衫复杂得多。但对机器人来说,后空翻是一系列基本可预测的、精确控制的动作。家务劳动则充满了不确定性。物体会弯曲、打滑、变形、破碎,而且每次出现的位置都略有不同。这就是为什么机器人手可能是打造真正实用的人形机器人过程中最难的部分之一。
手不仅仅是手指的集合
人类的手将机械结构、感知和控制集于一个极其紧凑的躯体之中。我们不断调整自己的抓握,却无需有意识地思考。当物体开始滑落时放松手指,当东西很重时握得更紧,或者当物体出乎意料地柔软时改变抓握方式。机器人必须通过传感器和软件来构建这一切。一只现代机器人手可能拥有多个电机和多个自由度(DoF),但这并不能自动让它变得灵巧。机器人还需要知道自己的手指在哪里、物体在哪里、触碰的力度有多大、物体是否在打滑,以及多大的力才是安全的。这一点尤其困难,因为视觉无法提供所有这些信息。摄像头可以告诉机器人它正拿着一个鸡蛋;但它无法直接告诉机器人距离捏碎鸡蛋还有多远。
因此,最近的研究越来越重视触觉感知。浙江大学 2026 年发表在《Science Robotics》上的一项研究将视觉和触觉信息与强化学习及在线模仿学习相结合,在涉及 25 个物体的五项复杂任务中取得了 85% 的成功率。
现实世界烦人地不可预测
工厂机器人拥有巨大的优势,因为工程师可以控制它们所处的环境。一只数千次组装同一部件的机械臂,可以被赋予固定的运动轨迹、可预测的照明、已知的物体尺寸和专用工装。家庭环境则恰恰相反。一件衬衫每次的褶皱可能都不一样。一个玻璃杯可能只装了一部分水。一个抽屉可能微微开着。一块海绵被挤压时会改变形状。一个塑料袋根本没有固定的几何形态。俄亥俄州立大学的研究人员将此描述为家务机器人的根本问题之一:物理接触难以建模和控制,特别是当物体柔软、易碎或形状不规则时。而且机器人在操作物体时往往还在移动。关于家务机器人的研究已经确定,双臂协调、稳定导航和足够的可达性是现实世界全身控制操作的三大要求。换句话说,手不能脱离手臂、身体和环境来单独考虑。
为什么后空翻可能比洗衣服更容易
这解释了人形机器人领域看似奇怪的进展。宇树(Unitree)的 H1 因完成原地后空翻而引人注目,而其 G1 则展示了越来越具运动能力的动作。但后空翻是一个定义严格的动作。机器人知道自己要做什么,环境可以被控制,动作序列可以被反复演练。洗衣服则不同。一个折叠衬衫的机器人必须定位织物、理解其不断变化的形状、选择抓取点、拉动而不丢失衣物、重新调整手的位置、考虑褶皱,然后准确地放置结果。用一百件不同的衬衫来做这件事,问题突然看起来就不再像一个简单的动作,而更像一个庞大的物理实验。中国机器人公司面临的正是这个问题。最近,Reuters 恰如其分地将一篇报道命名为《在奔跑和跳舞之后,中国机器人公司瞄准家务劳动》。该报道中提到的 X Square Robot 公司,与许多其他机器人公司一样,也一直在测试人形机器人执行捡垃圾和插花等家务。
缺失的要素是数据
现代机器人越来越多地通过训练来获得能力,而不仅仅是靠编程。但收集有用的操作数据比为 AI 模型收集图像要困难得多。一次有用的演示可能需要关于机器人关节位置、摄像头、力、力矩和触觉传感器的同步信息。而且根本不存在一个互联网规模的数据集,记录人们操作数千个物体的过程,同时记录下他们的手所感受到的一切。IEEE 最近强调触觉数据是一个主要瓶颈,并指出视觉-语言-动作模型(VLA)已经在帮助机器人完成洗衣和整理等任务,而精细操作仍然困难,部分原因是与视觉数据集相比,触觉数据集仍然非常小。这就是为什么各公司和研究人员正在试验遥操作、可穿戴传感器、模仿学习、强化学习和仿真。其目标是将人类演示转化为足够的训练经验,使机器人最终能够独立处理不熟悉的情况。
每个人都在追逐同一种缺失的技能
业内最知名的公司正从不同方向攻克这个问题。例如,宇树的 G1 可以配备力控三指灵巧手和可选的触觉感知。Apptronik 的 Apollo 围绕操作能力和运动能力(locomotion)同步开发,该公司称其核心执行器已经历了 35 次以上的迭代。Tesla 的 Optimus 追求同样的通用人形机器人目标,而 1X 的 NEO 则明确瞄准家务劳动。这些例子都不意味着家务机器人问题已经被解决。证明机器人能够可靠地执行一项任务,与要求它进入一个陌生的家庭并在无人监督的情况下工作八小时,是完全不同的两回事。这从根本上解释了为什么机器人手如此困难……