真正“会干活”的机器人灵巧手

从机械手到 Physical AI:全球机器人灵巧手技术路线综述

过去几年,人形机器人的竞争重点主要是“能不能站稳、走路和跑步”。但随着双足运动控制逐渐成熟,产业界越来越发现,真正决定机器人能否进入工厂、仓库和家庭的关键,正在从“腿”转向“手”。

机器人走到工作台前并不算太难,真正困难的是拿起螺丝、插接头、整理线缆、使用工具、抓取柔软物体,甚至仅凭触觉判断物体是否滑动。

因此,灵巧手正在成为 Physical AI 最关键的硬件之一。

但当前行业讨论灵巧手时经常把“自由度”“腱绳”“触觉”“强化学习”“五指结构”等概念混在一起。实际上,灵巧手应该从三个不同层面理解:

第一层:机械结构——手到底怎么动;
第二层:感知系统——手怎么知道自己碰到了什么;
第三层:智能控制——机器人怎么学会使用这只手。

机器人灵巧手

一、第一层:机械结构路线——手到底怎么动

从机械设计角度看,目前全球灵巧手大体可以分成三条主要路线。

路线一:高自由度、全驱动灵巧手

这是最接近人手的一种设计。

基本思路是:

一个关节对应一个执行器或独立控制通道。

人的手拥有大量可以独立运动的关节,因此这种路线通常追求十几个甚至二十多个主动自由度。

它的最大优势是:

手指能够真正独立运动。

机器人不仅能够抓取,还可以完成:

捏、旋转、拨动、侧向夹持、调整物体姿态等复杂动作。

这类灵巧手特别适合所谓的“手内操作”,也就是物体已经抓在手中以后,机器人仍然可以利用手指改变它的位置和方向。

典型代表包括:

Shadow Dexterous Hand、Unitree Dex5-1、Wuji Hand,以及部分 Allegro Hand 产品。

其中 Shadow Robot 是这一领域最经典的研究平台之一。

这类路线的问题同样非常明显:

自由度越多,就意味着电机越多、传感器越多、控制变量越多。

随之而来的问题包括:

重量增加、功耗增加、成本增加、控制复杂度上升。

因此,高自由度并不等于一定更加实用。


路线二:腱绳驱动——把“肌肉”放到前臂

第二条路线同样追求高自由度,但机械布局完全不同。

它采用一种非常接近人体结构的设计:

电机安装在手掌之外,通过绳索或者类似肌腱的结构拉动手指。

人体实际上就是这种结构。

人的手指内部并没有装满肌肉,相当一部分控制手指运动的肌肉位于前臂,通过肌腱驱动手指。

机器人也可以采用类似设计:

前臂执行器

腱绳

手指关节

这种结构最大的优势是:

可以显著减轻手掌重量。

如果把二十多个电机都塞进机器人手掌,手会非常笨重。

而机器人末端越重,手腕和手臂需要承担的负载越大,快速操作就越困难。

因此,把驱动器移到前臂实际上是在解决一个非常典型的灵巧手矛盾:

自由度越高,需要的电机越多;
电机越多,手又越重。

Tesla Optimus 就是目前这条路线最值得关注的代表之一。

Tesla 新一代 Optimus 手部采用高自由度五指结构,并把大量执行器集中在前臂,再通过控制缆索驱动手指。

它的思路并不是简单追求更多关节,而是希望同时解决:

高自由度、轻量化和规模化制造。

Shadow Robot 也长期采用腱绳驱动。

因此可以看到:

Tesla 与 Shadow 在机械传动思想上存在相似性,但产品目标完全不同。

Shadow 更偏向科研和极限灵巧性;

Tesla 更强调与人形机器人整机结合以及未来的大规模生产。


路线三:欠驱动与柔顺设计

第三条路线与前两种思路明显不同。

它并不追求每一个关节都独立控制。

核心思想是:

不需要精确控制所有手指关节,而是让机械结构自己适应物体。

这就是所谓的:

欠驱动。

例如一只手可能拥有十几个关节,但实际上只需要几个电机。

电机拉动机械结构后,手指会根据被抓物体的形状自动改变姿态。

意大利 qbrobotics 的 SoftHand 就是这条路线的典型代表。

这种设计可以理解成:

把一部分“智能”放进机械结构里。

机器人抓一个杯子时,不需要提前计算每根手指应该弯曲多少角度。

手接触杯子以后,柔顺结构会自然贴合杯子表面。

优点非常明显:

结构简单、重量低、抗冲击、控制容易。

而且在很多工业抓取场景中,实际上非常实用。

缺点同样明显:

因为很多关节不能完全独立控制,因此在精密操作方面通常不如全驱动灵巧手。

例如:

旋转一颗小螺丝、摆弄钥匙、操作非常小的连接器,

就可能比较困难。

因此未来机器人并不会全部采用二十多个主动自由度的五指手。

更可能形成长期并存:

两指夹爪
三指手
欠驱动五指手
高自由度五指手

不同任务选择不同结构。


二、第二层:从“会动”到“有感觉”

机械结构只解决一个问题:

手能不能运动。

但真正灵巧的机器人还必须解决第二个问题:

机器人知不知道自己正在碰什么。

这就是触觉。

早期机器人主要依靠视觉。

摄像头告诉机器人:

“杯子在那里。”

但是当机器人真正抓住杯子以后,还需要知道:

有没有碰到?
抓力够不够?
杯子是否正在滑动?
有没有夹得过紧?

这些问题仅靠视觉并不好解决。

因此当前高端灵巧手正在快速加入触觉传感器。


第一阶段:简单接触和压力感知

最基础的触觉系统,只需要回答:

碰到了没有,以及压力有多大。

这已经可以显著改善抓取。

例如 Unitree Dex5-1 等新一代灵巧手,开始在手指表面布置大量压力感知点。

机器人不仅知道手指已经接触物体,还能够判断不同区域承担了多少力量。


第二阶段:高密度触觉

下一步的发展是:

一根手指本身就像一块高分辨率触觉相机。

它不仅能够检测压力,还可以判断:

接触位置、接触面积、剪切力以及物体是否正在滑动。

Meta 推出的 Digit 系列人工指尖就是这种路线的重要代表。

这种技术的意义非常类似摄像头从几个像素发展到高分辨率图像。

未来机器人可能不再只是知道:

“食指碰到了东西。”

而是可以获得一张“触觉图像”。


第三阶段:视觉与触觉融合

更进一步的路线,是在机器人手内部直接加入摄像头。

例如 Figure、PaXini 等方案已经开始采用:

掌内视觉+手指触觉。

为什么要把摄像头装到手上?

因为机器人把手伸进柜子、箱子或者机器内部以后,头部摄像头经常会被手臂挡住。

此时:

头部摄像头负责大范围定位;

掌内摄像头负责近距离观察;

手指触觉负责最后的接触判断。

最终形成:

视觉负责“看”,
触觉负责“摸”。

这很可能成为下一代高级灵巧手的标准架构。


三、第三层:控制路线——机器人怎样学会“用手”

一只拥有20个自由度的灵巧手,机械结构可能已经非常接近人手。

但问题随之而来:

20个关节到底应该怎么同时运动?

传统机器人主要采用程序控制。

工程师提前告诉机器人:

第一关节转多少度;

第二关节转多少度;

什么时候闭合手指。

对于固定生产线,这种方法很好。

但进入家庭或者复杂工业现场以后,这种方式很快失效。

因为真实世界里几乎没有两个物体完全相同。

因此灵巧手控制正在发生一次非常重要的变化:

从“编程控制”转向“学习控制”。


第一阶段:遥操作采集数据

机器人首先模仿人。

操作人员可以使用:

数据手套、VR设备、动作捕捉设备,

控制机器人完成任务。

例如:

拿杯子、拧瓶盖、插接插件。

机器人同步记录:

摄像头图像
关节角度
手指位置
电机力矩
触觉数据
最终任务结果

这些数据成为机器人学习的训练数据。


第二阶段:模仿学习

机器人学习大量人类操作数据以后,可以开始自己完成类似任务。

这就是模仿学习。

简单理解:

人先做很多遍,机器人从数据里学习。

但真实世界中的情况太多,因此仅靠模仿学习仍然不够。


第三阶段:强化学习和仿真

机器人还可以进入虚拟环境进行大量训练。

例如:

MuJoCo、Isaac Sim 等仿真平台。

在现实世界中训练一百万次可能需要几个月。

但在虚拟环境中,可以同时运行成千上万个机器人。

机器人不断尝试:

抓取、旋转、插入、调整抓力。

失败以后再次尝试。

最终通过强化学习获得更加稳定的动作策略。


第四阶段:机器人基础模型

目前更前沿的方向,是把灵巧手直接连接到机器人基础模型。

这类模型不再只控制:

“某根手指应该转多少度。”

而是理解一个更高级的任务:

“把插头插进去。”

然后模型自己完成:

识别插头;

规划手臂路径;

决定抓取位置;

控制手指;

检测接触;

调整抓力;

完成插入。

Google DeepMind、NVIDIA、Figure 等公司目前都在朝这个方向发展。

这也是 Physical AI 真正重要的地方。


四、各厂商技术路线比较

经过上述分类,全球主要灵巧手方案就可以清晰定位。

企业/产品机械路线感知路线主要定位
Shadow Hand高自由度+腱驱动多传感器科研、高灵巧操作
Tesla Optimus Hand高自由度+前臂腱驱触觉人形机器人+规模化制造
Unitree Dex5-1高自由度高密度触觉+可反驱人形机器人与学习控制
Wuji Hand高自由度独立驱动力控/触觉扩展高自由度通用平台
qbrobotics SoftHand欠驱动+柔顺接触/力控简单、可靠、自适应抓取
Allegro Hand高自由度压力/触觉科研与机器人学习
PaXini高自由度高密度触觉+掌内视觉触觉智能
Figure Hand高自由度整机设计指尖触觉+掌内视觉AI与硬件一体化
1X NEO Hand腱驱+低减速比触觉+力透明家庭机器人自然操作

这样来看就会发现:

这些公司实际上并不是在一条直线上竞争。

它们是在不同维度做选择。


五、Tesla 为什么值得单独关注

Tesla Optimus 的灵巧手尤其值得关注,不是因为它单纯拥有更多自由度。

而是因为它同时解决三个问题:

高自由度、轻量化、量产。

Tesla 把大量驱动机构放入前臂,通过腱绳驱动手指。

这与人体结构高度相似。

其工程目标非常明确:

手掌尽可能轻,驱动能力尽可能强。

这对于人形机器人非常重要。

因为人形机器人每天可能需要完成成千上万次:

抓取、搬运、旋转、按压、使用工具。

如果手过重,不但增加能耗,还会降低整个手臂的动态性能。

Tesla 与 Shadow Robot 等科研灵巧手最大的区别,也正是在这里:

Shadow 的目标是:

最大程度探索机器人灵巧操作能力。

Tesla 的目标则是:

能不能把这种灵巧手真正做成百万级工业产品。

后者可能更加困难。


六、未来真正竞争的不是“谁自由度最多”

目前很多灵巧手宣传仍然强调:

16自由度、20自由度、22自由度。

但未来这个指标的重要性可能会下降。

因为当主动自由度达到一定水平以后,真正决定机器人能力的是:

触觉质量、力控、机械可靠性以及AI控制能力。

一只20自由度的手,如果没有触觉,机器人仍然不知道自己是否抓牢物体。

一只拥有高精度触觉的手,如果机械结构容易损坏,也无法真正进入工厂。

因此真正优秀的灵巧手应该同时具备:

足够的自由度
轻量化
触觉感知
柔顺控制
可反驱
高可靠性
低成本
AI接口


七、灵巧手最大的产业化难题

今天机器人做出一次复杂手部动作已经不是最困难的问题。

真正困难的是:

一天做一万次,一年做几百万次以后还能不能正常工作?

灵巧手可能是人形机器人中最容易磨损的部件之一。

因为它需要频繁:

摩擦、碰撞、弯曲、接触物体。

腱绳可能拉伸;

齿轮可能磨损;

传感器可能漂移;

柔性表皮可能损坏。

所以未来灵巧手真正的大规模应用,很可能不是首先比谁的动作最漂亮,而是比:

寿命、维护成本和单次操作成本。

这也是 Tesla 等整机厂商特别强调工程化和制造能力的原因。


八、未来技术路线正在收敛

尽管今天灵巧手看起来方案很多,但从整体趋势来看,技术路线实际上正在逐渐收敛。

未来高端通用灵巧手很可能形成这样的典型架构:

五指仿人结构

15—25个左右主动自由度

轻量化驱动

触觉传感器

可反驱和柔顺控制

掌内视觉

机器人基础模型

其中驱动方式仍然可能存在两种主要方向:

一种是:

电机直接或者通过减速器安装在手内。

另一种就是 Tesla、Shadow 等代表的:

驱动器放在前臂,通过腱绳传动。

而对于成本敏感、抓取任务较简单的机器人,则会继续大量使用:

欠驱动和柔顺手。

因此未来不会出现“一种灵巧手统治所有机器人”。


九、真正值得关注的是“手—触觉—AI”闭环

未来机器人手最重要的变化,是它不再只是一个执行器。

它还会成为:

真实世界数据采集设备。

机器人每完成一次抓取,都会产生:

视觉数据;

触觉数据;

关节运动数据;

力矩数据;

成功或失败结果。

这些数据重新进入模型训练。

形成:

机器人操作

获得真实世界数据

训练Physical AI模型

模型能力提升

完成更复杂操作

获得更多数据

这是一个非常重要的闭环。


十、结论:机器人竞争正在从“会走”进入“会用手”

过去的人形机器人竞争主要解决一个问题:

如何让机器人像人一样移动。

现在产业正在进入下一阶段:

如何让机器人像人一样操作物理世界。

因此灵巧手的重要性正在迅速提高。

从全球技术路线来看,可以把未来灵巧手简单概括为三个层面:

机械层:从夹爪走向高自由度、腱驱和柔顺结构;

感知层:从只有视觉走向视觉+触觉+力觉;

智能层:从编程控制走向模仿学习、强化学习和机器人基础模型。

Tesla、Figure、1X、Shadow Robot、Unitree、Wuji、PaXini 等企业虽然采用不同机械结构,但最终方向高度一致:

机器人手不再只是机械末端,而正在成为 Physical AI 与现实世界直接交互的接口。

未来真正领先的企业,未必是自由度最多的公司。

更可能是能够建立完整闭环的公司:

灵巧手

触觉

遥操作数据

仿真训练

机器人基础模型

真实应用场景。

如果说大语言模型解决的是:

AI如何理解数字世界,

那么灵巧手正在解决的则是:

AI如何真正改变物理世界。

这也是为什么未来几年,机器人产业的竞争很可能会从“会走之战”,真正进入一场更困难的——

“会用手之战”。

发表评论

您的邮箱地址不会被公开。 必填项已用 * 标注

Are you human? Please solve:Captcha