从机械手到 Physical AI:全球机器人灵巧手技术路线综述
过去几年,人形机器人的竞争重点主要是“能不能站稳、走路和跑步”。但随着双足运动控制逐渐成熟,产业界越来越发现,真正决定机器人能否进入工厂、仓库和家庭的关键,正在从“腿”转向“手”。
机器人走到工作台前并不算太难,真正困难的是拿起螺丝、插接头、整理线缆、使用工具、抓取柔软物体,甚至仅凭触觉判断物体是否滑动。
因此,灵巧手正在成为 Physical AI 最关键的硬件之一。
但当前行业讨论灵巧手时经常把“自由度”“腱绳”“触觉”“强化学习”“五指结构”等概念混在一起。实际上,灵巧手应该从三个不同层面理解:
第一层:机械结构——手到底怎么动;
第二层:感知系统——手怎么知道自己碰到了什么;
第三层:智能控制——机器人怎么学会使用这只手。

一、第一层:机械结构路线——手到底怎么动
从机械设计角度看,目前全球灵巧手大体可以分成三条主要路线。
路线一:高自由度、全驱动灵巧手
这是最接近人手的一种设计。
基本思路是:
一个关节对应一个执行器或独立控制通道。
人的手拥有大量可以独立运动的关节,因此这种路线通常追求十几个甚至二十多个主动自由度。
它的最大优势是:
手指能够真正独立运动。
机器人不仅能够抓取,还可以完成:
捏、旋转、拨动、侧向夹持、调整物体姿态等复杂动作。
这类灵巧手特别适合所谓的“手内操作”,也就是物体已经抓在手中以后,机器人仍然可以利用手指改变它的位置和方向。
典型代表包括:
Shadow Dexterous Hand、Unitree Dex5-1、Wuji Hand,以及部分 Allegro Hand 产品。
其中 Shadow Robot 是这一领域最经典的研究平台之一。
这类路线的问题同样非常明显:
自由度越多,就意味着电机越多、传感器越多、控制变量越多。
随之而来的问题包括:
重量增加、功耗增加、成本增加、控制复杂度上升。
因此,高自由度并不等于一定更加实用。
路线二:腱绳驱动——把“肌肉”放到前臂
第二条路线同样追求高自由度,但机械布局完全不同。
它采用一种非常接近人体结构的设计:
电机安装在手掌之外,通过绳索或者类似肌腱的结构拉动手指。
人体实际上就是这种结构。
人的手指内部并没有装满肌肉,相当一部分控制手指运动的肌肉位于前臂,通过肌腱驱动手指。
机器人也可以采用类似设计:
前臂执行器
↓
腱绳
↓
手指关节
这种结构最大的优势是:
可以显著减轻手掌重量。
如果把二十多个电机都塞进机器人手掌,手会非常笨重。
而机器人末端越重,手腕和手臂需要承担的负载越大,快速操作就越困难。
因此,把驱动器移到前臂实际上是在解决一个非常典型的灵巧手矛盾:
自由度越高,需要的电机越多;
电机越多,手又越重。
Tesla Optimus 就是目前这条路线最值得关注的代表之一。
Tesla 新一代 Optimus 手部采用高自由度五指结构,并把大量执行器集中在前臂,再通过控制缆索驱动手指。
它的思路并不是简单追求更多关节,而是希望同时解决:
高自由度、轻量化和规模化制造。
Shadow Robot 也长期采用腱绳驱动。
因此可以看到:
Tesla 与 Shadow 在机械传动思想上存在相似性,但产品目标完全不同。
Shadow 更偏向科研和极限灵巧性;
Tesla 更强调与人形机器人整机结合以及未来的大规模生产。
路线三:欠驱动与柔顺设计
第三条路线与前两种思路明显不同。
它并不追求每一个关节都独立控制。
核心思想是:
不需要精确控制所有手指关节,而是让机械结构自己适应物体。
这就是所谓的:
欠驱动。
例如一只手可能拥有十几个关节,但实际上只需要几个电机。
电机拉动机械结构后,手指会根据被抓物体的形状自动改变姿态。
意大利 qbrobotics 的 SoftHand 就是这条路线的典型代表。
这种设计可以理解成:
把一部分“智能”放进机械结构里。
机器人抓一个杯子时,不需要提前计算每根手指应该弯曲多少角度。
手接触杯子以后,柔顺结构会自然贴合杯子表面。
优点非常明显:
结构简单、重量低、抗冲击、控制容易。
而且在很多工业抓取场景中,实际上非常实用。
缺点同样明显:
因为很多关节不能完全独立控制,因此在精密操作方面通常不如全驱动灵巧手。
例如:
旋转一颗小螺丝、摆弄钥匙、操作非常小的连接器,
就可能比较困难。
因此未来机器人并不会全部采用二十多个主动自由度的五指手。
更可能形成长期并存:
两指夹爪
三指手
欠驱动五指手
高自由度五指手
不同任务选择不同结构。
二、第二层:从“会动”到“有感觉”
机械结构只解决一个问题:
手能不能运动。
但真正灵巧的机器人还必须解决第二个问题:
机器人知不知道自己正在碰什么。
这就是触觉。
早期机器人主要依靠视觉。
摄像头告诉机器人:
“杯子在那里。”
但是当机器人真正抓住杯子以后,还需要知道:
有没有碰到?
抓力够不够?
杯子是否正在滑动?
有没有夹得过紧?
这些问题仅靠视觉并不好解决。
因此当前高端灵巧手正在快速加入触觉传感器。
第一阶段:简单接触和压力感知
最基础的触觉系统,只需要回答:
碰到了没有,以及压力有多大。
这已经可以显著改善抓取。
例如 Unitree Dex5-1 等新一代灵巧手,开始在手指表面布置大量压力感知点。
机器人不仅知道手指已经接触物体,还能够判断不同区域承担了多少力量。
第二阶段:高密度触觉
下一步的发展是:
一根手指本身就像一块高分辨率触觉相机。
它不仅能够检测压力,还可以判断:
接触位置、接触面积、剪切力以及物体是否正在滑动。
Meta 推出的 Digit 系列人工指尖就是这种路线的重要代表。
这种技术的意义非常类似摄像头从几个像素发展到高分辨率图像。
未来机器人可能不再只是知道:
“食指碰到了东西。”
而是可以获得一张“触觉图像”。
第三阶段:视觉与触觉融合
更进一步的路线,是在机器人手内部直接加入摄像头。
例如 Figure、PaXini 等方案已经开始采用:
掌内视觉+手指触觉。
为什么要把摄像头装到手上?
因为机器人把手伸进柜子、箱子或者机器内部以后,头部摄像头经常会被手臂挡住。
此时:
头部摄像头负责大范围定位;
掌内摄像头负责近距离观察;
手指触觉负责最后的接触判断。
最终形成:
视觉负责“看”,
触觉负责“摸”。
这很可能成为下一代高级灵巧手的标准架构。
三、第三层:控制路线——机器人怎样学会“用手”
一只拥有20个自由度的灵巧手,机械结构可能已经非常接近人手。
但问题随之而来:
20个关节到底应该怎么同时运动?
传统机器人主要采用程序控制。
工程师提前告诉机器人:
第一关节转多少度;
第二关节转多少度;
什么时候闭合手指。
对于固定生产线,这种方法很好。
但进入家庭或者复杂工业现场以后,这种方式很快失效。
因为真实世界里几乎没有两个物体完全相同。
因此灵巧手控制正在发生一次非常重要的变化:
从“编程控制”转向“学习控制”。
第一阶段:遥操作采集数据
机器人首先模仿人。
操作人员可以使用:
数据手套、VR设备、动作捕捉设备,
控制机器人完成任务。
例如:
拿杯子、拧瓶盖、插接插件。
机器人同步记录:
摄像头图像
关节角度
手指位置
电机力矩
触觉数据
最终任务结果
这些数据成为机器人学习的训练数据。
第二阶段:模仿学习
机器人学习大量人类操作数据以后,可以开始自己完成类似任务。
这就是模仿学习。
简单理解:
人先做很多遍,机器人从数据里学习。
但真实世界中的情况太多,因此仅靠模仿学习仍然不够。
第三阶段:强化学习和仿真
机器人还可以进入虚拟环境进行大量训练。
例如:
MuJoCo、Isaac Sim 等仿真平台。
在现实世界中训练一百万次可能需要几个月。
但在虚拟环境中,可以同时运行成千上万个机器人。
机器人不断尝试:
抓取、旋转、插入、调整抓力。
失败以后再次尝试。
最终通过强化学习获得更加稳定的动作策略。
第四阶段:机器人基础模型
目前更前沿的方向,是把灵巧手直接连接到机器人基础模型。
这类模型不再只控制:
“某根手指应该转多少度。”
而是理解一个更高级的任务:
“把插头插进去。”
然后模型自己完成:
识别插头;
规划手臂路径;
决定抓取位置;
控制手指;
检测接触;
调整抓力;
完成插入。
Google DeepMind、NVIDIA、Figure 等公司目前都在朝这个方向发展。
这也是 Physical AI 真正重要的地方。
四、各厂商技术路线比较
经过上述分类,全球主要灵巧手方案就可以清晰定位。
| 企业/产品 | 机械路线 | 感知路线 | 主要定位 |
|---|---|---|---|
| Shadow Hand | 高自由度+腱驱动 | 多传感器 | 科研、高灵巧操作 |
| Tesla Optimus Hand | 高自由度+前臂腱驱 | 触觉 | 人形机器人+规模化制造 |
| Unitree Dex5-1 | 高自由度 | 高密度触觉+可反驱 | 人形机器人与学习控制 |
| Wuji Hand | 高自由度独立驱动 | 力控/触觉扩展 | 高自由度通用平台 |
| qbrobotics SoftHand | 欠驱动+柔顺 | 接触/力控 | 简单、可靠、自适应抓取 |
| Allegro Hand | 高自由度 | 压力/触觉 | 科研与机器人学习 |
| PaXini | 高自由度 | 高密度触觉+掌内视觉 | 触觉智能 |
| Figure Hand | 高自由度整机设计 | 指尖触觉+掌内视觉 | AI与硬件一体化 |
| 1X NEO Hand | 腱驱+低减速比 | 触觉+力透明 | 家庭机器人自然操作 |
这样来看就会发现:
这些公司实际上并不是在一条直线上竞争。
它们是在不同维度做选择。
五、Tesla 为什么值得单独关注
Tesla Optimus 的灵巧手尤其值得关注,不是因为它单纯拥有更多自由度。
而是因为它同时解决三个问题:
高自由度、轻量化、量产。
Tesla 把大量驱动机构放入前臂,通过腱绳驱动手指。
这与人体结构高度相似。
其工程目标非常明确:
手掌尽可能轻,驱动能力尽可能强。
这对于人形机器人非常重要。
因为人形机器人每天可能需要完成成千上万次:
抓取、搬运、旋转、按压、使用工具。
如果手过重,不但增加能耗,还会降低整个手臂的动态性能。
Tesla 与 Shadow Robot 等科研灵巧手最大的区别,也正是在这里:
Shadow 的目标是:
最大程度探索机器人灵巧操作能力。
Tesla 的目标则是:
能不能把这种灵巧手真正做成百万级工业产品。
后者可能更加困难。
六、未来真正竞争的不是“谁自由度最多”
目前很多灵巧手宣传仍然强调:
16自由度、20自由度、22自由度。
但未来这个指标的重要性可能会下降。
因为当主动自由度达到一定水平以后,真正决定机器人能力的是:
触觉质量、力控、机械可靠性以及AI控制能力。
一只20自由度的手,如果没有触觉,机器人仍然不知道自己是否抓牢物体。
一只拥有高精度触觉的手,如果机械结构容易损坏,也无法真正进入工厂。
因此真正优秀的灵巧手应该同时具备:
足够的自由度
轻量化
触觉感知
柔顺控制
可反驱
高可靠性
低成本
AI接口
七、灵巧手最大的产业化难题
今天机器人做出一次复杂手部动作已经不是最困难的问题。
真正困难的是:
一天做一万次,一年做几百万次以后还能不能正常工作?
灵巧手可能是人形机器人中最容易磨损的部件之一。
因为它需要频繁:
摩擦、碰撞、弯曲、接触物体。
腱绳可能拉伸;
齿轮可能磨损;
传感器可能漂移;
柔性表皮可能损坏。
所以未来灵巧手真正的大规模应用,很可能不是首先比谁的动作最漂亮,而是比:
寿命、维护成本和单次操作成本。
这也是 Tesla 等整机厂商特别强调工程化和制造能力的原因。
八、未来技术路线正在收敛
尽管今天灵巧手看起来方案很多,但从整体趋势来看,技术路线实际上正在逐渐收敛。
未来高端通用灵巧手很可能形成这样的典型架构:
五指仿人结构
+
15—25个左右主动自由度
+
轻量化驱动
+
触觉传感器
+
可反驱和柔顺控制
+
掌内视觉
+
机器人基础模型
其中驱动方式仍然可能存在两种主要方向:
一种是:
电机直接或者通过减速器安装在手内。
另一种就是 Tesla、Shadow 等代表的:
驱动器放在前臂,通过腱绳传动。
而对于成本敏感、抓取任务较简单的机器人,则会继续大量使用:
欠驱动和柔顺手。
因此未来不会出现“一种灵巧手统治所有机器人”。
九、真正值得关注的是“手—触觉—AI”闭环
未来机器人手最重要的变化,是它不再只是一个执行器。
它还会成为:
真实世界数据采集设备。
机器人每完成一次抓取,都会产生:
视觉数据;
触觉数据;
关节运动数据;
力矩数据;
成功或失败结果。
这些数据重新进入模型训练。
形成:
机器人操作
↓
获得真实世界数据
↓
训练Physical AI模型
↓
模型能力提升
↓
完成更复杂操作
↓
获得更多数据
这是一个非常重要的闭环。
十、结论:机器人竞争正在从“会走”进入“会用手”
过去的人形机器人竞争主要解决一个问题:
如何让机器人像人一样移动。
现在产业正在进入下一阶段:
如何让机器人像人一样操作物理世界。
因此灵巧手的重要性正在迅速提高。
从全球技术路线来看,可以把未来灵巧手简单概括为三个层面:
机械层:从夹爪走向高自由度、腱驱和柔顺结构;
感知层:从只有视觉走向视觉+触觉+力觉;
智能层:从编程控制走向模仿学习、强化学习和机器人基础模型。
Tesla、Figure、1X、Shadow Robot、Unitree、Wuji、PaXini 等企业虽然采用不同机械结构,但最终方向高度一致:
机器人手不再只是机械末端,而正在成为 Physical AI 与现实世界直接交互的接口。
未来真正领先的企业,未必是自由度最多的公司。
更可能是能够建立完整闭环的公司:
灵巧手
+
触觉
+
遥操作数据
+
仿真训练
+
机器人基础模型
+
真实应用场景。
如果说大语言模型解决的是:
AI如何理解数字世界,
那么灵巧手正在解决的则是:
AI如何真正改变物理世界。
这也是为什么未来几年,机器人产业的竞争很可能会从“会走之战”,真正进入一场更困难的——
“会用手之战”。