现在的机器人越来越聪明,已经能看懂画面、听懂人类指令,还能自己规划动作。比如,人对机器人说“把红色积木放进盒子里”,机器人可以通过摄像头找到红色积木,再控制机械臂把它抓起来。
但这类机器人有一个很现实的问题:它们虽然聪明,动作却常常不够流畅。
很多机器人会出现一种“走一步、想一下”的状态。机械臂做完一小段动作后,需要停下来,等待人工智能模型计算下一步。模型越大、任务越复杂,思考时间就越长。最后看起来就像机器人总在犹豫,动作一顿一顿的。
MIT等机构的研究人员提出了一种名为VLASH的新方法,希望解决这个问题。它的核心想法并不复杂,可以概括为一句话:
机器人在执行当前动作时,提前思考下一步。

这和人走路很像。人不会走完一步,站住不动,再考虑下一步迈哪只脚。我们通常是一边走,一边看前方,一边准备接下来的动作。VLASH就是让机器人也具备这种“边做边想”的能力。
传统机器人通常按照这样的顺序工作:先观察环境,然后进行计算,再执行动作。动作完成后,再重新观察、计算和行动。每次计算期间,机器人都可能停顿。
VLASH则让这几个过程重叠起来。机器人在执行当前动作时,后台的人工智能模型同时计算下一段动作。这样一来,机器人就不必停下来等待,整体动作会明显更连贯。
不过,这里面还有一个难题。
假设机器人开始计算下一步时,机械臂还在位置A。模型计算需要几十毫秒,在这段时间里,机械臂仍然继续移动。等计算完成时,机械臂可能已经到了位置B。
但模型刚刚计算出来的动作,仍然是按照位置A设计的。如果机器人在位置B直接执行这套动作,就可能出现轨迹跳动、动作不连贯,甚至抓偏目标。
这就像导航软件根据你十秒钟前的位置给出转弯指令,而你实际上已经开过了路口。
VLASH的解决方法是:不要只根据机器人当前在哪里来规划,而要估算机器人真正开始执行下一步时,会在哪里。
机器人在计算期间要执行哪些动作,系统其实是知道的。因此,它可以提前推算:等这次计算结束时,机械臂大概已经移动到了什么位置。接下来的动作就从这个未来位置开始规划,而不是从已经过时的位置开始规划。
换句话说,机器人不再根据“开始思考时的自己”做决定,而是根据“思考结束时的自己”做决定。
这正是VLASH最重要的特点。
研究人员还发现,仅仅在程序中加入未来位置预测还不够。因为很多机器人模型在训练时,过于依赖摄像头画面,并没有真正学会重视机械臂自身的位置。
例如,即使机械臂已经移动了一段距离,只要摄像头画面变化不明显,模型就可能仍然给出类似的动作。
为了解决这个问题,研究团队改变了训练方式。他们让模型看到同一幅画面,但搭配不同时间点的机械臂位置和动作。模型必须根据机器人自身状态来判断下一步应该怎么做。
经过这种训练后,机器人会更加关注“我的手现在在哪里”,而不只是关注“我看到了什么”。
VLASH还使用了一种叫作“动作量化”的方法。这里的“量化”并不是通常所说的压缩人工智能模型,而是把多个很小的动作合并成一个较大的动作。
比如,机械臂原本需要分三次向前移动,每次移动一点。系统可以把这三个动作合并,让机械臂一次移动更远。这样能够减少动作步骤,让机器人更快完成任务。
当然,动作合并也不能太激进。如果动作跨度过大,机器人可能会失去精细控制能力。在搬运、分类等任务中,稍微粗一点的动作通常没有问题;但在插接零件、精密装配或者与人接触的任务中,动作仍然需要足够细致。
因此,这种方法本质上是在速度和精度之间寻找平衡。
实验结果表明,VLASH在多种机器人任务中都表现出了明显优势。在抓取、堆叠和物体分类任务中,它能够保持较高成功率,同时减少等待时间,让动作更加连续。
在一些动态任务中,它的优势更加明显。
例如,在乒乓球回击实验中,传统方法往往还没有完成计算,球就已经飞过去了。而VLASH通过提前预测和连续计算,能够更快作出反应。在研究人员进行的20次测试中,VLASH成功击中乒乓球11次,而一些对比方法一次也没有成功。

在类似“打地鼠”的快速反应任务中,VLASH的得分也明显高于传统方法。
这些实验说明,对于机器人来说,聪明并不只是知道该做什么,还要能够在正确的时间做出来。
语言模型回答问题时,晚几十毫秒通常没有什么影响。但机器人生活在真实的物理世界中。机械臂在运动,物体在移动,人也可能突然出现。一个动作即使逻辑上完全正确,如果晚了一点执行,也可能变成错误动作。
不过,VLASH还没有解决所有问题。
它主要能够预测机器人自身的位置,却无法准确预测外部世界会发生什么。例如,一个滚动的球可能突然改变方向,一个人可能伸手拿走桌上的物体。机器人可以估算自己几十毫秒后在哪里,却不一定知道周围物体那时在哪里。
此外,现实中的机器人还会受到机械间隙、摩擦、碰撞、负载变化等因素影响。系统预测机械臂会移动到某个位置,实际结果可能存在偏差。因此,真正应用时仍然需要传感器反馈、安全控制器和实时纠错机制。
总体来看,VLASH并不是发明了一个更庞大的机器人“大脑”,而是重新安排了机器人思考和行动的节奏。
它让机器人不必停下来等人工智能模型算完,而是能够一边执行动作,一边准备下一步;同时根据未来位置规划动作,减少新旧动作之间的冲突。
这项研究说明,未来机器人的竞争,不只是看模型有多大、知识有多少,还要看人工智能能否真正跟上物理世界的速度。
只有当机器人能够边看、边想、边行动,并且及时修正自己,它才可能从实验室中的演示设备,逐步变成能够在工厂、家庭、仓库和公共场所稳定工作的实用工具。