Perceptron AI刚刚发布的 Isaac 0.5,是近期机器人基础模型中相当值得关注的一次发布。它真正有意思的地方,并不只是LIBERO分数达到97.2%,而是试图回答Physical AI一个更基础的问题:
能不能用廉价、海量的普通视频,大幅减少昂贵的机器人遥操作数据?
如果这一思路能够被独立验证,它对机器人产业的影响可能比某一个Benchmark领先零点几个百分点更大。
Isaac 0.5是一个360亿参数的稀疏具身基础模型,把视频理解、空间定位、具身推理和机器人控制放进同一个共享Backbone。它能够同时读取图像、视频、语言指令、机器人状态以及过去动作,并输出语言回答、物体定位、任务进度,以及连续或离散机器人动作。360亿是总参数,但通过稀疏专家路由,单个Token实际激活约25亿参数。(Pub)

这与很多传统VLA模型存在一个重要区别。
过去比较常见的是:
视觉语言模型 → 得到表示 → 另外接一个机器人Policy。
Isaac 0.5则希望:
视频理解、推理和动作控制共同训练一个表示。
这样,模型从普通视频中学到的“物体状态发生了什么变化”,理论上可以直接传递给机器人动作模块,而不是停留在视觉理解层。连续动作由独立的Flow Expert和Diffusion Transformer输出,离散动作则采用FAST Token接口。(Pub)
最值得关注的是“100万小时视频”
Isaac的训练数据包括约3万亿多模态Token、100万小时普通视频、37.5万小时第一视角视频、37.5万小时UMI手持夹爪视频,以及10万小时机器人相关经验,机器人部分覆盖35种以上本体配置。10万小时中又包括约1万小时高质量遥操作、4万小时广义机器人交互,以及5万小时游戏和仿真数据。(Pub)
这里真正值得关注的是Perceptron报告的Scaling实验。
当普通视频从1000小时增加到100万小时后,为达到同一个离线Action Loss阈值,所需要的机器人遥操作数据从约:
5884小时 → 28小时
下降约210倍。(Pub)
如果只看这个数字,很容易得出一个过于激进的结论:
普通视频可以取代机器人数据。
实际上论文自己明确否定了这种解释。
当机器人遥操作数据只有1小时时,增加普通视频几乎没有明显效果;大约拥有100小时以上动作Grounding以后,扩大视频规模的收益才稳定出现。研究者因此明确指出:视频提高的是机器人数据效率,而不是替代动作数据。 (Pub)
这一点非常重要。
更准确的Physical AI数据路线可能不是:
Video → Robot
而是:
海量Video学习“世界如何变化”
少量Robot Data学习“我的身体如何造成这些变化”
↓
Robot Policy
这很可能成为机器人基础模型未来最重要的Scaling路线之一。
Benchmark很强,但不要过度解读97.2%
Isaac 0.5在LIBERO四个任务组经过Benchmark-specific adaptation后,平均成功率达到97.2%,其中Spatial 98.0%、Object 99.0%、Goal 98.8%、Long 93.0%。这一成绩略高于论文列出的GR00T N1.7的97.0%和π0.5的96.9%,与MolmoAct2的97.2%相当。(Pub)
所以严格来说,它不是简单意义上的“全面SOTA碾压”。
更应该关注两个结果。
一是它的少样本适应能力。论文称,对单个专家示范训练一个Epoch后,未见任务的Action Loss能够降低约7—10.5倍,提升幅度明显高于其比较基线。(Pub)
二是它说明“通用具身模型”仍然离真正的Zero-shot机器人控制有明显距离。
在LIBERO-Long上,Isaac未经适配时成功率只有6%;只微调Flow/DiT动作专家后就提高到91%,完整Fine-tuning达到93%。(Pub)
这组数据非常有价值,因为它揭示现实:
基础模型提供了很强的知识和表示,但换一台机器人、换一种任务以后,目前仍然需要Action Adaptation。
所谓“一个模型控制所有机器人”,目前距离真正即插即用还很远。
“完全开放”也需要打一个小问号
Perceptron在LinkedIn中称Isaac 0.5为“fully open”。从机器人领域来看,它的开放程度确实相当高:模型权重、训练/推理与适配代码、评测设置,以及35种以上本体的部署配置都已发布;GitHub代码使用Apache 2.0许可证。(GitHub)
但从严格意义上的完全可复现开源来看,还不能这么说。
论文最核心的技术之一,是一种从无动作视频中预测未来“task-relevant percepts”的自监督目标,但研究者明确表示,其目标构造方法和Loss实现仍然是专有的。此外GitHub也注明,mHarmony与TensorStream单独维护,目前一个干净的Repository Checkout还不足以直接完成完整训练或推理。(Pub)
因此称它为:
高开放度的Open-weight模型
比“完全开源”更加准确。
还有一个现实问题:它暂时并不“Edge”
Isaac虽然采用稀疏架构,360亿参数中每Token只激活约25亿,但目前论文给出的推理估计仍是在H100 80GB上:大约70毫秒一次策略请求,对应约14.3Hz,FP8 Checkpoint约36GB。相比之下,GR00T N1.7公布的数据约27.9毫秒、35.9Hz。(Pub)
所以Isaac 0.5现在更像一个强大的机器人Foundation Model,而不是可以轻松装进低成本机器人控制器的模型。
这也是后续必须观察的方向:蒸馏、量化、小模型版本以及Jetson级Edge部署。
怎么评价Isaac 0.5?
我认为Isaac 0.5最重要的贡献,不是“又出现一个97%的机器人模型”,而是把Physical AI的数据问题进一步量化了。
大语言模型之所以爆发,是因为找到了一种可以规模化获得训练数据的方法——互联网文本。
机器人目前最大的难题恰恰是缺少自己的“互联网”。
Isaac 0.5提出的答案是:
不要等待100万小时机器人数据,而是先让模型看100万小时世界,再用相对少量机器人数据把“看懂世界”Ground到“改变世界”。
从这个角度看,它真正值得持续追踪的不是LIBERO排行榜,而是这个 Video → Robot Data Efficiency 的Scaling关系能否被其他团队、其他机器人和真实工业任务重复出来。
如果210倍的数据效率提升具有普遍性,那么Physical AI最昂贵的生产资料——机器人遥操作数据——其经济模型可能会被明显改变。
这才是Isaac 0.5最值得重视的地方。(Pub)
Isaac 0.5 GitHub仓库
Isaac 0.5技术报告