NVIDIA Cosmos 3 Edge:能够直接部署在机器人、智能摄像机和边缘计算设备上的小型“世界模型”

Japan’s Robotics and Manufacturing Leaders Build on NVIDIA Cosmos to Advance Physical AI ...
NVIDIA Cosmos 3 Edge

NVIDIA Cosmos 3 Edge 可以理解为一套能够直接部署在机器人、智能摄像机和边缘计算设备上的小型“世界模型”。它不仅识别画面中的物体,还试图理解物体之间的空间关系、运动变化和因果关系,预测接下来可能发生什么,并进一步生成机器人应当执行的动作。

该模型于2026年7月15日由 NVIDIA 正式宣布,模型权重、代码和模型卡于7月20日在 Hugging Face 与 GitHub 发布。它包含约 40亿个参数主要面向机器人、自动驾驶、智能基础设施和工业视觉等 Physical AI 场景。(NVIDIA Newsroom)

在 Cosmos 3 产品线中:

  • Cosmos 3 Edge:40亿参数,侧重边缘端和单GPU部署;
  • Cosmos 3 Nano:160亿参数,侧重工作站级推理;
  • Cosmos 3 Super:640亿参数,面向数据中心、高质量世界生成和复杂物理推理。

因此,尽管名字中有“Edge”,它实际上比被称为“Nano”的版本更小,更强调本地实时运行。(Hugging Face)

它与普通视觉大模型有什么不同

普通视觉语言模型通常完成的是“看图并回答问题”,例如识别机械臂、箱子或车辆。Cosmos 3 Edge 希望进一步回答三个问题:

现在发生了什么、接下来可能发生什么、机器应该采取什么动作。

例如,机械臂准备抓取香蕉时,模型不仅要识别香蕉,还需要理解夹爪与香蕉之间的位置关系,预测夹爪移动和接触后的视觉变化,并生成能够完成抓取和放置任务的动作序列。这种同时包含环境理解、未来预测和动作生成的模型,被 NVIDIA 称为 World Action Model,世界动作模型。(Hugging Face)

它可以完成三类相互关联的任务:

  • 正向动力学:给定当前画面和动作,预测动作执行后世界会怎样变化;
  • 逆向动力学:观察前后画面变化,推断中间发生了什么动作;
  • 策略生成:根据当前观察和任务指令,同时生成动作以及预期的视觉结果。

这意味着它不只是“机器人控制模型”,也可以作为训练机器人策略、生成带动作标注的数据和验证控制结果的基础模型。(Hugging Face)

双塔 Mixture-of-Transformers 架构

Cosmos 3 Edge 采用 NVIDIA 所称的 Mixture-of-Transformers,MoT 架构,内部包含两个相互配合的 Transformer:

自回归推理塔负责处理文字、图像和视频信息,用类似大语言模型逐个生成词元的方式进行场景理解、规划和视觉推理。

扩散生成塔负责生成图像、视频和动作轨迹,通过逐步去噪形成未来画面或控制序列。

两个塔保留各自的归一化层和前馈网络,但共享多模态注意力层,使语言、视频、环境状态和动作能够进入统一的表示空间。模型可以先“理解和推理”,再根据理解结果生成未来状态或动作。(Hugging Face)

动作在模型中被表示为包含平移、旋转和操作状态的几何向量。不同机器人和设备使用不同维度,例如单机械臂、双机械臂、自动驾驶车辆和相机运动可以分别映射到相应的动作表示。这种设计试图建立“像素变化—空间运动—控制命令”之间的直接联系。(Hugging Face)

所谓“15 Hz实时控制”如何理解

NVIDIA 宣称,经过机器人策略后训练的 Cosmos 3 Edge 能够在 Jetson Thor 上根据机器人视觉观察,一次推理生成32个未来动作,并支持15 Hz控制频率。公开文章给出的机器人控制观察分辨率为640×360。(Hugging Face)

这里容易产生一个误解:它并不是每秒完整运行模型15次。模型采用的是动作分块机制,一次生成未来32个控制时刻的动作;机器人按15 Hz依次执行这些动作,在执行当前动作块的同时,系统可以准备下一个动作块。32个动作在15 Hz下可覆盖约2.13秒,因此只要一次推理在2.13秒内完成,就能够维持连续控制。

详细模型卡显示,在特定PyTorch配置下,Jetson AGX Thor T5000完成一个32动作块的中位端到端延迟约为1.528秒,满足15 Hz实时预算;但T4000、T3000和T2000在同一测试中没有达到15 Hz预算,其中部分设备仍可满足5 Hz控制。也就是说,“Jetson Thor支持15 Hz”主要指高配T5000及特定优化配置,并不代表所有Thor模块都能达到这一水平。(Hugging Face)

此外,发布文章和详细模型卡使用的输入尺寸、去噪步数和运行栈并不完全相同,因此这些性能数据只能在各自测试条件下理解,不能直接推广到所有机器人任务。

开放程度与开发方式

NVIDIA 同时发布了基础模型、Cosmos Framework、后训练脚本和参考策略模型。其中 Cosmos 3 Edge Policy DROID 是一个基于DROID机器人数据集后训练的机械臂操作策略,可根据语言指令和视觉观察生成抓取、移动和放置动作。(Hugging Face)

模型采用 OpenMDW 1.1 许可证,模型卡标明可用于商业和非商业用途。不过,“开放模型”并不等于可以不受条件限制地使用,实际产品仍应核查许可证、数据来源、下游用途和地区性监管要求。(Hugging Face)

部署方面还有几个现实限制:

  • 官方目前仅测试了Linux,其他操作系统尚未验证;
  • 目前正式测试的精度主要是BF16,FP4、FP8和FP16尚未被官方列为受支持配置;
  • 模型主要针对NVIDIA GPU、CUDA和Jetson生态优化;
  • 当前Edge模型卡明确列出的接口主要覆盖文字、图像、视频和动作;虽然完整Cosmos 3架构也包含音频模态,但不能据此认定现阶段所有Edge工作流都已支持音频。(Hugging Face)
主要应用方向

在机器人领域,它可用于机械臂抓取、移动机器人导航、人机协作和任务规划;在自动驾驶领域,可用于理解道路场景、推测其他交通参与者意图,以及预测车辆动作带来的后果;在智能基础设施领域,则可以分析实时视频流,用于交通监测、工业检查、物流管理和安全事件识别。(NVIDIA Blog)

对于工业设备监测,Cosmos 3 Edge 更适合作为上层视觉理解和决策模块:例如观察操作人员行为、识别设备状态、分析事件前后的视频变化并生成处理建议。它并不适合直接替代针对振动、电流、声音或温度信号训练的轻量级异常检测模型。更现实的系统架构是:传统传感器模型负责快速、稳定地发现异常,Cosmos 3 Edge 负责结合视频和任务上下文解释异常,并辅助生成处置动作。

应当如何评价

Cosmos 3 Edge 的重要意义并不只是将视觉大模型压缩到40亿参数,而是尝试把感知、推理、预测、模拟和动作生成放入一个可以在机器人本地运行的统一模型中。它体现了机器人AI从“识别物体”向“理解环境变化并决定行动”的转变。

但它仍不是严格的物理仿真器。NVIDIA 在模型卡中明确指出,模型没有显式的物理引擎,对三维几何、物体持续存在、接触动力学和物理规律的理解只是统计近似,可能出现物体消失、形状变化、碰撞不真实、动作漂移和因果判断错误等问题。其输出不能直接视为精确物理仿真结果,也不能作为经过安全认证的机器人控制决策;实际部署仍必须增加传统控制器、安全联锁、碰撞检测、约束规划和独立验证机制。(Hugging Face)

总体而言,Cosmos 3 Edge 更像是一个面向 Physical AI 的边缘端基础模型底座,而不是下载后即可安全控制任意机器人的通用“大脑”。它降低了开发机器人世界模型和视觉智能体的起点,但从基础模型到可靠工业产品之间,仍需要大量领域数据、后训练、实时优化和系统安全工程。

发表评论

您的邮箱地址不会被公开。 必填项已用 * 标注

Are you human? Please solve:Captcha