SiMa.ai:用功耗10W级MLSoC,把Physical AI真正装进机器

当大模型从云端走向机器人、无人机、工业设备和智能汽车,一个很现实的问题开始出现:这些设备究竟需要什么样的 AI 芯片?

数据中心可以堆叠 GPU,但机器人不行。它既受功耗、散热和体积限制,又要处理摄像头等传感器数据,还要求低延迟甚至离线运行。

成立于 2018 年的美国 AI 芯片公司 SiMa.ai,瞄准的正是这个市场。

它最初专注 Edge AI,如今则把自己定位为 Physical AI——物理 AI计算平台。其核心思路不是简单造一颗更快的 NPU,而是尝试把感知、视觉处理、神经网络推理、大模型以及应用处理整合进一个低功耗计算平台。

目前这套体系的三个关键部分分别是:

Modalix MLSoC、Palette Neat 和 LLiMa。

SiMa.ai 边缘端物理AI

Modalix:不是一颗简单的 NPU

SiMa.ai 当前最核心的芯片是第二代 Modalix MLSoC。

MLSoC 即 Machine Learning System-on-Chip,可以理解为“机器学习系统级芯片”。

Modalix 提供 50 TOPS AI 算力,典型运行功耗低于 10W。但如果仅仅比较 TOPS,很容易低估这颗芯片。

它真正有特点的地方,在于高度异构的架构。

芯片内部除了 SiMa.ai 自己的 MLA机器学习加速器之外,还集成了八核 Arm Cortex-A65 应用处理器、计算机视觉处理单元、ISP 图像信号处理器、视频编解码器、高速内存接口以及 PCIe、10GbE、MIPI CSI-2 等外围接口。

这些模块通过片上 Network-on-Chip,也就是 NoC 互联。

这意味着 Modalix 面向的不是:

CPU → NPU → 输出结果

这么简单的计算过程,而是更完整的:

Camera / Sensor
↓
ISP与视频处理
↓
传统计算机视觉
↓
CNN / Transformer
↓
LLM / VLM
↓
应用逻辑
↓
控制与输出

例如一台机器人看到一个物体以后,首先要完成图像采集和预处理,然后进行目标检测,再利用视觉语言模型理解场景,最后结合应用逻辑生成动作。

SiMa.ai 希望这条 Pipeline 尽量在一颗 SoC 内完成。

因此,它与很多“外挂式 NPU”的设计哲学并不完全相同。

为什么Physical AI需要异构计算?

这是理解 SiMa.ai 技术路线的关键。

真实世界中的 AI 应用,很少只有神经网络矩阵运算。

以工业机器视觉为例,一套系统可能同时需要图像采集、畸变校正、滤波、视频编解码、目标检测、异常识别以及 PLC 或机器人控制。

其中有些任务适合 AI Accelerator,有些适合 DSP,有些适合 CPU,还有一些必须由 ISP 或专门的视频单元完成。

如果所有东西都交给 GPU,当然具有很好的通用性,但代价通常是更高的功耗、散热和系统复杂度。

SiMa.ai 选择的是另一条路:

针对不同任务配置不同计算单元,再通过统一的软件系统协调这些硬件。

因此,Modalix 的核心指标实际上不是单纯的 TOPS,而是 Performance per Watt——每瓦性能。

SiMa.ai 官方目前将 Modalix 定位为 50 TOPS、10W 以下的 Physical AI 平台。

这对于无人机、移动机器人以及电池供电设备非常重要,因为这些场景往往同时受到 Size、Weight and Power,也就是 SWaP 的严格限制。

从CNN一直做到LLM/VLM

Modalix 另一个值得关注的变化,是它面对的 AI 模型已经远远超出了传统 CNN。

第一代边缘 AI 芯片主要处理 ResNet、YOLO 等视觉网络。

现在 Physical AI 正快速进入 Transformer 时代。

机器人未来不仅需要“看到一个人”,还可能需要理解:

“这个人在工作台旁边,并且正在伸手拿工具,因此机器人应该暂停当前动作。”

这种能力通常需要 VLM,也就是视觉语言模型。

因此 Modalix 从架构设计上就把 Transformer、LLM、大型多模态模型和生成式 AI 纳入支持范围,同时继续兼容传统 CNN 和计算机视觉算法。

SiMa.ai 还开发了 LLiMa,专门解决大语言模型和多模态模型在 Modalix 上的编译、量化和运行问题。

这背后反映出的趋势非常重要:

边缘 AI 芯片正在从“视觉推理芯片”变成“本地智能计算平台”。

未来机器人很可能不是把摄像头图像不断传到云端,而是在设备内部直接完成:

视觉感知 → 语言理解 → 本地知识检索 → 决策 → 动作。

Palette:硬件之外更重要的一层

但专用 AI 芯片一直存在一个难题:

软件生态。

GPU 之所以强大,不只是硬件性能强,更重要的是 CUDA、TensorRT 以及庞大的开发者生态。

因此 SiMa.ai 从一开始就强调自己是一家 software-centric silicon company。

其软件核心是 Palette。

开发者可以把 ONNX 等现有模型导入工具链,由 Palette 完成模型优化、量化、编译以及针对 Modalix 不同计算单元的部署。

从开发流程来看,它更像是在硬件上方建立一层抽象:

模型
↓
编译与优化
↓
硬件资源映射
↓
Runtime
↓
Modalix

这样开发者不必直接处理底层 MLA、CPU、CVU 等硬件之间复杂的资源调度。

换句话说,SiMa.ai 真正想卖的不只是芯片,而是一个 Hardware + Compiler + Runtime 的完整系统。

Palette Neat:让AI帮助开发Physical AI

2026 年 SiMa.ai 又把这条路线向前推进了一步,推出 Palette Neat。

它被定位为面向 Physical AI 的 Agentic Development Environment,也就是智能体式开发环境。

现在官方给出的开发流程已经出现了 Codex、Claude、VS Code 等工具:

开发者 / Coding Agent
↓
Palette Neat
↓
模型编译与优化
↓
Runtime
↓
Modalix

Palette Neat 可以将模型编译、应用构建、部署以及运行环境进一步封装起来。

这件事情的意义可能比单纯增加几十 TOPS 更大。

因为未来 Physical AI 的复杂度会越来越高。

一个机器人应用可能同时包含 YOLO、VLM、语音模型、导航算法、传感器接口以及控制程序。如果每更换一款芯片都要重新适配大量代码,部署成本会非常高。

SiMa.ai 的思路是:

让AI Agent参与AI系统本身的开发。

也就是说,Agentic AI 不只是运行在机器人里面,也开始进入机器人和边缘 AI 平台的工程开发过程。

它真正想挑战的是Jetson

SiMa.ai 的目标市场非常明确。

Modalix 已经形成芯片、SoM、DevKit 和 PCIe 卡等不同形态。

更值得注意的是,SiMa.ai 宣称 Modalix SoM 在外形和引脚设计上与 NVIDIA Orin SoM 兼容,希望降低现有 Jetson 用户迁移到 Modalix 的硬件成本。

这实际上直接暴露了它的竞争策略。

它并不准备通过绝对算力与高端 NVIDIA GPU 正面对抗,而是希望在机器人、无人机、工业视觉等场景中,用:

更低功耗 + 更高集成度 + 完整模型 Pipeline + 更简单的软件迁移

切入 Jetson 已经建立起来的市场。

从技术路线来看,可以把几类平台粗略理解为:

NVIDIA Jetson:GPU + CUDA,强调通用计算能力;

Hailo:高效率 NPU,重点强化神经网络推理;

Qualcomm:CPU + GPU + NPU,延续移动 SoC 的异构路线;

而 SiMa.ai 更强调:

MLSoC + 完整 Physical AI Pipeline + Agentic Software。

SiMa.ai值得关注的并不是“50 TOPS”

因此,如果只是把 SiMa.ai 理解成一家“做50 TOPS AI芯片的创业公司”,实际上会遗漏它最重要的部分。

它正在尝试构建的是一套:

Modalix MLSoC + Palette Neat + LLiMa

组成的完整 Physical AI 计算体系。

前者负责低功耗异构计算,中间层解决模型编译、应用构建和部署,而 LLiMa 则把 LLM/VLM 带到边缘设备。

最终目标非常明确:

让摄像头、传感器、传统视觉算法、神经网络和大模型在同一台低功耗设备内部形成完整闭环。

随着机器人、无人机、工业 AI 和自主设备快速发展,边缘计算竞争的重点正在发生变化。

过去比的是“谁能把一个 CNN 跑得更快”。

下一阶段比的很可能是:

谁能在十瓦级甚至更低功耗内,把感知、理解、推理和控制真正装进机器。

而这正是 SiMa.ai 所押注的方向。

发表评论

您的邮箱地址不会被公开。 必填项已用 * 标注

Are you human? Please solve:Captcha