过去几年,人工智能产业最受关注的是数据中心:GPU 集群越来越大,模型参数越来越多,电力消耗也越来越惊人。但在另一个方向,一场几乎相反的技术竞赛正在发生——不是把几十万块 GPU 连在一起,而是想办法让越来越强的 AI 塞进一颗几毫米见方、只消耗几毫瓦甚至更低功耗的芯片里。
这就是正在快速发展的低功耗 Edge AI。
它的核心问题并不是“怎样让边缘设备获得最大的 TOPS”,而是:怎样在有限的电池、散热、存储器和成本预算下,让设备持续感知、理解环境,并在本地做出判断。 2026 年 7 月发布的 MLPerf Tiny v1.4(MLPerf Tiny 是一套专门衡量微控制器等超低功耗设备上 AI 推理性能、准确率和能效的标准化基准测试体系) 已经明确把延迟、准确率和能耗同时作为超低功耗 AI 系统的重要衡量维度。换句话说,对这一类设备而言,“每焦耳完成多少有效 AI 工作”往往比峰值 TOPS 更重要。

Edge AI 正在从“本地推理”走向“持续智能”
传统物联网设备通常只是采集数据。传感器测到声音、振动、温度、图像或者人体运动之后,将数据通过 Wi-Fi、4G、蓝牙或者工业网络送往服务器,再由服务器分析。
这种架构的问题越来越明显。无线传输本身需要能量,大量原始数据上传会增加带宽和云计算成本;涉及声音、视频和健康信息时,还会产生隐私问题;对于工业控制、机器人、医疗设备等实时系统,网络延迟和断网也不能被忽视。
Edge AI 的思路是把计算向数据产生的位置移动:
Sensor → Local AI → Decision → 必要时上传。
低功耗 Edge AI 又把这件事情推进了一步。设备并不是偶尔启动 AI,而是希望 AI 可以长期甚至永久处于工作状态。语音唤醒、跌倒检测、设备异常监测、智能戒指健康分析、摄像头人物检测和智能眼镜环境感知,都属于典型的 always-on intelligence。
于是一个新的工程问题出现了:如果 AI 每天运行 24 小时,哪怕每次推理只消耗很少电力,长期积累后的能耗仍然非常可观。因此,低功耗 Edge AI 实际上正在推动半导体行业重新设计从晶体管、电源管理、CPU、NPU、SRAM,一直到模型和 Runtime 的整条计算链路。
Ambiq:从降低晶体管电压开始解决 AI 功耗
Ambiq 是这一技术路线中相当典型的一家公司。
它与很多 AI 芯片公司的不同之处在于,Ambiq 最初并不是从 NPU 或神经网络加速器出发,而是从超低功耗集成电路设计出发。其核心 SPOT——Subthreshold Power Optimized Technology,目标就是让芯片能够在亚阈值和近阈值电压区间可靠工作。
由于 CMOS 动态功耗与供电电压高度相关,降低电压本身就是降低功耗最有效的方法之一。但电压越来越低之后,晶体管速度、噪声裕量、工艺波动和存储器可靠性都会成为问题。Ambiq 因此从电路、标准单元、存储器、电源管理和系统架构等多个层面进行优化。
这种思路在它最新的 Atomiq SoC 上表现得尤其明显。
2026 年 1 月发布的 Atomiq 集成 Arm Ethos-U85 NPU,AI 性能超过 200 GOPS,面向计算机视觉、多语言语音识别、传感器模型乃至一定程度的本地推理任务。更值得注意的是,Ambiq 在 2026 年 3 月宣布将 SPOT 首次带入 TSMC 12nm FinFET 工艺,Atomiq 的超低功耗模式目标工作电压可以低至 300mV;处理器、NPU 和多媒体引擎都可以进入这一低电压体系。Atomiq110 目前仍处于走向样片阶段,计划在 2027 年进入生产,因此它代表的是 Ambiq 下一阶段的技术方向,而不是已经全面量产的成熟平台。
这件事情的重要性在于,Ambiq 正试图证明:低功耗技术不仅适用于简单 MCU,也可以扩展到真正拥有 NPU 的 AI SoC。
过去低功耗 MCU 主要运行关键词识别、简单动作分类或者振动异常检测;如果 Atomiq 这类架构成功,电池供电设备能够承担的任务可能进一步扩展到复杂语音、视觉和多模态感知。
MCU 正在集体长出 NPU
Ambiq 并不是孤例。整个 MCU 行业实际上正在经历一次非常明显的结构变化:
CPU + DSP → CPU + SIMD → CPU + NPU。
STMicroelectronics 的 STM32N6 是其中非常有代表性的产品。它采用 800MHz Cortex-M55,同时集成 ST 自研的 Neural-ART NPU,AI 算力达到 600 GOPS,并配置 4.2MB 片上 RAM、ISP、摄像头接口和 H.264 硬件编码能力。过去需要 Cortex-A 应用处理器甚至 Linux 系统才能完成的一部分机器视觉任务,现在开始能够直接运行在 MCU 级平台上。
Renesas 的 RA8P1 则采用最高 1GHz 的 Cortex-M85,并集成 Arm Ethos-U55,AI 性能达到 256 GOPS,定位于机器视觉、语音、人机界面和实时工业控制。它体现出另一个重要趋势:Edge AI 和传统实时控制开始进入同一颗 MCU,而不再一定需要“AI 处理器 + 控制 MCU”两套系统。
NXP 的 MCX N 系列采用自己的 eIQ Neutron NPU。NXP 将 Neutron 设计成一种可扩展 AI 加速器架构,希望从 MCU 一直扩展到 i.MX 应用处理器,并通过统一的 eIQ 软件环境完成模型部署。NXP 给出的案例中,MCX N94x 的 Neutron NPU 相比仅使用 CPU 可以获得最高数十倍级别的推理加速。
Infineon 的 PSOC Edge 又展示了另一种非常有意思的架构。PSOC Edge E83 同时拥有 Cortex-M55 + Ethos-U55,以及低功耗 Cortex-M33 + Infineon 自己的 NNLite AI 加速器。前者负责复杂 AI,后者负责 always-on 的轻量 AI。系统可以长期运行一个极低功耗模型,只有发现感兴趣事件时才唤醒更强的处理单元。
这种“小 AI 唤醒大 AI”的分层架构,很可能成为未来低功耗智能设备的常见设计方式。
有些公司走得更极端:只做几十毫瓦甚至个位数毫瓦的 AI
如果说 STM32N6、RA8P1 和 Atomiq 代表“AI MCU/SoC”,那么另一批公司则把优化目标进一步缩小到 always-on inference。
Syntiant 就是其中的典型代表。它的 Neural Decision Processor 并不追求巨大的通用算力,而是围绕声音、视觉和传感器数据的持续识别设计。NDP250 提供超过 30 GOPS 的硬件加速能力,而其 always-on 图像识别可以运行在 30mW 以下。对于电池摄像头、门铃、耳机或者语音接口来说,这种功耗水平往往比几百 GOPS 的峰值性能更加重要。
Himax WiseEye2 则把这种思路进一步延伸到视觉传感器系统。WiseEye2 将超低功耗 CMOS 图像传感器与 Cortex-M55、Ethos-U55 AI MCU 结合,使整套 always-on vision 系统能够工作在个位数毫瓦级别。摄像头因此不需要不停把完整视频传出去,而可以一直在本地观察环境,只在检测到人、动作或者某种事件时才唤醒后续系统。
Analog Devices 的 MAX78000 则属于这一轮 AI MCU 的较早探索者。它将 MCU 与硬件 CNN 加速器结合,官方给出的应用设计显示,一次 AI 推理可以达到微焦耳级能耗。这种架构特别适合关键词识别、简单视觉和传感器分类。
这些公司的共同逻辑非常清楚:
不是让 AI 尽可能强,而是让 AI 尽可能长时间开着。
AI 正进一步进入传感器内部
低功耗 Edge AI 更值得关注的一个趋势,是 AI 计算正在继续向传感器本身移动。
传统系统是:
Sensor → MCU → AI Accelerator。
现在正在变成:
Intelligent Sensor → Result。
ST 的 ISPU——Intelligent Sensor Processing Unit 就是一种典型实现。它直接把可编程 DSP 放入 MEMS 惯性传感器内部,让振动、运动等数据在传感器芯片内完成信号处理和 AI 判断,主 MCU 可以一直休眠,只有检测到真正有意义的事件才被唤醒。2026 年 ST 又进一步推出 ISPU 2.0,把这种“传感器就是计算节点”的路线继续向前推进。
这对工业状态监测尤其有意义。
过去一个设备振动监测节点可能持续以几 kHz 或几十 kHz 采样,然后不断把数据送给 MCU、网关或者云平台。未来则可能直接在 MEMS 芯片或附近的超低功耗 MCU 上完成频谱分析、异常检测甚至故障分类,只把“正常”“异常”“轴承疑似故障”这样的结果发送出去。
从整个系统来看,最大的节能来源甚至不一定是 NPU 本身,而可能是减少数据搬运、无线通信以及主处理器唤醒次数。
所以,低功耗 Edge AI 的竞争已经不能只看 TOPS
这是理解这一产业非常重要的一点。
一颗芯片宣传 600 GOPS,并不一定比 100 GOPS 的芯片更适合某个产品。真正需要考察的是模型是否能够全部运行在 NPU 上、SRAM 是否足够、外部 DRAM 是否需要长期工作、传感器和 ISP 消耗多少电力、NPU 推理完成以后是否能够快速掉电,以及整个系统一次有效判断到底需要多少能量。
这也是为什么 MLPerf Tiny 正越来越强调energy per inference。
对于云 AI,人们经常讨论 tokens/s;对于低功耗 Edge AI,更合理的指标可能是:
Inference/Joule,或者 Joules/Inference。
例如一个芯片峰值算力很高,但每次推理结束后必须维持大量 SRAM、DDR 和外围设备供电,那么整个系统的能耗未必优秀。相反,一个算力较低的平台如果能够让传感器、SRAM、NPU 和无线模块高度协同工作,最终续航可能更好。
因此 Edge AI 芯片真正竞争的是系统级能源效率。
软件正在成为另一半战场
硬件变化很快,但真正限制低功耗 Edge AI 普及的,经常不是算力,而是模型部署。
云端开发者习惯 PyTorch、TensorFlow 和大容量 GPU;到了 MCU 上,却突然面对几百 KB 到几 MB RAM、INT8 量化、算子支持范围、静态内存分配和 NPU 编译器。
这种割裂正在逐渐改善。
Google 的 LiteRT for Microcontrollers 目前仍然可以在只有很小内存的 MCU 上运行,其核心 Runtime 在 Cortex-M3 上可以控制在约 16KB 规模;整数化模型依然是微控制器 Edge AI 的重要路线。
另一方面,PyTorch 的 ExecuTorch 正快速进入嵌入式市场。它已经支持 Arm Ethos-U55、U65 和 U85,通过 TOSA 与 Vela 编译工具把 PyTorch 模型映射到 NPU。2026 年 PyTorch 和 Arm 又进一步加强了 micro-edge 部署路径。
芯片厂商自己也在建设完整的软件栈。Ambiq 有 Helia 和 neuralSPOT,ST 有 Edge AI Suite,NXP 有 eIQ,Infineon 有 DEEPCRAFT,Renesas 有自己的 AI 开发环境。
这意味着 Edge AI 的竞争正在从:
谁有最好的 MCU
变成:
谁能让一个 PyTorch 模型最快、最稳定、最省电地跑到自己的芯片上。
下一步:Transformer 和小型生成式 AI 开始进入低功耗边缘
过去 TinyML 几乎等同于 CNN、RNN、关键词检测和简单分类。但这一边界正在改变。
Arm 最新一代 Ethos-U85 已经原生支持 Transformer 网络,最高可以扩展到 4 TOPS,并强调相比前代 Ethos-U55/U65 提高能源效率。
Ambiq 的 Atomiq 选择 Ethos-U85,本身就说明它瞄准的并不只是传统 TinyML,而是语音理解、多模态感知以及更复杂的端侧推理。
在更高一级的功耗区间,Qualcomm 的智能眼镜平台已经开始支持直接在眼镜上运行小型语言模型。Snapdragon AR1+ Gen 1 明确把 on-glass SLM 作为能力之一。
这并不意味着几十毫瓦 MCU 很快就能运行今天意义上的大语言模型,而意味着低功耗 Edge AI 的模型类型正在发生变化:从固定分类器逐渐走向更丰富的语义理解、Transformer、小型多模态模型和分层智能体系统。
未来的设备很可能并不会把完整的大模型塞在最低功耗芯片上,而是采用类似:
Sensor AI → Always-on NPU → Local SLM → Phone/Edge Server → Cloud LLM
这样的多级智能架构。
每一级只处理自己最适合处理的问题。
低功耗 Edge AI 很可能成为 Physical AI 的“神经末梢”
如果把 AI 数据中心看作“大脑”,机器人或自动化设备看作“身体”,那么低功耗 Edge AI 很像遍布身体各处的神经末梢。
一个工业机器人可以拥有强大的中央计算机,但它的关节、执行器、电机、摄像头、麦克风、振动传感器和电池节点并不需要把所有原始信号都传回中央处理器。越来越多的局部判断可以直接在传感器附近完成。
智能眼镜也是如此。摄像头不需要不停运行完整视觉模型,麦克风不需要永久运行大型语音模型。可以先由极低功耗 AI 判断“有人说话了吗”“用户正在看什么”“是否发生重要事件”,然后逐层唤醒更强的计算单元。
所以真正成熟的 Edge AI 系统很可能不是拥有一个巨大 NPU,而是拥有一个计算层级体系。
最底层是微瓦到毫瓦级的传感器 AI,其上是十几到几十毫瓦的 always-on AI,再向上是几百毫瓦甚至数瓦的视觉、多模态和 SLM 计算,最终才是云端的大模型。
从 TinyML 到 Ambient Intelligence
从 Ambiq、ST、NXP、Renesas、Infineon,到 Syntiant、Himax、Analog Devices,再到 Arm、Google 和 PyTorch,可以看到一条越来越清晰的技术主线:
Edge AI 正从早期“在 MCU 上跑一个小神经网络”的实验阶段,逐渐变成完整的半导体产业。
过去 TinyML 的典型问题是:
这颗 MCU 能不能跑 AI?
现在的问题正在变成:
在一块小电池上,可以让多强的 AI 一直运行?
这两个问题看起来很接近,实际上意味着完全不同的产业阶段。
前一个问题主要是模型压缩和软件优化问题;后一个问题则涉及芯片工艺、电压、NPU、SRAM、电源管理、传感器、模型架构、Runtime、无线通信以及整个产品系统。
因此,低功耗 Edge AI 真正值得关注的地方,并不是又出现了多少颗“NPU MCU”,而是计算体系正在发生一次向物理世界的迁移。
云端 AI 让计算机开始理解语言和知识;低功耗 Edge AI 则让数以十亿计的真实设备开始看、听、感知并理解周围环境。
Ambiq 提出的“always-on intelligence”,Himax 的 always-on vision,Syntiant 的 always-on audio/vision,以及 ST 将 AI 直接放入 MEMS 传感器中的尝试,其实都指向同一个终点:
AI 不再是一段偶尔被调用的软件,而会逐渐成为设备持续运行的基础能力。
下一代 Edge AI 的真正竞争,或许不是谁拥有最大的 TOPS,而是谁能够用最少的能量,让智能存在得更久、更靠近数据、更靠近真实世界。