论文《Doppio: A Dataset for Contactless Weight Estimation of Falling Particles》研究了一个看起来很简单、实际上很有工业意义的问题:能不能只靠摄像头,看着不断下落的颗粒,就估算出它们的重量?研究团队以咖啡粉为实验对象,希望探索一种“非接触式视觉称重”方法。它的意义并不局限于咖啡,而是指向一个更大的方向:让摄像头和AI逐渐承担传统物理传感器的一部分功能。

传统称重通常需要电子秤、称重传感器或者专门的机械结构,物料必须落到秤上才能测量。但在很多连续生产场景中,粉末和颗粒一直处于运动状态,例如食品加工、药品生产、塑料颗粒输送、化工粉料以及金属粉末送料。这些场景如果希望连续、实时测量物料流量,传统称重系统往往比较复杂,还容易受到机械振动等因素影响。
Doppio的思路非常直接:用高速摄像头拍摄正在下落的咖啡粉,让AI判断每一小段时间内有多少物料经过,再不断累积,得到已经通过的总重量。
研究人员专门搭建了一套数据采集系统,使用Canon EOS R5摄像机,以4K、60帧每秒拍摄快速下落的咖啡颗粒。实验包含3种咖啡豆、25档研磨粒度,共采集219条完整序列,每次实验大约处理32克咖啡粉。
为了得到“真实重量”作为AI训练标签,研究人员同时拍摄咖啡机电子秤的显示屏,再通过OCR自动识别重量。由于咖啡粉经过摄像区域之后,还需要一小段时间才能真正落到秤上,因此研究团队还对视频与称重数据进行了时间对齐。
这种方法其实非常值得工业AI项目借鉴:训练阶段仍然使用传统传感器提供真实标签,AI通过学习摄像头数据与真实物理量之间的关系,未来部署时就有可能减少对传统传感器的依赖。这类系统通常被称为Soft Sensor,也就是“软测量”或者“虚拟传感器”。
在模型设计上,这篇论文并没有使用复杂的视觉大模型,而是比较了几种成熟、实用的架构。
第一类是逐帧模型FFN(feed-forward network),使用MobileNet或ResNet直接观察单张图像,判断这一帧对应多少新增重量。它的优点是结构简单、计算量低,缺点是没有真正理解连续运动。
第二类是在CNN后面加入GRU,让模型不仅看当前画面,还能够记住前面一段时间的颗粒运动。
第三类则采用CNN加TCN(Temporal Convolution Network),也就是时间卷积网络。TCN并不需要像循环神经网络那样长期保存内部状态,而是重点观察最近一段时间中的连续变化。
实验结果显示,TCN整体表现最好。这一点很有工业AI的特点,因为对于物料从固定窗口快速通过的场景,模型可能并不需要理解几十秒甚至几分钟的历史,只需要理解最近几百毫秒发生了什么。
论文还有一个非常实用的设计:帧差。
除了把当前图像输入模型,研究人员还计算当前帧与上一帧之间发生了什么变化。这样AI看到的不只是“这里有多少颗粒”,还能够看到“这些颗粒正在怎样移动”。
对于轻量级MobileNet模型,加入帧差后,误差从0.28下降到0.19,提升非常明显。这说明在物料流量估计这种任务中,运动信息可能和静态外观同样重要。
最终实验中,表现最好的模型是ResNet-18或ResNet-34结合TCN,指标大约为0.18。轻量级的MobileNet-V3加FFN则达到约0.19,二者差距非常小。
从产品化角度看,这个结果尤其值得注意。
最高精度模型并不一定是最值得部署的模型。MobileNet计算量更低、模型更小,更适合运行在Edge AI芯片、工业相机或嵌入式设备上。如果只损失很小的精度,就能够显著降低算力、功耗和成本,那么真正做工业产品时,轻量模型反而可能更有价值。
不过,这篇论文距离“用摄像头替代电子秤”还有明显距离。
首先,所谓的逐帧重量标签并不是电子秤真正以60Hz直接测出来的。实验中的电子秤显示精度只有0.1克,而平均每一帧对应的重量变化大约只有0.03克。因此研究人员必须通过插值、平滑和时间对齐,得到更连续的逐帧标签。这意味着AI最终得到的误差已经受到标签系统自身精度的限制。
如果未来真正用于工业计量,更合理的训练系统应该使用高采样率称重传感器,直接采集原始信号,而不是通过摄像头拍电子秤显示屏再进行OCR。
第二个问题是泛化能力。
目前所有训练和测试基本都在同一套设备、相同摄像机、相似照明和固定观察角度下完成。论文证明了模型能够在不同咖啡豆之间具有一定泛化能力,但“从一种咖啡泛化到另一种咖啡”和“从咖啡粉泛化到药粉、塑料颗粒、金属粉末”完全不是一个难度。
摄像头实际上并不能直接看到“重量”。它看到的是颗粒大小、数量、密集程度、下落速度、团聚情况和运动轨迹,然后AI再通过这些视觉信息推测重量。因此一旦材料密度、形状或者运动特性发生明显变化,模型通常就需要重新标定甚至重新训练。
所以,我认为这篇论文最值得关注的地方,并不是“AI已经可以代替电子秤”,而是它展示了一种越来越重要的工业AI范式:
摄像头正在从“识别工具”变成“测量工具”。
过去机器视觉主要回答“这是什么”“有没有缺陷”“目标在哪里”;未来越来越多系统会尝试回答“有多重”“流量是多少”“尺寸是多少”“速度是多少”“形变量是多少”。
Doppio实际上属于AI Soft Sensor,也就是AI软传感器的一种早期实例。
如果进一步发展,这套系统完全可以从“累计重量估计”扩展到“实时质量流量估计”,再与送料器、螺杆、电机或阀门形成闭环控制。
届时整个系统就会从:
摄像头 → AI → 重量估计
进一步发展成:
摄像头 → AI测量物料流量 → 控制系统实时调节送料。
这才是它真正具有工业价值的方向。
总体来看,Doppio的算法创新并不算非常强,MobileNet、ResNet、GRU、TCN和帧差本身都是成熟技术。但它把这些技术组合起来,证明了一件非常值得关注的事情:普通视觉系统确实有可能成为测量物理量的新型传感器。
因此,这篇论文真正值得跟踪的关键词不是“AI称咖啡”,而是:
AI-based Metrology、Soft Sensor,以及从Computer Vision向Physical Measurement的演进。
这很可能成为未来Edge AI和工业AI一个典型细分应用方向。