摘要:很多工厂上产线故障预警项目,钱花了几十万,最后变成摆设,要么误报满天飞工人关了预警,要么漏报出了事故根本没提醒。我做了快15年现场机械运维,经手了12个不同行业的故障预警项目,踩过的坑比你吃过的盒饭还多。今天就说点真东西,给做项目的中级工程师提个醒。
别迷信通用方案,产线故障预警的核心是对准具体痛点
前年接了珠三角某汽车零部件厂的项目,他们之前花八十万上了某头部自动化厂商的冲压产线故障预警系统,上线半年就被车间停用了。什么原因?误报率超过78%,一天能跳十几次预警,工人一开始还停机查,查了十几次啥问题没有,最后直接把系统报警关了。
我去现场看了一天,差点笑出来。厂商给用的是针对连续旋转电机的通用振动故障模型,可冲压产线是间歇冲击工况,冲床每冲一次,振动值就是正常运转的三倍,通用模型直接就触发报警了。
他们连产线的工况特点都没搞对,谈什么预警。

说实话,大部分工厂上预警,需求根本不是预测一百年不遇的特大故障,就是想提前发现主轴承磨损、滑块间隙过大这些常见问题,避免突然停机停线。一条年产百万件的冲压线,停一天损失十几万,只要能提前三天预警,换个轴承只需要下班换,这个项目就值了。搞那些花里胡哨的东西有用吗?没用。
传感器选型和布置,90%的项目都死在这一步
我见过最多的坑,就是上来就堆最贵的传感器。什么进口高精度压电式加速度传感器,一个上千块,装了十几个,结果用不到半年全废了。
就说刚才那个冲压厂的项目,原来的传感器都装在冲床机身侧面,离冲头不到半米,天天泡在冲压油的油雾里,原来的传感器只有IP65防护,油雾慢慢渗进去,半年不到信号就飘得离谱。而且冲床旁边有大功率变频器,强电磁干扰,压电传感器输出是模拟信号,干扰杂波比故障信号还大,你说怎么判?
后来我们怎么改的?全换成了IP68防护的数字输出MEMS振动传感器,一个才三百多,抗干扰能力强,油泡着都没事。
布置测点也有讲究,很多人觉得装越多越准,不对。原来那个项目装了12个传感器,从机身到脚踏板都装了,大部分数据根本没用,反而增加计算量,还拉高了误报概率。我们按照ISO 10816-3:2009 机械振动 评估机器振动的测量标准,只保留了三个核心测点:主齿轮箱输入轴轴承座、滑块偏心机构连接座、驱动皮带轮轴承座。刚好三个点,覆盖了95%以上的常见故障点。

改完之后,数据量直接降到原来的四分之一,计算成本降了,准确性反而上来了。
不过话说回来,不同产线的测点真的不一样,瓶装水灌装线的预警,重点要盯灌装机的灌装阀密封和输送带滚轮,而焊接机器人的预警,重点要去看机械臂关节减速器的振动,不能一概而论对吧?
阈值怎么设才对?我只用两个落地的方法

很多人搞一堆复杂的深度学习模型,出来的结果是黑盒,现场工程师出了问题根本不知道怎么调,出几次错就没人用了。我做项目这么多年,大部分时候就用两个简单方法,解决了绝大多数问题。
第一个是分工况3σ阈值法,适合新投产的产线。新产线刚投产,设备状态是健康的,我们分不同负荷、不同产品工况,分别采集一周的振动、温度数据,算出每个工况下的健康基线,阈值设为基线平均值加三倍标准差,超过就报警。这个方法的核心是一定要分工况,你不能生产1kg零件和10kg零件用同一个阈值,那不误报才怪。
第二个是相对变化阈值法,适合已经投产好几年的老产线,没有完整的新设备数据。这种不用找绝对基线,就拿同一工况下,过去一周同一时间段的特征值做基准,只要当前特征值比基准升高超过20%,就触发预警。很多老产线本身有磨损,绝对阈值早就不准了,相对变化反而能准确捕捉异常。
我之前那个项目改完之后,误报率直接从78%降到11%,上线一年多,提前预警了三次主轴承磨损,两次皮带裂纹,帮工厂省了不下五十万的停机损失。
真的。
很多人觉得产线故障预警要多么高端,多么复杂,其实不是,工厂要的不是论文,不是算法指标,是能用,不出错,出了预警工人敢信,停机排查真能找到问题。
最后说两句
做现场工程,从来不是比谁用的方法高端,是比谁能解决真问题。产线故障预警,先找准痛点,选对适合工况的传感器,布对测点,再用简单靠谱的阈值方法,就已经能打败百分之八十的花架子项目了。剩下的,再去考虑要不要上更复杂的模型也不迟。