AI设备故障预测:一线工程师踩坑总结的落地干货

摘要:AI设备故障预测现在喊得响,真正能在工业现场落地的项目没几个。本文从一线项目经验出发,聊一聊数据采集、边缘落地、机理结合三个核心环节的踩坑经验和实用方案,给有一定基础的工程师做参考。

别光盯着准确率,你得先搞定数据这块的坑

前年帮钢厂做连铸辊的故障预测项目,刚拿到实验室出的结果时大家都开心。模型准确率98%,F1得分0.97,看起来完美。上线跑了一周,直接废了。 十次故障漏了八次,误报还一堆。为啥?翻数据才发现,实验室用的都是提前故意做坏的样本,数据干净得像纯净水。现场呢?传感器三个月漂移两个标准差,正常工况的数据都飘得没边,故障样本还不到总样本的1%。
工厂旋转设备传感器漂移数据对比图
工厂旋转设备传感器漂移数据对比图
说实话,很多工业场景本来就没多少故障样本。谁会天天开着设备等坏了攒数据?一次故障几十万损失,疯了吗?对吧。 很多年轻工程师上来就堆大模型,要端到端,结果标注数据才一百多个故障样本,训出来全是过拟合,拿上台面就露馅。我现在做项目,上来先看数据,再选模型。故障少就用半监督异常检测架构,按照ISO 13306-1:2019旋转机械故障分类标准打标签,比自己瞎编分类规则靠谱太多。 阈值怎么设?别抄论文里的默认值。我习惯把异常阈值设在95%置信区间,然后根据客户的需求调。钢厂怕误报停线,一次停线损失几十万,那我就把误报率压到1%以下,哪怕漏报率高一点,也比乱停车强。要是风电那种,坏了才停机,损失主要是运维,那漏报率往低了调,误报高点无所谓,大不了多跑一趟排查。这都是权衡,没有标准答案。

边缘端落地才是真落地,云端AI都是花架子

见过太多项目,云端演示做得漂漂亮亮,交付的时候根本用不了。为啥?工业现场哪有一直稳定的网?我去过西北的风电场,大风天刮断光缆,断网三天是常事。模型放云端,一断网就歇菜,要你AI有啥用? 还有带宽成本,几十台设备一百多个传感器,一秒传一次数据,一个月的流量费一年下来够买半台设备了,客户才不会当这个冤大头。 去年做风电齿轮箱的故障预测项目,我们干脆把模型剪枝压缩,最后整个模型才8M,直接跑在客户PLC自带的边缘计算模块里,根本不用连云端。一年多了,没出过大问题。
风电齿轮箱AI故障预测边缘部署架构图
风电齿轮箱AI故障预测边缘部署架构图
剪枝也不是瞎剪。我们用的是结构化剪枝,保留卷积层核心的特征提取参数,把全连接层的冗余参数全砍掉,最后精度只掉了1.2%,体积直接缩到原来的十二分之一,这个权衡太值了。 哦对了,我之前吃过亏。一次电磁干扰把边缘端的推理结果冲错了,直接触发了故障停机,赔了小十万。现在不管什么项目,边缘端输出必须加三重校验:硬件冗余校验+机理范围校验+历史数据趋势校验,就是多写几行代码的事,但是稳。别嫌麻烦,出事一次就够你喝一壶。

AI不是算命,得和传统机理结合才有用

AI不是算命,得和传统机理结合才有用
AI不是算命,得和传统机理结合才有用
现在圈里不少人吹,说AI故障预测不用懂机理,全数据驱动就行。我呸,纯粹瞎扯。 就拿最常见的滚动轴承故障来说,疲劳剥落的故障特征频率本身就有成熟的计算公式:
$f_c = \frac{z f_r}{60} \times (1 – \frac{d \cos\alpha}{D})$
这里z是滚珠数量,$f_r$是转轴转速,d是滚珠直径,α是接触角,D是轴承节径,这个公式是行业通用的,几十年验证下来不会错。你把计算出来的特征频率作为先验特征输入AI模型,比让AI自己从海量原始振动数据里瞎找特征准多了,泛化性还强。 我们之前做过对比试验,同一款轴承,纯数据驱动的模型换个批次的轴承,准确率直接从92%掉到67%。加了机理特征之后,准确率直接回到89%,这个差距够说明问题了吧。 不过话说回来,也不是说机理就能解决所有问题。很多复合故障,机理说不清楚,这个时候AI就能发挥作用,把隐藏的特征挖出来。本质上AI就是个工具,帮你处理人脑处理不了的海量数据,不是来推翻传统机械工程的。 最后说几句,AI设备故障预测不是什么炫技的黑科技,是帮我们干活减少损失的工具。实验室里再高的准确率,都不如在现场跑一年不出大错来得实在。选方案的时候,别选最先进的,选最适合现场工况的,这才是对项目负责,对自己的口碑负责。
免责声明:市场有风险,选择需谨慎!此文仅供参考,不作买卖依据。如有侵权请联系删除。
文章名称:AI设备故障预测:一线工程师踩坑总结的落地干货
文章链接:https://m.yqhljx.com/list_9/2292.html