摘要: 本文整理了近五年十余个工厂算力项目的落地踩坑经验,针对离散制造、机加工类工厂的实际场景,从需求测算、架构选型到硬件配置,给具有一定基础的中级工程师分享可落地的实操经验,避开厂商营销挖的坑。
别上来就堆硬件,先算清楚实际算力需求
很多工厂做算力规划,第一步就错了。上来先找厂商要方案,厂商往大了报,预算直接超一倍,最后闲一半算力吃灰。
前两年给江苏一家汽配冲压厂做在线检测项目,客户一开始定的是8台V100服务器,说要给12条线做全视觉检测。我帮着算需求,单工位1080P分辨率的YOLOv8缺陷检测,单帧推理的半精度算力需求是12TOPS,每条线3个检测工位,1秒出2帧结果,单条线满负荷也就72TOPS,12条线撑死了864TOPS。一块RTX A10的半精度算力是230TOPS,四块就够。加上冗余,两块备线,六块都用不了,挂在两台边缘服务器上就行。最后预算砍到原来的四分之一,跑了两年多,误报率比之前预想的还低0.2个百分点。

很多人说算力要留冗余,没错,但冗余不是往多了瞎堆。按照工信部《工业算力网络技术要求》的规范,实时算力的冗余预留不超过30%,非实时算力预留不超过50%就足够应对未来两到三年的产能扩张。真不够,后期加节点比一开始堆一堆闲着想办法消化容易多了。
说实话,我见过太多工厂,投了大几千万建算力中心,最后拿来挂办公系统,剩下的算力往外租,那何必呢?对吧。
中心算力还是边缘算力?别跟风全压一边
这两年边缘计算火,好像工厂不上全边缘部署就是落伍。我踩过这个坑,之前给一家新能源电池结构件工厂做方案,一开始听厂商忽悠,全工位上边缘节点,结果成本上去不说,排产优化的大模型,碎片化边缘算力拼不起来,跑一次排产要四个小时,原来的旧系统跑只要一个半小时。
其实根本没那么复杂,分场景就行。低延迟、高实时的任务,必须放边缘,比如冲压成形的在线预测,加工精度的实时补偿,要求100ms以内出结果,放中心机房,网络来回绕一圈,延迟就超标了。但那种非实时的大计算量任务,比如月度排产优化、工艺参数寻优、设备故障的全数据建模,放中心算力池就行,不仅调度方便,成本也比分散放边缘低太多。
之前遇到过一个低级错误,边缘节点放在车间,网络穿墙穿钢结构,5G的丢包率能飙到10%以上,全量回传原图直接断流。后来改了规则,边缘只做推理,只回传检测结果和缺陷截图,流量直接砍了99%,问题就解决了。

按照现在行业里的通用分级,L0级的现场实时控制,算力放设备端;L1级的单元检测控制,算力放车间边缘;L2级的工厂级调度优化,放工厂中心;L3以上的集团级建模,放云端就够。别乱了层级,乱了就是花钱买坑。
选型避坑:那些看起来好实则没用的花活

说实话,厂商推的很多新配置,真不适合工厂用。举个最常见的,全液冷算力柜。很多厂商说算力密度高,节能,我去年陪客户处理过一次全液冷的故障,北方的车间灰尘大,滤芯半个月堵一次,维护不到位,水管结垢,最后漏液传感器误报,直接触发整柜断电,那天停线四个小时,损失小两百万,那叫一个心疼!
实际上呢,工厂的算力部署,单柜算力密度一般不会超过8kW,普通的工业级风冷柜,加一层可更换的防尘网,改造一下进风通道,散热完全够用,成本只有全液冷的五分之一不到。维护也简单,每周换一次防尘网,十分钟的事。
还有一个坑,就是追新卡。很多人说买最新的GPU算力高,性价比好。工业场景和互联网不一样,工厂的设备一用就是五到十年,你买最新发布的卡,过两年供应链停产,坏一块连备件都找不到,停线等货等半个月,亏的钱够买十块卡了。我现在做选型,优先找上市两三年以上,工业级备货充足的卡,哪怕算力低一点,胜在稳定,备件好找。比如A10,虽然停产了,但是市面上备件足,工业级宽温支持,机柜里四十多度都能稳定跑,比新出的很多消费级卡靠谱多了。
还有虚拟化,很多工厂上来就全节点虚拟化,所有算力都池化调度,看起来利用率高,实际上实时任务的调度抖动能超过100ms,视觉检测赶不上生产线节拍,误报率直接翻三倍。所以做隔离的时候,实时任务一定要绑定物理核心或者用SR-IOV做硬件隔离,别为了那点利用率牺牲稳定性,工厂生产,稳定比什么都重要。
工厂算力部署,本质是给生产服务的,不是放那摆样子看参数的。不用追热点,不用凑参数,把自己生产环节的需求摸清楚,对应选型,避开这些坑,自然就能做出来好用又省钱的方案。