工厂算力资源调度:从乱成一锅粥到满负荷提效的实战笔记

国内大多数制造工厂完成数字化改造之后,都会遇到同一个尴尬:明明买算力的时候算过峰值,用起来却动不动卡壳,要么闲的时候算力空转浪费,忙的时候核心任务抢不到资源。以下都是我在汽配厂做了五年数字化改造攒的实战经验,全是踩坑踩出来的干货。

很多工厂的算力,其实都在偷偷”摸鱼”

三年前我待的那个汽车底盘零部件加工厂,花两百多万上了三条AI外观质检线,又搭了一套车间数字孪生仿真系统,招标的时候供应商算出来,总算力预留了20%的冗余,绝对够用。

结果上线第一个月就炸了。白班生产高峰期,数字孪生跑实时产能模拟跑到一半直接卡死,AI质检线为了不堵流水线被迫降速,次品漏检率一下子涨了三个百分点。夜班停产之后,所有服务器闲得发烫,后台看整体使用率不到10%。

说白了,根本不是算力不够,是没人给算力排上班。

所有人都只算了所有任务的峰值算力总和,没人算不同任务的负载时间差。白班生产的时候,AI质检占走40%的算力,生产部还要跑离线工艺优化占35%,剩下给孪生仿真的算力,连零头都不够。

传统工厂服务器算力使用率周度统计图
传统工厂服务器算力使用率周度统计图

说实话,我见过至少七八个同类型工厂,花大几百万买的企业级超算,一半时间都在空转。每年几十万的电费,大半都交了冤枉钱。太可惜。

实用调度逻辑:踩过三个坑之后总结的落地框架

第一个坑,上来就硬套互联网云原生的调度逻辑,完全不适配工厂本地算力的场景。

云上面的任务都是可中断可迁移的,自动扩缩容玩得很溜,工厂不一样,有一大堆低延迟要求的硬实时任务,比如AGV的路径规划,要求端到端延迟不能超过100ms,你动态调度把它迁到别的核心,哪怕只卡了几十毫秒,都可能导致AGV撞车。

我们后来参考GB/T 39116-2020《智能制造 制造能力成熟度模型》的任务分级,改成了适配工厂的三级算力调度规则,简单好用,从来没出过大问题:

第一级是刚性实时任务,包括PLC后台计算、AGV实时路径规划、在线AI质检推理,这类任务优先级拉满,提前预留固定的算力核心,任何人任何任务都不能抢。这类任务加起来一般不会超过总算力的20%,留出来不亏。

第二级是弹性可中断任务,比如批量次品离线复检、工艺参数模拟优化、模型训练,这类任务不怕停,跑一半停下来也不会影响生产,完全可以错峰跑,白天刚性任务占满的时候就挂起,晚上或者周末算力闲了再跑,这部分是调度的核心,也是挖潜的主要空间。

第三级是固定周期任务,比如每日生产报表生成、每周排产模拟、每月设备故障预测计算,这类直接给它排死在固定低峰时段,比如每天晚上十点之后,根本不用参与算力竞争。

工厂三级算力任务调度优先级划分图
工厂三级算力任务调度优先级划分图

第三个坑我印象特别深,当初我们没做边缘算力协同,什么活都往厂区数据中心塞。12台工位上的AI质检相机,本身都带NPU芯片,本地就能做推理,我们一开始图省事,把所有原始图像都传回中心算,硬生生占了数据中心16%的算力。后来改了架构,本地做推理只传结果,中心只需要每周攒数据更一次模型,一下子省出12%的可用算力,连加服务器的钱都省了,小二十万呢。

落地选型:不用追高大上,适合自己的才好用

落地选型:不用追高大上,适合自己的才好用
落地选型:不用追高大上,适合自己的才好用

刚开始搞调度的时候,我们跟着网上的教程上了全套K8s,运维的小伙子连着熬了三个月的大夜,改配置适配工厂的本地任务,本来省出来的电费钱,还不够付他加班费的。说实话,中小工厂真没必要玩这么复杂的。

不过话说回来,如果你是万人级的整车厂,三五个厂区分布式部署,那上全套的复杂调度体系当然没问题,支撑得起你的业务需求。但如果只是几百人的中小型加工厂,只上了三五条数字化生产线,轻量调度足够用了。

我们后来把K8s砍了一遍,把所有云原生相关的没用功能都去掉,只保留了任务分级、错峰调度、边缘节点注册三个核心功能,整个调度服务占用的自身算力不到2%,跑了两年多,除了季度性调优,基本不用管。

还有个压箱底的小技巧,每个季度拉一次算力负载热力图,看看哪些任务的负载规律变了,微调一下优先级和排班,我上次调完,全厂算力整体使用率从38%直接提到了67%,相当于白捡了快一半的算力,一分钱没花。

其实工厂算力调度,核心逻辑和工厂排产一模一样。你不会把所有订单都堆到白班一个班次做,也不会让工人闲一半时间。算力也是一样的,安排好了,花一块钱就能出两块钱的活,安排不好,花两块钱只能出五毛钱的活。很多工厂花大价钱搞数字化,最后栽在调度这种小事上,真的太可惜。

免责声明:市场有风险,选择需谨慎!此文仅供参考,不作买卖依据。如有侵权请联系删除。
文章名称:工厂算力资源调度:从乱成一锅粥到满负荷提效的实战笔记
文章链接:https://m.yqhljx.com/list_9/2312.html