很多工厂数字化跑了四五年,各种仿真、AI检测项目上了一堆,硬件买了一堆,却遇到一个怪事:明明算力越买越多,赶项目的时候还是抢不到资源。一边是大部分服务器常年闲得发烫,一边是工程师天天排队等仿真,问题出在哪?其实就是算力没打通,缺一套适配工厂实际场景的统一调度机制。
为什么工厂算力越买越不够用?
前年我在长三角的一家汽车零配件厂做技术支持,一进研发部就听见一堆人吐槽。
冲压车间自己申报预算买了一台8核16G的服务器,专门算冲压成型有限元分析,大部分时间CPU使用率不到15%。有时候甚至整周没人用,就开着机插电耗电费。
焊装车间有两台带专业显卡的工作站,用来做焊接变形模拟,一周也就开两三次。
研发中心为了赶新车项目,三年买了三套算力集群,加起来快五百万了。赶项目的时候,所有人提交任务排队,最快也要等两天才能出结果。老板还在天天说要批预算买新服务器。
我给他们拉了半个月的算力使用日志,一算吓一跳。全工厂可调度的闲置算力加起来,够同时开两个研发项目。纯纯的钱扔水里打水漂。

这种情况真的不是个例。大部分工厂上数字化,都是部门各自为战,谁要算力谁申报,谁买了谁独占,本质就是一个个分散的算力孤岛。按照GB/T 39116-2020《智能制造能力成熟度模型》的要求,资源协同优化是三级智能制造的核心考核项,很多工厂卡在这里,就是没搞定算力调度这一步。
没人统计全工厂到底有多少算力。没人管闲下来的算力去哪了。
太可惜了。
工厂算力统一调度核心要解决哪几个实际问题?
别听那些软件厂商上来就吹超融合、云原生,一堆概念抛出来,落地全是坑。我做过三个落地项目,核心要解决的就三个实际问题,前两个最容易踩坑。
第一个就是异构算力的兼容接入。工厂里的算力太杂了。有十几年的老工作站,有新买的GPU加速服务器,有车间角落堆着的边缘计算盒子,架构从x86到ARM都有,甚至还有设计师下班之后闲置的办公本。调度平台要是做不到纳管所有类型的算力,一上来就要求全换统一架构,那成本直接翻三倍,根本推不动。
第二个就是任务优先级的弹性抢占。我这里说的抢占,不是直接杀掉低优先级任务。之前我们试第一版调度方案的时候就踩过这个坑。生产线突然爆出焊接裂纹缺陷,要紧急做应力分析找原因,这个任务必须插队,结果原来的调度方案直接把一个工程师跑了三天的仿真任务给杀掉了,数据没保存,人家差点直接砸了调度平台的控制台。
后来改了规则,支持低优先级任务暂停休眠,把算力腾给高优先级任务,等高优先级任务跑完,再恢复低优先级任务,就没人吐槽了。

第三个,别忘了边缘算力。现在大部分工厂的车间都部署了AI缺陷检测的边缘节点,这些节点大部分时间利用率不到30%,闲下来的算力完全可以拉来做小体量的仿真计算、模型训练,只要控制好网络延迟,别传大文件就行。说实话,挖出来的这部分算力,一年下来省的硬件钱,够给整个部门发半年奖金了。
中小工厂落地算力统一调度的低成本路径

很多人一听到统一调度,就觉得是大工厂才玩得起的东西,要几百万投入,中小工厂玩不起。其实真不是。去年我们给一家百来人规模的工程机械零配件厂做方案,整套下来不到20万,跑了半年效果好得很。
第一步先做算力盘点,不用搞什么复杂的审计,两个工程师,一周时间,把全厂所有能调出闲时算力的设备全统计一遍,记清楚核心数、显存大小、每天固定的空闲时间段,哪怕是设计师每天下班之后到第二天上班之前的8小时空闲,都能算进去。这个活没难度,就是要细心,漏了几个大算力设备,后面全白搭。
第二步选框架,别从零开发,也别直接买几十万的商业调度平台,用开源的Kubernetes改,针对工业任务加个优先级调度的插件就行,我们当时改了一千多行代码,就解决了异构算力纳管和弹性抢占的问题,比买商业版省了八十多万。不过话说回来,要是你厂没合适的开发,找个小团队做定制化也比买原厂商业方案便宜太多。
这里说个选型权衡,要不要搭配合有云弹性算力?核心设计数据肯定不能出工厂,所以所有核心任务都放在私有端的统一调度里,真遇到突发的超大任务,把脱敏后的非核心任务甩到公有云按需付费就行,这样既安全又省钱,比直接买一堆服务器放着闲强太多。
还有个常见坑,别上来就搞全量虚拟化。很多方案商上来就要把所有物理服务器都改成虚拟机,说方便管理,其实虚拟化本身就要消耗5%到10%的算力,纯纯没必要。直接纳管物理机,只把需要迁移的任务做虚拟化就行,能省不少算力出来。
那个项目跑了半年,我们统计数据,原来研发仿真平均排队时间从42小时降到了不到6小时,全厂算力整体使用率从原来的18%升到了62%。老板原来批了三百万预算买新服务器,直接暂缓了,省下来的钱给研发部换了新的设计软件,没人不说好。
工厂数字化拼的从来不是谁买的硬件多,是谁能把手里的资源用透。把闲置的算力盘活,比投多少钱买新设备都更能出效果。