摘要:
离散装备制造业正处于从“设备联网”向“智能运维”加速演进的关键阶段。以航空发动机、风电装备、军工电子、精密机床等为代表的高端制造场景,具有设备资产价值高、工艺链条长、工况变化复杂、非计划停机损失大等显著特征。企业虽然普遍已完成设备接入和数据采集的基础建设,但大量工业数据仍存在语义不统一、上下文缺失、质量不稳、标签稀缺等问题,难以直接支撑预测性维护(PHM, Prognostics and Health Management)的规模化应用。
行业实践表明,传统以IT为中心的后置式数据治理模式,往往只能提升“数据质量”,却难以生成“AI可直接消费的数据资产”。在这一模式下,采集、治理、建模、决策之间相互割裂,导致设备数据难以转化为可行动的运维决策,预测性维护长期停留在试点验证阶段,难以形成复制推广能力。
基于此,佰思杰科技提出并落地了一体化的PHM解决方案:以BSG-IIoT工业物联网平台作为数据感知、建模和治理底座,以MindSpring工业垂域大模型平台作为智能分析与决策引擎,通过“业务驱动、模型先行”的方法论,在数据产生之前完成设备、参数、规则、知识与执行对象的形式化定义,使数据从源头具备结构化、语义化、可计算的特征,并在此基础上实现故障诊断、健康评估、剩余寿命预测和维保决策的闭环联动。
本文围绕离散装备制造业八类核心设备——机加工数控机床、热处理炉、冲压设备、焊接设备、铸锻造工装、下料切割设备、表面处理产线、自动化装配设备——系统阐述该方案的技术架构、数据治理路径、AI 落地机制与实施价值,并结合典型行业案例,验证其在降低非计划停机、提升设备综合效率(OEE)、优化维保资源配置等方面的实际成效。
▶核心价值主张:佰思杰方案的根本差异化在于——不是在已有数据上叠加AI,而是让数据从产生之初就为AI而生。
第一章 行业现状:离散装备制造设备运维数字化的核心矛盾
离散装备制造业具有多品种、小批量、工艺复杂、设备类型异构等显著特征。与流程制造相比,这类行业的运维对象更加离散,设备工况更加多变,故障机理更加复杂,对运维体系的感知能力、语义组织能力和智能决策能力提出了更高要求。
尽管不少企业已经建设了设备联网、SCADA、MES、DNC/MDC等系统,但在实际运维中,仍普遍存在以下四类矛盾:
工业现场协议多样,设备品牌众多、代际差异明显。现阶段很多IIoT平台已经能够实现设备接入和协议转换,但“接得上”并不等于“看得懂”。同一类参数在不同设备、不同厂商、不同工况下的定义方式、单位口径和业务含义并不一致,导致数据能够汇聚,却难以形成统一的分析视图。
传统运维模式主要依赖两种方式:一是故障发生后的事后抢修,二是按固定周期执行的预防性保养。前者会导致非计划停机,影响交付和产能;后者则容易造成“健康设备被提前更换”,进而带来备件浪费、人工计划成本上升和设备利用率下降。企业迫切需要一种基于设备真实健康状态触发的维护机制。
制造企业普遍积累了大量设备运行数据,但这些数据往往存在缺失、噪声、时序错位、采样不一致、标签稀缺等问题。更关键的是,传统数据治理通常面向报表统计和经营分析,并未围绕 AI 建模所需的数据粒度、时序结构和语义上下文进行设计,因此很难直接支撑 PHM 建模需求。
设备运维长期依赖老师傅经验和工程师个人判断,虽然在单点场景中能够发挥作用,但其知识往往隐性化、碎片化、难以传承。一旦人员流动,经验资产便容易流失。对于跨车间、跨工厂、跨设备型号的规模化复制而言,仅依靠人工经验已经难以满足效率与一致性要求。
基于上述矛盾,离散装备制造业的预测性维护不能仅依赖单一算法优化,而必须从数据底座、语义建模、知识组织和决策闭环四个层面协同推进。
尽管市场上已出现各类预测性维护平台与工具,但在离散装备制造场景中,传统 PHM 方案普遍在以下方面存在共性短板,导致其难以真正实现规模化落地:
传统方案通常采用“先建设数采、后叠加AI”的路径:由自动化团队完成设备联网,再由数据团队或外部算法团队另行开展建模。两条线之间缺乏统一的语义模型,导致算法团队拿到的数据“看起来很多、用起来很少”,需要反复沟通、清洗、重新标注,项目周期被大幅拉长。
不同厂商、不同代际设备的参数定义方式不一,传统方案往往按"设备—测点—数值"的扁平结构存储数据,未建立设备—参数—故障—工艺之间的语义关联。当企业需要跨设备、跨产线、跨工厂推广PHM能力时,每个新场景都需要重新适配数据接口和特征工程,无法形成可复制的产品化能力。
传统 PHM 项目的产出通常是一个“训练好的模型”和一套“分析报告”,但模型参数、特征选择逻辑、故障判定规则、维修建议模板等知识并未被结构化沉淀。一旦项目负责人或核心工程师离开,后续团队往往难以理解模型逻辑,更无法持续迭代优化,导致PHM能力随时间衰减。
许多 PHM 方案止步于“生成预警报告”,但预警信息如何转化为工单、如何匹配维修资源、如何跟踪执行结果、如何将执行结果回流用于模型优化,这些环节往往依赖人工流转,导致“预警很多、整改很少”,预测性维护的业务价值无法充分释放。
正因为这些短板的存在,离散装备制造企业的 PHM 实践往往陷入“试点时表现良好、推广时困难重重”的困境。要真正破解这一困境,需要从数据底座、语义建模、知识组织和决策闭环四个层面系统进行重新设计——这也正是佰思杰BSG-IIoT+MindSpring一体化方案的设计出发点。
第二章 传统运维模式与后置式数据治理的双重瓶颈
2.1 三大工业智能公理
要真正推动 PHM 规模化落地,必须回到工业智能的第一性原理。任何有效的工业智能体系,都应遵循以下三项基本公理:
公理一:业务目标优先。工业智能的最终价值不是“让数据更漂亮”,而是优化物理世界中的业务运营,因此一切数据工作都应服务于可量化的业务目标。
公理二:数据必须映射业务上下文。数据的价值不取决于其数量本身,而取决于其是否能够真实反映设备状态、工艺变化、运行关系和故障机理。脱离上下文的数据只是数字碎片。
公理三:AI 需要形式化、结构化、可解释的数据输入。模型无法天然理解隐含知识,它需要明确的实体、属性、关系和约束。数据组织方式如果不能与模型理解方式匹配,就难以形成可用的智能能力。
2.2 传统“先采集、后清洗”模式的问题
传统数据治理普遍采用 ETL 后置路径:先采集原始数据,再进行清洗、转换和加载。这一模式在事务性数据处理中通常有效,但在 PHM 场景中存在明显局限。
更重要的是,传统模式中“数据治理”和“PHM 建模”往往由不同团队分别负责,前者关注数据标准化,后者关注模型效果,二者之间缺少统一的方法论和共享的数据模型。这也是许多 PHM 项目无法从试点走向规模化的关键原因之一。
2.3 “业务驱动、模型先行”的治理范式
针对上述问题,佰思杰提出“业务驱动、模型先行”的治理理念:不是先采集数据,再事后寻找用途;而是在设备接入之前,就先定义业务模型、设备模型、参数模型、故障模型和执行模型,使所有数据在产生之初就具备明确语义和可计算结构。
这一思路的核心价值在于:
将数据治理前移到数据生成阶段;
将业务逻辑直接映射为数字模型;
将 PHM 所需的数据结构预先固化;
让数据从源头即具备 AI 可消费性。
这样,数据治理不再是PHM的前置准备工作,而成为PHM数据资产生产过程本身。
佰思杰 PHM 解决方案以BSG-IIoT工业物联网平台为底座,以MindSpring工业垂域大模型平台为智能引擎,两者原生融合,形成“数据感知—知识建模—智能分析—决策执行”的一体化体系。
3.1 Nebula四层工业本体模型:统一语义的PHM数据底座
Nebula是佰思杰构建工业语义体系的核心框架,通过四层本体模型实现对异构设备的统一表达。
第一层:设备本体
面向离散装备制造八大类设备建立标准化数字身份档案,定义设备型号、出厂参数、安装位置、工艺属性、可采集参数清单及故障模式映射关系。该层解决的是"平台知道自己连接了什么设备"的问题。
第二层:参数本体
对采集参数进行统一定义,包括单位、量程、采样频率、校准规则、业务含义及与故障模式的关联关系。例如,主轴振动信号不再只是一个时序数值,而是被定义为与特定故障机理相关联的业务参数。这使后续特征工程和模型训练有了明确方向。
第三层:规则本体
将工艺知识、设备经验和故障逻辑固化为可执行规则,包括确定性规则和概率规则两类。前者适用于明确阈值类告警,后者适用于多变量耦合故障识别。规则本体使经验知识能够被系统化、结构化和持续复用。
第四层:执行本体
打通 SCADA、DNC/MDC、检试验设备、MES、WMS 等业务系统,形成从异常识别到工单下发、再到现场执行和结果回流的完整闭环,并为 MindSpring 的智能决策提供执行接口。
3.2 M3四层元元模型:前置式数据治理引擎
M3元元模型是 BSG-IIoT 的核心方法论基础,支持从 M0 到 M3 的全栈模型驱动。
M3的实战意义在于:当企业新增设备类型或新增工艺场景时,无需从底层重构数据模型和业务逻辑,只需在 M3 元元模型层定义新的数据结构语义规则,平台即可据此驱动数据模型的自动生成与适配,大幅缩短新设备接入时的数据建模周期。
需要说明的是,M3四层元模型负责的是数据结构的语义定义与模型层自扩展能力,并不直接替代协议解析、时序对齐、特征提取等底层工程开发工作。对于私有非标设备的协议驱动开发、边缘数据采集适配等环节,仍需结合具体设备接口规范进行定制化实现;模型的价值在于为这些底层开发提供统一的数据结构框架和语义标准,避免每次接入都从零设计数据模型,从而降低整体实施成本并提升多设备、多产线场景下的数据一致性。
3.3 BSG-IIoT 与 MindSpring 的原生融合
BSG-IIoT与MindSpring不是简单的“平台加模型”式集成,而是从数据底座到智能能力的原生协同。
Data for AI:数据滋养 AI
BSG-IIoT通过Nebula和M3产出高质量、强语义、时序化的工业数据,为 MindSpring的训练、微调和推理提供直接输入。数据进入 AI 之前已完成必要的清洗、对齐、标注和结构化处理,大幅缩短从数据到智能的转化链路。
AI for Data:AI 反哺数据
MindSpring反向赋能数据治理与知识沉淀。例如,利用大模型自动解析非结构化维修记录,提取故障模式和维保措施;利用模型生成合成故障样本,缓解真实故障样本不足的问题;利用语义推理辅助知识补全和标签校正,从而持续提升数据资产质量。
3.4 动态工艺—故障知识图谱
离散装备制造中的故障通常具有多因素耦合特征,往往不是单一部件失效,而是设备状态、工艺参数、环境条件和操作行为共同作用的结果。为此,佰思杰在 PHM 架构中引入动态工艺—故障知识图谱,将设备、参数、工艺、故障、工单、维修记录等实体及其关系构建为可推理网络。
该知识图谱主要支持两类能力:
3.5 PHM 五层技术架构映射
传统PHM通常包含五层:数据采集层、特征工程层、故障诊断层、健康预测层和维保决策层。佰思杰方案对这五层进行了完整覆盖:
第四章 面向预测性维护的工业数据治理与PHM数据集建设
PHM落地的核心,不在于算法本身,而在于是否具备高质量、强语义、时序完整、可持续迭代的工业数据基础。围绕这一目标,佰思杰基于“业务驱动、模型先行”的理念,构建了从数据资源化、资产化、服务化到智能化的演进路径。
4.1 基于M3的PHM数据需求定义
高质量PHM数据建设的第一步,是在采集前就明确业务模型与数据模型。针对离散装备制造八类核心设备,需在M3框架下定义以下内容:
通过上述模型定义,设备数据在采集之初即具备后续建模所需的语义结构。
4.2 数据采集、治理与对齐
PHM数据建设必须兼顾“实时性”和“可解释性”。为此,BSG-IIoT在边缘侧完成以下工作:
多协议接入与统一编码;
实时数据清洗与异常剔除;
时序同步与采样对齐;
缺失值处理与降噪;
特征预处理与分层存储。
通过边缘侧预处理,平台上传的数据已不再是零散原始信号,而是具备业务上下文的结构化数据流,为模型训练和在线推理提供稳定输入。
4.3 PHM 数据集构建原则
针对工业场景“故障少、正常多、工况复杂、样本不均衡”的现实情况,PHM 数据集构建应遵循以下原则:
将原始时序数据、工艺参数、维修记录和故障标签统一映射到设备健康演化链条中。
建立统一的故障分类标准,避免不同工厂、不同班组之间的标签口径不一致。
将温度、负载、节拍、材料、工艺配方等变量纳入建模空间,提升模型泛化能力。
将现场新故障、新工况、新维修记录持续回流至数据湖和知识图谱中,形成动态更新的数据集。
4.4 由数据集到智能资产
在传统模式下,数据仅是存储对象;在BSG-IIoT + MindSpring体系中,数据进一步演化为可以持续服务 AI 的智能资产。其关键转变体现在:
从“原始数据”变为“可解释样本”;
从“静态标签”变为“动态知识”;
从“单次建模”变为“持续学习”;
从“报表资产”变为“决策资产”。
第五章 MindSpring工业Agent平台的四大落地范式
MindSpring并非以“从零训练工业大模型”为目标,而是面向制造业运维场景,基于现有大模型能力与工业知识工程方法,构建可落地、可编排、可迭代的工业 Agent 平台。其核心价值不在于大规模模型参数训练,而在于通过知识增强、任务编排、工具调用和流程闭环,将通用模型能力转化为可服务PHM的工业智能能力。
在实际项目中,MindSpring主要通过以下四种范式实现落地。需要指出的是,这四大范式并非彼此独立的并列关系,而是形成层次化的协同链条:RAG 检索增强为模型提供知识支撑,Agent 工具调用将知识转化为执行动作,Prompt / 规则 / 模板工程把执行流程固化为可复用的标准化作业程序,轻量推理与边缘协同则确保关键场景下的实时响应能力。在一个完整的 PHM 应用场景中,这四大范式通常按“知识支撑→工具执行→流程固化→现场响应”的路径协同工作,共同构成从感知、理解、决策到执行的闭环智能。
5.1 RAG 检索增强:让模型“懂工业知识”
将设备手册、故障案例、维修记录、点检标准、工艺规范、备件说明等知识源接入检索增强框架,在回答诊断问题、分析异常原因或生成维保建议时,先检索再生成,提高回答的准确性、可追溯性和可解释性。
5.2 Agent 工具调用:让模型“会用工业系统”
将模型与 MES、EAM、SCADA、CMMS、知识库、报警系统、工单系统等工具打通,由 Agent 自动调用查询、检索、计算、比对、生成工单等能力,把“会说”变成“会做”。
5.3 Prompt / 规则 / 模板工程:让模型“按工业流程办事”
针对不同设备、不同故障类型、不同岗位角色,构建结构化提示词、标准化分析模板和决策规则,将老师傅经验和企业制度固化为稳定的处理流程,减少大模型输出的不确定性。
5.4 轻量推理与边缘协同:让模型“在现场实时响应”
对低时延、高可靠的场景,在边缘侧部署轻量模型或规则引擎执行初筛、分级、告警和状态判断,再由中心Agent进行深度分析,实现云边协同,满足工业现场对实时性和稳定性的要求。
通过上述四种范式,MindSpring将通用大模型能力转化为面向工业运维的可执行能力,使系统能够在不依赖大规模模型训练和微调的前提下,完成设备异常识别、根因分析、维保建议生成和工单闭环等关键任务。
第六章 面向离散装备制造八大类设备的PHM落地策略
离散装备制造业设备类型多、故障机理差异大,因此PHM落地不能采用“一套模型打天下”的方式,而应结合不同设备类别建立差异化监测策略。
6.1 机加工数控机床
重点监测主轴振动、温度、电流、伺服误差、刀具磨损、进给系统状态等参数,重点识别主轴轴承磨损、刀具异常、热漂移、定位偏差等故障模式。
6.2 热处理炉
重点监测炉温均匀性、升温曲线、保温时间、气氛浓度、能耗曲线和热电偶状态,识别温控失准、加热元件老化、炉体泄漏等问题。
6.3 冲压设备
重点关注滑块位移、冲压力、振动冲击、液压/气动系统压力、模具状态等,识别模具磨损、过载冲击、润滑异常等故障。
6.4 焊接设备
重点监测电流、电压、焊接速度、送丝状态、焊枪温度、焊点质量指标等,识别焊接不稳定、接触异常和质量偏差风险。
6.5 铸锻造工装
重点监测受力状态、温度、变形、疲劳累积和结构健康指标,识别裂纹、疲劳、松动和失效风险。
6.6 下料切割设备
重点监测刀具状态、切割速度、激光功率、气体压力、轨迹精度等,识别切割偏差、热损伤和刀具磨损。
6.7 表面处理产线
重点监测液位、浓度、温度、pH 值、流量、循环效率等指标,识别药液异常、设备腐蚀、工艺漂移等问题。
6.8 自动化装配设备
重点监测节拍、定位精度、夹紧状态、伺服响应和视觉检测结果,识别装配偏差、夹具异常和节拍失衡等情况。
针对不同设备类型,系统可采用"规则优先 + 模型增强 + 知识补充"的组合策略,确保预测性维护方案既具备通用性,又具备设备级别的针对性。
预测性维护的关键,不只是“发现异常”,而是让异常能够被及时转化为可执行的运维动作。为此,佰思杰建立了从预警到执行的闭环体系。
7.1 异常识别与风险分级
系统对设备状态进行连续监测,一旦发现偏离正常模式的趋势,即结合规则引擎、统计模型和 AI 推理进行综合判断,并按照风险等级进行分层预警。
7.2 维保工单自动派发
当异常达到一定阈值后,系统自动生成维保建议,并联动MES、EAM 或工单系统,形成可执行的维修任务,减少人工流转环节。
7.3 现场执行与知识沉淀
维修人员在现场执行任务后,将检修结果、故障原因、处理方法和备件更换情况反馈回系统,形成标准化维修记录,沉淀为可复用知识。
7.4 数据回流与模型迭代
现场执行结果回流至知识图谱、样本库和训练集,用于持续优化模型参数和知识规则,实现"越用越准、越用越强"的迭代机制。
在航空重工等高价值制造场景中,设备运行稳定性直接关系到交付周期、生产安全和综合成本。佰思杰在相关项目中,通过BSG-IIoT与MindSpring的协同部署,实现了从设备监测、故障识别到维保闭环的系统化落地。
▶关于以下量化数据的说明:
具体收益因设备类型、工况复杂度和企业原有数字化基础差异而异,不具备直接可比性。以下数据基于佰思杰在航空、重工等行业多个PHM项目的实测统计,以典型值区间呈现,仅供评估参考,不代表任何特定客户的承诺收益。
项目实践表明,该方案可在以下方面产生明显价值:
提前 7~14 天识别关键设备异常趋势(典型区间:7~14 天,具体取决于设备类型和监测参数);
非计划停机时间降低 30%~50%(典型区间:30%~50%,取决于原有停机频率和设备关键程度);
过度保养和无效检修减少 20%~35%(典型区间:20%~35%,取决于原有保养策略和执行精度);
备件库存周转效率提升 15%~25%(典型区间:15%~25%,取决于原有库存管理水平和备件种类复杂度);
运维响应速度提升 40%~60%(典型区间:40%~60%,取决于原有工单流转机制和现场管理能力);
设备综合效率(OEE)改善 5%~15 个百分点(典型区间:5~15 个百分点,取决于设备原有机效水平和停机主要原因)。
需要强调的是,上述收益的实现,依赖于企业具备一定的数字化基础(设备已联网、具备基本的数据采集能力),并且在项目实施过程中能够有效协同设备、工艺、维修、IT等多方资源。对于数字化基础薄弱的场景,建议先进行基础数据采集和治理建设,再逐步引入PHM能力。
预测性维护的价值,不仅体现在设备维护层面,更体现在企业经营层面。通过BSG-IIoT与MindSpring的一体化建设,企业可以在以下几个维度获得长期收益:
降低非计划停机
通过提前识别设备劣化趋势,减少突发故障带来的停线损失。
降低维保成本
通过按健康状态触发维护,减少不必要的周期保养和备件浪费。
提升资产利用率
通过优化设备运行状态和维修计划,提高关键设备稼动率和 OEE。
沉淀企业知识资产
将老师傅经验、维修记录和故障案例结构化沉淀,形成可复用的知识资产。
提升组织响应能力
通过工单闭环和智能决策,缩短故障响应时间,提高跨部门协同效率。
需要指出的是,本方案并非适用于所有场景,其效果发挥依赖于一定的前提条件。明确适用边界,有助于企业更合理地评估自身需求与准备度。
设备资产价值高、停机损失大的关键设备:如航空发动机整机测试台、大型精密机床、热处理炉、军工电子装配线等,其非计划停机将造成显著经济或交付损失,PHM投入的ROI更为明确。
已有一定数据积累和联网基础的企业:设备已部分联网、具备基本数据采集能力,但数据尚未有效转化为运维决策的场景,最适合引入本方案。
具备工艺知识和维修经验沉淀的组织:企业拥有可结构化的老师傅经验、维修记录或故障案例,可借助本方案将其固化为可复用的知识资产。
以下场景中,本方案的效果可能有限,或需要先完成其他基础建设:
设备尚未联网或数据采集能力严重不足:此时应优先完成设备联网和基础数采建设,再逐步引入PHM能力。
完全无工艺知识积累、维修完全依赖外部服务商:此时企业缺乏可结构化的领域知识,PHM建模所需的特征工程和故障标签将难以建立,建议先通过外部合作积累基础数据和经验。
设备工况极度单一、故障模式极其简单:对于工况几乎不变、故障模式单一且已有成熟周期性保养规范的设备,引入 PHM 的边际收益可能有限,应优先用于更复杂的设备。
企业在引入PHM之前,建议从以下维度进行准备度自评:
关键设备联网率是否达到60%以上?
是否有至少6个月的历史运行数据和维修记录?
是否有可结构化的故障案例或维修经验?
是否具备跨设备、工艺、维修、IT的协同推进机制?
准备度越高,PHM落地的周期越短、效果越显著。
离散装备制造业的预测性维护,不是单一算法问题,也不是单纯的数据采集问题,而是一个涉及设备感知、语义建模、知识组织、智能分析与执行闭环的系统工程。
佰思杰基于BSG-IIoT与MindSpring构建的PHM解决方案,核心并不在于“把设备连起来”,而在于通过“业务驱动、模型先行”的方法论,让数据从产生之初就具备可计算、可解释、可复用的业务语义,并进一步借助工业大模型将数据转化为可执行的运维决策。
对于离散装备制造企业而言,这一体系的价值不仅是提升单点设备的健康管理能力,更重要的是建立一套可持续迭代、可跨场景复制、可持续产生业务价值的工业智能底座。随着模型、知识与数据的持续沉淀,预测性维护将逐步从“项目能力”演进为“平台能力”,从“局部优化”演进为“系统优化”,最终成为高端制造企业数字化竞争力的重要组成部分。