从“数据饥渴”到“数据富集”:数字孪生技术在机电系统故障数据生成中的应用
摘要:故障数据的稀缺与不平衡,是制约机电系统智能故障诊断技术从实验室走向工业现场的核心瓶颈。数字孪生技术通过在虚拟空间中构建物理实体的高保真镜像,为故障数据的生成与增强开辟了一条区别于纯数据驱动方法的新路径。本文围绕机电系统故障数据生成这一核心任务,系统梳理了数字孪生在该领域的技术原理与实现机制,将其归纳为分层协同建模、虚实数据融合和物理一致性约束三条技术路径。在分层协同建模方面,分析了元素-数据-关系三元组解耦与空间-行为-过程-状态四级子孪生的建模方法;在虚实数据融合方面,考察了生成对抗网络在弥合虚拟数据与真实数据分布差异中的作用;在物理一致性约束方面,讨论了物理信息引导和因果机制约束对生成样本可靠性的保障。文章结合多耦合机电系统试验台、永磁同步电机和轴承故障诊断等应用场景的实证数据,验证了数字孪生驱动故障数据生成方案的有效性,并指出了模型保真度与计算效率之间的权衡这一尚未解决的张力。
关键词:数字孪生;故障数据生成;机电系统;生成对抗网络;故障诊断
一、引言
机电系统故障诊断的智能化转型,正在遭遇一个颇具讽刺意味的困境:深度学习等数据驱动方法在公开数据集上不断刷新诊断精度的纪录,但在真实的工业场景中,这些方法却时常“水土不服”。问题的根源不在于算法本身,而在于训练数据的质量与数量。在机电系统的实际运行中,故障的发生具有偶发性、不可控性和高成本特征——没有人会为了采集故障样本而故意让一台价值数百万的电机烧毁。这导致了故障样本的极度稀缺,以及在类别分布上的严重不平衡:正常样本充裕而故障样本零星。
面对这一困境,学术界和工业界探索了多种数据增强策略。传统的信号处理手段(如加噪、平移、缩放)虽然操作简便,但生成样本的多样性有限,难以覆盖故障模式的复杂变化。纯数据驱动的生成模型(如生成对抗网络)能够从有限的真实样本中学习数据分布并生成新样本,但在小样本条件下训练不稳定、模式坍塌的问题突出,且生成样本的物理合理性难以保证。物理仿真方法可以生成任意数量和类型的故障信号,但仿真模型的简化假设使其输出与真实数据之间存在显著的分布差异。
数字孪生技术的介入,为上述困境提供了一种新的解题思路。数字孪生通过在虚拟空间中构建物理实体的高保真数字镜像,利用传感器数据实现虚实之间的实时映射与双向交互,使故障数据的生成不再依赖“等待故障发生”,也不再完全依赖“凭空创造”,而是在一个由物理机制约束的虚拟环境中主动“制造”故障。这种思路的核心价值在于:它将故障数据生成从“数据问题”部分地转化为“建模问题”——只要虚拟模型足够忠实于物理实体,生成的故障数据就具有工程可信度。
本文试图回答的核心问题包括:数字孪生技术在机电系统故障数据生成中的技术原理是什么?实现这一目标的关键技术路径有哪些?这些路径各自解决了什么问题、又面临什么局限?文章将从建模方法、数据融合和物理约束三个维度展开分析,并结合近年来该领域的实验数据对技术效果进行验证。
二、故障数据稀缺问题的成因与数字孪生的应对逻辑
(一)故障数据稀缺的深层原因
机电系统故障数据稀缺的表象是“样本少”,但深层原因更为复杂。第一,故障的物理稀缺性:关键机电设备(如航空发动机、大型电机、精密轴承)的设计寿命长、可靠性高,故障事件本身发生频率极低。第二,采集的经济约束:在工业现场部署高采样率传感器阵列需要可观的硬件投入,而企业对于在关键设备上增加传感器可能带来的停产风险持保守态度。第三,标注的专业门槛:故障数据的标注需要具备机电系统专业知识的技术人员完成,标注过程本身耗时且难以规模化。第四,数据的分布不均衡:即使获得了部分故障样本,不同故障类型之间的样本量差异可能达到几个数量级,比如轴承的“内圈故障”样本可能远多于“保持架断裂”样本。
这些原因的交织,使得单纯依靠“多采集数据”来解决故障诊断问题在工程上不可行。数据生成因此成为必由之路。
(二)从“数据增强”到“数据生成”:数字孪生的技术定位
需要区分“数据增强”和“数据生成”这两个概念。数据增强是在已有样本的基础上通过变换操作产生新样本,其本质是对现有数据分布的重采样。数据生成则是从数据分布的学习或物理机制的仿真出发,产生原本不存在的新样本。数字孪生技术在这两个层面都有用武之地,但其核心价值在于“数据生成”而非“数据增强”。
数字孪生驱动的故障数据生成具有三个区别于传统方法的特征。第一,物理可解释性:生成样本的故障特征来源于对物理机制的建模,而非统计分布的拟合,因此其频率成分、幅值特征和时序模式具有物理意义上的合理性。第二,故障类型的可控性:研究者可以根据诊断模型的需求,在数字孪生模型中灵活注入不同类型的故障(如调整轴承故障的尺寸、改变齿轮断齿的程度),生成“定制化”的故障样本,而无需等待故障在物理世界中偶然发生。第三,多工况的覆盖能力:物理实体的运行工况受限于实际生产条件,而数字孪生模型可以在虚拟空间中遍历各种工况组合,生成覆盖广泛运行条件的故障数据。
三、数字孪生驱动故障数据生成的技术路径
(一)分层协同建模:复杂机电系统的解耦与孪生构建
机电耦合系统的故障数据生成面临的首要困难是建模的复杂性。机电耦合系统由机械、电气、控制等多个子系统构成,子系统之间存在复杂的耦合关系——电机的电磁转矩受机械负载影响,机械振动又反过来影响电气参数。将这样一个高度耦合的系统作为一个整体来构建数字孪生模型,在建模精度和计算效率上都面临巨大挑战。
针对这一问题,有研究提出了一种分层协同的数字孪生构建框架,其核心思想是“解耦再耦合”。具体而言,该框架将机电耦合系统解耦为“元素-数据-关系”三元组表示,从多种模态出发建立对耦合特性的深层理解。在此基础上,构建空间、行为、过程、状态四个层级的子数字孪生,每一级子孪生采用数据与机理相结合的技术来平衡建模精度和适应性。最后,通过协同编排算法将这些异构子孪生整合为全系统数字孪生,实现不同故障模式下全局一致的映射。
这一方法在一个多耦合机电故障试验台上进行了验证。结果表明,该框架在数据增强故障分类的准确率上平均提升了17.29%,在另一组对比实验中提升了9.97%。这一数据表明,分层协同建模的策略有效地解决了复杂机电系统整体建模精度不足的问题,为后续的故障数据生成提供了可靠的虚拟实验平台。
从“
数字通信世界”领域的技术视角来看,这种分层协同建模的思路与通信网络中的分层协议设计有异曲同工之处:每一层负责特定粒度的建模任务,层与层之间通过标准化的接口进行交互,整体的复杂性被分解为可管理的子问题。
(二)生成对抗网络的虚实融合:弥合分布差异
数字孪生模型生成的故障数据虽然具有物理合理性,但与真实数据之间往往存在分布差异。这种差异的来源包括:仿真模型的简化假设、传感器特性的差异、以及环境噪声的影响。如果直接将仿真数据用于训练诊断模型,可能导致负面的知识迁移——诊断模型学到的是仿真数据的特征而非真实故障的特征。
生成对抗网络(GAN)在数字孪生驱动的故障数据生成中扮演了“虚实翻译器”的角色。其基本思路是:以数字孪生模型生成的仿真数据作为源域,以真实故障数据作为目标域,通过对抗训练使生成器学会将仿真数据映射到真实数据的分布空间。
有研究提出了一种基于Sobel梯度算子的双判别器GAN(DDGAN-Sobel),专门用于解决数字孪生辅助故障诊断中虚拟数据与真实数据分布差异过大的问题。该方法的创新之处在于设计了两个判别器,分别聚焦合成数据的全局特征和局部特征,同时引入Sobel梯度算子来捕获突变频率特征,实现指定故障信息的方向性传输。在一个定制的轴系统试验台上,该方法在三种不同条件下分别达到了99.46%、100%和98.47%的平均诊断准确率,优于当前的领先算法。
另一个值得关注的进展是基于物理信息引导的生成对抗网络(PIG-GAN),该方法利用数字孪生模型生成故障样本以缓解数据不平衡问题,其核心思路是将物理信息作为GAN训练的引导信号,使生成样本在保持统计逼真度的同时不偏离物理规律。
(三)物理一致性约束:从“像数据”到“对的数据”
GAN生成的故障数据在统计分布上可以逼近真实数据,但统计相似性不等于物理正确性。一个在统计上“像”故障信号但在物理上不成立的样本,对于诊断模型的训练可能产生误导。例如,GAN可能生成一种在频谱特征上与轴承外圈故障相似、但故障特征频率与转速的物理关系不成立的信号。
物理一致性约束技术旨在解决这一问题。有研究提出了基于物理信息引导的多尺度SMOTE方法(ARPMG-MS-SMOTE),将物理模型、先验知识和数据学习相结合来生成故障样本。具体而言,该方法构建了一个物理模型引导的U-Net编码器-解码器,从频域谱中提取层次化的故障表示,然后在多尺度潜在特征空间中进行插值生成候选故障样本。为进一步提升物理一致性,该方法利用频带幅值比和谱平坦度构建频域先验知识库,并使用溯因推理来验证和修正生成谱。在两个轴承数据集上的消融实验验证了物理模型引导、溯因推理修正和多尺度特征生成各组件的有效性。
在永磁同步电机的故障数据生成中,物理一致性约束同样得到了应用。有研究基于Modelica构建了耦合电磁、机械和热多物理域的高保真数字孪生模型,通过仿真具有代表性的故障场景来生成物理一致、时间分辨的故障数据集。基于CNN的结构感知深度学习架构在验证集上达到了98.08%的准确率,启动延迟约为10到20毫秒。
物理一致性约束的引入,使数字孪生驱动的故障数据生成从“生成像数据的数据”升级为“生成对的数据”,这是该方法区别于纯数据驱动生成模型的核心竞争力。
四、应用验证与性能分析
(一)多耦合机电系统试验台验证
前面提到的分层协同数字孪生框架在多耦合机电故障试验台上进行了系统的实验验证。该试验台模拟了机械传动、电气驱动和控制系统的耦合关系,能够复现多种故障模式。实验对比了基于数字孪生生成的增强数据与原始数据在故障分类任务上的表现。结果显示,使用数字孪生增强数据训练的分类模型在准确率上平均提升了17.29%,在另一组涉及不同故障严重程度的实验中提升了9.97%。这一提升幅度在故障诊断领域是相当显著的,说明数字孪生生成的数据不仅增加了样本数量,更在样本多样性和物理合理性上弥补了原始数据的不足。
(二)轴承故障诊断的小样本场景
滚动轴承是机电系统中故障率最高的部件之一,其故障诊断的小样本问题尤为突出。有研究提出了一种基于数字孪生的WGAN-CT数据增强框架,首先建立故障轴承的动态模型生成物理一致的仿真信号,然后引入WGAN-CT通过Dropout实现双Lipschitz约束来稳定训练并提升生成质量。该框架的核心创新在于通过引入物理先验将仿真数据映射到真实数据域,实验结果表明该方法在Wasserstein距离和MMD指标上均优于对比方法,增强数据显著提升了小样本条件下的诊断准确率。
在制动阀异常监测场景中,一项研究将物理仿真与硬件在环实验相结合,构建了域自适应的循环GAN(CausalStarGAN),通过引入阀门激励信号与压力响应之间的因果关系来实现高保真的数据迁移。实验数据显示,合成数据使模型在平均绝对误差、均方根误差和平均绝对百分比误差上分别降低了21.3%、23.1%和8.8%。这一结果表明,将因果关系纳入GAN的训练约束,可以显著提升生成数据在工程应用中的可用性。
(三)跨场景的技术效果比较
从上述应用案例中可以提炼出一个值得关注的规律:数字孪生驱动的故障数据生成方法在不同应用场景中的效果存在差异。在结构相对简单的部件(如单个轴承)上,方法的诊断准确率提升幅度较大;而在多耦合复杂系统上,提升幅度相对较小但绝对值仍然显著。这一差异的根本原因在于数字孪生模型的保真度:部件级孪生模型的物理机制相对清晰,建模精度容易保证;系统级孪生模型的耦合关系复杂,建模误差的累积效应更为明显。
另一个值得关注的趋势是,近年来的研究越来越强调“物理一致性”而非单纯的“统计相似性”。从DDGAN-Sobel的梯度算子约束,到ARPMG-MS-SMOTE的溯因推理修正,再到PIG-GAN的物理信息引导,技术演进的共同方向是:让生成的数据不仅在数值分布上接近真实数据,更在物理机制上符合工程规律。
五、挑战与展望
尽管数字孪生驱动的故障数据生成已经展现出显著的技术潜力,但其从实验室走向工业现场仍面临若干挑战。
第一,模型保真度与计算效率的权衡。 高保真度的多物理场耦合仿真能够生成物理一致的故障数据,但其计算成本往往难以承受。在实际工业应用中,企业需要的是能够在合理时间内生成足够数量故障数据的方案,而非追求极致精度的“
实验室级”仿真。如何在保真度和效率之间找到工程可接受的平衡点,是当前研究亟需回答的问题。从“河南科技”领域的技术应用视角看,基于数字孪生的变电站电气设备状态评估与预测性维护技术已经在这方面进行了探索,其实践经验表明,分层建模和模型降阶是缓解这一矛盾的有效手段。
第二,数字孪生模型的持续更新。 机电系统在运行过程中会发生磨损、老化和性能退化,数字孪生模型如果不能及时反映这些变化,其生成的故障数据就会逐渐偏离实际。数字孪生的“动态更新”能力——即模型参数随物理实体的状态变化而自适应调整——目前的研究仍不充分。
第三,生成数据的评估标准缺失。 如何判断一组生成的故障数据是否“足够好”?当前研究中常用的Wasserstein距离、MMD等统计指标只能衡量分布相似性,无法评估物理一致性。建立一个涵盖统计指标和物理指标的综合评估框架,是该领域走向工程化应用的必然要求。
第四,跨域迁移的可靠性。 数字孪生模型通常针对特定设备或特定工况构建,将一个设备上生成的故障数据迁移到另一台设备上使用时,迁移的有效性和可靠性缺乏理论保障。域自适应方法虽然提供了一些技术手段,但其在机电系统故障数据生成场景中的适用边界仍需进一步厘清。
六、结语
机电系统故障数据的稀缺,是制约智能诊断技术落地的核心瓶颈之一。数字孪生技术通过在虚拟空间中构建物理实体的忠实镜像,使故障数据的生成从“被动等待”转变为“主动制造”。本文从分层协同建模、生成对抗网络虚实融合和物理一致性约束三个维度梳理了该领域的技术路径,并结合多耦合机电系统、轴承和制动阀等应用场景的实验数据验证了这些路径的有效性。数字孪生生成的数据在诊断准确率上能够带来10%以上的提升,在特定场景下可达20%以上的误差降低。
然而,数字孪生驱动的故障数据生成并不只是一个技术问题。它涉及一个更深层的认识论转变:从“用数据训练模型”转向“用模型生成数据”,再用生成的数据训练诊断模型。这一转变的合理性建立在数字孪生模型足够忠实的假设之上,而这一假设的成立条件——模型的物理覆盖范围、参数校准精度、以及对未建模动态的处理方式——正是未来研究需要系统回答的问题。在“数字通信世界”领域,数字孪生与通信技术的融合正在为远程故障诊断提供新的可能性;而在“河南科技”所关注的产业技术升级语境中,数字孪生驱动的故障数据生成技术有望成为机电装备预测性维护体系的关键支撑。
参考文献:
[1] Su X, Tao L, Sun B, et al. Fault data augmentation for electromechanical coupling systems based on hierarchical collaborative digital twin[J]. Chinese Journal of Aeronautics, 2025.
[2] Geng J, Zhang Y, Daoerji S, et al. Multiphysics modelling-based digital twin for intelligent fault diagnosis of PMSMs[C]//IET International Conference on Digital Twins and Applications (DTA APAC 2026), 2026.
[3] A dual-discriminator network based on Sobel gradient operator for digital twin-assisted fault diagnosis[J]. Engineering Applications of Artificial Intelligence, 2025.