一种基于DQN的集群系统预测性维修决策方法

allin2026-09-03  39


本发明涉及人工智能,尤其涉及一种基于dqn的集群系统预测性维修决策方法。


背景技术:

1、在现代工业领域中,随着集群系统规模的不断扩大,设备的性能和可靠性要求变得越来越严格。集群系统广泛应用于各类复杂的工程系统中,如工业储能系统、大规模数据中心以及智能制造系统。这些系统通常由大量的节点组成,这些节点在长期运行过程中会因为多种因素逐渐退化,导致系统整体性能的下降和故障风险的增加。因此,如何有效地进行预测性维修以确保系统的可靠性和延长系统的使用寿命,已成为一个至关重要的技术挑战。

2、传统的维修策略通常依赖于定期维护或基于单一设备状态参数的策略。这些方法在应对现代复杂系统的动态性和多样性时往往表现出一定的局限性,容易导致维修不足或过度维修,从而增加系统的运维成本,并可能影响系统的整体可靠性。为了解决这一问题,研究人员提出了基于状态的预测性维修方法。这些方法通过监测系统的运行状态,预测设备的退化趋势,并在设备出现故障之前进行预防性维修,从而降低系统的故障风险。

3、针对集群系统运维中的预防性维修这类典型问题,聚焦该类问题的代表性前沿问题——集群系统“预测性维修”决策问题,对于长期运行阶段集群系统性能退化条件下的运维工作具有重要意义,其问题的难点在于集群系统通常具备集群-集簇-节点三层级组成形态,涉及超大规模的节点集,并且节点与节点之间需按照复杂的内部联系组合而成集簇形态,与此同时,由于材料、制造工艺和其他环境因素,每个节点之间仍然存在细微差异,导致长期运行阶段各个节点及其部件在性能退化上表现出不尽相同的时间动态特征。因此,对于预测性维修方案而言,需考虑不同退化状态下的集簇及节点维修收益的不均衡性,集簇及节点修复程度的可选择性,集簇及节点修复时序对集群性能恢复的高影响,从而形成高维度的集群-集簇-节点退化状态空间和预测性维修动作空间,进而导致集群系统预测性维修决策问题整体的np-hard特征。

4、近年来,随着人工智能技术的发展,基于深度学习的预测性维修方法逐渐引起了广泛关注。其中,深度强化学习(deep reinforcement learning,drl)技术因其在处理高维状态空间和复杂决策问题上的优势,成为预测性维修领域的一个重要研究方向。深度q网络(deep q-network,dqn)作为drl的核心算法之一,能够通过学习和优化复杂系统的维修策略,在保证系统可靠性的同时,最大限度地降低维修成本。

5、dqn模型通过对系统的高维状态空间进行建模,利用神经网络对维修动作的价值函数进行逼近,并通过策略迭代不断优化维修策略。这种方法能够动态调整维修策略,使其适应系统的实际运行状态,从而提高预测性维修的精确度和有效性。此外,dqn结合了经验回放技术,通过利用过去的维修数据进一步优化模型性能,增强了系统在不同运行阶段的维修决策能力。


技术实现思路

1、针对上述考虑集群系统退化与维修收益不均衡的预测性维修决策问题,本发明提供了一种基于dqn的集群系统预测性维修决策方法,该方法旨在解决大规模集群系统中多节点、多层次退化的复杂问题。通过设计和训练dqn模型,建立集群系统的退化状态模型,并利用ε-greedy算法生成维修策略,本发明能够有效应对集群系统在长期运行过程中所面临的可靠性挑战。在执行维修策略后,系统的运行状态得到反馈,并用于进一步优化dqn模型,以持续提升系统的预测性维修能力。此方法不仅适用于工业储能系统的大规模电池组集群,还可推广应用于其他复杂集群系统的维护与管理中。

2、为了实现上述的目的,本发明采用了以下的技术方案:

3、一种基于dqn的集群系统预测性维修决策方法,所述方法包括以下的步骤:

4、1)构建集群系统的退化状态模型,所述集群系统包括多个节点,所述节点的退化状态在系统运行过程中随时间变化;

5、2)设计并训练一个dqn模型,对最优价值函数q进行函数逼近,提供对价值函数q的估计,评估当前的集群系统维修状态特征x;

6、3)基于所述dqn模型对价值函数q进行估计,通过ε-greedy算法得到一个维修状态概率π,进而生成当前集群维修状态特征的最佳维修动作a*;

7、4)执行所述维修策略中的一系列维修动作,直至集群系统的性能恢复至预定阈值;

8、5)通过对执行的维修动作进行反馈,将获得的维修数据添加至经验回放缓冲区,所述经验回放缓冲区用于对所述dqn模型进行进一步的训练,以优化下一次维修决策。

9、作为优选,所述步骤1)中建集群系统建立一个集簇集c来描述h个集簇的集群,每个集簇ch(h=1,2,…,h)由m×n个个节点按照一定的秩序和节点间内部联系组成,集群系统的预测性维修涉及三个决策层面,包括节点、集簇和集群层面;约束条件是成本,优化目标是集群的可靠性,变量是节点的维修状态;基本决策变量为集簇ch中节点n(h,m,n)的预测性维修状态pms(h,m,n)(h=1,2,…,h;m=1,2,…,m;n=1,2,…,n);当pms(h,m,n)=1时,对该节点执行预测性维修任务,当pms(h,m,n)=0时,不对该节点执行预测性维修任务。

10、作为优选,一个h×m×n的集群,其维修决策用维修策略pms来描述如下:

11、pms=[pms1,pms2,…,pmsh,…, pmsh](1.1)

12、式中pmsh是集簇ch的策略矩阵,描述为:

13、(1.2)

14、式中维修策略矩阵的每个元素pms(h,m,n)均仅有两种状态,0-正常状态,1-维修更换状态;则有:

15、(1.3)

16、集群的初始状态特征张量表示为:

17、s=[s1rec,s2rec,…,shrec,…,shrec](1.4)

18、其中向量中每个元素是每个集簇ch的初始状态特征,表示为:

19、(1.5)

20、式中,矩阵元素为节点n(h,m,n)的初始状态;在集群运行一段时间之后,根据式(1.3)计算节点的状态;

21、节点退化后集群的状态特征张量表示为:

22、sfad=[s1fad,s2fad,…,shfad,…,shfad](1.6)

23、其中向量元素为每个集簇ch退化后的状态特征,表示为:

24、(1.7)

25、式中元素为节点n(h,m,n)退化后的状态;

26、成本可以与变量pms(h,m,n)相关,完成预测性维修后的集群可靠性与此时的集群状态特征张量smai相关;预测性维修问题表示为:

27、(1.8)

28、其中ct为预期总成本;rs是集群的可靠性,cthr是成本的阈值;集群的预期总成本ct通过以下方式计算:

29、(1.9)

30、其中,ch为集簇ch的成本,c(h,m,n)为节点n(h,m,n)的成本。

31、作为优选,所述dqn模型包括:

32、输入层,用于接收集群系统的当前状态特征;

33、多个隐藏层,包括至少一个卷积层和全连接层,用于提取系统状态特征并进行价值函数估计;

34、输出层,用于输出各维修动作的最优价值估计。

35、作为优选,基于q-learning的思想使用深度神经网络作为dqn,对最优价值函数q进行函数逼近,最优价值函数q表示为:

36、(1.10);

37、rt表示t时刻的奖励,γ表示折扣因子, π表示行为策略,s表示状态,a表示动作,st表示t时刻状态的观测结果,at表示t时刻执行的动作;

38、在策略迭代过程中,更新的损失函数表示为:

39、(1.11)

40、其中γ表示折扣因子;θi表示dqn在第i个pi过程时的网络参数;θi-表示在第i个pi过程时目标dqn的网络参数;目标dqn的网络参数设置为第i-1个pi过程的网络参数,θi-=θi-1;q(s,a,θi)表示基于深度神经网络的近似价值函数,θi表示神经网络的参数;(s,a,r,s’)~u(d)表示dqn智能体的经验数据,s表示当前时刻状态,a表示当前时刻动作,s’表示下一时刻状态,a’表示下一时刻动作。

41、作为优选,所述经验回放技术包括:

42、随机采样经验回放缓冲区中的数据,并通过梯度下降法对所述dqn模型进行训练,更新模型参数,以最小化估计的价值函数与实际奖励之间的均方差。

43、作为优选,所述经验回放技术包括以下的步骤:

44、所述经验回放技术包括以下的步骤:

45、设计一个dqn最优价值函数q进行函数逼近,随机初始化网络参数 θo,定义其输入输出信息;

46、dqn的输入是一个集群系统状态特征矩阵st=[st,s1]:在t时刻下,集群系统中所有集簇及其节点组成的h×m×n阶状态矩阵,记为:

47、st=[s1t,s2t,…,sht,…,sht](1.12)

48、其中sth代表t时刻集簇ch的状态特征,表示为:

49、(1.13)

50、式中元素为t时刻节点n(h,m,n)的状态;

51、dqn的输出是价值函数的最优估计q*(s,a);在预测性维修决策过程(pmdp)过程中通过ε-greedy算法得到的维修状态概率π以及最终的奖励值r,然后生成经验数据集et=(st,at,rt,st+1),基于经验回放技术,利用梯度下降法训练神经网络参数θ。

52、作为优选,预测性维修agent学习过程的每次迭代包括四个模块:输入特征生成、pmdp、可靠性评价与奖励,以及dqn学习训练;首先,生成初始状态特征和lru集;其次,执行pmdp以生成维护策略;第三,对策略进行评分,并通过批量训练调整resnet参数 θi;对于下一次迭代i+1,生成新的初始状态特征和lru-set,然后pmdp使用参数为 θi的resnet生成新的策略;对于第一次迭代,pmdp使用参数为 θo的随机初始化的resnet。

53、作为优选,预测性维修agent完成学习训练后,将现实世界集群系统的输入特征x和lru集的 slru作为输入;然后,预测性维修agent使用lru集slru执行一系列维修动作;对于每一个时间步,经过训练的dqn使用输入特征x来预测先验信息,然后ε-greedy基于先验信息选择更高回报的动作来修复一个退化节点;最后,一系列高回报的维修动作会产生一个完整的预测性维修策略。

54、进一步,本发明还公开了一种计算机可读存储介质,其上存储有计算机程序或指令,该计算机程序或指令被处理器执行时实现所述方法。

55、本发明由于采用了上述的技术方案,通过训练一个dqn神经网络模型,对预测性维修动作的最优价值函数进行函数逼近,提供对该价值函数的估计,评估当前的集群系统高维退化状态特征;然后基于dqn对预测性维修动作价值函数的估计,通过ε-greedy算法得到维修策略,即预测性维修动作概率矩阵,进而生成面向当前集群退化状态特征的最佳维修动作;在执行一系列最佳维修动作之后集群系统性能恢复至一个设定阈值,则完成一次预测性维修决策过程,一系列最佳维修动作构成一个完整的预测性维修策略。多组维修决策数据构成训练样本数据集,dqn基于该经验数据集进行学习训练,为下一次预测性维修决策过程提供更优的价值函数估计。

56、综上所述,预测性维修决策方法通过综合分析集群系统中大规模节点退化模型、集群性能评估算法以及集群系统的预测性维修决策等关键环节,针对大规模节点退化状态空间与维修动作空间之间复杂的映射关系,设计dqn模型学习其中复杂映射关系所伴随的不均衡的维修收益,进而基于dqn智能体选择维修动作。基于所提出的dqn预测性维修决策算法,本发明在案例分析部分针对面向工业储能系统的大规模电池组集群在长期运行阶段的预测性维修决策问题进行了案例验证,并且在案例的对比分析部分,基于退化模型和评估算法,通过启发式博弈和mcts搜索维修动作,与所提出的dqn方法进行对比,讨论所研究的考虑退化与收益不均衡的预测性维修方法。案例分析结果表明,所提出的决策算法在大规模电池组集群长期运行过程中,能够高效稳定地提供预测性维修决策方案,提升了在高维非线性状态动作空间下的维修收益。


技术特征:

1.一种基于dqn模型的集群系统预测性维修决策方法,其特征在于,该方法包括以下的步骤:

2.根据权利要求1所述的预测性维修决策方法,其特征在于,步骤1)中建集群系统建立一个集簇集c来描述h个集簇的集群,每个集簇ch,由m×n个个节点按照一定的秩序和节点间内部联系组成,h=1,2,…,h;集群系统的预测性维修涉及三个决策层面,包括节点、集簇和集群层面;约束条件是成本,优化目标是集群的可靠性,变量是节点的维修状态;基本决策变量为集簇ch中节点n(h,m,n)的预测性维修状态pms(h,m,n),h=1,2,…,h;m=1,2,…,m;n=1,2,…,n;当pms(h,m,n)=1时,对该节点执行预测性维修任务,当pms(h,m,n)=0时,不对该节点执行预测性维修任务。

3.根据权利要求2所述的预测性维修决策方法,其特征在于,h×m×n的集群,其维修决策用维修策略pms来描述如下:

4.根据权利要求1所述的预测性维修决策方法,其特征在于,所述dqn模型包括:

5.根据权利要求4所述的预测性维修决策方法,其特征在于,基于q-learning的思想使用深度神经网络作为dqn,对最优价值函数q进行函数逼近,最优价值函数q表示为:

6.根据权利要求1所述的预测性维修决策方法,其特征在于,所述经验回放技术包括:

7.根据权利要求6所述的预测性维修决策方法,其特征在于,所述经验回放技术包括以下的步骤:

8.根据权利要求3所述的预测性维修决策方法,其特征在于,预测性维修agent学习过程的每次迭代包括四个模块:输入特征生成、预测性维修决策过程、可靠性评价与奖励,以及dqn学习训练;首先,生成初始状态特征和lru集;其次,执行预测性维修决策过程以生成维护策略;第三,对策略进行评分,并通过批量训练调整resnet参数θi;对于下一次迭代i+1,生成新的初始状态特征和lru-set,然后预测性维修决策过程使用参数为θi的resnet生成新的策略;对于第一次迭代,预测性维修决策过程使用参数为θo的随机初始化的resnet。

9.根据权利要求8所述的预测性维修决策方法,其特征在于,预测性维修agent完成学习训练后,将现实世界集群系统的输入特征x和lru集的slru作为输入;然后,预测性维修agent使用lru集slru执行一系列维修动作;对于每一个时间步,经过训练的dqn使用输入特征x来预测先验信息,然后ε-greedy基于先验信息选择更高回报的动作来修复一个退化节点;最后,一系列高回报的维修动作会产生一个完整的预测性维修策略。

10.一种计算机可读存储介质,其上存储有计算机程序或指令,其特征在于,该计算机程序或指令被处理器执行时实现权利要求1-9任意一项权利要求所述方法。


技术总结
本发明涉及人工智能技术领域,尤其涉及一种基于DQN的集群系统预测性维修决策方法。本发明通过设计和训练DQN模型,建立集群系统的退化状态模型,并利用ε‑greedy算法生成维修策略,本发明能够有效应对集群系统在长期运行过程中所面临的可靠性挑战。在执行维修策略后,系统的运行状态得到反馈,并用于进一步优化DQN模型,以持续提升系统的预测性维修能力。此方法不仅适用于工业储能系统的大规模电池组集群,还可推广应用于其他复杂集群系统的维护与管理中。

技术研发人员:吴其隆,祖天培,李炳华,李颖异,张清源,杨超,康锐
受保护的技术使用者:杭州市北京航空航天大学国际创新研究院(北京航空航天大学国际创新学院)
技术研发日:
技术公布日:2024/10/31
转载请注明原文地址: https://www.8miu.com/read-30972.html

最新回复(0)