本发明涉及新能源汽车,特别涉及一种基于多智能体强化学习的新能源汽车热管理系统控制方法。
背景技术:
1、随着全球对环境保护和能源效率要求的日益提高,新能源汽车作为减少碳排放、提升能源利用效率的重要方向,得到了快速发展。电动汽车(ev)作为传统化石燃料汽车的替代品继续受到更多关注,与传统的化石燃料汽车相比,当前电动汽车的最大缺点之一其行驶里程相对较短。而改善短续航里程最简单的方法是增加电池容量,大量相关研究正在进行中,另一种方法是提高电动汽车中耗能系统的效率。
2、在电动汽车领域,热管理系统(tms)的重要性远超传统内燃机汽车,同时供暖、通风和空调(hvac)系统是电动汽车中最耗能的系统之一,它是一种复杂的非线性热流体动力学系统,由压缩机、电子膨胀阀(exv)和热交换器等各种执行器组成,用于控制车辆驾驶舱内温度。由于电动汽车中热管理系统的能耗比例更大,使得电动汽车对热管理系统高效控制的重要性大于传统车辆。
3、多数热管理系统采用pid算法控制,因其简单的实现而被广泛使用,不需要目标系统的动力学建模,然而pid算法控制会产生如下问题:(1)现有热管理系统采用pid算法控制时没有进行温控阶段的划分,导致不同温控阶段的控制策略相似,无法最大限度的降低热管理系统的能耗;(2)在大多数情况下,在多输入多输出(mimo)系统中很难使用pid算法控制,因为每个控制输出都与单个功能耦合,这使得pid算法控制难以反映具有多个特征的复杂目标,从而导致控制的效果不佳;(3)pid算法控制需要一个通常基于经验和专业知识的设定点,因此可能并不是最佳的点,尤其是目标过冷度(dos)的确定极大地影响了系统的效率,而这取决于先前的经验,可靠性不足;(4)由于pid算法控制是一种反馈控制,它依赖于系统当前观测的误差,很难考虑整个轨迹,如果模型系数设置不当,系统运行时可能会发生振荡,稳定性较差。
4、因此,在电动汽车的热管理系统设计中,研发一种热管理系统控制方法,能够在确保汽车整体性能的同时最大限度地减少热管理系统对动力电池的能量消耗,具有十分重要的意义。
技术实现思路
1、本发明要解决的技术问题是:克服现有技术中之不足,提供一种能够在确保汽车整体性能的同时最大限度地减少热管理系统对动力电池能量消耗,且可靠性和稳定性均能够得到保证的基于多智能体强化学习的新能源汽车热管理系统控制方法。
2、本发明解决其技术问题所采用的技术方案是:一种基于多智能体强化学习的新能源汽车热管理系统控制方法,包括如下步骤:
3、s1.实时数据的采集:通过各传感器采集车辆行驶过程中热管理系统所需实时数据,所需实时数据包括驾驶舱温度、压缩机功率、压缩机转速、制冷剂温度、制冷剂压力、防冻液温度和防冻液液位;
4、s2.温控阶段的划分:依据驾驶舱内实时温度与目标温度的关系,将温度控制划分为两个阶段:瞬态阶段和稳态阶段;其中,瞬态阶段下多智能体的目标是让热管理系统找到最佳运行轨迹,使得驾驶舱内实时温度在给定时间内达到目标温度;稳态阶段下多智能体的目标是让热管理系统找到最佳运行组合,使得驾驶舱内实时温度稳定在目标温度;
5、s3.多智能体的建立:构建马尔科夫博弈框架,各智能体包括元组,其中,表示连续状态空间,表示连续动作空间,表示未知状态的转移动态,代表着转移到下一个状态的概率密度,为奖励函数,为奖励的折扣系数;
6、s4.多智能体的训练;
7、s5.多智能体与热管理系统的交互:步骤s4中训练后的各温控阶段智能体对步骤s1中采集的实时数据进行计算分析,将输出结果通过控制信号反馈至热管理系统,热管理系统执行器根据控制信号对车辆制冷系统进行控制。
8、进一步地,所述步骤s2中最佳运行轨迹应满足如下约束条件:
9、
10、所述步骤s2中最佳运行组合应满足如下约束条件:
11、
12、其中,为时刻的功率,决定了时间惩罚的权重,为温度的收敛范围,为时刻温度,为时刻温度,为目标温度,为由瞬态阶段转为稳态阶段的临界时刻,为稳态阶段收敛的时间限制。
13、进一步地,所述步骤s3中各温控阶段智能体均由压缩机智能体和电子膨胀阀智能体组成,所述压缩机智能体和电子膨胀阀智能体采用相同的架构,所述电子膨胀阀智能体还包括观测信号,公式如下:
14、
15、其中,为温度的收敛范围,为时刻温度,为目标温度。
16、进一步地,所述多智能体强化学习的目标是最大化当前策略在每一时间步所累计的期望奖励;使用策略函数,状态值函数,行动值函数以获得近似的累计期望奖励;策略的函数如下
17、
18、其中,为数学期望,为时刻的折扣系数,为时间步的折扣系数,为时刻状态值,为时刻行动值,为时刻奖励值。
19、进一步地,所述压缩机智能体的状态空间如下:
20、;
21、所述电子膨胀阀智能体的状态空间如下:
22、
23、其中,为时刻的温度,为时刻的温度,为时刻的过冷度,为时刻的过冷度,为目标过冷度,为时刻压缩机的控制值,为时刻电子膨胀阀的控制值,为电子膨胀阀的一个额外观测信号。
24、进一步地,所述压缩机的控制值由压缩机智能体中动作空间的行动值通过映射函数转换获得,所述电子膨胀阀的控制值由电子膨胀阀智能体中动作空间的行动值通过映射函数转换获得,映射关系如下:
25、
26、其中,为压缩机的操作范围上限,为电子膨胀阀的操作范围上限,为控制值上限,为压缩机的操作下限,为电子膨胀阀的操作下限,为控制值的下限,为时刻压缩机的行动值,为时刻压缩机的状态,为时刻电子膨胀阀的行动值,为时刻电子膨胀阀的状态,为时刻压缩机的控制值,为时刻压缩机的控制值,为时刻电子膨胀阀的控制值。
27、进一步地,所述瞬态阶段各智能体的奖励函数如下:
28、
29、所述稳态阶段各智能体的奖励函数如下:
30、
31、其中,为压缩机智能体的奖励函数,为电子膨胀阀智能体的奖励函数,为温度奖励,为工作奖励, 为过冷度奖励,为时刻的过冷度, 为目标过冷度,为奖励系数,为电子膨胀阀的一个额外观测信号,为实时温度未达到目标温度,为实时温度达到目标温度,为时刻的功率。
32、进一步地,所述步骤s4中多智能体的训练均采用软演员-评论家算法,具体步骤如下:
33、s41.多智能体通过与热管理系统交互,接收当前车辆状态信息,各智能体通过奖励函数计算出奖励和,将过度状态信息存放到经验回放记忆单元中;
34、s42.从每个经验回放记忆单元中随机抽取批过度状态信息,输入到各智能体的网络中进行网络计算,将当前计算出的动作值、值和目标值输出到各智能体,多个损失函数接收动作值、值和目标值,分别计算出演员损失、评论家损失和损失,再将这些损失进行反向传播,更新梯度,更新各智能体参数;
35、s43.训练结束后,在推理阶段,演员网络分离出来,将状态信息作为输入,各智能体分别输出压缩机和电子膨胀阀的控制值。
36、进一步地,所述软演员-评论家算法中智能体的目标公式如下:
37、
38、其中,为数学期望,,表示策略分布的熵,为状态下的策略,为策略熵的权重;
39、评论家为在策略下的软函数,通过最小化评论目标进行训练,公式如下:
40、
41、其中,为策略下的期望回报,为数学期望,为在状态下采取动作后转移到状态的概率分布上的期望,为在策略下从状态开始预期能够得到的未来奖励的总和,为目标网络设置的参数;
42、演员策略通过最小化演员的目标进行更新,公式如下:
43、
44、其中,为策略下的期望回报,和均为数学期望,为在策略下从状态开始采取动作的概率。
45、进一步地,所述步骤s5中热管理系统执行器至少包括电子水泵、多通水阀、电子膨胀阀、压缩机、电磁截止阀、制冷剂的温度压力传感器、压力传感器、温度传感器以及防冻液的温度传感器、液位传感器;
46、其中,电子水泵根据热管理系统的控制指令,调节水泵的转速,控制冷却液的流量;多通水阀根据热管理系统的控制指令,调节阀门的开度,实现冷却液的分配和流向控制;电子膨胀阀根据热管理系统的控制指令,调节阀门的开度,控制制冷剂的流量,调节制冷效果;压缩机根据热管理系统的控制指令,将低温低压的气态制冷剂压缩成高温高压的气体,然后输送到冷凝器中,使其释放热量并冷凝成液体;电磁截止阀根据热管理系统的控制指令,快速开启或关闭,实现制冷剂和冷却液流路的通断控制;制冷剂的温度压力传感器、压力传感器、温度传感器用于采集制冷剂的温度及压力;防冻液的温度传感器和液位传感器分别用于采集防冻液的温度和液位。
47、本发明的有益效果是:
48、(1)本发明通过温控阶段的划分,对不同温控阶段的多智能体制定相应的奖励函数,从而实现对不同温控阶段的热管理系统采用不同的控制策略,热管理系统的控制更加精细化,最大限度的降低了热管理系统的能耗,同时汽车的整体性能能够得到保证。
49、(2)本发明通过分别对瞬态阶段的最佳运行轨迹和稳态阶段的最佳运行组合施加约束条件,保证多智能体对热管理系统的控制策略符合降低热管理系统能耗的最终目标。
50、(3)本发明通过在电子膨胀阀智能体内引入观测信号,实时观测过冷度的变化,以适当的反馈满足目标过冷度。
1.一种基于多智能体强化学习的新能源汽车热管理系统控制方法,其特征在于,包括如下步骤:
2.根据权利要求1所述的基于多智能体强化学习的新能源汽车热管理系统控制方法,其特征在于,所述步骤s2中最佳运行轨迹应满足如下约束条件:
3.根据权利要求1所述的基于多智能体强化学习的新能源汽车热管理系统控制方法,其特征在于,所述步骤s3中各温控阶段多智能体均由压缩机智能体和电子膨胀阀智能体组成,所述压缩机智能体和电子膨胀阀智能体采用相同的架构,所述电子膨胀阀智能体还包括观测信号,公式如下:
4.根据权利要求3所述的基于多智能体强化学习的新能源汽车热管理系统控制方法,其特征在于,所述多智能体强化学习的目标是最大化当前策略在每一时间步所累计的期望奖励;使用策略函数、状态值函数和行动值函数以获得近似的累计期望奖励;策略的q函数如下:
5.根据权利要求3所述的基于多智能体强化学习的新能源汽车热管理系统控制方法,其特征在于,所述压缩机智能体的状态空间如下:
6.根据权利要求5所述的基于多智能体强化学习的新能源汽车热管理系统控制方法,其特征在于,所述压缩机的控制值由压缩机智能体中动作空间的行动值通过映射函数转换获得,所述电子膨胀阀的控制值由电子膨胀阀智能体中动作空间的行动值通过映射函数转换获得,映射关系如下:
7.根据权利要求3所述的基于多智能体强化学习的新能源汽车热管理系统控制方法,其特征在于,所述瞬态阶段各智能体的奖励函数如下:
8.根据权利要求1所述的基于多智能体强化学习的新能源汽车热管理系统控制方法,其特征在于,所述步骤s4中多智能体的训练均采用软演员-评论家算法,具体步骤如下:
9.根据权利要求8所述的基于多智能体强化学习的新能源汽车热管理系统控制方法,其特征在于,所述软演员-评论家算法中智能体的目标公式如下:
10.根据权利要求1所述的基于多智能体强化学习的新能源汽车热管理系统控制方法,其特征在于,所述步骤s5中热管理系统执行器至少包括电子水泵、多通水阀、电子膨胀阀、压缩机、电磁截止阀、制冷剂的温度压力传感器、压力传感器、温度传感器以及防冻液的温度传感器、液位传感器;
