基于多模态时空表征的级联深度强化学习安全决策方法

allin2026-07-31  2


本发明属于深度强化学习自动驾驶领域,涉及车辆安全决策技术,具体涉及一种基于多模态时空表征的级联深度强化学习安全决策方法。


背景技术:

1、在自动驾驶领域,确保车辆能够在多种多样的驾驶场景下做出安全决策是至关重要的,这直接关系到驾驶员和乘客的生命财产安全。传统的自动驾驶系统基本采用模块化方法,其中每个功能,如感知、预测和决策等,分别开发并集成到系统中。模块化方法中最常见的决策方法是使用基于规则的方法,这对于解决驾驶时发生的大量情况通常是无效的。因此,现有的方法主要趋向数据学习策略来实现安全决策,例如模仿学习和深度强化学习。

2、基于深度强化学习的自动驾驶安全决策方法是一种将长序列驾驶任务表征为马尔科夫决策过程,智能车辆通过与环境的不断交互,在奖励函数的指导下自行学习驾驶策略,从而根据当前状态观测给出自适应最优决策动作的方法。它允许智能汽车通过试错来优化其决策效果,而不依赖于人工设计的规则和人类驾驶数据。当前的深度强化学习自动驾驶方法主要分为两大类:端到端的方法和解耦的方法。端到端的方法直接学习从原始传感器数据到控制命令的映射。由于传感器数据通常是复杂的高维数据,包含干扰和冗余信息,这需要较深的网络才能学习到良好的驾驶策略。但drl产生的梯度通常不足以有效训练深度神经网络,使得训练过程变得困难。而解耦的方法通常将自动驾驶系统分为感知和决策两部分。首先,感知部分使用监督学习训练深度网络,对环境进行理解并产生一个中间表示;然后决策部分使用强化学习训练较浅的网络,从中间表示中学习驾驶策略。主要有两种方法,一种训练感知模型直接将原始观测映射到自定义感知结果来作为强化学习状态,如相关的感知指标(汽车相对于道路的角度、到车道标记的距离等)或解析整个场景的语义分割掩码。另一种则是使用一些辅助任务头训练感知编码器从原始观测中获取驾驶相关的潜在特征,然后将其馈送到强化学习网络以解码最优驾驶策略。前者在感知和决策之间通过自定义结果来进行传递,随着顺序过程的进行,容易造成误差累积和信息丢失,从而限制决策的性能。后者通过传递特征表示的方法解决了这个问题,受到了广泛关注。

3、目前,使用潜在特征作为强化学习状态的方法在涉及大量动态对象的高流量密度场景中,尤其在罕见的突发事件下存在缺乏安全性的问题。促成了这种安全问题的因素有很多,其中两个主要缺陷是:1)缺乏全面的场景感知。单个传感器通常不能提供足够的信息来感知驾驶场景,单图像方法不能提供场景的准确3d信息,单激光雷达方法则无法提供语义信息。2)缺乏交通场景的时间维度信息。可见,对动态驾驶场景不能只捕获空间信息,还应该捕获连续输入之间的动态变化性。此外,预测周围交通参与者的未来行为对自动驾驶汽车采取安全可靠的决策也至关重要。


技术实现思路

1、本发明的目的是为了克服现有技术的不足,提出一种基于多模态时空表征的级联深度强化学习安全决策方法,其感知和预测编码器不仅考虑空间维度的信息而且引入时间维度的信息,实现了对动态场景的全面理解,从而提高了行车安全性,更加符合实际应用的需要。

2、为了实现上述目的,本发明具体采用的技术方案如下:

3、基于多模态时空表征的级联深度强化学习安全决策方法,其先构建了一个多模态时空感知编码器从多模态连续输入中联合建模空间和运动信息,以获取动态驾驶场景的当前感知表征;而后,引入未来预测编码器从当前感知表征中捕获不同交通参与者之间的交互,获取未来预测表征;而后,连接当前感知表征和未来预测表征形成多模态时空表征并作为强化学习的状态输入,以全面把握场景,并结合分布式ppo算法,在针对安全决策设计的奖励函数指导下实现安全决策任务,具体包括以下步骤:

4、s1、原始传感器数据的采集及预处理;其中,原始传感器数据包括当前时刻的前视rgb彩色图像、激光雷达点云、速度数据以及与车道中心的偏差距离和偏差角度数据;对于激光雷达点云,首先将过去五帧的激光雷达点云重新对准当前时刻的车辆坐标系,然后将这连续六帧的点云都体素化为具有固定分辨率的2d bev网格,最后将它们连接起来得到六通道激光雷达bev投影伪图像;对于速度数据以及与车道中心的偏差距离和偏差角度数据,进行归一化操作;

5、s2、结合空间感知和运动感知的多任务头监督训练一个多模态时空感知编码器,从单帧前视rgb彩色图像和连续六帧的激光雷达bev投影伪图像中提取当前感知表征;该多模态时空感知编码器的网络由图像特征提取主干网络、激光雷达bev特征提取主干网络、多模态特征融合网络和多任务头网络组成;

6、s3、训练未来预测编码器学习从多模态时空感知编码器输出的激光雷达bev特征flidar_fusion中捕获各交通参与者的相互关系,获取动态驾驶场景的未来预测表征;该未来预测编码器的网络由位置注意力网络、通道注意力网络、注意力融合网络和未来预测任务头网络组成;

7、s4、完成步骤s2和步骤s3的监督训练后,设计奖励函数,使用分布式ppo强化学习算法训练深度强化学习决策模型,从激光雷达bev特征和未来预测特征组成的多模态时空表征以及速度数据、与车道中心的偏差距离和偏差角度数据中学习最优安全决策策略。

8、进一步地,所述的图像特征提取主干网络通过一个经过imagenet预训练的resnet-34网络的四个残差卷积块分别进行特征提取得到四个具有不同层次信息的图像特征si表示不同的特征提取阶段。

9、进一步地,所述的激光雷达bev特征提取主干网络以连续六帧的六通道激光雷达bev投影伪图像为输入项,通过一个引入时空卷积结构的vi deoresnet-18网络的四个时空卷积块分别进行特征提取得到四个具有不同层次信息的激光雷达bev特征其中si表示不同的特征提取阶段。

10、进一步地,所述的多模态特征融合网络用于将四个不同尺度的图像特征和四个不同尺度的激光雷达bev特征分别进行特征融合,融合时,先将两个分支的主干网络提取的图像特征和激光雷达bev特征经过维度重塑后连接得到序列向量然后将经过一个多模态融合transformer模块,实现不同模态特征之间的充分信息交互,获取到3d场景中的全局时空上下文特征最后,将切片且分别还原为和相同维度的特征,并和进行元素相加得到经过融合后的图像特征和激光雷达bev特征

11、进一步地,为了捕获不同分支任务之间的相互关系,增强不同分支中的特征表达,图像分支和激光雷达bev分支分别使用不同的多任务头进行监督训练,;图像分支由hdep和hsem两个任务头组成,分别为前视图像的深度估计和语义分割;使用交叉熵损失进行前视语义分割,使用l1损失监督前视深度估计任务;bev点云分支由任务头hbev,hv和hbb组成,分别用于bev语义分割、周边车辆速度预测和2d目标检测;使用交叉熵损失进行bev语义分割,使用l2损失监督周边车辆速度预测,2d目标检测使用centernet解码器来定位场景中的其他交通参与者。

12、进一步地,所述的步骤s3中,位置注意力网络将多模态时空融合后的激光雷达bev特征flidar_fusion分别输入到三个卷积层获取三个与原来相同维度的特征图,然后将它们的维度调整为三个相同维度的二维特征和接着,在的转置和之间执行矩阵乘法,并应用softmax层计算空间注意力图slo;然后在slo和的转置之间执行矩阵乘法,捕获特征图任意两个位置之间的空间依赖性,并将结果重新调整维度得到与flidar_fusion相同维度的特征图最后将和flidar_fusion进行元素相加得到位置注意力网络的最终输出

13、进一步地,所述的步骤s3中,通道注意力网络将多模态时空融合后的激光雷达bev特征flidar_fusion进行维度调整得到两个相同维度的二维特征然后在的转置和之间执行矩阵乘法,并应用softmax层来获取通道注意力图sch;之后在sch和flidar_fusion的转置之间执行矩阵乘法,捕获任意两个通道之间的通道依赖性,并将结果重新调整维度得到与flidar_fusion相同维度的特征图最后将和flidar_fusion进行元素相加得到通道注意力网络的最终输出

14、进一步地,所述的步骤s3中,注意融合网络将位置注意力网络和通道注意力网络的输出和经过元素相加和卷积操作得到未来预测特征ffuture;未来预测任务头网络从未来预测特征ffuture中解析未来0.5秒后的场景状态,即当前场景中的其他交通参与者在0.5秒后的位置及速度预测。

15、进一步地,所述的步骤s4中,奖励函数包括触发预定义事件获得的稀疏奖励和每个时间戳都获得的稠密奖励;稀疏奖励包含六种,分别是发生碰撞、无故停车、超速、偏差距离大于阈值、偏差角度大于阈值及其偏差角速度大于阈值,当满足上述条件时给予惩罚;稠密奖励包含四种,分别是偏差距离奖励、偏差角度奖励、角速度奖励以及速度奖励。

16、进一步地,所述的步骤s4中,采用多分支横纵向分离的网络结构,对一组高级导航命令(路口左转、路口右转、路口直行、沿当前道路行驶)中的每个导航命令采用独立的动作预测分支,导航命令充当在每个时间戳下使用哪个分支的选择开关,每个分支学习特定于其导航命令的子策略;在每个分支中,考虑到车辆的运动控制涉及两个相对独立的操作:横向控制和纵向控制,设计两个相同的分支分别处理横向控制和纵向控制;横向控制和纵向控制的网络结构均由策略网络和值网络组成;

17、策略网络将多模态时空融合后的激光雷达bev特征图flidar_fusion和未来预测特征图ffuture进行通道拼接操作得到特征图f,然后将f经过四层卷积后展平为一维特征向量,最后将该特征向量与包含速度数据、与车道中心的偏差距离和偏差角度数据的自车测量向量连接起来后经过三层全连接层后输出d维的离散动作预测概率p(st);

18、值网络将多模态时空融合后的激光雷达bev特征图flidar_fusion和未来预测特征图ffuture进行通道拼接操作得到特征图f,然后将f经过四层卷积后展平为一维特征向量,最后将该特征向量与包含速度数据、与车道中心的偏差距离和偏差角度数据的自车测量向量连接起来后经过三层全连接层后输出一维的状态价值预测q(st)。

19、本发明具有以下的特点和有益效果:

20、本发明采用基于多模态时空表征的级联深度强化学习主动安全决策方法通过奖励函数指导车辆进行主动安全决策技能的学习。设计的多模态时空感知编码器联合建模空间和运动信息,为后续决策提供了场景的当前感知表征,保证了决策需要信息的丰富性;设计的未来预测编码器捕获不同交通参与者之间的交互,为后续决策提供未来预测表征,提高了决策成功率。当前感知表征和未来预测表征形成对场景的全面理解,保证了决策过程的安全,具有很高的环境适应性和决策成功率。通过决策策略学习后,该方法能够在稠密交通场景中以及突发事件下实现智能汽车的安全决策任务。


技术特征:

1.基于多模态时空表征的级联深度强化学习安全决策方法,其特征在于,包括以下步骤:

2.如权利要求1所述的基于多模态时空表征的级联深度强化学习安全决策方法,其特征在于,所述的图像特征提取主干网络通过一个经过imagenet预训练的resnet-34网络的四个残差卷积块分别进行特征提取得到四个具有不同层次信息的图像特征其中si表示不同的特征提取阶段。

3.如权利要求1所述的基于多模态时空表征的级联深度强化学习安全决策方法,其特征在于,所述的激光雷达bev特征提取主干网络以连续六帧的六通道激光雷达bev投影伪图像为输入项,通过一个引入时空卷积结构的videoresnet-18网络的四个时空卷积块分别进行特征提取得到四个具有不同层次信息的激光雷达bev特征其中si表示不同的特征提取阶段。

4.如权利要求1所述的基于多模态时空表征的级联深度强化学习安全决策方法,其特征在于,所述的多模态特征融合网络用于将四个不同尺度的图像特征和四个不同尺度的激光雷达bev特征分别进行特征融合,融合时,先将两个分支的主干网络提取的图像特征和激光雷达bev特征经过维度重塑后连接得到序列向量然后将经过一个多模态融合transformer模块,实现不同模态特征之间的充分信息交互,获取到3d场景中的全局时空上下文特征最后,将切片且分别还原为和相同维度的特征,并和进行元素相加得到经过融合后的图像特征和激光雷达bev特征

5.如权利要求1所述的基于多模态时空表征的级联深度强化学习安全决策方法,其特征在于,图像分支和激光雷达bev分支分别使用不同的多任务头进行监督训练,图像分支由hdep和hsem两个任务头组成,分别为前视图像的深度估计和语义分割;bev点云分支由任务头hbev,hv和hbb组成,分别用于bev语义分割、周边车辆速度预测和2d目标检测。

6.如权利要求1所述的基于多模态时空表征的级联深度强化学习安全决策方法,其特征在于,所述的步骤s3中,位置注意力网络将多模态时空融合后的激光雷达bev特征flidar_fusion分别输入到三个卷积层获取三个与原来相同维度的特征图,然后将它们的维度调整为三个相同维度的二维特征和接着,在的转置和之间执行矩阵乘法,并应用softmax层计算空间注意力图slo;然后在slo和的转置之间执行矩阵乘法,捕获特征图任意两个位置之间的空间依赖性,并将结果重新调整维度得到与flidar_fusion相同维度的特征图最后将和flidar_fusion进行元素相加得到位置注意力网络的最终输出

7.如权利要求1所述的基于多模态时空表征的级联深度强化学习安全决策方法,其特征在于,所述的步骤s3中,通道注意力网络将多模态时空融合后的激光雷达bev特征flidar_fusion进行维度调整得到两个相同维度的二维特征然后在的转置和之间执行矩阵乘法,并应用softmax层来获取通道注意力图sch;之后在sch和flidar_fusion的转置之间执行矩阵乘法,捕获任意两个通道之间的通道依赖性,并将结果重新调整维度得到与flidar_fusion相同维度的特征图最后将和flidar_fusion进行元素相加得到通道注意力网络的最终输出

8.如权利要求1所述的基于多模态时空表征的级联深度强化学习安全决策方法,其特征在于,所述的步骤s3中,注意融合网络将位置注意力网络和通道注意力网络的输出和经过元素相加和卷积操作得到未来预测特征ffuture;未来预测任务头网络从未来预测特征ffuture中解析未来0.5秒后的场景状态。

9.如权利要求1所述的基于多模态时空表征的级联深度强化学习安全决策方法,其特征在于,所述的步骤s4中,奖励函数包括触发预定义事件获得的稀疏奖励和每个时间戳都获得的稠密奖励;稀疏奖励包含六种,分别是发生碰撞、无故停车、超速、偏差距离大于阈值、偏差角度大于阈值及其偏差角速度大于阈值,当满足上述条件时给予惩罚;稠密奖励包含四种,分别是偏差距离奖励、偏差角度奖励、角速度奖励以及速度奖励。

10.如权利要求1所述的基于多模态时空表征的级联深度强化学习安全决策方法,其特征在于,所述的步骤s4中,采用多分支横纵向分离的网络结构,对一组高级导航命令中的每个导航命令采用独立的动作预测分支,导航命令充当在每个时间戳下使用哪个分支的选择开关,每个分支学习特定于其导航命令的子策略;在每个分支中,考虑到车辆的运动控制涉及两个相对独立的操作:横向控制和纵向控制,设计两个相同的分支分别处理横向控制和纵向控制。

11.如权利要求10所述的基于多模态时空表征的级联深度强化学习安全决策方法,其特征在于,横向控制和纵向控制的网络结构均由策略网络和值网络组成;


技术总结
本发明属于深度强化学习自动驾驶领域,涉及车辆安全决策技术,具体是一种基于多模态时空表征的级联深度强化学习安全决策方法,其先构建了一个多模态时空感知编码器从多模态连续输入中联合建模空间和运动信息,以获取动态驾驶场景的当前感知表征;而后,引入未来预测编码器从当前感知表征中捕获不同交通参与者之间的交互,获取未来预测表征;而后,连接当前感知表征和未来预测表征形成多模态时空表征并作为强化学习的状态输入,以全面把握场景,并结合分布式PPO算法,在针对安全决策设计的奖励函数指导下实现安全决策任务。本发明具有很高的环境适应性和决策成功率,能够在稠密交通场景中以及突发事件下实现智能汽车的主动安全决策任务。

技术研发人员:杨宇翔,葛风龙,赵巨峰,凡金龙,董哲康,高明裕
受保护的技术使用者:杭州电子科技大学
技术研发日:
技术公布日:2024/10/31
转载请注明原文地址: https://www.8miu.com/read-29877.html

最新回复(0)