本发明涉及计算机视觉,尤其涉及一种基于多模态融合和动态知识图谱的目标检测方法及装置。
背景技术:
1、目标检测是计算机视觉领域的一个重要任务,旨在从图像或视频中识别和定位特定类别的物体。传统的目标检测方法通常基于封闭集假设,即只能检测预定义类别的目标。然而,在实际应用中,经常需要检测未知类别或新出现的目标,传统的目标检测方法就无法正常使用。
技术实现思路
1、本发明的目的在于克服现有技术中的不足,提供一种基于多模态融合和动态知识图谱的目标检测方法及装置,解决传统的目标检测方法仅能够检测预定义类别的目标,使用具有一定的局限性。
2、为达到上述目的,本发明是采用下述技术方案实现的:
3、第一方面,本发明提供了一种基于多模态融合和动态知识图谱的目标检测方法,包括:
4、获取待识别图像数据,以及与所述待识别图像数据相关的多模态数据;
5、对所述多模态数据进行预处理,对预处理后的所述多模态数据进行特征提取生成多模态特征;
6、构建知识图谱,将所述多模态特征与所述知识图谱的信息进行融合,生成统一的向量表示;
7、通过区域提议网络对所述待识别图像数据进行目标检测生成目标候选区域;
8、对各所述目标候选区域,进行边界框回归定位目标位置,结合统一的向量表示使用多层感知机预测目标类别;
9、其中,所述结合统一的向量表示使用多层感知机预测目标类别包括:
10、为所述多层感知机设计动态词汇表机制,根据统一的向量表示推理出与多层感知机当前预测相关的潜在类别,所述潜在类别为多层感知机当前未知的目标类别;
11、将所述潜在类别加入动态词汇表,扩展所述多层感知机的预测范围;通过所述多层感知机对各所述目标候选区域进行目标类别预测。
12、可选的,所述多模态数据包括图像数据、文本数据以及语音数据;
13、所述多模态数据的预处理包括:
14、所述图像数据的预处理包括缩放处理、裁剪处理以及归一化处理;
15、所述文本数据的预处理包括分词处理、去除停用词处理以及词形还原处理;
16、所述语音数据的预处理包括将所述语音数据转化为语音文本数据,对所述语音文本数据进行预处理。
17、可选的,所述对预处理后的所述多模态数据进行特征提取生成多模态特征包括:
18、对预处理后的图像数据,通过预训练的图像网络模型提取图像视觉特征;
19、对预处理后的文本数据和语音数据,通过预训练的语言网络模型提取文本语义特征;
20、对语音数据,通过预训练的语音网络模型提取语音语义特征。
21、可选的,所述构建知识图谱包括:
22、基于预定义的本体和大规模知识库构建初始知识图谱;所述本体包括实体、属性以及关系,所述实体为目标类别;
23、设计知识图谱的动态更新机制,所述动态更新机制包括新实体添加、关系更新以及冲突解决;
24、获取目标检测结果或外部反馈信息,并基于所述知识图谱的动态更新机制持续更新初始知识图谱。
25、可选的,所述将所述多模态特征与所述知识图谱的信息进行融合,生成统一的向量表示包括:
26、设计特征对齐机制,将多模态特征映射到知识图谱的语义空间;
27、采用注意力机制计算映射操作后的模态特征之间的相关性权重;
28、基于所述相关性权重采用跨模态transformer编码器进行特征深度融合,生成统一的向量表示。
29、可选的,针对所述潜在类别,可以通过少样本学习方式或零样本学习方式,令所述多层感知机快速适应其新类别。
30、第二方面,本发明提供了一种基于多模态融合和动态知识图谱的目标检测装置,包括:
31、数据获取模块,被配置为获取待识别图像数据,以及与所述待识别图像数据相关的多模态数据;
32、预处理模块,被配置为对所述多模态数据进行预处理,对预处理后的所述多模态数据进行特征提取生成多模态特征;
33、特征融合模块,被配置为构建知识图谱,将所述多模态特征与所述知识图谱的信息进行融合,生成统一的向量表示;
34、区域候选模块,被配置为通过区域提议网络对所述待识别图像数据进行目标检测生成目标候选区域;
35、类别识别模块,被配置为对各所述目标候选区域,进行边界框回归定位目标位置,结合统一的向量表示使用多层感知机预测目标类别。
36、第三方面,本发明提供了一种电子设备,包括处理器及存储介质;
37、所述存储介质用于存储指令;
38、所述处理器用于根据所述指令进行操作以执行根据上述方法的步骤。
39、第四方面,本发明提供了一种计算机可读存储介质,其上存储有计算机程序,该程序被处理器执行时实现上述方法的步骤。
40、第五方面,本发明提供了一种计算机程序产品,包括计算机程序/指令,该计算机程序/指令被处理器执行时实现上述方法的步骤。
41、与现有技术相比,本发明所达到的有益效果:
42、本发明提供的一种基于多模态融合和动态知识图谱的目标检测方法及装置,通过融合视觉、文本和语音等多模态信息,结合动态更新的知识图谱,实现了对已知类别和未知类别目标的高效检测。该方法能够自适应地学习新类别,并在检测过程中动态扩展词汇表,显著提高了开放性词汇目标检测的性能和泛化能力。
1.一种基于多模态融合和动态知识图谱的目标检测方法,其特征在于,包括:
2.根据权利要求1所述的基于多模态融合和动态知识图谱的目标检测方法,其特征在于,所述多模态数据包括图像数据、文本数据以及语音数据;
3.根据权利要求1所述的基于多模态融合和动态知识图谱的目标检测方法,其特征在于,所述对预处理后的所述多模态数据进行特征提取生成多模态特征包括:
4.根据权利要求1所述的基于多模态融合和动态知识图谱的目标检测方法,其特征在于,所述构建知识图谱包括:
5.根据权利要求1所述的基于多模态融合和动态知识图谱的目标检测方法,其特征在于,所述将所述多模态特征与所述知识图谱的信息进行融合,生成统一的向量表示包括:
6.根据权利要求1所述的基于多模态融合和动态知识图谱的目标检测方法,其特征在于,针对所述潜在类别,可以通过少样本学习方式或零样本学习方式,令所述多层感知机快速适应其新类别。
7.一种基于多模态融合和动态知识图谱的目标检测装置,其特征在于,包括:
8.一种电子设备,其特征在于,包括处理器及存储介质;
9.一种计算机可读存储介质,其上存储有计算机程序,其特征在于,该程序被处理器执行时实现权利要求1-6任一项所述方法的步骤。
10.一种计算机程序产品,包括计算机程序/指令,其特征在于,该计算机程序/指令被处理器执行时实现权利要求1-6中任一项所述方法的步骤。
