本发明涉及计算机技术的领域,尤其涉及一种视频异常检测模型网络结构、训练方法及检测方法。
背景技术:
1、随着监控系统在公共场所的广泛应用,视频异常检测(video anoma lydetection,简称vad)在计算机视觉领域引起了越来越多的关注。vad的目标对视频中的异常时间相位(即异常事件发生的时间段)进行自动定位,其中,异常事件通常包括打斗、枪击、爆炸或入室盗窃等。
2、现有技术通常采用弱监督的视频异常检测技术(weak ly-supervi sed videoanomaly detection,wsvad)对异常事件进行监测;通过对数据集标注视频级的弱标签结合多示例学习完成异常检测任务。弱标签的标记方法即为若视频的所有帧都是正常的则将其标记为正常,如果视频包含若干异常帧则将其标记为异常。多示例学习法,其思想是将视频和片段分别视为包和示例,将异常视频视为正包,正常视频视为负包;在负包(即正常视频)中,所有示例均为正常;在正包(即异常视频)中,异常和正常示例同时存在。基于特征幅度、特征动态、聚类和注意力机制等异常标准,选出正包中的异常样本作为潜在异常示例。将正包中的潜在异常示例与负包中的正常示例配对,作为异常分类器的训练样本来完成训练。
3、尽管上述的弱监督的视频异常检测技术已表现出良好的性能,但其准确性仍然受到两个限制的阻碍:
4、1)异常标准不明确:先前研究中的异常标准通常依赖于一些不可靠的假设。例如,广泛使用的特征幅值标准假设异常片段的特征幅值会高于正常片段,但特征幅值由物体运动、物体数量、人类等多种因素决定,单纯以特征幅值作为异常判定标准并不合理;
5、2)异常长度的变化:不同的异常事件持续时间不同,如爆炸和枪击时间较短,而打斗时间较长,因此在vad中将相邻片段纳入考虑十分重要。然而在多示例学习范式中,时间连续性往往得不到充分利用,从而影响对异常片段的分辨效果,因此需要对现有的弱监督视频异常检测技术进行改进。
技术实现思路
1、为了提高对视频中正常片段和异常片段的分辨效果,本技术提供了一种视频异常检测模型网络结构、训练方法及检测方法。
2、为了实现本发明的上述目的,根据本发明的第二方面,本发明还提供一种视频异常检测模型训练网络结构;
3、一种视频异常检测模型训练网络结构包括
4、特征提取模块、特征融合模块和异常分数生成模块,
5、特征提取模块的输出端与特征融合模块的输入端连接;
6、特征融合模块的输出端与异常分数生成模块的输入端连接;
7、特征提取模块用于提取视频中的各视频片段的时空特征;时空特征包括时间特征和空间特征;
8、特征融合模块用于通过注意力机制将视频片段的时空特征和训练视频中其他视频片段的时间特征进行融合,得到融合时空特征;
9、异常分数生成模块用于根据视频片段的时空特征和片段间余弦相似度确定训练视频的异常分数。
10、可选地,异常分数生成模块包括第一评分单元和第二评分单元,
11、第一评分单元用于基于视频的融合时空特征输出第一评分结果;
12、第二评分单元用于根据预设规则对视频中各视频片段之间的片段间特征余弦相似度进行计算,得到视频的片段间特征余弦相似度矩阵;并根据片段间特征余弦相似度矩阵的均值向量与方差向量进行统计学计算,输出第二评分结果;
13、根据第一评分结果与第二评分结果确定训练视频最终的异常分数。
14、可选地,特征融合模块包括局部cyclefc层和全局cyclefc层,全局cyclefc层的时间步长大于局部cyclefc层的时间步长;
15、局部cyclefc层用于提取视频片段与相邻的一个视频片段的时间关系,得到局部时间特征;
16、全局cyclefc层用于提取视频片段与训练视频中多个视频片段的时间关系,得到全局时间特征;
17、特征融合模块用于通过注意力机制将视频片段的时空特征、局部时间特征和全局时间特征进行融合,得到融合时空特征。
18、为了实现本发明的上述目的,根据本发明的第二个方面,本发明提供了一种弱监督视频异常检测模型训练方法。
19、本发明提供的一种弱监督视频异常检测模型训练方法,包括:
20、获取具有弱分类标签的训练样本集,其中,训练样本集包括多个具有分类标签的训练视频;
21、利用训练视频样本集对第一方面提供的视频异常检测模型进行训练,获得最终的视频异常分类模型。
22、可选地,利用训练样本集对视频异常检测模型进行训练的步骤包括;
23、提取训练视频中的各视频片段的时空特征;时空特征包括时间特征和空间特征;
24、通过注意力机制将视频片段的时空特征和训练视频中其他视频片段的时间特征进行融合,得到融合时空特征;
25、将各视频片段的融合时空特征输入待训练视频异常分类模型,得到训练视频的异常分数,输出训练视频的新分类标签;
26、基于各训练视频的新分类标签确定待训练视频异常分类模型的损失函数;
27、根据具有弱标签的训练视频样本集和损失函数优化待训练视频异常分类模型的网络参数,得到最终的视频异常检测模型。
28、可选地,待训练视频异常分类模型对训练视频的异常分数进行预测的步骤包括:
29、将各视频片段的融合时空特征输入待训练视频异常分类模型,得到训练视频的异常分数的步骤包括
30、将训练视频的融合时空特征代入预设的分类函数,分类函数对各视频片段的分类标签进行预测评分,输出第一评分结果;
31、根据预设规则对训练视频中各视频片段之间的片段间特征余弦相似度进行计算,得到训练视频的片段间特征余弦相似度矩阵;
32、根据片段间特征余弦相似度矩阵的均值向量与方差向量进行统计学计算,得到第二评分结果;
33、根据第一评分结果与第二评分结果确定训练视频最终的异常分数。
34、可选地,每个训练视频中包括多个视频片段,训练视频包括正常视频和异常视频,正常视频为不存在异常视频片段的训练视频,异常视频为存在异常视频片段的训练视频;在训练阶段将正常视频和异常视频成对输入待训练视频异常分类模型;
35、根据预设规则对训练视频中各视频片段之间的片段间特征余弦相似度进行计算,得到训练视频的片段间特征余弦相似度矩阵的步骤包括:
36、将异常视频的融合时空特征和与异常视频配对的正常视频的融合时空特征进行余弦相似度计算,得到异常视频的片段间特征余弦相似度矩阵;
37、将正常视频和自身的融合时空特征进行余弦相似度计算,得到正常视频的片段间特征余弦相似度矩阵;
38、基于异常视频的片段间特征余弦相似度矩阵的均值向量和方差向量,得到异常视频的第二评分结果;
39、基于正常视频的片段间特征余弦相似度矩阵的均值向量和方差向量,得到正常视频的第二评分结果。
40、可选地,所述方法还包括:为训练视频注入长短期时间信息。
41、可选地,为训练视频注入长短期时间信息的步骤包括:
42、将各视频片段的时空特征和与之相邻的一个视频片段的时间特征进行融合,得到局部时间信息;
43、将各视频片段的时空特征和训练视频中多个视频片段的时间特征进行特征融合,得到全局时间信息;
44、根据局部时间信息和全局时间信息确定训练视频的长短期时间信息。
45、为了实现本发明的上述目的,根据本发明的第三方面,本发明还提供一种弱监督视频异常检测方法,所述弱监督视频异常检测方法包括:
46、获取待检测视频,将待检测视频输入按照第二方面提供的弱监督视频异常检测模型训练方法获取的视频异常检测模型,视频异常分类模型对待检测视频的异常分数进行预测,输出待检测视频的分类标签。
47、综上,本技术包括以下有益技术效果:
48、1、由于正常视频片段与正常视频片段之间的余弦相似度趋近于1,而异常视频片段与正常视频片段之间的平均特征余弦相似度比较低,因此异常视频的片段间特征余弦相似度将表现出较大的方差;利用视频的片段间余弦相似度对正常视频和异常视频进行区分,能够提高分类识别网络对正常视频和异常视频区分结果的准确性;在对视频进行打分时,根据视频片段时空特征幅值和训练视频片段间特征余弦相似度的统计学特性对训练视频的异常分数进行预测,使得视频异常检测模型能够更容易的判断出视频中是否存在异常视频片段,从而能够提高对视频中正常片段和异常片段的分辨效果;
49、2、通过具有较小时间步长的局部cyclefc层提取相邻视频片段的时间信息,通过具有较大时间步长的全局cyclefc层对视频片段间长期的时间关系提取,实现对视频片段长短期时间特征信息的获取,使得视频异常检测模型能够对视频片段长短期的时间关系进行整合,使得视频异常检测模型能够更有效地辨别正常视频片段和异常视频片段;
50、3、利用标注有弱标签的训练视频样本集,对待训练视频异常分类模型进行训练,只需要对整个训练视频标注正常视频或异常视频的标签即可,减小工作人员的工作量;根据训练视频待训练视频异常分类模型预测的异常分数确定训练视频的新分类标签;并利用新分类标签构建损失函数对待训练视频异常分类模型进行自动优化,能够提高对待训练视频异常分类模型的训练效率;
51、4、通过具有较小时间步长的局部cyclefc层提取相邻视频片段的时间信息,通过具有较大时间步长的全局cyclefc层对视频片段间长期的时间关系提取,实现对视频片段长短期时间特征信息的获取,使得视频异常检测模型能够更有效地辨别正常视频片段和异常视频片段。
1.一种视频异常检测模型网络结构,其特征在于,
2.如权利要求1所述的视频异常检测模型网络结构,其特征在于,异常分数生成模块(3)包括第一评分单元(31)和第二评分单元(32),
3.如权利要求1所述的视频异常检测模型网络结构,其特征在于,
4.一种弱监督视频异常检测模型训练方法,其特征在于,
5.如权利要求4所述的弱监督视频异常检测模型训练方法,其特征在于,利用训练样本集对视频异常检测模型进行训练的步骤包括;
6.如权利要求5所述的弱监督视频异常检测模型训练方法,其特征在于,
7.如权利要求6所述的弱监督视频异常检测模型训练方法,其特征在于,每个训练视频中包括多个视频片段,训练视频包括正常视频和异常视频,正常视频为不存在异常视频片段的训练视频,异常视频为存在异常视频片段的训练视频;在训练阶段将正常视频和异常视频成对输入待训练视频异常分类模型;
8.如权利要求4至7任一项所述的弱监督视频异常检测模型训练方法,其特征在于,所述方法还包括:为训练视频注入长短期时间信息。
9.如权利要求8所述的弱监督视频异常检测模型训练方法,其特征在于,为训练视频注入长短期时间信息的步骤包括:
10.一种弱监督视频异常检测方法,其特征在于,包括:
