一种基于自监督预训练的无监督小样本宫颈细胞分类方法

allin2026-08-10  5


本发明涉及一种基于自监督预训练的无监督小样本宫颈细胞分类方法,属于数字图像处理与医学交叉。


背景技术:

1、宫颈癌是引全球女性死亡的主要疾病之一,其发病机制明确,早期诊断治愈率极高。因此,宫颈细胞图像的准确分类对于宫颈癌的早期筛查和干预治疗至关重要。当前最主要的早筛手段是宫颈液基细胞学检测(即tct检查,通过采集宫颈细胞并进行制片,观察细胞的形态和结构,以发现异常细胞或可疑的恶性细胞),筛查效率低,极易受病理医生主观影响,准确度低,经常出现误诊和漏诊情况。

2、基于深度学习的宫颈细胞图像分类算法虽然实现了自动化阅片,但算法需要大量数据训练数据。然而在实际医疗场景中,涉及病人的隐私,以及罕见、低发病例极少,所以收集大量宫颈细胞图像不仅费时费力,而且每张数据都需要专业人员标注,成本极高。因此,需要设计小样本学习算法,基于极少标注数据准确分类宫颈细胞,辅助医生进行疾病诊断。

3、目前的小样本学习算法应用于宫颈细胞图像分类问题直接应用于宫颈细胞图像分类任务还存在以下问题:

4、(1)监督小样本学习算法应用于图像分类任务时,需要使用一个包含大量标注数据的辅助数据集用于元训练过程,但是宫颈细胞分类任务中,难以收集大量标注数据,且标注成本高;

5、(2)目前的无监督小样本学习算法通过相同的数据增强方法构建小样本分类任务,由于支持集和查询集图像过于相似,小样本分类任务过于简单,导致网络容易过拟合,分类准确度低(参见“xu h,wang j,li h,et al.unsupervised meta-learning for few-shot learning[j].pattern recognition,2021,116(6):107951.doi:10.1016/j.patcog.2021.107951.”);另外,由于无监督小样本学习算法是依靠算法自身从未标记的数据中发现模式或结构,而不是依赖于预先定义的标签来指导学习过程,也即元训练时不能使用图像的标签信息,而是采用随机初始化的特征提取网络,因此难以训练出准确的分类模型。


技术实现思路

1、为解决目前存在的上述问题,打破小样本图像分类算法需要一个包含大量标注数据作为元训练集的严苛条件,本发明提供了一种基于自监督预训练的无监督小样本宫颈细胞分类算法,实现基于大量无标注数据训练小样本宫颈细胞图像分类模型。

2、本发明一种基于自监督预训练的无监督小样本宫颈细胞分类算法,包含以下步骤:

3、步骤1:将小样本宫颈细胞图像数据集划分为元训练集和元测试集,其中元训练集不包含图像的标签信息,元测试集包含图像的标签信息;

4、步骤2:搭建特征提取网络;

5、步骤3:基于元训练集构建图像方向旋转方向判定的辅助任务和对比学习任务,对特征提取网络进行自监督预训练;

6、步骤4:基于元训练集采用传统数据增强技术和自动数据增强技术分别生成支持集和查询集图像,构建n-way k-shot小样本分类任务进行无监督小样本学习,微调特征提取网络,其中n表示一个小样本分类任务中样本的总的类别数,k表示每个类别包含的支持集样本个数,并提出分布偏移损失函数;

7、步骤5:利用训练完成的特征提取网络对待分类的宫颈细胞进行分类。

8、可选的,所述步骤3包括:

9、步骤3a,构建图像旋转方向判定的辅助任务;

10、假设从元训练集中随机采样m张宫颈细胞图像{x1,x2,…,xm},并定义一组离散的旋转变换任意一张图像xi经过该组离散的旋转变换都能生成四张图像其中r表示中的旋转角度;对于变换后的图像利用特征提取网络fθ(·)提取抽象特征,并经过判定旋转角度的分类器gω(·)得到各方向的判定概率:

11、

12、其中θ和ω分别表示特征提取网络和分类器的权重;最后基于旋转方向判定辅助任务的损失函数表示为

13、

14、步骤3b,构建对比学习任务;

15、假设从元训练集中随机采样m张宫颈细胞图像{x1,x2,…,xm},通过传统数据增强算子ac∈ac得到m张增强后的图像{ac(x1),ac(x2),…,ac(xm)};原图和增强后的图像经过特征提取网络后的嵌入特征分别为

16、

17、通过极大似然估计法将对比学习视为一个简单的二分类任务;对于任意的图像xi,其增强后的图像ac(xi)应被视为同一实例i,其他图像xj(j≠i)被视为不同的实例;图像ac(xi)被分类为实例i的概率为

18、

19、其中τ表示对比学习中的温度系数,控制对难分负样本的惩罚系数,一般默认采用较小的温度系数;图像xj不被分类成实例i的概率为

20、

21、不同图像被分类成实例i是相互独立的事件,所以ac(xi)呗分类成实例i和xj不被分类成实例i的联合概率为

22、

23、联合概率的负对数似然函数为

24、

25、因此,对比学习任务的每一批次损失为所有实例的负对数似然函数之和:

26、

27、步骤3c,自监督预训练阶段的总体损失函数定义为:

28、lssl=lrot+lcon

29、预训练完成后,保存预训练后的特征提取网络。

30、可选的,所述步骤4包括:

31、步骤4a,构建n-way k-shot小样本分类任务;

32、从元训练集中随机采样n张宫颈细胞图像{x1,x2,…,xn},将每张图像视为一个类别并随机赋予为标签{(x1,1),(x2,2),…,(xn,n)},使用k种传统数据增强算子生成支持集图像,另外使用q种自动数据增强算子生成查询集图像,最后构建n-way k-shot小样本分类任务t=(supportset,queryset):

33、

34、步骤4b,构建基于原型的分类器;

35、针对构建的n-way k-shot小样本分类任务,将支持集图像和查询集图像分别输入到预训练后的特征提取网络fθ(·)得到各自的嵌入特征,根据每类支持集图像的嵌入特征计算原型:

36、

37、通过sns(semi-normalized similarity)相似性度量函数构建最近邻分类器,假设给定当前小样本分类任务的查询集图像其被分为第c类的概率为

38、

39、若查询图像嵌入特征与原型的相似度越大,则属于该类的可能性越大,因此一个小样本分类任务的损失函数定义为

40、

41、步骤4c,计算分布偏移损失函数;

42、首先,采用最大均值差异算法度量支持集和查询集在特征空间的分布差异:

43、

44、分布偏移损失函数应保证在训练过程中,支持集和查询集的分布差异逐渐增大,从而增加小样本分类任务的难度,因此被定义为:

45、

46、步骤4d,计算无监督小样本学习阶段的总体损失函数为:

47、l=lfew+λldol

48、通过损失的梯度更新特征提取器的参数;当所有的小样本任务都处理完毕后,结束学习过程,保存训练好的特征提取器。

49、可选的,所述步骤5包括:

50、在元测试阶段,基于训练好的特征提取网络和元测试集的小样本任务,利用支持集样本嵌入特征计算原型并构建最近邻分类器,根据查询集样本嵌入特征到各原型的距离对查询集样本分类,计算所有小样本任务上的平均分类准确度。

51、可选的,k种传统数据增强算子包括:缩放、随机裁剪、随机旋转以及图像属性的随机调整。

52、可选的,所述图像属性包括图像亮度、对比度、饱和度、色温、色调、透明度等。

53、可选的,所述q种自动数据增强算子采用从imagenet数据集迁移的自动数据增强技术的子策略;自动数据增强技术采用强化学习思想搜索的最佳增强策略。

54、可选的,子策略包括图像剪切和翻转、颜色变换、几何变换等。

55、本发明有益效果是:

56、1、本发明提出的无监督小样本宫颈细胞分类方法,打破监督学习的严格条件限制,在元训练时不需要图像的标签信息,相比于监督小样本学习算法,极大的降低宫颈细胞图像的收集和标注成本。

57、2、本发明采用自监督学习算法,从宫颈细胞图像本身固有结构和信息中创建监督信息进行预训练,不仅为特征提取网络提供良好的初始参数,也学习更多的先验知识和更一般的特征表示,显著提高了对宫颈细胞的分类准确度。

58、3、针对无监督小样本学习算法中支持集和查询集图像过于相似导致的网络容易过拟合、分类准确度低的问题,本发明一方面分别采用传统数据增强技术和自动数据增强技术生成支持集和查询集图像以构建小样本分类任务,增加了支持集和查询集样本的多样性,另一方面又提出分布偏移损失函数,通过最大化分布偏移损失在元训练时逐步扩大支持集和查询集的分布差异,进一步提高小样本分类任务的难度,能够有效防止网络过拟合,提高分类准确度。


技术特征:

1.一种基于自监督预训练的无监督小样本宫颈细胞分类方法,其特征在于,所述方法包括:

2.根据权利要求1所述的方法,其特征在于,所述步骤3包括:

3.根据权利要求2所述的方法,其特征在于,所述步骤4包括:

4.根据权利要求3所述的方法,其特征在于,所述k种传统数据增强算子包括:缩放、随机裁剪、随机旋转以及图像属性的随机调整。

5.根据权利要求3所述的方法,其特征在于,所述q种自动数据增强算子采用从imagenet数据集迁移的自动数据增强技术的子策略;自动数据增强技术采用强化学习思想搜索的最佳增强策略。

6.根据权利要求3所述的方法,其特征在于,所述支持集和查询集在特征空间的分布差异mmd(supportset,queryset)为:

7.根据权利要求6所述的方法,其特征在于,所述经过判定旋转角度的分类器gω(·)得到的各方向的判定概率pi,r为:

8.根据权利要求7所述的方法,其特征在于,所述小样本宫颈细胞图像数据集采用公开的数据集或者自采集数据集。


技术总结
本发明公开了一种基于自监督预训练的无监督小样本宫颈细胞分类方法,属于数字图像处理与医学交叉技术领域。所述方法通过自监督预训练技术为特征提取网络提供良好的初始参数,随后,在无监督小样本学习阶段,基于两种不同数据增强技术生成支持集和查询集样本,构建大量小样本分类任务微调特征提取网络;最后,提出分布偏移损失函数,在训练过程中逐渐扩大支持集和查询集的分布差异,增加小样本分类任务的难度,从而提高算法的分类准确度;相对于现有宫颈细胞分类方法,本申请方案极大的降低了数据的收集和标注成本,提高了分类精度,且有效减少了病理医生对宫颈细胞分类的工作强度。

技术研发人员:谢莉,舒卫平,耿俊杰,兰倩,杨海麟
受保护的技术使用者:江南大学
技术研发日:
技术公布日:2024/10/31
转载请注明原文地址: https://www.8miu.com/read-30136.html

最新回复(0)