一种基于周期性跨模态对齐的医学影像报告生成方法

allin2026-07-30  17


本发明属于人工智能领域,具体涉及深度学习、自然语言处理、跨模态对齐、图像字幕等技术,尤其涉及一种基于周期性跨模态对齐的医学影像报告生成方法。


背景技术:

1、随着医疗科技的不断进步,医学图像研究已经成为医疗领域不可或缺的技术工具,在指导医生制定诊疗计划和评估治疗效果等方面发挥着至关重要的作用。医学报告自动生成是一项前沿研究,其背景根植于现代医疗领域的急剧发展。医疗系统面临着日益增长的患者数量、庞大的医学数据库和信息技术的快速进步。这些因素共同推动了医学信息的快速增长,但也引发了一系列挑战。医生和医护人员需要处理巨大的患者信息,包括临床数据、实验室结果、影像学资料等,以制定精确的诊断和制定治疗方案。然而,这需要大量时间和努力,容易受到人为错误和信息丢失的影响。医学文献的增长速度令人望而却步,医生难以跟踪最新的研究成果和临床指南。这可能导致医疗决策的滞后,无法充分利用最新的医学知识。通过医疗图像来制作医疗报告是一项复杂的任务,必须由在专门课程中学习数年的放射科医生完成。然而,每张图像都需要放射科医生仔细检查并撰写全文报告来描述结果,这可能是一项耗时的任务。解决这一问题的方法之一是将医学图像和先进的智能技术相结合,以辅助医疗决策并提高工作效率。为了缓解临床医师的工作负担,同时提高医疗诊断的准确性和效率,将医疗图像和先进智能技术进行交叉研究和应用成为当前国际上的一个重要研究方向。医学报告自动生成的研究致力于解决这些挑战。借助自然语言处理技术、机器学习算法和医学领域的专业知识的融合,研究人员努力开发自动化技术,以分析患者数据并生成高质量的医学报告。这一努力有助于提高医疗保健的效率,降低错误和遗漏,确保医学报告的一致性和标准化,同时为医疗决策提供更强有力的支持,促进医学研究的发展。

2、从传统的图像和视频中生成文本描述已经得到广泛深入的研究,例如图像字幕和视频摘要生成等。近来,基于深度学习的编码器-解码器体系结构在图像描述领域表现出了卓越性能。受到图像字幕任务的成功启发,大多数现有的医疗报告生成方法采用编码器-解码器框架来生成自由文本报告。然而,医疗报告生成任务可能与图像字幕任务不同。图像字幕任务的目标是生成简洁的总结句子来描述主要内容,而在医疗报告生成任务中,需要生成由多个细粒度句子组成的冗长段落,以详细描述对不同物理组织的观察结果。鉴于在医疗图像的视觉内容和语言表达之间建立联系颇具挑战,因此从医疗图像中自动生成详尽和准确的报告仍然具有一定难度。


技术实现思路

1、目前的医学影像报告生成方法在视觉内容和语言表达之间建立联系仍有缺陷,难以从医学影像中自动生成详尽和准确的报告。本发明旨在解决以上现有技术的问题。本发明提出一种基于周期性跨模态对齐的医学影像报告生成方法,目的是解决现有方法医学影像和文本报告之间的异构鸿沟和语义鸿沟的问题。

2、为实现上述目的,本发明采用的技术方案如下:

3、本发明提供的一种基于周期性跨模态对齐的医学影像报告生成方法,其包括以下步骤:

4、1)、构建编码器-解码器架构。在构建新的医学影像报告生成模型时,在编码器-解码器框架的基础上引入了周期性跨模态对齐方法,旨在实现不同模态的医学影像数据之间的周期性对齐,从而提高报告的准确性和多样性,更好地捕捉医学图像中的关键信息。

5、2)、获取数据集。获取包含真实数据的医学数据集,其中包括多组胸片图像以及与之对应的医学报告。随后,将对数据集进行适当的划分,以满足实际任务的需求,将数据分为训练集、验证集和测试集。

6、3)、特征提取。将医学图像和相应的文本报告分别输入视觉特征提取器和文本特征提取器,以获取一组图像特征v={v1,...,vk},vi∈rd以及文本特征t={t1,...,tn},ti∈rd。

7、4)、初始化对齐周期。根据实际情况,自行设定周期的大小,即period的值,该值将决定训练过程中跨模态对齐的次数。同时,初始化循环起始值,将其设为n=1。这意味着将在训练过程中执行跨模态对齐的操作共计period次,每次从n=1开始逐步增加n以进行相应的对齐操作。

8、5)、构造对应关系。建立单词与图像区域之间的对应关系,记录每个单词与所有相关图像区域之间的相关性。对图像区域特征vj以及其相关的单词特征首先构建对齐向量的计算方式如下:

9、

10、其中fa∈rm×d是一个线性变换器,对vj和之间的元素差异和细粒度关系进行编码。

11、6)、细化对应关系。通过学习每个单词的特定注意因子,进一步细化单词与所有图像区域之间的对应关系。这些特定注意因子加权单词的权重向量,并引入温度值,以确保来自正匹配的图像区域更关注与特定相关单词相关的信息,而来自负匹配的图像区域则更关注与这些“完全不相关”单词的信息。具体来说,通过综合编码对齐跨两种模态数据,得到对齐向量被用于通过多层感知器(mlp)学习自适应注意因子,以用于下一个图像区域-单词交互:

12、

13、其中f{·}和b{·}是几个可学习的参数,σ{·}表示双曲正切激活,,而将x的值限制在[-1,+1]之间。向量的每个值的范围在-1到1之间,重新加权vj和之间的信道负相关或正相关。此外,[]+限制标量的值范围为[0;+∞),控制与vj相关的注意力分布的平滑度或锐度。

14、7)、计算相似度得分。通过计算单词-图像区域对之间的余弦相似度得分,评估每个单词在与图像区域的关联中的重要性。余弦相似度得分提供了一个度量,用于衡量单词和图像区域之间的相似性,从而确定哪些单词与哪些图像区域更相关。相似度得分的计算方式如下:

15、

16、其中,是自适应的信道加权向量,用于校正ti和vj之间的相关性,我们称之为·表示按元素相乘。

17、8)、更新特征表示。根据余弦相似度得分更新特征表示,其原理是通过学习两个新的注意因素来更新图像区域参与的单词特征。具体过程如下:

18、

19、其中,是调整注意力分布的自适应方式softmax温度,是关于第j个图像区域的新的集成单词特征表示。

20、9)、循环判断。判断是否达到了设定的循环周期大小,即判断是否满足条件n<period。如果这个条件成立,更新n的值为n=n+1后再次执行步骤4)至步骤7)的操作,随后再次进行循环判断;如果不满足条件(n不小于period),则输出更新后的文本特征以及最终的图像文本相似度得分。

21、10)、报告生成。将更新后的文本特征作为先验知识,与步骤1)中得到的图像特征进行拼接后一起输入解码器以生成文本报告,并使用对比损失c-loss来优化模型效果。

22、具体地,所述步骤2)使用的数据集有iu-xray数据集以及mimic-cxr数据集。此外,对于iu-xray数据集,遵循了之前工作r2gen的数据分割方法,将数据按照7∶1∶2的比例分成训练、验证和测试集,确保患者之间没有重叠。而mimic-cxr数据集,则采用了官方提供的数据分割。

23、进一步的,所述步骤3)中采用resnet-101主干作为在imagenet上预先训练的视觉编码器,其中在对医学影像进行编码时,输入的是两张医学影像(通常为一张正面视角的胸片图,另一张为侧面视角的胸片图),将两张含有不同信息的医学影像特征融合在一起,以便捕获更多医疗信息。此外,本发明使用bert作为文本特征提取器。

24、进一步的,本发明采用对比损失函数基于图像文本相似度得分得到模型的损失值;对比损失函数计算损失值c-loss的公式如下:

25、

26、其中,s(·,·)示由前述网络计算的图像-文本对的相似度分数,γ表示固定的softmax lambda的值。

27、进一步的,本发明提出的基于周期性跨模态对齐的医学影像报告生成方法使用采用了多种自然语言生成(nlg)度量和临床效果度量作为评判指标,这些指标包括bleu-n、cider和rouge-l得分。本发明根据这些指标得分来获得模型最佳的最佳迭代次数。

28、进一步的,本发明提出的基于周期性跨模态对齐的医学影像报告生成方法使用采用了多种自然语言生成(nlg)度量和临床效果度量作为评判指标,包括bleu-n、cider和rouge-l得分,以获得具有不同多模态对齐周期大小时模型的c-loss。

29、进一步的,本发明提出的基于周期性跨模态对齐的医学影像报告生成方法使用采用了多种自然语言生成(nlg)度量和临床效果度量作为评判指标,包括bleu-n、cider和rouge-l得分,以获得模型的维度、编码器解码器的维度以及超参数的值。

30、综上所述,由于采用了上述技术方案,本发明的优点和积极效果是:本发明针对以往医学影像报告生成方法中存在的视觉信息和语言表达之间的鸿沟问题,提供了一种基于周期性跨模态对齐的医学影像报告生成方法,在一定程度上解决了难以在视觉内容和语言表达之间建立联系的问题。本发明动态更新跨模态注意力单元,以更充分地利用不同模态之间的信息。本发明学习每个特定词汇的自适应注意力因子,并通过迭代改进跨模态关注单元,以获得不同图像-文本对之间更具语义差异的词汇的更合理的注意力分布。这一方法有助于更好地将视觉和语言信息融合在一起,提高了医学报告生成的质量和准确性。


技术特征:

1.一种基于周期性跨模态对齐的医学影像报告生成方法,其特征在于,包括以下步骤:

2.根据权利要求1所述的基于周期性跨模态对齐的医学影像报告生成方法,其特征在于,在构建新的医学影像报告生成模型时,在编码器-解码器框架的基础上引入了周期性多模态对齐方法。

3.根据权利要求1所述的基于周期性跨模态对齐的医学影像报告生成方法,其特征在于,所述的周期性跨模态调节方法动态更新跨模态注意力单元,以更充分地利用不同模态之间的信息,学习每个特定词汇的自适应注意力因子,并通过迭代改进跨模态关注单元,以获得不同图像-文本对之间更具语义差异的词汇的更合理的注意力分布,在一定程度上解决了难以在视觉内容和语言表达之间建立联系的问题,助于更好地将视觉和语言信息融合在一起,提高了医学报告生成的质量和准确性。

4.根据权利要求1所述的基于周期性跨模态对齐的医学影像报告生成方法,其特征在于,所述的视觉编码器使用resnet-101,并在imagenet上进行预先训练,在对医学影像进行编码时,输入的是两张医学影像(通常为一张正面视角的胸片图,另一张为侧面视角的胸片图),将两张含有不同信息的医学影像特征融合在一起,以便捕获更多医疗信息。

5.根据权利要求1所述的基于周期性跨模态对齐的医学影像报告生成方法,其特征在于,所述的文本特征提取器使用bert结构。

6.根据权利要求1所述的基于周期性跨模态对齐的医学影像报告生成方法,其特征在于,所述利用损失函数基于图像文本相似度得分得到模型的损失值,根据损失值对网络参数进行调整,得到基于周期性跨模态对齐的医学影像报告生成模型。

7.根据权利要求1所述的基于周期性跨模态对齐的医学影像报告生成方法,其特征在于,所述获得周期性跨模态调节方法具有不同周期大小时模型的bleu-n、cider和rouge-l,根据具有不同周期大小时模型的bleu-n、cider和rouge-l确定最佳跨模态对齐次数。

8.根据权利要求1所述的基于周期性跨模态对齐的医学影像报告生成方法,其特征在于,所述获得周期性跨模态调节方法具有不同周期大小时模型的bleu-n、cider和rouge-l,根据具有不同周期大小时模型的bleu-n、cider和rouge-l确定超参数的值。

9.根据权利要求1所述的基于周期性跨模态对齐的医学影像报告生成方法,其特征在于,所述获得周期性跨模态调节方法具有不同周期大小时模型的bleu-n、cider和rouge-l,根据具有不同周期大小时模型的bleu-n、cider和rouge-l确定模型的维度、编码器解码器的维度。


技术总结
本发明涉及深度学习、自然语言处理、跨模态对齐、图像字幕等技术,并公开了一种基于周期性跨模态对齐的医学影像报告生成方法。该方法构建图像文本对应关系,并采用自适应注意因子,通过多层感知器学习和改进单词与图像区域之间的对应关系。同时使用相似度得分评估每个单词的重要性,确保模型能够更好地选择和加权单词,以提高报告生成的质量。在此基础上,模型引入了循环周期,允许模型多次迭代对齐操作,以进一步提高模型性能。最终,将循环跨模态对齐更新后的文本特征与图像特征拼接,用于生成医学报告。本发明的技术方案弥合了医学影像报告生成领域的视觉与语言之间的鸿沟,为解决这一难题提供了一种创新方法。

技术研发人员:陈乔松,李远路,陈浩,张冬
受保护的技术使用者:重庆邮电大学
技术研发日:
技术公布日:2024/10/31
转载请注明原文地址: https://www.8miu.com/read-29859.html

最新回复(0)