本发明涉及图像处理,更具体的说是涉及一种基于提示学习的图像美学质量评价方法。
背景技术:
1、美学,作为一门探讨美与丑、人类审美意识、美学体验、美的创造与发展,以及美的规律等范畴的重要学科,在视觉艺术领域中占据着核心地位。图像美学质量评价多被应用于摄影、艺术、广告、社交媒体等,传统的图像美学评价多是依赖于人进行主观评价,与个人美学素质息息相关,存在主观性强、效率低下等问题,而随着计算机科学技术的发展,形成了一项图像美学质量评价创新技术,能够通过计算机模拟人类的美学感知,对图像的美学价值进行评估和判断,为理解和量化视觉艺术中的美感提供了一种全新的途径。
2、但是,很多现有图像美学质量评价方法专注于构建高效的网络架构来提取图像的多维特征,输入了图像的单一模态信息,却忽视了文本信息的潜能,文字蕴含丰富的语义内容,能够为解读视觉作品提供有力的辅助。现有技术中这种单模态多属性评价方法很大程度上对于美学属性抽象问题的表达能力不足,模型的泛化能力有限。同时,当前的美学质量评价方法中,标注样本的稀缺和标注信息的局限性也导致了对有监督模型的过度依赖;费力的数据标记过程和基于学习的方法的任务特定性质也限制了它们的泛化能力。并且美学涉及对视觉内容的抽象理解,这种感知往往含糊且易受语言表述上的歧义影响。
3、因此,如何结合文本信息提高图像美学质量评价的准确性是本领域技术人员亟需解决的问题。
技术实现思路
1、有鉴于此,本发明提供了一种基于提示学习的图像美学质量评价方法,令美学评分质量评价性能得到提升,辅助提升美学分类和美学分布评价性能。
2、为了实现上述目的,本发明采用如下技术方案:
3、一种基于提示学习的图像美学质量评价方法,包括以下步骤:
4、步骤1:获取图像数据集,构建图像美学质量评价模型;
5、步骤2:将图像数据集中的图像数据输入图像美学质量评价模型的图像编码器中得到图像嵌入;
6、步骤3:构建正反义提示词;
7、步骤4:将正反义提示词输入图像美学质量评价模型的文本编码器中获得正反义文本嵌入;
8、步骤5:图像美学质量评价模型的对比学习模块计算图像嵌入和正反义文本嵌入之间的余弦相似度;
9、步骤6:图像美学质量评价模型的归一化模块对余弦相似度采用归一化指数函数进行归一化处理,获得美学质量评分;
10、步骤7:根据美学质量评分利用损失函数优化调整图像美学质量评价模型参数,获得训练后的图像美学质量评价模型;
11、步骤8:采集待评价图像输入训练后的图像美学质量评价模型,获得待评价图像的美学质量评分。本发明通过正反义提示词的构建以及参与模型训练,能够改善模型训练中文本歧义问题,通过正反义提示词对相似文本进行有效筛选判断、分类,从而提高模型精度,实现更准确的美学质量评价。
12、优选的,步骤1中采集图像数据集并对图像数据进行roipooling操作,获得增强图像,利用增强图像扩充图像数据集。
13、优选的,图像编码器包括vit-b/16模块、resnet50模块和特征融合模块,vit-b/16模块和resnet50模块分别用于提取图像数据中的图像特征,并在特征融合模块对提取的两种图像特征进行特征融合,获得图像嵌入。提取的两种图像特征维度相同,特征融合模块令两种图像特征进行对应维度的相加,获得图像嵌入,通过图像融合能够获得更多的图像信息,使得图像评价更加准确。
14、优选的,预设若干组文本模板和若干组正反义词提示对,选择一对文本模板和正反义词提示对的组合构建正反义提示词;正反义提示词包括正义提示词和反义提示词。其中,文本模版包括:(a)[text]aesthetic photo,(b)[text]photo,(c)[text]aestheticquality photo;正反义词提示对包括:(a)“good/bad”,(b)“high quality/low quality”,and(c)“high definition/low definition”(d)“high/low”(e)“beautiful/ugly”(f)“visually pleasing/visually unpleasing”;通过对比实验,深入研究提示词的选择,选择性能最优的文本模板和正反义词提示对组合,最大限度地减少由于语言歧义而产生的潜在模糊。
15、优选的,正反义提示词包括总体正反义提示词和多组属性正反义提示词,根据提示词的组数在图像美学评价模型中设置对应数量的文本编码器;
16、总体正反义提示词经过文本编码器获得总体提示文本嵌入,再经过余弦相似度计算和归一化处理获得总体美学质量评分;
17、属性正反义提示词经过文本编码器获得属性提示文本嵌入,再经过余弦相似度计算和归一化处理获得属性美学质量评分。
18、优选的,总体正反义提示词的学习和评价对应总体任务,属性正反义提示词的学习和评价对应属性任务,将总体任务和多组属性任务的损失函数按照1:1的权重相加得到多任务总损失函数,利用多任务总损失函数训练调整图像美学质量评价模型。
19、优选的,正反义提示词为总分相似表达集成提示词,将若干组相似的总体正反义提示词组成总分相似表达集成提示词作为正反义提示词。
20、优选的,正反义提示词为总分-属性集成提示词,将总体正反义提示词和多组属性正反义提示词组成总分-属性集成提示词作为正反义提示词。
21、优选的,图像美学质量评价模型还包括非线性回归模块,集成提示词中每一组提示词均通过图像美学质量评价模型获得一组对应的评分,所有评分输入至非线性回归模块中,获得最终的美学质量评分;非线性回归模块包括含三个全连接层(linear_1、linear_2和linear_3),以及每个全连接层后设置一个leaky relu激活函数(lrelu),在前向传播过程中,首先通过第一全连接层linear_1将输入数据映射到隐藏层,然后经过leaky relu激活函数,再通过第二全连接层linear_2和leaky relu激活函数进行第二次隐藏层的映射和激活,最后通过第三全连接层linear_3和leaky relu激活函数得到输出结果。
22、优选的,步骤3中构建正反义提示词,并根据图像嵌入构建提示向量;步骤4中将提示向量嵌入正反义文本嵌入中获得提示文本嵌入;步骤4中计算图像嵌入和提示文本嵌入之间的余弦相似度。
23、优选的,提示向量包括可学习上下文向量,将可学习上下文向量嵌入正反义文本嵌入中;在训练图像美学质量评价模型时,首先随机初始化可学习上下文向量,随着训练次数的迭代,不断调整可学习上下文向量,从而优化模型。
24、优选的,将可学习上下文向量嵌入正反义文本嵌入中表示为:
25、
26、其中,表示文本编码器的输入;[lv]1[lv]2…[lv]κ表示可学习上下文向量,每个[lv]n(n∈{1,...,κ})是一个向量,与词嵌入具有相同的维度,κ是一个超参数,指定上下文标记的数量;[class]表示文本嵌入;通过将传递给文本编码器t(·),可以获得一个表示视觉概念的分类权重向量;
27、或者,将可学习上下文向量嵌入正反义文本嵌入中表示为:
28、
29、将可学习上下文向量分别嵌入至文本嵌入的首端和末尾,将表示类别标记的文本嵌入放置在可学习上下文向量的中间。这增加了学习的灵活性——提示允许用补充描述填充后面的单元格,或者通过使用终止信号(如句号)提前结束句子。
30、优选的,提示向量包括可学习上下文向量和元向量;图像嵌入输入元网络获得元向量;将元向量与可学习上下文向量的对应位相加,将其嵌入可学习上下文向量中,获得提示向量。
31、优选的,正反义文本嵌入包括正义文本嵌入和反义文本嵌入,将提示向量分别嵌入到正义文本嵌入和反义文本嵌入的序列中,分别得到正义提示文本嵌入和反义提示文本嵌入组成提示文本嵌入。
32、优选的,余弦相似度的计算公式为:
33、
34、其中,v表示图像嵌入;μ表示提示文本嵌入;s表示余弦相似度;当i=1时,μ1表示正义提示文本嵌入;当i=2时,μ2表示反义提示文本嵌入。
35、优选的,归一化指数函数表示为:
36、
37、其中,表示美学质量评分,s1表示正义余弦相似度,s2表示反义余弦相似度,分别作为e的指数。
38、优选的,对比学习模块和归一化模块根据文本嵌入和视觉嵌入计算美学质量评分的具体计算公式为:
39、
40、其中,为美学质量评分;每个输入pi中的类别标记被第i个类别名称对应的词嵌入向量替换;t(·)表示文本编码器;i为图像编码器提取的图像x的特征,即视觉嵌入;c表示类别的数量,此处c=2,为正义词提示或反义词提示;τ表示温度系数。
41、优选的,元网络的结构包括线性层1、激活函数层(relu)和线性层2;视觉特征通过线性层1将视觉维度输入缩小为原来的1/16,然后通过激活层以增加非线性能力,再通过线性层2将视觉特征映射为和上下文维度一致的特征。
42、经由上述的技术方案可知,与现有技术相比,本发明公开提供了一种基于提示学习的图像美学质量评价方法,利用语言-图像预训练对比学习模型中蕴含的丰富视觉语言先验知识,来对图像进行美学质量评估,而无需明确的特定任务训练;深入研究不同的有效的提示词方法,提出基于提示学习的图像美学质量评价模型和基于提示学习的多属性图像美学质量评价。具体有益效果包括:
43、(1)图像美学质量评价模型引入一种利用正反义词配对的策略,最大程度地减少语言多义性带来的理解模糊,显著降低了人工标注的成本。
44、(2)通过美学总分和不同的美学属性的提示学习,将可学习上下文向量作为软提示语,美学总体提示词和属性特征正反义提示词相结合构建集成提示词,采用不同文本提示方式进一步提升美学质量评价分数的准确性;软提示可以从大规模的自然文本中学习得到,因此具有更好的表达能力,可以针对不同的文本查询进行动态调整,以更好地适应不同查询的需求;
45、(3)通过不同美学属性的独立学习和评价,本发明可以对针对某一属性单独获得该属性的评分,并提供灵活调节该属性的能力。
46、(4)基于元网络获得输入条件化的向量,并结合软提示语训练图像美学质量评价模型,由于提示是针对每个输入实例条件化的,能够更好地泛化到同一任务中未见过的类别上,减少了对训练类别的过度拟合,鲁棒性更好,泛化性能更好。
47、(5)美学评分质量评价性能得到提升,可以实现美学分类和美学分布,并提升美学分类和美学分布的性能。
1.一种基于提示学习的图像美学质量评价方法,其特征在于,包括以下步骤:
2.根据权利要求1所述的一种基于提示学习的图像美学质量评价方法,其特征在于,图像编码器包括vit-b/16模块、resnet50模块和特征融合模块,vit-b/16模块和resnet50模块分别提取图像数据中的图像特征,并在特征融合模块对提取的两种图像特征进行特征融合,获得图像嵌入。
3.根据权利要求1所述的一种基于提示学习的图像美学质量评价方法,其特征在于,预设若干组文本模板和若干组正反义词提示对,选择一对文本模板和正反义词提示对的组合构建正反义提示词;正反义提示词包括正义提示词和反义提示词。
4.根据权利要求1所述的一种基于提示学习的图像美学质量评价方法,其特征在于,正反义提示词包括总体正反义提示词和多组属性正反义提示词,根据提示词的组数在图像美学评价模型中设置对应数量的文本编码器;
5.根据权利要求1所述的一种基于提示学习的图像美学质量评价方法,其特征在于,正反义提示词为总分相似表达集成提示词,将若干组相似的总体正反义提示词组成总分相似表达集成提示词作为正反义提示词。
6.根据权利要求1所述的一种基于提示学习的图像美学质量评价方法,其特征在于,正反义提示词为总分-属性集成提示词,将总体正反义提示词和多组属性正反义提示词组成总分-属性集成提示词作为正反义提示词。
7.根据权利要求1所述的一种基于提示学习的图像美学质量评价方法,其特征在于,步骤3中构建正反义提示词,并根据图像嵌入构建提示向量;步骤4中将提示向量嵌入正反义文本嵌入中获得提示文本嵌入;步骤4中计算图像嵌入和提示文本嵌入之间的余弦相似度。
8.根据权利要求7所述的一种基于提示学习的图像美学质量评价方法,其特征在于,提示向量包括可学习上下文向量,将可学习上下文向量嵌入正反义文本嵌入中。
9.根据权利要求7所述的一种基于提示学习的图像美学质量评价方法,其特征在于,提示向量包括可学习上下文向量和元向量;图像嵌入输入元网络获得元向量;将元向量与可学习上下文向量的对应位相加,将其嵌入可学习上下文向量中,获得提示向量。
10.根据权利要求7所述的一种基于提示学习的图像美学质量评价方法,其特征在于,正反义文本嵌入包括正义文本嵌入和反义文本嵌入,将提示向量分别嵌入到正义文本嵌入和反义文本嵌入的序列中,分别得到正义提示文本嵌入和反义提示文本嵌入组成提示文本嵌入。
