基于多模态处理的视频译码方法与流程

allin2026-09-26  19



背景技术:

1、几十年来,混合图像和视频编解码器一直被用于压缩图像和视频数据。在这种编解码器中,通常通过对块进行预测和通过对原始块与其预测块之间的差异进行译码来逐块对信号进行编码。具体地,这种译码可以包括变换、量化和生成码流,通常包括一些熵译码。通常,混合译码方法的三个组成部分——变换、量化和熵译码——分别进行优化。现代视频压缩标准,如高效视频编码(high-efficiency video coding,hevc)、通用视频编码(versatile video coding,vvc)和基本视频编码(essential video coding,evc)也使用变换表示对预测后的残差信号进行译码。

2、最近,神经网络架构已经应用于图像和/或视频译码。通常,这些基于神经网络(neural network,nn)的方法可以以各种不同的方式应用于图像和视频译码。例如,人们已经讨论了一些端到端优化的图像或视频译码框架。此外,深度学习已被用于确定或优化端到端译码框架的一些部分,例如预测参数的选择或压缩等。此外,还讨论了一些用于混合图像和视频译码框架的基于神经网络的方法,例如,用于作为用于图像或视频译码中的帧内预测或帧间预测的经过训练的深度学习模型实现。

3、上文讨论的端到端优化图像或视频译码应用的共同点是,产生了一些特征图数据,这些数据将在编码器和解码器之间发送。

4、神经网络是机器学习模型,它使用一层或多层非线性单元,基于这些非线性单元,这些模型可以预测接收到的输入的输出。一些神经网络除了输出层之外,还包括一个或多个隐藏层。可以提供相应的特征图作为每个隐藏层的输出。每个隐藏层的这种对应的特征图可以用作网络中的后续层(即后续隐藏层或输出层)的输入。网络的每一层根据相应参数集的当前值从接收到的输入生成输出。在设备之间(例如,在编码器和解码器之间、设备和云之间或在不同设备之间)划分的神经网络中,划分位置(例如,第一设备)输出处的特征图被压缩并传输到神经网络的其余层(例如,传输到第二设备)。

5、可能需要使用经过训练的网络架构进一步改进编码和解码。


技术实现思路

1、本发明的实施例提供了用于使用神经网络对图像数据进行编码和解码处理的装置和方法。

2、本发明的实施例由独立权利要求的特征定义,并且实施例的其它有利实现方式由从属权利要求的特征定义。

3、根据一个实施例,提供了一种用于从码流中解码图像数据的方法,包括:从所述码流中解码所述图像数据的第一表示;获取所述图像数据的第二表示;通过应用第一神经网络来处理所述第一表示,包括生成第一潜在表示和第二潜在表示;通过应用第二神经网络来处理所述第二表示,包括生成第三潜在表示和第四潜在表示;合并处理,包括合并所述第一潜在表示和所述第三潜在表示;获取重建图像数据,包括将生成神经网络应用于所述合并处理的输出、所述第二潜在表示和所述第四潜在表示。

4、对从包括多尺度增强(或重建)神经网络的码流中解码的数据的处理提高了重建图像数据的质量,所述神经网络至少包括所述第一神经网络、所述第二神经网络和所述生成神经网络。

5、在一种示例性实现方式中,所述获取所述第二表示包括从所述码流中解码所述第二表示,其中,所述第二表示在所述码流中具有比所述第一表示更小的分辨率和/或不同的码率。

6、当第二表示被所述第二神经网络处理时,具有不同分辨率和/或不同码率的所述第二表示可以为所述生成神经网络提供其它(不同的)特征。

7、例如,所述解码包括:将所述码流划分为至少两个子码流;从所述至少两个子码流中的相应子码流中解码所述第一表示和所述第二表示。

8、这样对两个单独的子码流的独立解码为并行化提供了先决条件。

9、在一种示例性实现方式中,所述解码包括:解码所述码流;将所述经解码码流至少划分为所述第一表示和所述第二表示。

10、包括所述第一表示和所述第二表示的联合码流能够利用所述编码中的冗余信息,因此可能导致所述码流的码率较低。

11、例如,所述解码是通过以下中的一个执行的:自编码神经网络的解码器,或混合块解码器。

12、所述方法很容易应用于自动编码神经网络的解码器或混合块解码器。

13、在一种示例性实现方式中,所述获取第二表示包括:通过缩小所述第一表示来生成所述第二表示。

14、从所述解码的第一表示获取的第二表示(即附加表示)可以通过相应神经网络的处理提供附加隐藏特征,但不增加所述码流的所述码率或降低在所述码流中编码的表示的一个或多个码率,从而增强所述重建图像数据。

15、例如,所述方法还包括从所述码流中解码一个或多个参数,其中,所述一个或多个参数指示在所述码流中编码的一个或多个相应表示的目标码率,以下中的至少一个的配置是根据所述一个或多个参数选择的:所述第一神经网络;所述第二神经网络;所述生成神经网络。

16、通过选择至少包括所述第一神经网络、所述第二神经网络和所述生成神经网络的多尺度重建网络的适当配置,在所述码流中包括参数有助于更高效的处理。

17、在一种示例性实现方式中,所述第一神经网络、所述第二神经网络和所述生成神经网络中的至少一个内的权重集是根据所述一个或多个参数选择的。

18、为一个或多个神经网络选择权重集,通过考虑输入表示的不同配置,能够更精细地获取所述重建图像数据。

19、例如,所述方法还包括在通过应用所述第二神经网络处理所述第二表示之前,对所述第二表示执行插值以获取所述第一表示的分辨率。

20、相同的输入分辨率使所述神经网络能够更高效地进行处理。

21、在一种示例性实现方式中,所述合并处理包括级联所述第一潜在表示和所述第三潜在表示;由全连接神经网络处理。

22、级联高效实现了合并,全连接神经网络的处理能够提取隐藏特征用于进一步处理,从而能够改进图像数据的重建。

23、例如,所述应用所述第一神经网络包括生成第一潜在表示集,其中,所述第一集合包括所述第二潜在表示;所述应用所述第二神经网络包括生成第二潜在表示集,其中,所述第二集合包括所述第四潜在表示;所述生成神经网络接收所述第一集合和所述第二集合作为附加输入。

24、考虑到由所述第一神经网络和所述第二神经网络输出的多个潜在表示,为所述生成神经网络的处理提供了额外的隐藏特征,从而能够改进图像数据的重建。

25、在一种示例性实现方式中,所述方法还包括:获取n个表示,其中,n为大于或等于2的整数,所述n个表示包括所述第一表示和所述第二表示;对于所述n个表示中的每个第i表示,通过应用第i神经网络来处理所述第i表示,包括生成第(2i–1)潜在表示和第(2i)潜在表示,其中,i为1到n;合并处理,包括合并每个第(2i–1)潜在表示;获取重建图像数据,包括将生成神经网络应用于所述合并处理的输出和所述每个第(2i)潜在表示。

26、扩展所述方法以处理多个表示,通过向所述生成神经网络提供额外的输入,能够更精细地重建图像数据。

27、例如,所述获取n个表示还包括:从所述码流中解码所述n个表示中的第一表示;通过从所述码流中解码第j表示或通过缩小所述第一表示,获取所述n个表示中的所述第j表示,其中,j为2至n。

28、这使得能够通过从所述码流中解码和/或缩小来获取额外的表示。这些附加表示为所述生成神经网络提供了其它输入。

29、在一种示例性实现方式中,所述第i神经网络中的每个神经网络包括ki个下采样层、瓶颈层和ki个上采样层,其中,ki为大于0的整数,其中,所述瓶颈层输出所述第(2i–1)潜在表示,在所述瓶颈层之后的所述ki个上采样层中的第一层输出所述第(2i)潜在表示。

30、所述配置可以高效地实现(特征提取)神经网络。

31、例如,所述生成神经网络中的第一块接收所述合并处理的所述输出以及所述第(2i)潜在表示中的每个潜在表示作为输入;所述生成神经网络中的第二块接收以下中的一个或多个作为输入:所述第一块的输出;所述合并处理的所述输出;对于每个第i神经网络,所述第i神经网络中的所述ki个上采样层中的第二层的潜在表示输出,其中,所述第二层在所述ki个上采样层中的第一层之后。

32、所述配置可以高效低实现生成神经网络。

33、在一种示例性实现方式中,所述生成神经网络包括m个块,其中,所述m个块包括所述第一块和所述第二块,m为大于或等于2的整数;所述m个块中的每个第q块接收以下中的一个或多个作为输入,其中,q为2到m:第(q–1)块的输出;所述合并处理的所述输出;对于每个第i神经网络,所述第i神经网络中的所述ki个上采样层中的第q层的潜在表示输出。

34、在所述生成神经网络的所述配置中,增加的块数量能够处理由所述至少两个特征提取网络生成的额外潜在表示,从而通过向所述生成神经网络提供额外的输入,能够更精细地重建图像数据。

35、例如,所述方法还包括获取所述n个表示中的每个表示中的对应子帧,其中,所述处理所述第i表示包括将所述第i神经网络应用于所述第i表示的所述对应子帧。

36、将至少包括所述第一神经网络、所述第二神经网络和所述生成神经网络的多尺度重建网络的处理限制在子帧上,能够聚焦所述图像数据的重要部分,并可以实现对所述子帧的更专门的重建。

37、在一种示例性实现方式中,所述对应子帧包括面部裁剪。

38、对包括面部裁剪在内的子帧的限制有助于应用专门的多尺度重建网络,以进行面部重建训练。

39、例如,所述生成神经网络是通用对抗网络(general adversarial network,gan)。

40、通用对抗网络可以高效地重建图像数据。

41、根据一个实施例,提供了一种用于将图像数据编码到码流中的方法,包括:根据成本函数获取参数集,其中,所述参数指示目标码率;根据所述参数集获取所述图像数据的两个或两个以上表示;根据所述参数集,将所述两个或两个以上表示编码到码流中,其中,所述成本函数基于通过处理相同图像数据的两个或两个以上经解码表示而获取的重建图像数据。

42、所述编码生成码流,所述码流基于所述成本函数进行优化,以向包括多尺度重建网络的解码器提供输入。

43、在一个示例性实现方式中,所述根据成本函数获取参数集包括:对于预定义的多个参数集中的每个当前参数集:根据所述当前参数集获取所述图像数据的两个或两个以上表示;根据所述当前参数集,将所述两个或两个以上表示编码到码流中;从所述码流中解码所述两个或两个以上表示;根据所述两个或两个以上经解码表示,获取重建图像数据;确定所述重建图像质量数据;根据包括所述确定质量的成本函数,从所述预定义的多个集合中选择参数集。

44、根据所述重建图像数据的质量从参数集中选择参数集,能够生成适用于在解码器解码后获取所述质量的重建图像数据的码流。

45、例如,所述根据成本函数获取参数集包括:通过神经网络的一个或多个层处理所述图像数据以输出参数集,其中,所述神经网络是通过优化所述成本函数来训练的。

46、应用经过训练的神经网络可以高效地获取所述参数集。

47、在一种示例性实现方式中,所述神经网络接收以下中的一个或多个作为输入:图像数据;所述码流的目标码率;所述图像数据的复杂性的指示;所述图像数据的运动强度的指示。

48、向所述神经网络提供额外的输入可以改进所述参数的获取。

49、例如,所述将所述两个或两个以上表示编码到所述码流中包括:对于两个或两个以上表示中的每个表示,将表示编码到子码流中;在所述码流中包括每个子码流。

50、这样对两个单独的子码流的独立编码为并行化提供了先决条件。

51、在一种示例性实现方式中,所述将所述两个或两个以上表示编码到所述码流中包括:在所述码流中包括所述参数集。

52、通过选择所述多尺度重建网络的适当配置,将所述参数包括在所述码流中有助于解码中进行更高效的处理。

53、例如,两个或两个以上表示代表所述图像数据的不同分辨率。

54、提供不同的分辨率可以有助于在解码中处理所述表示时应用的神经网络提取附加特征。

55、在一种示例性实现方式中,所述两个或两个以上表示中的第一表示代表所述图像数据的原始分辨率,所述两个或两个以上表示中的第二表示代表所述图像数据的缩小分辨率。

56、所述方法易于应用于所述原始图像数据和所述原始图像数据的缩小表示。

57、例如,所述参数集中的第一参数指示表示所述图像数据的原始分辨率的所述第一表示的目标码率;所述参数集中的第二参数指示表示所述图像数据的缩小分辨率的所述第二表示的目标码率。

58、通过获取参数集来适应相应表示的目标码率可以导致解码侧图像数据的改进重建。

59、在一种示例性实现方式中,所述指示所述参数集内相应表示的目标码率的参数加起来为所述码流的目标码率。

60、所述码流的目标码率提供了用于获取所述参数集的适当约束。

61、例如,所述编码中使用的编码器选择用于编码表示的量化参数,以获取与所述表示对应的所述参数集内的所述参数指示的目标码率。

62、选择适当的量化参数可以高效地获取目标码率。

63、在一种示例性实现方式中,所述编码是通过以下中的一个执行的:自编码神经网络的编码器,或混合块编码器。

64、所述方法很容易应用于自动编码神经网络的编码器或混合块编码器。

65、例如,提供了一种包括程序代码的计算机程序产品,当所述程序代码在计算机或处理器中执行时,所述程序代码用于执行上文所述的方法。

66、在一种示例性实现方式中,提供了一种包括程序代码的非瞬时性计算机可读存储介质,当计算机设备执行所述程序代码时,所述程序代码使得所述计算机设备执行根据上文所述的方法。

67、根据一个实施例,提供了一种解码器,包括用于执行上述用于解码图像数据的任何方法的处理电路。

68、根据一个实施例,提供了一种编码器,包括用于执行上述用于编码图像数据的任何方法的处理电路。

69、根据一个实施例,提供了一种非瞬时性存储介质,包括由上述用于编码图像数据的任何方法编码的码流。

70、所述程序和装置提供了上述方法的优点。

71、本发明可以在硬件(hardware,hw)和/或软件(software,sw)或其组合中实现。此外,基于硬件的实现可以与基于软件的实现相结合。

72、一个或多个实施例的细节在附图和说明书中阐述。其它特征、目标和优点将从说明书、附图和权利要求中显而易见。


技术特征:

1.一种用于从码流(1130)中解码图像数据的方法,其特征在于,包括:

2.根据权利要求1所述的方法,其特征在于,所述获取所述第二表示(1011)包括:

3.根据权利要求2所述的方法,其特征在于,所述解码包括:

4.根据权利要求2所述的方法,其特征在于,所述解码包括:

5.根据权利要求3或4所述的方法,其特征在于,所述解码是通过以下中的一个执行的:

6.根据权利要求1所述的方法,其特征在于,所述获取所述第二表示(1011)包括:

7.根据权利要求1至6中任一项所述的方法,其特征在于,还包括从所述码流(1130)中解码一个或多个参数,其中,所述一个或多个参数指示在所述码流(1130)中编码的一个或多个相应表示的目标码率,以下中的至少一个的配置是根据所述一个或多个参数选择的:

8.根据权利要求7所述的方法,其特征在于,所述第一神经网络(1020)、所述第二神经网络(1030)和所述生成神经网络(1050)中的至少一个内的权重集是根据所述一个或多个参数选择的。

9.根据权利要求1至8中任一项所述的方法,其特征在于,还包括在通过应用所述第二神经网络(1030)处理所述第二表示之前,对所述第二表示(1011)执行插值以获取所述第一表示(1010)的分辨率。

10.根据权利要求1至9中任一项所述的方法,其特征在于,所述合并处理包括以下中的至少一种:

11.根据权利要求1至10中任一项所述的方法,其特征在于,所述应用所述第一神经网络(1020)包括生成第一潜在表示集,其中,所述第一集合包括所述第二潜在表示;

12.根据权利要求1至11中任一项所述的方法,其特征在于,所述方法还包括:

13.根据权利要求12所述的方法,其特征在于,所述获取n个表示还包括:

14.根据权利要求12或13所述的方法,其特征在于,所述第i神经网络中的每个神经网络包括ki个下采样层、瓶颈层(1022、1032)和ki个上采样层,其中,ki为大于0的整数,

15.根据权利要求12至14中任一项所述的方法,其特征在于,

16.根据权利要求15所述的方法,其特征在于,所述生成神经网络(1050)包括m个块,其中,所述m个块包括所述第一块(1051)和所述第二块(1052),m为大于或等于2的整数;

17.根据权利要求12至16中任一项所述的方法,其特征在于,所述方法还包括:

18.根据权利要求17所述的方法,其特征在于,所述对应子帧包括面部裁剪(1440)。

19.根据权利要求1至18中任一项所述的方法,其特征在于,所述生成神经网络(1050)是通用对抗网络(general adversarial network,gan)。

20.一种用于将图像数据编码到码流(1130)中的方法,其特征在于,包括:

21.根据权利要求20所述的方法,其特征在于,所述根据成本函数获取参数集包括:

22.根据权利要求20所述的方法,其特征在于,所述根据成本函数获取参数集包括:

23.根据权利要求22所述的方法,其特征在于,所述神经网络(1740)接收以下中的一个或多个作为输入:

24.根据权利要求20至23中任一项所述的方法,其特征在于,所述将所述两个或两个以上表示(1110、1111、1112)编码到所述码流(1130)中包括:

25.根据权利要求20至24中任一项所述的方法,其特征在于,所述将所述两个或两个以上表示(1110、1111、1112)编码到所述码流(1130)中包括:

26.根据权利要求20至25中任一项所述的方法,其特征在于,所述两个或两个以上表示(1110、1111、1112)表示所述图像数据的不同分辨率。

27.根据权利要求26所述的方法,其特征在于,所述两个或两个以上表示(1110、1111、1112)中的第一表示(1110)表示所述图像数据的原始分辨率,所述两个或两个以上表示(1110、1111、1112)中的第二表示(1111)表示所述图像数据的缩小分辨率。

28.根据权利要求27所述的方法,其特征在于,

29.根据权利要求20至28中任一项所述的方法,其特征在于,所述指示所述参数集内相应表示的目标码率的参数加起来为所述码流(1130)的目标码率。

30.根据权利要求20至29中任一项所述的方法,其特征在于,所述编码中使用的编码器选择用于编码表示的量化参数,以获取与所述表示对应的所述参数集内的所述参数指示的目标码率。

31.根据权利要求30所述的方法,其特征在于,所述编码是通过以下中的一个执行的:

32.一种包括程序代码的计算机程序产品,其特征在于,当所述程序代码在计算机或处理器中执行时,用于执行根据权利要求1至31中任一项所述的方法。

33.一种包括程序代码的非瞬时性计算机可读介质,其特征在于,当所述程序代码由计算机设备执行时,使得所述计算机设备执行根据权利要求1至31中任一项所述的方法。

34.一种解码器(30),其特征在于,包括处理电路,用于执行根据权利要求1至19中任一项所述的方法。

35.一种编码器(20),其特征在于,包括处理电路,用于执行根据权利要求20至31中任一项所述的方法。

36.一种非瞬时性存储介质,其特征在于,包括由根据权利要求20或21所述的方法编码的码流。


技术总结
描述了用于对图像数据进行编码和解码的方法和装置,包括:通过多尺度重建网络处理所述图像数据的两个或两个以上表示;特征提取网络为所述表示中的每个表示生成潜在表示;所述潜在表示由生成神经网络处理,以获取重建图像数据;所述表示根据划分参数集的指示目标码率编码到码流中。

技术研发人员:阿列克谢·亚历山大维奇·列图诺夫斯基,丹尼斯·弗拉基米洛维奇·朴霍门科,马祥,安德烈·谢尔盖耶维奇·舒特金,亚历山大·安德烈耶维奇·普列涅夫,伊万·弗拉基米洛维奇·基里洛夫,伊万·尤雷维奇·伊林
受保护的技术使用者:华为技术有限公司
技术研发日:
技术公布日:2024/10/31
转载请注明原文地址: https://www.8miu.com/read-31501.html

最新回复(0)