本发明涉及一种基于大语言模型后训练量化的方法,同时也涉及相应的装置,属于自然语言处理。
背景技术:
1、大语言模型(large language models,简写为llms)是指那些拥有大量参数的机器学习模型,它们通常用于处理和生成自然语言文本。这些模型通过在海量文本数据上进行训练,学习语言的复杂结构和模式,从而能够执行各种语言任务,如文本分类、情感分析、机器翻译、问答系统和文本生成等。由于参数数量庞大,大语言模型能够捕捉到丰富的语言特征,提供更为精确和人性化的语言处理能力。然而,这些模型的规模也带来了一些挑战,包括计算资源的高消耗、存储需求大以及部署困难等。
2、尽管大语言模型在性能上具有显著优势,但它们在实际应用中面临一些限制,这正是后训练量化技术发挥作用的地方。后训练量化是一种模型压缩技术,它通过将模型的权重和激活从浮点数转换为低精度的表示(如8位整数),来减少模型的存储大小和内存占用。这一过程不仅减少了模型的部署成本,还加快了模型的加载和推理速度,使其更适合在资源受限的设备上运行,如移动设备和嵌入式系统。此外,量化还能降低模型运行时的功耗,这对于电池供电的设备尤为重要。通过后训练量化,可以在保持模型性能的同时,提高其在各种环境下的可用性和实用性。因此,后训练量化对于大语言模型的实际部署和广泛应用至关重要。
3、在专利号为zl 202111150818.8的中国发明专利中,公开了一种语音识别任务中的训练后量化压缩方法及系统。该量化方法包括:通过对角矩阵来分别放缩输入向量与权重矩阵的各个行列,再进行量化,估计得到量化后计算结果的理论期望误差;设定放缩的权重矩阵量化后计算中不发生截断,并建立相应的约束条件,使用交替迭代的优化算法,求解使理论期望误差最小的对角矩阵;或者,引入预截断边界来调整约束条件,再使用交替迭代的优化算法,求解使理论期望误差最小的对角矩阵。上述量化方法通过更精细的放缩和基于理论推导的优化算法,实现了在模型精度损失得到良好控制的同时,模型推理效率获得明显提升,即显著降低存储空间和运行时间,扩展了语音识别模型的应用场景。
技术实现思路
1、本发明所要解决的首要技术问题在于提供一种基于大语言模型后训练量化的方法。
2、本发明所要解决的另一技术问题在于提供一种基于大语言模型后训练量化的装置。
3、为实现上述技术目的,本发明采用以下的技术方案:
4、根据本发明实施例的第一方面,提供一种基于大语言模型后训练量化的方法,包括如下步骤:
5、获取待处理的自然语言任务;
6、基于用户输入的大语言模型,确定后训练量化策略;其中,采用如下公式将用户输入的大语言模型的高精度值映射到离散级别:
7、
8、其中,x代表浮点数据,是量化值,s是量化步长,z是零偏移,b是目标位宽;截断函数φ(·)将四舍五入后的值限制在[0,2b-1]的范围内;
9、按照所述后训练量化策略对用户输入的大语言模型进行量化,并降低所述大语言模型的权重和激活;
10、利用量化后的大语言模型处理所述自然语言任务。
11、其中较优地,基于用户设置确定目标应用场景,将所述目标应用场景下的对话数据或者问答数据作为量化的标准数据。
12、其中较优地,在确定后训练量化策略时,选取符合预设精度要求的量化比特。
13、其中较优地,所述量化比特包括4比特的权重量化和8比特的激活量化。
14、其中较优地,在对用户输入的大语言模型进行量化之前,对用户输入的大语言模型进行性能维持处理。
15、其中较优地,所述性能维持处理包括如下子步骤:利用权重和激活之间的幅度差异平衡量化扰动;其中,在每次迭代中,根据大语言模型的输出精度选择一部分激活值进行处理,将这些激活值除以缩放因子,其中权重和激活之间的幅度差异被用来决定哪些值需要通过缩放因子进行调整。
16、其中较优地,所述性能维持处理还包括如下子步骤:按照预设规则裁剪权重中的指定极值;其中,设定两个阈值,当权重的数值大于或小于所述阈值时,所述权重被裁剪到最接近的阈值。
17、其中较优地,所述性能维持处理还包括如下子步骤:利用海森矩阵评估量化扰动,并更新用户输入的大语言模型中未受影响的元素。
18、其中较优地,采用泰勒展开近似量化操作对大语言模型的参数造成的影响。
19、根据本发明实施例的第二方面,提供一种基于大语言模型后训练量化的装置,包括处理器和存储器,所述存储器与所述处理器耦接;其中,
20、所述存储器用于存储计算机程序,当该计算机程序被所述处理器执行时,用于实现上述基于大语言模型后训练量化的方法。
21、与现有技术相比较,本发明实施例基于任务和模型的特性选择合适的校准数据,并通过不同维度的量化算法(变换、裁减、重建)降低量化扰动,兼顾了成本和部署的灵活性。利用本发明,可以保证大语言模型量化后的精度,同时由于不需要进行反向传播,因此量化过程十分高效,例如对于70亿参数大小的大语言模型只需要数分钟即可完成量化。另外,由于本发明中使用的是最朴素的均匀量化,并且未曾引入新的量化参数,因此可以在现有的几乎所有框架下实现高效的部署。
1.一种基于大语言模型后训练量化的方法,其特征在于包括如下步骤:
2.如权利要求1所述的基于大语言模型后训练量化的方法,其特征在于:
3.如权利要求2所述的基于大语言模型后训练量化的方法,其特征在于:
4.如权利要求3所述的基于大语言模型后训练量化的方法,其特征在于:
5.如权利要求1所述的基于大语言模型后训练量化的方法,其特征在于:
6.如权利要求5所述的基于大语言模型后训练量化的方法,其特征在于所述性能维持处理包括如下子步骤:
7.如权利要求6所述的基于大语言模型后训练量化的方法,其特征在于所述性能维持处理还包括如下子步骤:
8.如权利要求7所述的基于大语言模型后训练量化的方法,其特征在于所述性能维持处理还包括如下子步骤:
9.如权利要求8所述的基于大语言模型后训练量化的方法,其特征在于:
10.一种基于大语言模型后训练量化的装置,其特征在于包括处理器和存储器,所述存储器与所述处理器耦接;其中,
