本发明涉及大模型与神经网络领域,尤其涉及一种线性复杂度的最少参数注意力逼近的logos大模型。
背景技术:
1、传统的transformer模型的核心是自注意力机制(self-attention),它允许模型在处理序列时将注意力集中在序列内不同位置的相关部分。自注意力机制通过计算查询(query)、键(key)和值(value)之间的相似度来决定在给定查询时应该关注哪些值。在transformer模型中,softmax是一种常用的非线性函数,用于计算注意力权重。并在模型计算完相似度以后,由softmax函数将这些相似度转换为注意力权重,以确保总和为1。采用softmax函数的transformer模型以其由于其长距离依赖性、全局建模,高性能表现在包含大语言模型,视频生成,图像生成,多模态领域展现了强大的性能表现,尤其是目前大量基于transformer的大模型出现,使得这一框架的使用成为目前行业主流方式。
2、但transformer模型难以进行序列外推和二次长度复杂度带来的计算成本问题,逐渐限制模型的使用。目前所采用的线性复杂度的方式进行transformer替代的方式仍旧难以实现长序列记忆性以及拟合softmax形成的注意力矩阵,导致模型计算性能差计算成本高的问题。
技术实现思路
1、本发明提供一种线性复杂度的最少参数注意力逼近的logos大模型,具体来说是一种用最少参数组合利用线性复杂度逼近transformer注意力的大模型,用以解决解决现有技术中的transformer模型由于二次长度复杂度而导致的模型计算性能低的问题。
2、本发明提供一种线性复杂度的最少参数注意力逼近的logos大模型,包括token混合层和通道混合层;所述token混合层用于:将t时刻输入的第一token经可重参数化矩阵分别映射得到查询值、键值、动态衰减值和门控状态;基于所述键值和所述动态衰减值确定t时刻的记忆状态,并基于t时刻的记忆状态和查询值得到中间值;将所述中间值和所述门控状态进行矩阵运算后经可重参数化矩阵映射得到所述t时刻的第一输出矩阵;基于所有时刻的第一输出矩阵得到第二token;所述通道混合层用于:将所述第二token经可重参数化矩阵映射得到第一矩阵和第二矩阵;将所述第一矩阵与非线性激活函数进行矩阵运算后与所述第二矩阵进行矩阵运算,得到通道矩阵;将所述通道矩阵经可重参数化矩阵映射得到第二输出矩阵。
3、根据本发明提供的线性复杂度的最少参数注意力逼近的logos大模型,所述基于所述键值和所述动态衰减值确定t时刻的记忆状态,包括:基于所述键值、t时刻第h个计算头的动态衰减值与t-1时刻第h个计算头的记忆状态,确定t时刻第h个计算头的记忆状态;其中,h的取值为[1,h]之间的整数,h表示计算头的总数且h为大于或等于1的整数。
4、根据本发明提供的线性复杂度的最少参数注意力逼近的logos大模型,所基于所述键值、t时刻第h个计算头的动态衰减值与t-1时刻第h个计算头的记忆状态,确定t时刻第h个计算头的记忆状态,通过以下公式实现:其中,表示t时刻第h个计算头的记忆状态,diag(·)表示构建对角矩阵,表示t时刻第h个计算头的动态衰减值,表示t-1时刻第h个计算头的记忆状态,vt表示t时刻的键值,t的取值为[1,t]之间的整数且t为大于1的整数。
5、根据本发明提供的线性复杂度的最少参数注意力逼近的logos大模型,所述基于t时刻的记忆状态和查询值得到中间值,包括:通过各个计算头在t时刻的查询值和记忆状态分别确定所述各个计算头的计算值,每个计算头的所述计算值是将所述计算头在t时刻的查询值和记忆状态相乘后得到的;基于所述各个计算头的计算值确定所述中间值。
6、根据本发明提供的线性复杂度的最少参数注意力逼近的logos大模型,所述基于所述各个计算头的计算值确定所述中间值,通过以下公式实现:其中,ot表示t时刻的中间值,表示t时刻第1个计算头的查询值,表示t时刻第1个计算头的记忆状态,表示t时刻第2个计算头的查询值,表示t时刻第2个计算头的记忆状态,表示t时刻第h个计算头的查询值,表示t时刻第h个计算头的记忆状态,表示第1个计算头的计算值,表示第2个计算头的计算值,表示第h个计算头的计算值,h表示计算头的总数且h为大于或等于1的整数,concat表示对于的结果进行拼接,xnorm表示正则化。
7、根据本发明提供的线性复杂度的最少参数注意力逼近的logos大模型,所述将所述中间值和所述门控状态进行矩阵运算后经可重参数化矩阵映射得到所述t时刻的第一输出矩阵,通过以下公式实现yt=(gt⊙ot)wo,其中,yt表示t时刻的第一输出矩阵,gt表示t时刻的门控状态,ot表示t时刻的中间值,wo表示用于映射得到yt的可重参数化矩阵,⊙为hadamard积。
8、根据本发明提供的线性复杂度的最少参数注意力逼近的logos大模型,所述第二输出矩阵,通过以下公式计算:y=(σ(xw1)⊙xw2)w3,其中,y表示第二输出矩阵,x为所述第二token,w1表示用于映射得到所述第一矩阵的可重参数化矩阵,xw1表示所述第一矩阵,w2表示用于映射得到所述第二矩阵的可重参数化矩阵,xw2表示第二矩阵,σ(·)是非线性激活函数,⊙为hadamard积,w3表示用于得到所述第二输出矩阵的可重参数化矩阵。
9、根据本发明提供的线性复杂度的最少参数注意力逼近的logos大模型,所述查询值通过以下公式确定:qt=xtwq,其中,qt为t时刻的查询值,xt为所述t时刻输入的第一token,wq表示用于映射得到所述查询值的可重参数化矩阵;所述键值通过以下公式确定:vt=xtwv,其中,vt为t时刻的键值,xt为所述t时刻输入的第一token,wv表示用于映射得到所述键值的可重参数化矩阵。
10、根据本发明提供的线性复杂度的最少参数注意力逼近的logos大模型,所述动态衰减值,通过以下公式确定:αt=σ(xtwα),其中,αt为t时刻的动态衰减值,xt为所述t时刻输入的第一token,wα表示用于映射得到所述动态衰减值的可重参数化矩阵,σ(·)是非线性激活函数。
11、根据本发明提供的线性复杂度的最少参数注意力逼近的logos大模型,所述门控状态,通过以下公式确定:gt=φ(xtwg),其中,gt为t时刻的门控状态,xt为所述t时刻输入的第一token,wg表示用于映射得到所述门控状态的可重参数化矩阵,φ(·)是激活函数。
12、本发明提供的线性复杂度的最少参数注意力逼近的logos大模型,包括token混合层和通道混合层,通过在token混合层中通过可重参数化矩阵确定查询值、键值、动态衰减值和门控状态,然后利用记忆状态、查询值和门控状态以及可重参数化矩阵确定出第一输出矩阵。基于第一输出矩阵确定出第二token,然后由通道混合层将第二token经可重参数化矩阵映射得到第二输出矩阵,本发明提供的线性复杂度的最少参数注意力逼近的logos大模型相较于现有技术中的transformer模型解决了由于二次长度复杂度而导致的模型计算性能低的问题。
1.一种线性复杂度的最少参数注意力逼近的logos大模型,其特征在于,包括token混合层和通道混合层;
2.根据权利要求1所述的线性复杂度的最少参数注意力逼近的logos大模型,其特征在于,所述基于所述键值和所述动态衰减值确定t时刻的记忆状态,包括:
3.根据权利要求2所述的线性复杂度的最少参数注意力逼近的logos大模型,其特征在于,所基于所述键值、t时刻第h个计算头的动态衰减值与t-1时刻第h个计算头的记忆状态,确定t时刻第h个计算头的记忆状态,通过以下公式实现:
4.根据权利要求1所述的线性复杂度的最少参数注意力逼近的logos大模型,其特征在于,所述基于t时刻的记忆状态和查询值得到中间值,包括:
5.根据权利要求4所述的线性复杂度的最少参数注意力逼近的logos大模型,其特征在于,所述基于所述各个计算头的计算值确定所述中间值,通过以下公式实现:
6.根据权利要求1所述的线性复杂度的最少参数注意力逼近的logos大模型,其特征在于,所述将所述中间值和所述门控状态进行矩阵运算后经可重参数化矩阵映射得到所述t时刻的第一输出矩阵,通过以下公式实现:
7.根据权利要求1所述的线性复杂度的最少参数注意力逼近的logos大模型,其特征在于,所述第二输出矩阵,通过以下公式计算:
8.根据权利要求1-6中任一项所述的线性复杂度的最少参数注意力逼近的logos大模型,其特征在于,
9.根据权利要求1-6中任一项所述的线性复杂度的最少参数注意力逼近的logos大模型,其特征在于,所述动态衰减值,通过以下公式确定:
10.根据权利要求1-6中任一项所述的线性复杂度的最少参数注意力逼近的logos大模型,其特征在于,所述门控状态,通过以下公式确定:
