本发明涉及数据处理,特别是涉及一种面向高维数据的特征选择方法、装置、设备及介质。
背景技术:
1、随着检测设备和互联网技术的快速发展,人们接触和收集的数据呈指数级增长。其中,许多特征与数据建模分析无关或冗余,导致了“维度灾难”问题。维度灾难是指在高维数据中进行模式识别和数据挖掘时所面临的困难和挑战。高维数据具有庞大而复杂的搜索空间,要获取用于分析和建模的最佳特征子集,需要较高的计算成本。dna微阵列表达谱数据就是这样的超高维数据,样本可能仅有几百个,但其维度却高达几万个。这类数据集通常包含大量冗余和不相关的特征,可能会干扰分类过程并降低分类性能。解决这个问题的方法之一是通过选择相关且有用的特征来获得更好的分类性能,这种方法称为特征选择。
2、近年来,多目标优化(moo)算法已成为特征选择(fs)领域的一个研究重点。多文献通过引入了moo技术,将特征数量视为fs任务的额外优化问题。用于fs的moo算法通常能产生较好的结果,其关键在于存在多个最优解供种群学习,从而提高种群多样性,并增强了特征之间的组合效应。不过,moo技术也存在过程复杂、计算成本高的缺点。此外,基于非支配排序的fs方法侧重于演化出一个更均匀的帕累托前沿。而在算法的后期阶段,在特征较少和错误率较高的一侧进行搜索时,会产生大量无效搜索。
3、现有的大多数依赖种群更新的fs方法都倾向于向优秀个体学习或优秀个体之间相互学习,忽略了较弱特征组合产生的分类结果,因此特征组合的范围也非常有限,使得最终的分类精度较差,同时选择优秀个体的过程复杂,计算效率低。
技术实现思路
1、本发明提供了一种面向高维数据的特征选择方法、装置、设备及介质,解决了现有的fs方法都倾向于向优秀个体学习或优秀个体之间相互学习,忽略了较弱特征组合产生的分类结果,因此特征组合的范围也非常有限,使得最终的分类精度较差,同时选择优秀个体的过程复杂,计算效率低问题。
2、本发明提供一种面向高维数据的特征选择方法,包括以下步骤:
3、将待处理的高维数据集中的多个不同的特征子集作为多个个体,构建初始种群;
4、对初始种群进行迭代进化,得到最优个体,得到最优的特征子集,包括:
5、设置种群规模、最大迭代次数、学习氛围参数以及学习比率参数;
6、对初始种群中个体的数量扩充至种群规模,得到合并种群,对合并种群中每个个体进行评估,得到多个评估值,根据多个评估值将多个个体进行划分至不同的层级;
7、依次遍历合并种群中的每个个体,对每个个体的值进行更新,得到更新种群;其中,若该个体位于最高层级,则从最高层级中抽取除自身之外的两个个体;若该个体不是位于最高层级,则分别从最接近的高层级以及对应层级中各抽取一个个体;将该个体与抽取的两个个体的和的平均值作为更新概率;生成一个随机数,当随机数小于学习氛围参数时,生成另一个随机数,当另一个随机数小于更新概率与学习比率参数的乘积时,将该个体更新为1,否则更新为0;
8、对更新种群进行上述迭代进化,直到满足迭代次数,输出最终种群的最优个体,得到最优的特征子集。
9、优选的,通过下式进行个体评估:
10、min f=0.99×f1+0.01×f2
11、其中,
12、
13、式中,f为目标函数,f1为分类错误率,f2为所选特征相对于原始特征数量的比例,fp为假阳率,fn为为假阴率,tp为真阳率,tn为真阴率。
14、优选的,对初始种群中个体的数量扩充至种群规模,得到合并种群,包括以下步骤:
15、将初始种群p和更新种群pu合并,得到种群pm;当迭代次数为1时,更新种群pu为空;
16、若种群pm个体数量小于种群规模,则从种群pm随机选择个体进行补充直至种群pm个体数量等于种群规模,得到合并种群。
17、优选的,对合并种群中每个个体进行评估,得到多个评估值,根据多个评估值将多个个体进行划分至不同的层级,包括以下步骤:
18、对合并种群中每个个体进行评估,得到多个评估值,并将其进行由小到大的排序;
19、从合并种群中按排列顺序依次不放回的取出n0,n1,n2,和n3个个体,并分别放入level0,level1,level2,和level3;其中n0,n1,n2,和n3的比例设定为1:2:3:4。
20、优选的,若该个体位于最高层级,则从最高层级中抽取除自身之外的两个个体;若该个体不是位于最高层级,则分别从最接近的高层级以及对应层级中各抽取一个个体,包括以下步骤:
21、对于合并种群中的个体i,若个体i位于level0,则从level0选择除自身之外的两个个体;
22、若个体i不在level0,则从对应的层级中抽取除自身之外的一个个体以及与该层级最接近的一个高层级中抽取一个个体;
23、所述将该个体与抽取的两个个体的和的平均值作为更新概率,具体如下所示:
24、
25、式中,ind_prob为更新概率,ind为个体i,ind1和ind2为抽取的两个个体。
26、优选的,所述学习氛围参数如下式所示:
27、
28、式中,la为学习氛围参数,t为当前迭代次数,t为最大迭代次数;
29、生成一个随机数,当随机数小于学习氛围参数时,生成另一个随机数,具体如下所示:
30、
31、式中,indi为个体i,vi为个体i的值,rand()为随机数;
32、当另一个随机数小于更新概率与学习比率参数的乘积时,将该个体更新为1,否则更新为0,具体如下所示:
33、
34、式中,lr为学习比率参数,为个体i的更新概率,rand()为另一个随机数。
35、优选的,对初始种群进行迭代进化的时间复杂度为o(tn*(d+2log(2n))),其中,t表示迭代次数,n表示个体数量,d表示数据维度,o为时间复杂度。
36、一种高维数据特征选择装置,包括:
37、构建模块,用于将待处理的高维数据集中的备选特征子集作为多个个体,构建初始种群;
38、迭代模块,用于对初始种群进行迭代进化,得到最优个体,得到最优的特征子集;
39、所述迭代模块包括:
40、设置模块,用于设置种群规模、最大迭代次数、学习氛围参数以及学习比率参数;
41、分层模块,用于对初始种群中个体的数量扩充至种群规模,得到合并种群,对合并种群中每个个体进行评估,得到多个评估值,根据多个评估值将多个个体进行划分至不同的层级;
42、更新模块,用于依次遍历合并种群中的每个个体,采用二进制编码对每个个体的值进行更新,得到更新种群;其中,若该个体位于最高层级,则从最高层级中抽取除自身之外的两个个体;若该个体不是位于最高层级,则分别从最接近的高层级以及对应层级中各抽取一个个体;将该个体与抽取的两个个体的和的平均值作为更新概率;生成一个随机数,当随机数小于学习氛围参数时,生成另一个随机数,当另一个随机数小于更新概率与学习比率参数的乘积时,将该个体更新为1,否则更新为0;
43、进化模块,用于对更新种群进行上述迭代进化,直到满足迭代次数,输出最终种群的最优个体,得到最优的特征子集。
44、一种计算机设备,包括存储器、处理器及存储在存储器上并可在处理器上运行的计算机程序,所述处理器执行所述程序时实现上述的面向高维数据的特征选择方法。
45、一种计算机可读存储介质,所述存储介质存储有计算机程序,所述计算机程序被处理器执行时实现上述的面向高维数据的特征选择方法。
46、与现有技术相比,本发明的有益效果是:
47、本发明根据多个评估值将初始种群中的多个个体进行划分至不同的层级,采用了层级化的种群模式,在进化过程中,来自较高层次的个体为较低层次的个体提供指导,从而探索数据集特征之间潜在的组合效应。其次,针对高维数据特征选择任务的时间长的问题,基于划分的层级采用二进制编码对每个个体的值进行更新,其中,若该个体位于最高层级,则从最高层级中抽取除自身之外的两个个体;若该个体不是位于最高层级,则分别从最接近的高层级以及对应层级中各抽取一个个体;将该个体与抽取的两个个体的和的平均值作为更新概率;生成一个随机数,当随机数小于学习氛围参数时,生成另一个随机数,当另一个随机数小于更新概率与学习比率参数的乘积时,将该个体更新为1,否则更新为0。通过该更新方法,当种群中的所有个体都不包含某个特征时,可以动态地缩小搜索空间;当所有个体都包含某种特征组合时,可以帮助算法摆脱特定特征组合的控制并跳出局部最优。本发明可以在较短的运行时间内实现特征集的简化,并具有较高的分类精度。
1.一种面向高维数据的特征选择方法,其特征在于,包括以下步骤:
2.如权利要求1所述的一种面向高维数据的特征选择方法,其特征在于,通过下式进行个体评估:
3.如权利要求1所述的一种面向高维数据的特征选择方法,其特征在于,对初始种群中个体的数量扩充至种群规模,得到合并种群,包括以下步骤:
4.如权利要求3所述的一种面向高维数据的特征选择方法,其特征在于,对合并种群中每个个体进行评估,得到多个评估值,根据多个评估值将多个个体进行划分至不同的层级,包括以下步骤:
5.如权利要求4所述的一种面向高维数据的特征选择方法,其特征在于,若该个体位于最高层级,则从最高层级中抽取除自身之外的两个个体;若该个体不是位于最高层级,则分别从最接近的高层级以及对应层级中各抽取一个个体,包括以下步骤:
6.如权利要求5所述的一种面向高维数据的特征选择方法,其特征在于,所述学习氛围参数如下式所示:
7.如权利要求1所述的一种面向高维数据的特征选择方法,其特征在于,对初始种群进行迭代进化的时间复杂度为o(tn*(d+2log(2n))),其中,t表示迭代次数,n表示个体数量,d表示数据维度,o为时间复杂度。
8.一种高维数据特征选择装置,其特征在于,包括:
9.一种计算机设备,其特征在于,包括存储器、处理器及存储在存储器上并可在处理器上运行的计算机程序,所述处理器执行所述程序时实现上述权利要求1-7任一所述的面向高维数据的特征选择方法。
10.一种计算机可读存储介质,其特征在于,所述存储介质存储有计算机程序,所述计算机程序被处理器执行时实现上述权利要求1-7任一项所述的面向高维数据的特征选择方法。
