本公开涉及云计算,尤其涉及一种云产品客户画像分类方法、装置、电子设备及存储介质。
背景技术:
1、随着云计算市场的快速发展,不同类型的云产品在不同行业和场景中得到了广泛应用。对于云计算厂商而言,不同行业、规模的企业的上云需求更是千差万别。因此,高效精准的客户画像分类有利于云计算厂商明确客户特点和需求,从而针对性地提供定制化解决方案,进而提升客户满意度和品牌竞争力。例如近年来,客户画像分类建模在银行业、保险业、互联网和医疗服务等众多领域已经得到广泛应用。
2、相关技术中,通常采用简单的统计分析或者规则匹配进行客户画像分类,但是这样无法应对大数据时代复杂多变的分析需求,限制了客户画像的深度和广度,另外,部分均值算法需人为设定初始聚类数并随机选取初始聚类中心,易使算法陷入局部最优。因此,如何实现云产品客户群体精准分类是当前亟需解决的问题。
技术实现思路
1、为了解决上述技术问题或者至少部分地解决上述技术问题,本公开提供了一种云产品客户画像分类方法,实现云产品客户群体精准分类。
2、为了实现上述目的,本公开实施例提供技术方案如下:
3、第一方面,本公开的实施例提供一种云产品客户画像分类方法,所述方法包括:
4、获取客户样本集;所述客户样本集包括多个客户样本,每个客户样本包括多个客户特征;
5、基于预设canopy算法对所述客户样本集进行预聚类,得到多个客户样本子集;每个客户样本子集包括一个初始聚类中心;
6、分别计算各个客户样本到每个初始聚类中心的欧式距离,将各个客户样本分配到距离最近的初始聚类中心所在的客户样本子集中;
7、计算每个客户样本子集的样本均值,将各个客户样本子集的样本均值作为新聚类中心;
8、若所述各个客户样本子集的新聚类中心与所述初始聚类中心一致,则输出客户画像分类结果。
9、作为本公开实施例一种可选的实施方式,所述方法还包括:
10、若所述各个客户样本子集的新聚类中心与所述初始聚类中心不一致,则重复执行步骤分别计算各个客户样本到每个初始聚类中心的欧式距离,将各个客户样本分配到距离最近的初始聚类中心所在的客户样本子集中,计算每个客户样本子集的样本均值,将各个客户样本子集的样本均值作为新聚类中心,并将所述各个客户样本子集的新聚类中心与所述初始聚类中心进行比较,直至所述各个客户样本子集的新聚类中心与所述初始聚类中心一致。
11、作为本公开实施例一种可选的实施方式,所述基于预设canopy算法对所述客户样本集进行预聚类,得到多个客户样本子集,包括:
12、计算所述客户样本集中各个客户样本的样本密度,选取样本密度最大的客户样本作为第一聚类中心;
13、将所述第一聚类中心以及所述客户样本集中与所述第一聚类中心的距离小于样本平均距离的样本加入第一客户样本子集,并将所述第一客户样本子集从所述客户样本集中去除;所述样本平均距离用于表示所述客户样本集中所有客户样本的平均差异度;
14、计算所述客户样本集中剩余客户样本的样本密度、簇内样本平均距离和簇间距离,选取权值积最大的客户样本作为第二聚类中心;
15、将所述第二聚类中心以及所述客户样本集中与所述第二聚类中心的距离小于剩余样本平均距离的样本加入第二客户样本子集,并将所述第二客户样本子集从所述客户样本集中去除;
16、分别计算所述客户样本集中剩余客户样本与第一聚类中心的距离、以及各个剩余客户样本与第二聚类中心的距离,选取满足预设条件的样本作为第三聚类中心,并获取第三客户样本子集,重复执行该步骤,直至所述客户样本集为空,将所述客户样本集划分为多个客户样本子集。
17、作为本公开实施例一种可选的实施方式,所述权值积为所述样本密度、所述簇内样本平均距离的倒数以及所述簇间距离的乘积。
18、作为本公开实施例一种可选的实施方式,所述获取客户样本集,包括:
19、获取客户原始数据;所述客户原始数据包括:基本信息、行为信息、交易信息和资源使用信息;
20、对所述客户原始数据进行预处理,得到预处理后的客户特征数据;
21、基于主成分分析法对所述预处理后的客户特征数据进行客户画像分类特征提取,得到客户特征矩阵;
22、将所述客户特征矩阵以集合方式表示,得到客户样本集。
23、作为本公开实施例一种可选的实施方式,所述基于主成分分析法对所述预处理后的客户特征数据进行客户画像分类特征提取,得到客户特征矩阵,包括:
24、根据所述预处理后的客户特征数据,建立客户特征矩阵;
25、对所述客户特征矩阵进行特征去中心化处理,得到去中心化矩阵;
26、根据所述去中心化矩阵,计算协方差矩阵;
27、对所述协方差矩阵进行特征值分解,得到特征值和特征向量;
28、对所述特征值进行排序,计算每个特征向量的方差贡献率,获取特征向量矩阵;
29、将所述客户特征矩阵和所述特征向量矩阵相乘,得到降维后的客户特征矩阵。
30、作为本公开实施例一种可选的实施方式,所述对所述客户原始数据进行预处理,得到预处理后的客户特征数据,包括:
31、对所述客户原始数据进行编码处理、缺失值处理、异常值处理以及标准化处理,得到预处理后的客户特征数据。
32、第二方面,本公开实施例提供一种云产品客户画像分类装置,包括:
33、获取模块,用于获取客户样本集;所述客户样本集包括多个客户样本,每个客户样本包括多个客户特征;
34、预聚类模块,用于基于预设canopy算法对所述客户样本集进行预聚类,得到多个客户样本子集;每个客户样本子集包括一个初始聚类中心;
35、分配模块,用于分别计算各个客户样本到每个初始聚类中心的欧式距离,将各个客户样本分配到距离最近的初始聚类中心所在的客户样本子集中;
36、计算模块,用于计算每个客户样本子集的样本均值,将各个客户样本子集的样本均值作为新聚类中心;
37、输出模块,用于若所述各个客户样本子集的新聚类中心与所述初始聚类中心一致,则输出客户画像分类结果。
38、作为本公开实施例一种可选的实施方式,所述装置还包括:
39、比较模块,用于若所述各个客户样本子集的新聚类中心与所述初始聚类中心不一致,则重复执行步骤分别计算各个客户样本到每个初始聚类中心的欧式距离,将各个客户样本分配到距离最近的初始聚类中心所在的客户样本子集中,计算每个客户样本子集的样本均值,将各个客户样本子集的样本均值作为新聚类中心,并将所述各个客户样本子集的新聚类中心与所述初始聚类中心进行比较,直至所述各个客户样本子集的新聚类中心与所述初始聚类中心一致。
40、作为本公开实施例一种可选的实施方式,所述预聚类模块,具体用于:
41、计算所述客户样本集中各个客户样本的样本密度,选取样本密度最大的客户样本作为第一聚类中心;
42、将所述第一聚类中心以及所述客户样本集中与所述第一聚类中心的距离小于样本平均距离的样本加入第一客户样本子集,并将所述第一客户样本子集从所述客户样本集中去除;所述样本平均距离用于表示所述客户样本集中所有客户样本的平均差异度;
43、计算所述客户样本集中剩余客户样本的样本密度、簇内样本平均距离和簇间距离,选取权值积最大的客户样本作为第二聚类中心;
44、将所述第二聚类中心以及所述客户样本集中与所述第二聚类中心的距离小于剩余样本平均距离的样本加入第二客户样本子集,并将所述第二客户样本子集从所述客户样本集中去除;
45、分别计算所述客户样本集中剩余客户样本与第一聚类中心的距离、以及各个剩余客户样本与第二聚类中心的距离,选取满足预设条件的样本作为第三聚类中心,并获取第三客户样本子集,重复执行该步骤,直至所述客户样本集为空,将所述客户样本集划分为多个客户样本子集。
46、作为本公开实施例一种可选的实施方式,所述权值积为所述样本密度、所述簇内样本平均距离的倒数以及所述簇间距离的乘积。
47、作为本公开实施例一种可选的实施方式,所述获取模块,包括:
48、获取单元,用于获取客户原始数据;所述客户原始数据包括:基本信息、行为信息、交易信息和资源使用信息;
49、预处理单元,用于对所述客户原始数据进行预处理,得到预处理后的客户特征数据;
50、特征提取单元,用于基于主成分分析法对所述预处理后的客户特征数据进行客户画像分类特征提取,得到客户特征矩阵;
51、表示模块,用于将所述客户特征矩阵以集合方式表示,得到客户样本集。
52、作为本公开实施例一种可选的实施方式,所述特征提取单元,具体用于:
53、根据所述预处理后的客户特征数据,建立客户特征矩阵;
54、对所述客户特征矩阵进行特征去中心化处理,得到去中心化矩阵;
55、根据所述去中心化矩阵,计算协方差矩阵;
56、对所述协方差矩阵进行特征值分解,得到特征值和特征向量;
57、对所述特征值进行排序,计算每个特征向量的方差贡献率,获取特征向量矩阵;
58、将所述客户特征矩阵和所述特征向量矩阵相乘,得到降维后的客户特征矩阵。
59、作为本公开实施例一种可选的实施方式,所述预处理单元,具体用于:
60、对所述客户原始数据进行编码处理、缺失值处理、异常值处理以及标准化处理,得到预处理后的客户特征数据。
61、第三方面,本公开实施例提供一种电子设备,包括存储器和处理器,所述存储器存储有计算机程序,所述处理器执行所述计算机程序时实现上述第一方面或第一方面的任一实施方式所述的云产品客户画像分类方法。
62、第四方面,本公开实施例提供一种计算机可读存储介质,其上存储有计算机程序,计算机程序被处理器执行时实现上述第一方面或第一方面的任一实施方式所述的云产品客户画像分类方法。
63、本公开提供的云产品客户画像分类方法,首先获取客户样本集,其中,客户样本集包括多个客户样本,每个客户样本包括多个客户特征,然后基于预设canopy算法对客户样本集进行预聚类,得到多个客户样本子集,每个客户样本子集包括一个初始聚类中心,再分别计算各个客户样本到每个初始聚类中心的欧式距离,将各个客户样本分配到距离最近的初始聚类中心所在的客户样本子集中,接着计算每个客户样本子集的样本均值,将各个客户样本子集的样本均值作为新聚类中心,若各个客户样本子集的新聚类中心与初始聚类中心一致,则输出客户画像分类结果。通过密度canopy算法获取客户样本集的初始聚类中心,作为k-means的输入参数,解决了传统的k-means算法需人为设定初始聚类数并随机选取初始聚类中心,易使算法陷入局部最优的问题,实现客户群体精准分类,从而帮助云计算厂商更好地了解客户需求和特征。
1.一种云产品客户画像分类方法,其特征在于,包括:
2.根据权利要求1所述的方法,其特征在于,所述方法还包括:
3.根据权利要求1所述的方法,其特征在于,所述基于预设canopy算法对所述客户样本集进行预聚类,得到多个客户样本子集,包括:
4.根据权利要求3所述的方法,其特征在于,所述权值积为所述样本密度、所述簇内样本平均距离的倒数以及所述簇间距离的乘积。
5.根据权利要求1所述的方法,其特征在于,所述获取客户样本集,包括:
6.根据权利要求5所述的方法,其特征在于,所述基于主成分分析法对所述预处理后的客户特征数据进行客户画像分类特征提取,得到客户特征矩阵,包括:
7.根据权利要求5所述的方法,其特征在于,所述对所述客户原始数据进行预处理,得到预处理后的客户特征数据,包括:
8.一种云产品客户画像分类装置,其特征在于,包括:
9.一种电子设备,包括存储器和处理器,所述存储器存储有计算机程序,其特征在于,所述处理器执行所述计算机程序时实现权利要求1至7中任一项所述的云产品客户画像分类方法。
10.一种计算机可读存储介质,其特征在于,其上存储有计算机程序,计算机程序被处理器执行时实现权利要求1-7中任一项所述的云产品客户画像分类方法。
