本发明涉及计算机,特别是涉及一种指令数据的生成方法、装置、电子设备及存储介质。
背景技术:
1、大语言模型(large language model,llm),是指使用大量文本数据训练的深度学习模型,可以生成自然语言文本或理解语言文本的含义。大语言模型可以处理多种自然语言任务,如文本分类、问答、对话等,是通向人工智能(artificial intelligence,ai)的一条重要途径。
2、目前,利用指令数据训练的大语言模型已在自然语言处理(natural languageprocessing,nlp)的多个下游任务中展现出卓越的性能,下游任务比如信息抽取、文本生成、问答等。利用指令数据训练大语言模型旨在使得训练得到的大语言模型能够更好的遵循指令完成垂直下游任务。然而,现有的大语言模型在处理逻辑性比较强的问题上存在逻辑推理能力有限、泛化能力不足等问题。针对该问题,相关技术中,通过人类专家进行标注的方式得到具有逻辑推理能力的指令数据,然而这种方式不仅标注成本高,还较为耗时。
技术实现思路
1、本发明实施例的目的在于提供一种指令数据的生成方法、装置、电子设备及存储介质,以在减少人力成本的同时提高指令数据生成的效率。具体技术方案如下:
2、第一方面,本发明实施例提供了一种指令数据的生成方法,所述方法包括:
3、获取预设的初始指令数据;
4、利用映射智能体对所述初始指令数据进行类型分析,并生成与所述初始指令数据的类型相同的指令数据,得到相似指令数据;
5、利用演化智能体对所述相似指令数据执行预设的演化策略,得到多个候选指令数据;
6、利用评估智能体对各所述候选指令数据执行预设的评估策略,得到各所述候选指令数据对应的评估结果;
7、将评估结果满足预设条件的候选指令数据,确定为目标指令数据;所述目标指令数据用于训练大语言模型。
8、可选地,所述利用映射智能体对所述初始指令数据进行类型分析,并生成与所述初始指令数据的类型相同的指令数据,得到相似指令数据,包括:
9、将所述初始指令数据输入所述映射智能体中进行类型分析以及数据生成,得到与所述初始指令数据的类型相同的相似指令数据。
10、可选地,所述预设的演化策略包括以下至少一项:逻辑深度化生成策略、逻辑范围化生成策略、逻辑精确化生成策略、逻辑限制化生成策略、逻辑推理化生成策略以及逻辑对抗化生成策略。
11、可选地,所述利用演化智能体对所述相似指令数据执行预设的演化策略,得到多个候选指令数据,包括以下至少一项:
12、在预设的演化策略包括逻辑深度化生成策略时,将所述相似指令数据输入所述演化智能体中执行所述逻辑深度化生成策略,增加所述相似指令数据的深度和复杂度,得到候选指令数据;
13、在预设的演化策略包括逻辑范围化生成策略时,将所述相似指令数据输入所述演化智能体中执行所述逻辑范围化生成策略,扩展所述相似指令数据的数据范围,得到候选指令数据;
14、在预设的演化策略包括逻辑精确化生成策略时,将所述相似指令数据输入所述演化智能体中执行所述逻辑精确化生成策略,增强所述相似指令数据的准确度,得到候选指令数据;
15、在预设的演化策略包括逻辑限制化生成策略时,将所述相似指令数据输入所述演化智能体中执行所述逻辑限制化生成策略,为所述相似指令数据引入限制条件,得到候选指令数据;
16、在预设的演化策略包括逻辑推理化生成策略时,将所述相似指令数据输入所述演化智能体中执行所述逻辑推理化生成策略,增强所述相似指令数据的逻辑推理,得到候选指令数据;
17、在预设的演化策略包括逻辑对抗化生成策略时,将所述相似指令数据输入所述演化智能体中执行所述逻辑对抗化生成策略,生成所述相似指令数据的对抗数据,得到候选指令数据。
18、可选地,所述预设的评估策略包括以下至少一项:一致性评估策略、合理性评估策略、连贯性评估策略、因果关系评估策略、推理能力评估策略以及专业知识评估策略。
19、可选地,所述利用评估智能体对各所述候选指令数据执行预设的评估策略,得到各所述候选指令数据对应的评估结果,包括以下至少一项:
20、在预设的评估策略包括一致性评估策略时,将所述候选指令数据输入所述评估智能体中执行所述一致性评估策略,对所述候选指令数据中包含的题目与答复内容的一致性进行评估,得到所述候选指令数据对应的评估结果;
21、在预设的评估策略包括合理性评估策略时,将所述候选指令数据输入所述评估智能体中执行所述合理性评估策略,对所述候选指令数据中包含的题目与答复内容的合理性进行评估,得到所述候选指令数据对应的评估结果;
22、在预设的评估策略包括连贯性评估策略时,将所述候选指令数据输入所述评估智能体中执行所述连贯性评估策略,对所述候选指令数据中包含的答复内容的解题步骤的连贯性进行评估,得到所述候选指令数据对应的评估结果;
23、在预设的评估策略包括因果关系评估策略时,将所述候选指令数据输入所述评估智能体中执行所述因果关系评估策略,对所述候选指令数据中包含的答复内容的解题步骤的因果关系进行评估,得到所述候选指令数据对应的评估结果;
24、在预设的评估策略包括推理能力评估策略时,将所述候选指令数据输入所述评估智能体中执行所述推理能力评估策略,对所述候选指令数据中包含的答复内容的解题步骤的逻辑清晰度进行评估,得到所述候选指令数据对应的评估结果;
25、在预设的评估策略包括专业知识评估策略时,将所述候选指令数据输入所述评估智能体中执行所述专业知识评估策略,对所述候选指令数据中包含的答复内容的准确度进行评估,得到所述候选指令数据对应的评估结果。
26、可选地,所述方法还包括:
27、获取所述目标指令数据对应的标注结果;
28、将所述目标指令数据输入预训练的大语言模型中,得到所述目标指令数据对应的预测结果;
29、计算所述预测结果与所述标注结果之间的损失,并根据所述损失调整所述预训练的大语言模型的参数,得到训练好的大语言模型。
30、第二方面,本发明实施例提供了一种指令数据的生成装置,所述装置包括:
31、数据获取模块,用于获取预设的初始指令数据;
32、数据映射模块,用于利用映射智能体对所述初始指令数据进行类型分析,并生成与所述初始指令数据的类型相同的指令数据,得到相似指令数据;
33、数据演化模块,用于利用演化智能体对所述相似指令数据执行预设的演化策略,得到多个候选指令数据;
34、数据评估模块,用于利用评估智能体对各所述候选指令数据执行预设的评估策略,得到各所述候选指令数据对应的评估结果;
35、数据筛选模块,用于将评估结果满足预设条件的候选指令数据,确定为目标指令数据;所述目标指令数据用于训练大语言模型。
36、第三方面,本发明实施例提供了一种电子设备,包括处理器、通信接口、存储器和通信总线,其中,处理器,通信接口,存储器通过通信总线完成相互间的通信;
37、存储器,用于存放计算机程序;
38、处理器,用于执行存储器上所存放的程序时,实现上述任一所述的方法。
39、第四方面,本发明实施例还提供了一种计算机可读存储介质,所述计算机可读存储介质内存储有计算机程序,所述计算机程序被处理器执行时实现上述任一所述的方法。
40、第五方面,本发明实施例还提供了一种包含指令的计算机程序产品,当其在计算机上运行时,使得计算机执行上述任一所述的方法。
41、本发明实施例有益效果:
42、本发明实施例提供的一种指令数据的生成方法、装置、电子设备及存储介质,可以利用映射智能体对初始指令数据进行类型分析,并生成与初始指令数据的类型相同的相似指令数据,能够降低后续数据演化处理过程中所演化数据的重复率,利用演化智能体对相似指令数据执行预设的演化策略,得到多个候选指令数据,实现了指令数据的大量自动生成,提升了生成指令数据的多样性,进一步的,利用评估智能体对各候选指令数据执行预设的评估策略,并将评估结果满足预设条件的候选指令数据确定为目标指令数据,一定程度上保证了生成指令数据的数据质量,进而在减少人力成本的同时提高了指令数据生成的效率。
43、当然,实施本发明的任一产品或方法并不一定需要同时达到以上所述的所有优点。
1.一种指令数据的生成方法,其特征在于,所述方法包括:
2.根据权利要求1所述的方法,其特征在于,所述利用映射智能体对所述初始指令数据进行类型分析,并生成与所述初始指令数据的类型相同的指令数据,得到相似指令数据,包括:
3.根据权利要求1所述的方法,其特征在于,所述预设的演化策略包括以下至少一项:逻辑深度化生成策略、逻辑范围化生成策略、逻辑精确化生成策略、逻辑限制化生成策略、逻辑推理化生成策略以及逻辑对抗化生成策略。
4.根据权利要求3所述的方法,其特征在于,所述利用演化智能体对所述相似指令数据执行预设的演化策略,得到多个候选指令数据,包括以下至少一项:
5.根据权利要求1所述的方法,其特征在于,所述预设的评估策略包括以下至少一项:一致性评估策略、合理性评估策略、连贯性评估策略、因果关系评估策略、推理能力评估策略以及专业知识评估策略。
6.根据权利要求5所述的方法,其特征在于,所述利用评估智能体对各所述候选指令数据执行预设的评估策略,得到各所述候选指令数据对应的评估结果,包括以下至少一项:
7.根据权利要求1-6任一所述的方法,其特征在于,所述方法还包括:
8.一种指令数据的生成装置,其特征在于,所述装置包括:
9.一种电子设备,其特征在于,包括处理器、通信接口、存储器和通信总线,其中,处理器,通信接口,存储器通过通信总线完成相互间的通信;
10.一种计算机可读存储介质,其特征在于,所述计算机可读存储介质内存储有计算机程序,所述计算机程序被处理器执行时实现权利要求1-7任一所述的方法步骤。
