本技术属于智能家电,具体涉及一种智能引导的处理方法、装置、设备和存储介质。
背景技术:
1、随着社会的发展,人们生活水平的逐渐提高,人们对衣物处理设备、洗碗机等家电的处理功能也逐渐重视起来。
2、但随着家电的更新换代,功能和参数不断丰富,用户的学习成本也在不断增加。纸质版的产品说明书难以将复杂的操作描述清楚,电子版产品说明书则需要借助其它电子设备,对于特殊人群乃至正常人群都不友好。
3、因此,需给出一种智能引导的处理方法,以使用户能够快速掌握家电的处理流程。
技术实现思路
1、为了解决现有技术中的上述问题,本技术提供了一种智能引导的处理方法、装置、设备和存储介质。
2、第一方面,本技术提供一种智能引导的处理方法,所述方法包括:
3、获取用户的家电处理请求;
4、将所述家电处理请求输入至预训练语言模型,得到所述预训练语言模型输出的第一引导指令;其中,所述预训练语言模型为可进行上下文自适应学习的语言模型,所述预训练语言模型每次输出家电处理的单个阶段的引导指令;
5、向所述用户输出所述第一引导指令,并根据所述用户在第一预设时长内的反馈,重新生成第一引导指令或继续生成第二引导指令并输出至用户,其中,所述第二引导指令为第一引导指令之后的指令。
6、在一种可能的实施方式中,所述根据所述用户在第一预设时长内的反馈,确定重新生成第一引导指令或第二引导指令,包括:
7、若在第一预设时长内,未收到用户针对所述第一引导指令的第一操作,则重新生成第一引导指令;
8、若在第一预设时长内,收到用户针对所述第一引导指令的第一操作,则继续生成第二引导指令。
9、在一种可能的实施方式中,所述在第一预设时长内,收到用户针对所述第一引导指令的第一操作之后,所述方法还包括:
10、获取所述用户操作的反应时长,所述反应时长为第一引导指令发出后至收到所述第一操作的时长;
11、根据所述反应时长对所述预训练语言模型的输出进行评分,得到评分结果;
12、通过所述评分结果训练奖励模型,并基于所述奖励模型,通过强化学习训练来优化所述预训练语言模型。
13、在一种可能的实施方式中,所述根据所述反应时长对所述预训练语言模型的输出进行评分,得到评分结果,包括:
14、判断所述反应时长是否大于第二预设时长,其中,所述第二预设时长小于所述第一预设时长;
15、若所述反应时长大于所述第二预设时长,则评分为0;
16、若所述反应时长小于所述第二预设时长,则根据反应时长与评分的对应关系,获取所述评分;
17、根据所述预训练语言模型的输出和对应的评分,得到评分结果。
18、在一种可能的实施方式中,所述根据反应时长与评分的对应关系,获取所述评分,包括:
19、根据反应时长和预设函数,获取所述评分,其中,所述预设函数用于指示反应时长与评分成反比;或者
20、获取所述反应时长所属的时长范围,获取所述时长范围对应的评分,其中,所述反应时长与所述评分成反比。
21、在一种可能的实施方式中,所述重新生成第一引导指令或继续生成第二引导指令,包括:
22、将用户不满意所述第一引导指令的信息输入至所述预训练语言模型,得到所述预训练语言模型重新生成的第一引导指令;或者
23、将输出下一指令的指示信息输入至所述预训练语言模型,得到所述预训练语言模型输出的第二引导指令。
24、在一种可能的实施方式中,所述将所述家电处理请求输入至预训练语言模型之前,所述方法还包括:
25、若所述家电处理请求非文本信息,则将所述家电处理请求转化为文本信息;
26、所述将所述家电处理请求输入至预训练语言模型,包括:
27、将所述文本信息输入至所述预训练语言模型。
28、第二方面,本技术提供一种智能引导的控制装置,包括:获取模块、模型模块和反馈模块,其中:
29、所述获取模块,用于获取用户的家电处理请求;
30、所述模型模块,用于将所述家电处理请求输入至预训练语言模型,得到所述预训练语言模型输出的第一引导指令;其中,所述预训练语言模型为可进行上下文自适应学习的语言模型,所述预训练语言模型每次输出家电处理的单个阶段的引导指令;
31、所述反馈模块,用于向所述用户输出所述第一引导指令,并根据所述用户在第一预设时长内的反馈,重新生成第一引导指令或继续生成第二引导指令并输出至用户,其中,所述第二引导指令为第一引导指令之后的指令。
32、在一种可能的实施方式中,所述反馈模块,还用于:
33、若在第一预设时长内,未收到用户针对所述第一引导指令的第一操作,则重新生成第一引导指令;
34、若在第一预设时长内,收到用户针对所述第一引导指令的第一操作,则继续生成第二引导指令。
35、在一种可能的实施方式中,所述反馈模块,还用于:
36、获取所述用户操作的反应时长,所述反应时长为第一引导指令发出后至收到所述第一操作的时长;
37、根据所述反应时长对所述预训练语言模型的输出进行评分,得到评分结果;
38、通过所述评分结果训练奖励模型,并基于所述奖励模型,通过强化学习训练来优化所述预训练语言模型。
39、在一种可能的实施方式中,所述反馈模块,还用于包括:
40、判断所述反应时长是否大于第二预设时长,其中,所述第二预设时长小于所述第一预设时长;
41、若所述反应时长大于所述第二预设时长,则评分为0;
42、若所述反应时长小于所述第二预设时长,则根据反应时长与评分的对应关系,获取所述评分;
43、根据所述预训练语言模型的输出和对应的评分,得到评分结果。
44、在一种可能的实施方式中,所述反馈模块,还用于:
45、根据反应时长和预设函数,获取所述评分,其中,所述预设函数用于指示反应时长与评分成反比;或者
46、获取所述反应时长所属的时长范围,获取所述时长范围对应的评分,其中,所述反应时长与所述评分成反比。
47、在一种可能的实施方式中,所述反馈模块,还用于:
48、将用户不满意所述第一引导指令的信息输入至所述预训练语言模型,得到所述预训练语言模型重新生成的第一引导指令;或者
49、将输出下一指令的指示信息输入至所述预训练语言模型,得到所述预训练语言模型输出的第二引导指令。
50、在一种可能的实施方式中,所述获取模块,还用于:
51、若所述家电处理请求非文本信息,则将所述家电处理请求转化为文本信息;
52、所述将所述家电处理请求输入至预训练语言模型,包括:
53、将所述文本信息输入至所述预训练语言模型。
54、第三方面,本技术提供一种设备,包括:至少一个处理器和存储器,其中:
55、所述存储器用于存储计算机执行指令;
56、所述至少一个处理器用于执行所述存储器存储的计算机执行指令,使得所述至少一个处理器执行如第一方面任一项所述的智能引导的处理方法。
57、第四方面,本技术提供一种计算机存储介质,所述计算机存储介质中存储有计算机执行指令,所述计算机执行指令被处理器执行时用于实现如第一方面任一项所述的智能引导的处理方法。
58、第五方面,本技术还提供一种计算机程序产品,包括计算机程序,所述计算机程序被处理器执行时,可实现如前述任一项所述的智能引导的处理方法的步骤。
59、本技术提供一种智能引导的处理方法、装置、设备和存储介质,获取用户的家电处理请求,将家电处理请求输入预训练语言模型,输出每个阶段的引导指令。向用户输出指导指令,根据用户反馈判断重新获取该阶段的引导指令或获取下一步引导指令。通过上述方式,根据用户反馈生成用户更倾向的引导指令,使得家电满足用户的家电处理请求的结果,更能达到用户的要求,提高引导指令的适用性,以及增强了用户的使用体验感。
1.一种智能引导的处理方法,其特征在于,所述方法包括:
2.根据权利要求1所述的方法,其特征在于,所述根据所述用户在第一预设时长内的反馈,确定重新生成第一引导指令或第二引导指令,包括:
3.根据权利要求2所述的方法,其特征在于,所述在第一预设时长内,收到用户针对所述第一引导指令的第一操作之后,所述方法还包括:
4.根据权利要求3所述的方法,其特征在于,所述根据所述反应时长对所述预训练语言模型的输出进行评分,得到评分结果,包括:
5.根据权利要求4所述的方法,其特征在于,所述根据反应时长与评分的对应关系,获取所述评分,包括:
6.根据权利要求1所述的方法,其特征在于,所述重新生成第一引导指令或继续生成第二引导指令,包括:
7.根据权利要求1所述的方法,其特征在于,所述将所述家电处理请求输入至预训练语言模型之前,所述方法还包括:
8.一种智能引导的控制装置,其特征在于,包括:获取模块、模型模块和反馈模块,其中:
9.一种设备,其特征在于,包括:至少一个处理器和存储器,其中:
10.一种计算机存储介质,其特征在于,所述计算机存储介质中存储有计算机执行指令,所述计算机执行指令被处理器执行时用于实现如权利要求1至7任意一项所述的方法。
