多模态融合的人机交互方法、装置、可穿戴设备和介质

allin2026-10-01  6


本技术涉及人机交互。更具体地说,本技术涉及一种多模态融合的人机交互方法、装置、可穿戴设备和介质。


背景技术:

1、传统的人机交互方法通常局限于单一的模态信息,也即语音、图像、文本、眼动或者触觉中的任意一种。这种方法在日常环境下表现良好,但是,在水下交互场景和聋哑人交互场景等无法进行自然语言沟通的交互场景中,其鲁棒性和泛化能力表现欠佳。具体的,这种方法通常需要占用用户的四肢,侵占了用户的任务空间,使得在原有的任务空间的情况下,用户的四肢无法完成人机交互,难以满足无法进行自然语言沟通的应用场景的多任务操作需求。该任务空间,指的是用户在进行某项活动或任务时,身体各部分(尤其是四肢)所处的空间范围以及它们所能够自由移动和操作的区域。


技术实现思路

1、本技术实施例的目的是,提供一种多模态融合的人机交互方法、装置、可穿戴设备和介质,其能够满足无法进行自然语言沟通的交互场景的多任务操作需求,提高人机交互效率。本技术实施例主要通过下述技术方案实现:

2、本技术实施例的第一方面,提供了一种多模态融合的人机交互方法,包括:

3、获取用户的头部动作分类信息、喉部动作分类信息和用户状态信息;

4、基于所述头部动作分类信息获得第一用户意图标签,并将所述第一用户意图标签加入第一堆栈;

5、基于所述喉部动作分类信息获得第二用户意图标签,并将所述第二用户意图标签加入第二堆栈;

6、在所述第一堆栈和/或所述第二堆栈处于溢出状态时,基于所述第一堆栈和所述第二堆栈获得用户操作意图;

7、基于所述用户操作意图和所述用户状态信息获得第一操作指令,并向水下机器人发出所述第一操作指令。

8、根据本技术的一个实施例,所述获取用户的头部动作分类信息的步骤包括:

9、基于第一时序采集用户的头部姿态信息,获得头部运动数据;

10、对所述头部运动数据进行滤波处理,获得第一待处理数据;

11、采用分割方法对所述第一待处理数据进行分割处理,获得第二待处理数据;

12、基于预设特征对所述第二待处理数据进行表征,获得第三待处理数据;

13、将所述第三待处理数据与头部动作模板进行对比,获得所述头部动作分类信息。

14、根据本技术的一个实施例,所述获取用户的喉部动作分类信息的步骤包括:

15、基于第二时序采集所述用户的喉部振动信息,获得喉部振动数据;

16、对所述喉部振动数据进行音频信号处理,获得第四待处理数据;

17、对所述第四待处理数据进行离散傅里叶变换,获得频谱信息;

18、对所述频谱信息进行特征提取,获得第五待处理数据;

19、采用神经网络对所述第五待处理数据进行分类处理,获得所述喉部动作分类信息。

20、根据本技术的一个实施例,所述获取用户的用户状态信息的步骤包括:

21、获取用户的生命体征数据和外界环境信息;

22、基于所述生命体征数据和外界环境信息获得所述用户状态信息。

23、根据本技术的一个实施例,在所述基于所述生命体征数据和外界环境信息获得所述用户状态信息的步骤之后,所述获取用户的用户状态信息的步骤还包括:

24、对所述生命体征数据和所述外界环境信息进行交叉验证,获得验证结果;

25、基于所述验证结果修改所述用户状态信息。

26、根据本技术的一个实施例,在所述获取用户的头部动作分类信息、喉部动作分类信息和用户状态信息步骤之后,所述多模态融合的人机交互方法还包括:

27、在所述用户状态信息处于危险状态时,采用主导控制系统自动生成所述第二操作指令,并向所述水下机器人发出所述第二操作指令;

28、在所述第二操作指令发出之前或者在所述第二操作指令发出之后,所述主导控制系统生成第一脱离危险指示,以提示用户脱离危险状态。

29、根据本技术的一个实施例,在所述获取用户的头部动作分类信息、喉部动作分类信息和用户状态信息步骤之后,所述多模态融合的人机交互方法还包括:

30、基于预设共享函数判断是否采用主导控制系统自动生成第三操作指令,并向所述水下机器人发出所述第三操作指令;

31、在所述第三操作指令发出之前或者在所述第三操作指令发出之后,所述主导控制系统生成第二脱离危险指示,以提示用户脱离危险状态。

32、本技术实施例的第二方面,提供了一种多模态融合的人机交互装置,包括:

33、信息获取模块,用于获取用户的头部动作分类信息、喉部动作分类信息和用户状态信息;

34、第一用户意图标签获得模块,用于基于所述头部动作分类信息获得第一用户意图标签,并将所述第一用户意图标签加入第一堆栈;

35、第二用户意图标签获得模块,用于基于所述喉部动作分类信息获得第二用户意图标签,并将所述第二用户意图标签加入第二堆栈;

36、用户操作意图获得模块,用于在所述第一堆栈和/或所述第二堆栈处于溢出状态时,基于所述第一堆栈和所述第二堆栈获得用户操作意图;

37、第一操作指令获得模块,用于基于所述用户操作意图和所述用户状态信息获得第一操作指令,并向机器发出所述第一操作指令。

38、本技术实施例的第三方面,提供了一种可穿戴设备,包括:相机、惯性测量单元、生命体征传感器、温度传感器、喉部振动传感器、处理器和存储器,所述相机、所述惯性测量单元、所述生命体征传感器、所述温度传感器和所述喉部振动传感器均与所述处理器连接,所述存储器用于存储计算机程序,所述处理器用于调用并运行所述存储器中存储的计算机程序,执行上述本技术实施例第一方面提供的多模态融合的人机交互方法的步骤。

39、本技术实施例的第四方面,提供了一种计算机可读存储介质,所述计算机可读存储介质用于存储计算机程序,所述计算机程序使得计算机执行上述本技术实施例第一方面提供的多模态融合的人机交互方法的步骤。

40、本技术实施例的有益效果至少包括:

41、本技术实施例通过获取用户的头部动作分类信息、喉部动作分类信息和用户状态信息;基于所述头部动作分类信息获得第一用户意图标签,并将所述第一用户意图标签加入第一堆栈;基于所述喉部动作分类信息获得第二用户意图标签,并将所述第二用户意图标签加入第二堆栈;在所述第一堆栈和/或所述第二堆栈处于溢出状态时,基于所述第一堆栈和所述第二堆栈获得用户操作意图;基于所述用户操作意图和所述用户状态信息获得第一操作指令,并向水下机器人发出所述第一操作指令。也即,本技术实施例采用用户的头部动作分类信息、喉部动作分类信息和用户状态信息作为生成控制水下机器人工作的第一操作指令的因素,由此,本技术人机交互的实现,无需占用用户的四肢,使得用户能够在完成人机交互任务的同时,有足够的身体部位去实施其他任务。因此,与现有技术相比,本技术实施例能够满足无法进行自然语言沟通的交互场景的多任务操作需求,提高人机交互效率。


技术特征:

1.一种多模态融合的人机交互方法,其特征在于,包括:

2.根据权利要求1所述的多模态融合的人机交互方法,其特征在于,所述获取用户的头部动作分类信息的步骤包括:

3.根据权利要求1所述的多模态融合的人机交互方法,其特征在于,所述获取用户的喉部动作分类信息的步骤包括:

4.根据权利要求1所述的多模态融合的人机交互方法,其特征在于,所述获取用户的用户状态信息的步骤包括:

5.根据权利要求4所述的多模态融合的人机交互方法,其特征在于,在所述基于所述生命体征数据和外界环境信息获得所述用户状态信息的步骤之后,所述获取用户的用户状态信息的步骤还包括:

6.根据权利要求1所述的多模态融合的人机交互方法,其特征在于,在所述获取用户的头部动作分类信息、喉部动作分类信息和用户状态信息步骤之后,所述多模态融合的人机交互方法还包括:

7.根据权利要求1所述的多模态融合的人机交互方法,其特征在于,在所述获取用户的头部动作分类信息、喉部动作分类信息和用户状态信息步骤之后,所述多模态融合的人机交互方法还包括:

8.一种多模态融合的人机交互装置,其特征在于,包括:

9.一种可穿戴设备,其特征在于,包括:相机、惯性测量单元、生命体征传感器、温度传感器、喉部振动传感器、处理器和存储器,所述相机、所述惯性测量单元、所述生命体征传感器、所述温度传感器和所述喉部振动传感器均与所述处理器连接,所述存储器用于存储计算机程序,所述处理器用于调用并运行所述存储器中存储的计算机程序,执行上述权利要求1至7任一项所述的多模态融合的人机交互方法的步骤。

10.一种计算机可读存储介质,其特征在于,用于存储计算机程序,所述计算机程序使得计算机执行上述权利要求1至7任一项所述的多模态融合的人机交互方法的步骤。


技术总结
本申请涉及人机交互技术领域。本申请公开了一种多模态融合的人机交互方法、装置、可穿戴设备和介质,其能够满足无法进行自然语言沟通的交互场景的多任务操作需求,提高人机交互效率。所述多模态融合的人机交互方法包括获取用户的头部动作分类信息、喉部动作分类信息和用户状态信息;基于头部动作分类信息获得第一用户意图标签,并将第一用户意图标签加入第一堆栈;基于喉部动作分类信息获得第二用户意图标签,并将第二用户意图标签加入第二堆栈;在第一堆栈和/或第二堆栈处于溢出状态时,基于第一堆栈和第二堆栈获得用户操作意图;基于用户操作意图和用户状态信息获得第一操作指令,并向水下机器人发出第一操作指令。

技术研发人员:万芳,宋超阳,张镕正,邱望弘杰
受保护的技术使用者:南方科技大学
技术研发日:
技术公布日:2024/10/31
转载请注明原文地址: https://www.8miu.com/read-31681.html

最新回复(0)