1.一种基于主动声学感知场的手势识别方法,其特征在于,包括:利用头戴式设备上的扬声器发射调频连续波构建主动声学感知场,所述主动声学感知场用于感知头戴式设备的穿戴者手部运动,在主动声学感知场内的穿戴者手部和物品反射调频连续波形成回波信号;通过头戴式设备上的麦克风接受所述回波信号;对回波信号进行混频、低通滤波及模数转换得到数字基带信号;
对数字基带信号进行范围校正和降噪处理获得手部回波信号,具体包括:对数字基带信号进行信道解析获得信道脉冲响应,对信道脉冲响应执行差分操作获得差分信道脉冲响应,表达公式为:;
公式中, 为第k帧的差分信道脉冲响应; 为第k帧的信道脉冲响应; 为第k+1帧的差分信道脉冲响应;为物理延时索引;
将差分信道脉冲响应的延迟索引映射为物理距离,表达公式为:;
公式中,为声速,为物理距离;为离散延迟索引; 为差分信道脉冲响应的采样频率;
根据物理距离截取目标感知范围内的差分信道脉冲响应获得输入图谱;
将输入图谱进行二维快速傅里叶变换获得二维频谱,根据二维频谱中的高频干扰峰值构建高斯凹陷掩膜,将高斯凹陷掩膜作用于二维频谱并进行傅里叶逆变换获得手部回波信号;
将手部回波信号输入至预训练好的手势感知识别网络;所述手势感知识别网络包括多尺度时序编码器、手部关键点回归分支和手势识别分支;将手部回波信号输入至所述多尺度时序编码器,捕获长时序依赖获得多尺度时空特征;由所述手部关键点回归分支对多尺度时空特征进行轨迹跟踪获得手部关键点特征;将手部关键点特征和多尺度时空特征输入至所述手势识别分支获得手势识别结果。
2.根据权利要求1所述的手势识别方法,其特征在于,将输入图谱进行二维快速傅里叶变换获得二维频谱,表达公式:;
公式中, 为二维频谱; 为输入图谱; 为帧轴对应的频域索引,为延迟轴对应的频域索引;m为帧轴的离散索引;n为离散延迟索引;M为二维频谱中帧轴的总维度;N为二维频谱中延迟轴的总维度;为虚数单位;为圆周率。
3.根据权利要求2所述的手势识别方法,其特征在于,根据二维频谱中的高频干扰峰值构建高斯凹陷掩膜,将高斯凹陷掩膜作用于二维频谱并进行傅里叶逆变换获得手部回波信号,具体包括:;
;
公式中, 为高斯凹陷掩膜;为帧轴对应的频域索引, 为延迟轴对应的频域索引; 为第 个干扰峰值在帧轴的频率索引; 为第 个干扰峰值在延迟轴的频率索引;
为干扰峰值的序号索引;R为干扰峰值的总数量; 为抑制深度控制因子;为陷波宽度控制因子;e为自然常数; 为手部回波信号, 为傅里叶逆变换函数;
为二维频谱; 为哈达玛积。
4.根据权利要求1所述的手势识别方法,其特征在于,所述多尺度时序编码器包括多尺寸时序特征提取模块和共享Transformer编码器;多尺寸时序特征提取模块对手部回波信号分层提取多尺寸时序信息;所述共享Transformer编码器对多尺寸时序信息捕捉长时序依赖关系获得多尺度时空特征;
所述手部关键点回归分支包括第一线性层、激活函数、第二线性层和重塑层;所述多尺度时空特征依次经过第一线性层完成特征维度适配与关键信息初步提取,激活函数引入非线性映射以捕捉复杂特征关联,第二线性层优化特征表达并映射至关键点坐标空间,最后通过重塑层调整输出维度形成手部关键点特征;
所述手势识别分支包括向量级隐式特征提取模块、关节级显式特征提取模块、注意力融合模块和分类线性层;
向量级隐式特征提取模块从多尺度时空特征中,提取包含全局时序关联与声学感知信息的向量级声学隐式特征;
关节级显式特征提取模块以手部关键点特征为输入,构建静态特征和动态特征,并通过计算五个指尖关键点到掌心基准点的动态欧氏距离得到显式几何特征;将显式几何特征、静态特征和动态特征加权融合生成关节级特征;
注意力融合模块对关节级特征和向量级声学隐式特征加权自适应融合得到融合特征,表达公式为:;
公式中, 为注意力融合模块; 为关节级特征; 为向量级声学隐式特征; 为融合特征;
分类线性层以融合特征为输入计算获得手势类别的概率分布,根据手势类别的概率分布确定手势识别结果。
5.根据权利要求4所述的手势识别方法,其特征在于,通过计算五个指尖关键点到掌心基准点的动态欧氏距离得到显式几何特征,具体包括:;
;
公式中, 为显式几何特征; 表示为第t帧中第s个指尖关键点的三维空间坐标;
表示为代表第t帧中掌心基准点的三维空间坐标; 表示为第t帧中第s个指尖关键点到掌心基准点的实时欧氏距离;T为时序长度;t为时间帧索引;s为关键点索引;
为最大值计算算子; 表示为方差计算算子; 为最小值计算算子。
6.根据权利要求4所述的手势识别方法,其特征在于,所述手势感知识别网络的训练过程具体包括:通过剪切变换算法、多普勒拖尾合成算法以及高斯驱动的弹性形变算法对手部回波信号进行数据增强获得多视角样本;将多视角样本输入至所述手势感知识别网络,由手部关键点回归分支输出手部关键点特征,由手势识别分支输出手势类别的概率分布;
所述手势感知识别网络的训练过程包括第一训练阶段、第二训练阶段和第三训练阶段;
在第一训练阶段中,冻结手势识别分支的权重参数,根据手部关键点特征与手部关键点真实位置计算位置回归损失、运动损失和时序平滑损失;对位置回归损失、运动损失和时序平滑损失进行加权求和获得第一训练损失,表达公式为:;
;
;
;
公式中, 为第一训练损失, 为位置回归损失, 为运动损失,为时序平滑损失, 、 和 为设定损失权重参数,G为手部关键点总数,s为关键点索引,T为时序长度, 为第 帧第 个手部关键点特征; 为第 帧第 个手部关键点特征; 为第 帧第 个手部关键点真实位置; 为运动显著性权重;
根据第一训练损失对多尺度时序编码器和手部关键点回归分支的参数进行优化,重复迭代第一训练阶段,直至第一训练损失收敛输出训练后的手势感知识别网络,记为第一级模型;
在第二训练阶段中,冻结第一级模型中的多尺度时序编码器和手部关键点回归分支的权重参数,根据手势类别的概率分布和手势真实标签计算手势识别损失,将手势识别损失作为第二训练损失,表达公式为:;
公式中, 为第二训练损失, 为手势识别损失,C为手势类别总数;c为手势类别索引; 为第t帧手势类别的手势真实标签, 为第t帧手势预测为第c类的概率;
根据第二训练损失对第一级模型中手势识别分支的参数进行优化,重复迭代第二阶段训练过程,直至第二训练损失收敛输出训练后的手势感知识别网络,记为第二级模型;
在第三训练阶段中,根据手部关键点特征与手部关键点真实位置计算位置回归损失、运动损失、骨骼尺寸损失和时序平滑损失;根据手势类别的概率分布和手势真实标签计算手势识别损失,对位置回归损失、运动损失、骨骼尺寸损失、时序平滑损失以及手势识别损失加权求和获得第三训练损失,表达公式为:;
;
公式中, 为第三训练损失, 为骨骼尺寸损失, 和 为第b根骨骼两端的关键点索引, 为第 根骨骼的真实长度,为手部骨骼索引; 为手部骨骼总数;
为手部关键点特征; 、 、 、 和 为设定损失权重;
根据第三训练损失对第二级模型的参数进行优化,重复迭代第三阶段训练过程,直至第三训练损失收敛输出最终训练好的手势感知识别网络。
7.根据权利要求6所述的手势识别方法,其特征在于,通过剪切变换算法、多普勒拖尾合成算法以及高斯驱动的弹性形变算法对手部回波信号进行数据增强获得多视角样本,具体包括:所述多视角样本包括第一视角样本、第二视角样本和第三视角样本;
通过剪切变换算法对手部回波信号进行变换,模拟手部俯仰角变化获得第一视角样本,表达公式为:;
公式中,为剪切系数; 为手部回波信号中传播延迟对应的空间位置; 为手部回波信号的时间序列位置; 为第一视角样本中传播延迟对应的空间位置; 为第一视角样本的时间序列位置;
通过多普勒拖尾合成算法对手部回波信号进行变换,模拟手部运动速度差异获得第二视角样本,表达公式为:;
公式中, 为手部回波信号; 为第二视角样本; 为拖尾权重; 为第 次延迟叠加的加权系数;L为延迟叠加次数;为延迟叠加的序号索引; 为时间轴平移算子; 为帧轴平移步长;
通过高斯驱动的弹性形变算法生成随机高斯位移场,表达公式为:;
;
公式中, 为帧轴的位移场分量; 为延迟轴的位移场分量;为位移幅度控制因子;
为帧轴对应的高斯核; 为延迟轴对应的高斯核; 为标准正态分布随机噪声场;
将随机高斯位移场添加至手部回波信号,模拟头部微颤获得第三视角样本。
8.一种基于主动声学感知场的手势识别系统,其特征在于,包括:获取单元,利用头戴式设备上的扬声器发射调频连续波构建主动声学感知场,所述主动声学感知场用于感知头戴式设备的穿戴者手部运动,在主动声学感知场内的穿戴者手部和物品反射调频连续波形成回波信号;通过头戴式设备上的麦克风接受所述回波信号;
校正单元,对回波信号进行混频、低通滤波及模数转换得到数字基带信号;对数字基带信号进行范围校正和降噪处理获得手部回波信号;
识别单元,将手部回波信号输入至预训练好的手势感知识别网络;所述手势感知识别网络包括多尺度时序编码器、手部关键点回归分支和手势识别分支;将手部回波信号输入至所述多尺度时序编码器,捕获长时序依赖获得多尺度时空特征;由所述手部关键点回归分支对多尺度时空特征进行轨迹跟踪获得手部关键点特征;将手部关键点特征和多尺度时空特征输入至所述手势识别分支获得手势识别结果;
所述校正单元对数字基带信号进行范围校正和降噪处理获得手部回波信号,具体包括:对数字基带信号进行信道解析获得信道脉冲响应,对信道脉冲响应执行差分操作获得差分信道脉冲响应,表达公式为:;
公式中, 为第k帧的差分信道脉冲响应; 为第k帧的信道脉冲响应; 为第k+1帧的差分信道脉冲响应;为物理延时索引;
将差分信道脉冲响应的延迟索引映射为物理距离,表达公式为:;
公式中,为声速,为物理距离;为离散延迟索引; 为差分信道脉冲响应的采样频率;
根据物理距离截取目标感知范围内的差分信道脉冲响应获得输入图谱;
将输入图谱进行二维快速傅里叶变换获得二维频谱,根据二维频谱中的高频干扰峰值构建高斯凹陷掩膜,将高斯凹陷掩膜作用于二维频谱并进行傅里叶逆变换获得手部回波信号。
9.一种电子终端,其特征在于,包括处理器及存储介质;所述存储介质用于存储指令;
所述处理器用于根据所述指令进行操作以执行权利要求1至7任一项所述手势识别方法的步骤。