1.基于改进视觉Transformer模型的语音特征识别方法,其特征在于,方法包括以下步骤:接收原始语音信号,对原始语音信号进行预处理得到语音处理信号;
对语音处理信号提取声学特征,得到log‑Mel语谱图;
将log‑Mel语谱图输入至预先建立的P2T模块内,得到特征向量;
将特征向量输入至预先建立的Sparse Transformer网络内,得到输出结果;
将输出结果导入预先建立的Softmax分类器后,得到识别结果。
2.根据权利要求1所述的基于改进视觉Transformer模型的语音特征识别方法,其特征在于,所述得到log‑Mel语谱图的过程:利用快速傅里叶变换对语音处理信号计算功率谱,将梅尔滤波器组应用于功率谱后,生成log‑Mel语谱图。
3.根据权利要求1所述的基于改进视觉Transformer模型的语音特征识别方法,其特征在于,所述P2T模块部分主干网络主要由单个卷积层、ReLU激活函数和最大池化操作组成。
4.根据权利要求2所述的基于改进视觉Transformer模型的语音特征识别方法,其特征在于,所述log‑Mel语谱图均匀划分为一系列patch,每个patch都经过P2T模块进行特征提取,且P2T模块公式如下:xi=I2P(IP)=MaxPool(ReLU(Conv2d(IP)))式中,IP为输入patch的大小,为 Conv2d代表卷积操作,ReLU代表激活函数,MaxPool代表最大池化操作,H、W分别为语谱图的高和宽,设S=4,patch的数量为N=16,其中xi代表第i个patch经过卷积提取得到的特征向量,其中1≤i≤N,单个卷积层中卷积核大小均设定为7×7,池化层尺寸均设定为2×2×2。
5.根据权利要求1所述的基于改进视觉Transformer模型的语音特征识别方法,其特征在于,所述Sparse Transformer网络包括SMHA模块和MLP结构。
6.根据权利要求5所述的基于改进视觉Transformer模型的语音特征识别方法,其特征在于,所述SMHA通过将输入的特征向量划分为多个特征子空间,从而产生多组注意力权重矩阵,引入稀疏矩阵M对注意力权重矩阵进行稀疏操作。
7.根据权利要求6所述的基于改进视觉Transformer模型的语音特征识别方法,其特征在于,所述稀疏操作如下:与注意力权重矩阵进行逐个元素比较,应用一个值对需要稀疏位置的数值进行覆盖,当计算注意力取Softmax激活函数时,将序列相似性矩阵进行归一化概率分布,M中被标记的位置被设为0,然后通过归一化相似矩阵与V进行点积运算,计算公式如下:式中Q、K、V分别代表查询向量、键向量、值向量,Q和K的点积代表上下文信息对关键信息的影响程度,dk代表K的维度,其中 Mi,j=1表示第i个patch注意到第j个patch,Mi,j=0第i个patch不能注意到第j个patch。
8.根据权利要求5所述的基于改进视觉Transformer模型的语音特征识别方法,其特征在于,所述MLP将每组注意力的信息进行筛选整合,公式如下:o
SMHA=Concat(H1,H2,…,Hn)W
Q K V
式中Hh是每个头的注意力得分,h=1,2,…,n,n代表注意力头数,这里n取16;Wh 、Wh 、Who分别代表Q、K、V第h次训练映射的权重矩阵;参数矩阵W用于将拼接后的数据进一步融合。
9.根据权利要求1所述的基于改进视觉Transformer模型的语音特征识别方法,其特征在于,所述得到输出结果的过程如下:将SMHA的输出送入MLP结构,先经过全连接层线性变换,再通过ReLU激活函数非线性变换,最后线性变换得到输出结果,公式如下:FFN(Y)=W2[ReLU(YW1+b1)+b2]
式中Y代表MLP的输入特征向量,W1、W2是两个线性变换层的参数矩阵,b1、b2代表偏置向量,然后将输出结果导入Softmax分类器后得到最终识别结果。
10.基于改进视觉Transformer模型的语音特征识别系统,其特征在于,包括:数据处理模块:用于接收原始语音信号,对原始语音信号进行预处理得到语音处理信号;
提取模块:用于对语音处理信号提取声学特征,得到log‑Mel语谱图;
第一输入模块:用于将log‑Mel语谱图输入至预先建立的P2T模块内,得到特征向量;
第二输入模块:用于将特征向量输入至预先建立的SparseTransformer网络内,得到输出结果;
识别模块:用于将输出结果导入预先建立的Softmax分类器后,得到识别结果。