1.一种基于余弦相似性和语音去噪的声纹识别对抗样本防御方法,其特征在于,包括以下步骤:步骤1:对说话人语音信号进行数据预处理;
步骤2:搭建声纹识别模型;
步骤3:根据声纹模型设计对抗样本;
步骤4:根据干净数据和小波变换重构方法得到检测阈值;具体包括:抑制扰动ei(t),得到真实信号fi(t),信号经过小波变换后,能够最大程度的去除信号fi(t)的相关性,将大部分能量集中在少数的、幅度较大的小波系数上;而扰动ei(t)经过小波变换后将分布在各个尺度下的所有时间轴上,且幅度不是很大;可以通过阈值过滤的方法达到对语音信号降噪的目的;
小波阈值降噪的步骤如下:
I.对语音信号fi(t)进行小波变换;选定一个正交小波和分解层数N,对信号fi(t)进行N层的小波分解;
II.对样本信号fi(t)的小波变换系数进行线性阈值处理;对第一层到N层的每一层高频系数通过阈值函数处理,每层的低频系数不做处理;阈值公式如下:其中w为小波系数,λ为选定的阈值;
III.对处理后的小波系数进行重构;根据小波分解的第N层的低频系数和经过处理后的第一层到N层的高频系数进行语音信号重构,从而得到降噪后的语音信号 则有:将原始干净样本 和经过小波变换后的干净样本 输入声纹识别模型中得到对应的输出概率向量 和 然后计算两个向量间的余弦相似性值为然后在干净样本的余弦相似性值集合C中选定一个检测阈值,如设定误检测率为b%,则检测阈值T为sort(C)中第b%的那个值,其中,sort(C)表示对C进行从小到大进行排序;
步骤5:根据检测阈值来检测对抗样本;将对抗样本Xi进行小波变换,然后得到余弦相似性值Ci′,将对抗样本的余弦相似性值与检测阈值T进行比较,若满足Ci′<T则判定Xi为对抗样本;
步骤6:去噪神经网络防御对抗样本;具体包括:首先训练一个去噪神经网络,采用的去噪神经网络是DCCRN,DCCRN网络首先通过短时傅里叶变换,对带噪语音进行变换,得到具有实部和虚部的语音复数频谱然后定义输入复数矩阵I=Ir+jIi,复数卷积滤波器W=Wr+jWi,其中矩阵Wr和Wi表示复数卷积核的实部和虚部,复数层的输出特征Fout为:Fout=(Ir*Wr‑Ii*Wi)+j(Ir*Wi+Ii*Wr) (10)类似于复数卷积,给定复数输入Xr和Xi的实部和虚部,复数LSTM的输出Lout可以被定义为:Lrr=LSTMr(Xr);Lii=LSTMi(Xi) (11)Lri=LSTMi(Xr);Lir=LSTMr(Xi) (12)Lout=(Lrr‑Lii)+(Lri+Lir) (13)其中LSTMr和LSTMi是两个常规LSTM模块的实部和虚部;
在训练网络过程中,DCCRN的目的是优化一个复数掩码矩阵M=Mr+jMi,带噪的语音经过掩码矩阵后可以得到去噪后的语音S=M*Y (14)其中S=Sr+jSi,这是干净语音的复数频谱,Y=Yr+jYi是带噪语音的复数频谱;
给定S和Y,M可以被如下公式计算:
M在极坐标中表示为:
Mphase=arctan2(Mi,Mr) (18)以此带噪语音可以被估计为:
DCCRN的损失函数为SI‑SNR,计算公式如下:其中<·,·>代表两向量间的点积,当估计语音 非常接近干净语音S时,en≈0;
当DCCRN去噪网络训练好后,将未检测出的对抗样本输入去噪网络中,得到去噪后的语音,去噪后的语音将恢复为原始正确标签。
2.如权利要求1所述的基于余弦相似性和语音去噪的声纹识别对抗样本防御方法,其特征在于,步骤1具体包括:首先对现有的语音文件进行数据提取,其中,现有的语音文件指.WAV格式的语音文件;
利用librosa音频处理python工具包对说话人语音进行语音数据提取,如下:Xi,sr=librosa(Ti,sr=None),i=1,2,...n+m (1)其中Xi是提取的第i个说话人语音文件的语音数据,sr是语音数据的采样率,Ti是第i个说话人语音文件;
train test
对语音信号数据集进行归一化处理,并将数据集D划分为训练集D 与测试集D ,其中数据集train
D ={(X1,Y1),(X2,Y2),...,(Xn,Yn)}test
D ={(Xn+1,Yn+1),(Xn+2,Yn+2),...,(Xn+m,Yn+m)}Xi=(Xi1,Xi2,...,Xid),d表示Xi的数据长度, 代表c类标签;归一化公式为:其中 表示归一化后的样本,max(Xi)表示样本中d个采样点中最大值,归一化后
3.如权利要求1所述的基于余弦相似性和语音去噪的声纹识别对抗样本防御方法,其特征在于,步骤2具体包括:预先指定分类模型的结构和参数,且不发生变化;采用的分类模型结构主要包含1D卷积层,最大池化层,批归一化层,全连接层;利用训练数据集进行训练,声纹识别分类模型如下:目标模型:
Ftarget(·)代表模型输出的概率向量。
4.如权利要求1所述的基于余弦相似性和语音去噪的声纹识别对抗样本防御方法,其特征在于,步骤3具体包括:对抗样本定义为:
其中,δi为添加到原样本上的扰动;
这里以基于优化的对抗攻击方法为例说明对抗样本生成;基于优化的攻击方法本质是一种基于梯度的对抗样本生成方法;
优化函数定义为: