利索能及
我要发布
收藏
专利号: 2022112484861
申请人: 西安邮电大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-09-16
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于图像处理说话人识别检测方法,其特征在于:包括以下步骤:

步骤S1、FPGA获取识别检测图像,并将图像灰度化,再对图像进行Gamma校正,并缓存校正后的图像像素数据;

步骤S2、FPGA通过校正后的图像像素数据,得到图像的8邻域像素和16邻域像素,根据邻域像素计算图像8个方向的梯度值,并取8个方向中的最大幅度值及对应方向作为该像素点的梯度,得到梯度图像;

步骤S3、FPGA将梯度图像分割成若干个cell,并对所有cell以36*36像素为检测窗进行滑窗,并将滑窗进行HOG特征提取及分类,得到每个检测窗的特征向量;

步骤S4、SVM软件通过并行流水线的方式处理检测窗,将得到的每个检测窗的特征向量均输入第一级SVM分类器模块进行人脸分类检测;并将每个检测窗的位置信息输入非极大值抑制模块,去除多余的置信度较低的位置信息及将相互交叉的位置信息进行筛选合并,之后将人脸坐标数据位置信息进行缓存;

步骤S5、将筛选合并之后的相互交叉的位置信息再输入第二级SVM分类器模块,进行说话人脸的分类检测,分类完成后直接将分类为说话人脸的位置信息保存,并将非说话人脸位置信息删除;

步骤S6、将分类为说话人脸的位置信息输入到画框模块中,通过画框模块在原始彩色图像上将其标记为说话人脸,然后输出在屏幕上显示,完成对说话人脸识别检测的实时处理。

2.根据权利要求1所述的一种基于图像处理说话人识别检测方法,其特征在于:所述步骤S1中,获取识别检测图像包括,识别检测系统通过摄像头采集或经其他设备传输来获取图像,通过FPGA对摄像头或其他设备传输的图像进行读取来获得输入图像,通过图像缩放模块将输入图像的像素范围调整到800×600内,将其作为识别检测图像;

图像Gamma校正包括,通过FPGA将图像归一化处理,并对归一化图像的像素点进行补偿,最后将计算出的补偿像素点去归一化处理;所述归一化图像的像素点补偿计算公式为:γ

I=V ,其中,V是归一化图像的亮度,γ是校正参数,I是校正后的归一化图像亮度。

3.根据权利要求1所述的一种基于图像处理说话人识别检测方法,其特征在于:所述步骤S2中,图像8个方向分别为0度、26度、45度、64度、90度、116度、135度和153度;其8个方向的梯度值计算公式分别为:G0(x,y)=1/2[H(x+2,y)+H(x+1,y)‑H(x‑1,y)‑H(x‑2,y)]G26(x,y)=H(x+2,y‑1)‑H(x‑2,y+1)

G45(x,y)=1/2[H(x+2,y‑2)+H(x+1,y‑1)‑H(x‑1,y+1)‑H(x‑2,y+2)]G64(x,y)=H(x+1,y‑2)‑H(x‑1,y+2)

G90=1/2[H(x,y‑2)+H(x,y‑1)‑H(x,y+1)‑H(x,y+2)]G116(x,y)=H(x‑1,y‑2)‑H(x+1,y+2)

G135(x,y)=1/2[H(x‑2,y‑2)+H(x‑1,y‑1)‑H(x+1,y+1)‑H(x+2,y+2)]G153=H(x‑2,y‑1)‑H(x+2,y+1)其中,H(x,y)表示位置(x,y)处的像素灰度值,数字2表示图像的16邻域,数字1表示图像的8邻域;G0(x,y)表示0度方向的梯度值,G26(x,y)表示26度方向的梯度值,G45(x,y)表示

45度方向的梯度值,G64(x,y)表示64度方向的梯度值,G90(x,y)表示90度方向的梯度值,G116(x,y)表示116度方向的梯度值,G135(x,y)表示135度方向的梯度值,G153(x,y)表示153度方向的梯度值。

4.根据权利要求3所述的一种基于图像处理说话人识别检测方法,其特征在于:所述步骤S3中,检测窗HOG特征提取及分类包括如下步骤:步骤S31、将梯度图像以3*3像素大小分为若干个cell,并读取每个cell的对应像素的梯度值及方向,并将每个cell的8个方向的梯度值分别计入梯度直方图统计中,得到若干个特征向量长度为8的一维向量;

步骤S32、将每4个cell以大小为2*2的方式组成一个块,将每个块内每个cell的梯度直方图串联,并进行对比度归一化处理得到每个块的维特征描述子;

步骤S33、将每个检测窗内的所有块的特征描述子串联,得到每个检测窗的特征向量。

5.根据权利要求3所述的一种基于图像处理说话人识别检测方法,其特征在于:步骤S4中,人脸分类检测具体包括以下步骤:步骤S41、通过第一级线性SVM分类器进行人脸和非人脸两个线性SVM分类器的训练,并通过交叉验证来获取训练时的最优超参数,将最优超参数作为输入进行优化,得到优化后的第一级线性SVM分类器模型的参数,并将优化后的第一线性SVM分类器模型的参数分别存入第一ROM里;

步骤S42、根据优化的第一线性SVM分类器模型的参数,将每个检测窗为人脸的特征向量通过SVM决策分类函数判断人脸和非人脸,并将判断为人脸的保存其窗口的坐标,具体判断公式为:f(x)=sign(w1 x1+b1)其中,sign(w1 x1+b1)=sign(y1),f(x)为SVM分类器,sign为符号函数,x1为 提取 到为人 脸的特征 向量,y1 为sig n符 号函数 的输入 ,当计算的数值大于0时判断为人脸,否则判断为非人脸。

6.根据权利要求1所述的一种基于图像处理说话人识别检测方法,其特征在于:步骤S4中,去除多余的置信度较低的位置信息为,选定一个阈值T(T∈(0,1))来作为两个窗口的相似性大小;当大于该阈值就判断两个窗口相似,则去掉置信度较低的窗口,从而获得人脸框坐标,将人脸坐标数据进行缓存。

7.根据权利要求5所述的一种基于图像处理说话人识别检测方法,其特征在于:步骤S5中,说话人脸的分类检测具体包括以下步骤;

步骤S51、通过第二级线性SVM分类器进行说话人脸和非说话人脸两个线性SVM分类器的训练,并通过交叉验证来获取训练时的最优超参数,将最优超参数作为输入进行优化,得到优化后的第二线性SVM分类器模型的参数,并将优化后的第二线性SVM分类器模型的参数分别存入第二ROM里;

步骤52、根据优化的两个第二线性SVM分类器模型的参数,将检测窗内所有cell中为说话人脸的特征向量通过SVM决策分类函数判断说话人脸和非说话人脸,具体判断公式为:f(x)″=sign(w2x2+b2)其中,sign(w2x2+b2)=sign(y2),f(x)″为SVM分类器,sign为符号函数,x2为提取到为说话人脸的特征向量,y2为sign符号函数的输入,当计算的数值大于0时判断为说话人脸,否则判断为非说

话人脸。