利索能及
我要发布
收藏
专利号: 2023109225620
申请人: 西安邮电大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-09-16
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于高阶递归注意力加权网络的人脸情绪识别方法,其特征在于,是构建HRAM‑CNN网络模型并对其进行人脸情绪识别的学习训练,再将待识别的图像输入训练好的HRAM‑CNN网络模型中,对各个图像进行情绪判断;

所述的HRAM‑CNN网络模型是将高阶递归注意力机制HRAM放入到卷积网络模型CNN的卷积层中;其中,CNN的输入层负责输入人脸情绪图像数据,卷积层负责提取图像数据特征,池化层负责对提取到的数据特征进行降维,全连接层是将降维的特征综合起来,输出层负责图像分类识别;在CNN卷积层的多个Block之后加入加入HRAM;

所述HRAM是在一阶空间相互作用基本操作后,通过引入高阶相互作用,构建三阶递归HW×C形式;设X∈R 为输入特征,则HRAM的基本操作如式1所示:其中, 是执行信道混合的线性投影层,f表示深度卷积,H表示特征矩阵的高度,W表示特征矩阵的宽度,C表示特征矩阵的深度,Avgpool表示平均池化,Linear表示全连接,P0表示投影特征,q0表示它的邻居特征;

Ωi是以i为中心的局部窗口,ω表示f的卷积权值。

2.如权利要求1所述的基于高阶递归注意力加权网络的人脸情绪识别方法,其特征在于,所述HRAM在执行时:首先使用 来获得一组投影特征P0和

然后,通过高阶递归地执行HRAM的基本操作:

Pk+1=fk(qk)+fk(Pk)/α k=0,1,2 (4)将输出按1/α缩放以稳定训练,{fk}是一组深度卷积层,{gk}用于按不同顺序匹配维数:最后,将第三个递归步骤qn的输出给投影层 以获得HRAM的结果。

3.如权利要求1或2所述的基于高阶递归注意力加权网络的人脸情绪识别方法,其特征在于,所述HRAM对输入尺寸大小为H×W×C的图像特征执行的操作为:

1)将图像特征通过一层卷积Conv1*1将通道维度从C升为2C;

2)然后将通道维度分为C/4和7C/4两部分,其中第一部分先经过一个全局平均池化Adaptive AvgPool、经过两层全连接FC,再进行Scale操作将前面得到的归一化权重加权到每个通道的特征上,得到该部分特征图;第二部分先经过一个深度卷积DW Conv,再将深度卷积后得到的图像特征图在通道维度拆分为C/4、C/2、C三份;

3)将第一部分得到的特征图与第二部分拆分得到的C/4特征图进行拼接,得到通道维度为C/2的特征图;

4)将通道维度为C/2的特征图经过一个Conv1*1卷积,实现跨通道的信息交互与整合;

再经过一个全局平均池化AdaptiveAvgPool、两层全连接FC,最后进行Scale操作将前面得到的归一化权重加权到每个通道的特征上,得到该部分特征图;

5)将步骤4)得到的特征图与第二部分拆分得到的C/2特征图进行拼接,得到通道维度为C的特征图;

6)将维度为C的特征图经过一个Conv1*1卷积,实现跨通道的信息交互与整合;再经过一个全局平均池化AdaptiveAvgPool、两层全连接FC,最后进行Scale操作将前面得到的归一化权重加权到每个通道的特征上,得到该部分特征图;

7)将步骤(6)得到的特征图与第二部分拆分得到的C特征图进行拼接,得到通道维度为

2C的特征图;

8)将维度为2C的特征图再经过一层卷积Conv1*1,将输入图像通道维度从2C降为C,得到输出图像特征图。

4.如权利要求1所述的基于高阶递归注意力加权网络的人脸情绪识别方法,其特征在于,所述的卷积网络模型CNN为VGG16模型,其卷积层被分为五个Block,每个Block都是多个Conv‑BN‑ReLU的组合;HRAM被加入到VGG16的后三个Block中;

输出层通过Softmax函数输出情绪类型,包括生气、蔑视、厌恶、恐惧、高兴、悲伤、惊讶;

其中Softmax函数用于分类过程中,它将多个神经元的输出映射到(0,1)区间,这些数值可以看作概率且概率总和为1,分别对应属于七种人脸情绪类型的概率。

5.如权利要求4所述的基于高阶递归注意力加权网络的人脸情绪识别方法,其特征在于,HRAM‑CNN网络模型包括特征提取器和分类器,其中特征提取器对输入图像的特征提取处理包括:

1)通过第一个Block提取图像的大致位置特征;

2)通过第二个Block提取人脸的轮廓特征;

3)在第三个Block后加入一个HRAM以提取人脸脸部特征,使得提取到的脸部特征更加细微;

4)通过第四个Block加入一个HRAM以提取包括眼睛倾斜角度、微闭程度、嘴巴张开角度和大小在内的细节信息特征;

5)第五个Block加入一个HRAM以提取图像的隐性特征;

分类器对提取的特征进行以下处理:先通过两层全连接将图像特征矩阵拉成一维,然后在输出层通过Softmax函数得到最终输出的情绪类型。

6.如权利要求1所述的基于高阶递归注意力加权网络的人脸情绪识别方法,其特征在于,所述HRAM‑CNN网络模型的训练学习包括以下操作:

1)以交叉熵损失函数为目标函数LOSS,Loss=‑log(Pi),Pi为第i个情绪信号的输出概率,定义每次迭代后所有数据的损失为LOSS, I为类别,J为每类的数量,i为第i类数据,j为第j个数据;

2)选用反向传播去调节网络参数,经过多轮迭代得到优异的网络参数;

首先实现网络的前向传播,并得到每一层每一个节点的输出值,其次确定网络的损失函数,在输出层计算出输出和样本值的残差,并分别计算出其他各层各节点的残差,最后分别求出损失函数对于权值和偏置的偏导数,根据梯度下降法更新权值和偏置;

3)使用ADAM优化器加速损失收敛速度;

4)通过多次网络训练,得到效果优异的网络模型以及网络模型的参数。