利索能及
我要发布
收藏
专利号: 2024101406849
申请人: 南京信息工程大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-08-19
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于动态图卷积的开放驾驶场景下多标签识别方法,其特征在于,通过构建映射对齐和词向量解耦双端驱动的叠加动态图卷积网络,捕捉每幅图像的内容感知类别关系;以图像数据驱动为主导,真实世界先验知识为约束辅助,实现对开放驾驶场景中多标签图像的识别;所述叠加动态图卷积网络包括词向量解耦模块、映射对齐模块和叠加动态图卷积模块;实现步骤如下:S1,所述词向量解耦模块以类别嵌入后生成的词向量语义为指导,学习特定类别的特征表示,以得到依靠词向量解耦所有类别标签的特征向量集合D特征;

S2,所述映射对齐模块通过分析图像中的隐含区域关系来生成特征数据,获取一组感知向量A来表征某种特定类别,每组特定的类别特征描述都源自输入特征图中相关标签的内容感知向量;并将基于梯度的类激活映射层的最终输出的标签内容感知向量A′与标签嵌入矩阵E对齐,在对齐之后输出新的标签内容感知向量A和进行偏差修订后更新的标签嵌入矩阵S3,将特征向量集合D特征和感知向量A进行拼接、融合后得到的特征数据送入叠加动态图卷积模块,所述叠加动态图卷积模块通过全局先验知识图和动态共现叠加图进行特征传播,最后利用叠加动态图卷积模块生成判别向量进行多标签分类;

所述全局先验知识图由知识图谱ConceptNet生成的先验常识图和全局静态图叠加生成,主要捕获训练数据集上的粗粒度真实世界依赖关系以及部分粗略语义关系;

所述动态共现叠加图是采用特定动态图主导、并辅以共现矩阵引导的方法来构建的;

动态共现叠加图的相似度矩阵是应用当前数据集中每个图像的内容感知类别表示的非线性特征映射,用于捕获这些标签内容感知类别表示之间的细粒度依赖关系和高级语义交互关系,然后输出最终的标签分布;

步骤S1中,所述词向量解耦模块学习特定类别的特征表示的实现步骤如下:S11,对于给定的输入图片X,采用特征提取模块得到相应的特征图 计算公式为:其中, Wy、H和N分别代表特征图的宽度、高度和通道数,R表示实数;TCNN1()表示特征提取网络;

对于数据集中不同种类的标签c,采用带有预训练权重的Bert模型对每个类别分别进行嵌入生成ds维词向量:Xc=TBert(Wc)

其中,Wc是类别标签c的编码,Xc是词向量,TBert()表示Bert模型的嵌入权重层;

S12,设计词向量引导注意力机制,从词向量Xc中获取经验感知区域,学习到与标签c对应的特征向量;使用低秩双线性池化方法融合相对应的词向量Xc和单一通道上任意位置(w,h)的特征图 得到融合后特征图其中,tanh(·)是双曲正弦函数, 均为可学习的参数,d1、d2分别为词向量融合嵌入的维度和最终特征输出的维度,⊙表示元素点乘操作;T表示矩阵转置;

S13,对于融合后特征图 计算注意力系数,公式如下:其中, 为注意力系数,表示在该标签词向量映射到特征图中时,该(w,h)位置对于关系建模的重要性系数;Ta(·)是一个注意力函数,由全连接网络实现;

使用SoftMax函数对所有位置的注意力系数进行归一化,融合后的注意力系数ac,wh为:其中,exp()表示自然指数函数;

S14,对于当前类别的所有位置的注意力系数进行融合,融合后的注意力系数与融合后特征图进行加权平均池化,以获得特定词向量标签的特征向量Fc:最终得到依靠词向量解耦所有类别标签的特征向量集合步骤S2中,Wy、H和N分别表示特征图的宽度、高度和通道数,计算公式为:其中,TCNN2是一个特征提取网络,由全卷积层实现;

通过映射对齐模块获取一组感知向量来表征某种特定类别的实现步骤如下:S21,采用Grad‑CAM++基于梯度的类激活映射方法,生成所有种类隐激活映射图M;

首先将输入图像通过卷积神经网络进行特征提取,得到特征映射 然后,对这些特征映射 执行全局平均池化或全局最大池化操作,以获得全局池化的所有种类隐激活映射图 mc表示对于特定种类生成的激活映射特征图,c=1,

2,…,c总,Nc表示激活映射得到的特征图通道数;接下来,使用全连接层搭建的分类器对这些全局池化的特征进行分类,以确定图像所属的特定类别;

X′

S22,将特征提取网络的输出特征图通过全局特征映射生成转换后的感知特征图F :其中,TGM()表示全局平均池化层,N′表示映射后特征图的通道数;

对不同类别特征的激活映射融合转换后的感知特征图,得到标签内容感知向量c总表示标签类别总数;

X′

每个类别的内容感知向量Ac′由激活映射M在感知特征图F 上的注意力加权和得到,公式如下:其中, 表示特定类别c激活图的权重, 表示特定类别c激活图的特征图在(w,h)处的标签感知向量;i,j分别表示特征图在长和宽上的位置;

S23,利用自注意力层自动捕获标签之间的相关性,利用类激活映射方法中最后一层的输出来参与交叉注意运算;实现步骤如下:D

S231,对于每个类别标签c,利用预训练好的Bert模型提取语义嵌入向量ec∈R,然后在整个数据集中对类别标签利用预训练好的Bert模型提取语义嵌入向量,构造标签词嵌入利用线性变换层Wl将矩阵E变换为新的矩阵D′表示更新后的词嵌入矩阵的新维度,并将矩阵E′作为后续图片的词嵌入向量和标签对齐嵌入矩阵;其中,ec′=Wlec+bc

D×D′

其中,ec′表示类别标签c在矩阵E′中的标签向量;Wl∈R 为线性变换层,bc为偏置向量;

所述自注意力层采用多头注意力机制,来变换标签嵌入矩阵E′,以捕获标签之间的相关性;公式如下:D′ D′

式中,ei′∈R ,ej′∈R 均为标签嵌入矩阵E′中的一个标签向量;自注意力运算得到的o q新标签嵌入矩阵为 W 表示多头注意力层的权重参数,W表示注意力机制中的k v查询层权重,W表示注意力机制中的关键字层权重,W表示注意力机制中的映射值层权重;

s

S232,利用类激活映射层的最终输出的标签内容感知向量A′与标签嵌入矩阵E进行拼接,然后进行交叉注意力操作,计算公式如下:cat s

F =||(E ,A′)

其中,X(·,·)表示交叉注意力层;

s

通过连接A′和E作为交叉注意力层的输入,标签嵌入矩阵E与图像特征映射A′建立了有效的相关性;之后,从交叉注意层中提取对齐后的标签嵌入矩阵 并对该矩cross阵E 应用残差连接;计算过程如下:

c cross s

E=E +E

c

最后,利用全连接前馈层和Add&Norm归一标准化模块对标签嵌入矩阵E 进行通道调整和运算,对齐后的模块最终输出为步骤S3中,所述叠加动态图卷积模块将V作为输入节点特征,依次将输入节点特征馈送到静态GCN和动态GCN中,其中 表示融合了词向量解耦和映射特征对齐双端驱动的感知内容的类别表示;

设单层静态GCN为:

K=LeakyReLU(AksVWs)

其中, LeakyReLU(·)为激活函数;kc代表类别表示vc在经过常识静态图卷积后生成的相应的聚合特定种类特征向量;

则叠加动态图卷积模块的处理步骤如下:

S31,通过知识图谱ConceptNet模型获取标签之间的相似度;

构建静态邻接矩阵Aks如下:

Aks=λAs+(1‑λ)A′k

其中,λ为先验常识图在整体静态邻接矩阵Aks中所占比例;As为静态图,被所有图像共享,在训练期间被随机初始化并通过梯度下降学习;A′k是根据知识图谱ConceptNet模型获得的知识图搭建的图谱邻接矩阵Ak经过规范对称化得到的;

其中,(Ak)ij代表规范化后的Ak中节点vi和节点vj关系相似度,Sij表示在ConceptNet知识图谱模型中标签内容感知节点vi和节点vj的相关元素个数;r代表Sij中的某一种相关元素;wr则是相关性的权重系数;|Sij|是Sij的绝对值;

S32,对于原始标签类别表示 进行全局平均池化得到全局嵌入向量vg;将静态图生成的 和vg进行拼接和融合,得到新的带有全局关系引导的标签类别向量Kg:

其中,(kc:vg)表示将kc和vg在维度上拼接起来;

S33,将Kg引入动态图卷积中进行变换,在动态邻接矩阵Ad上叠加利用共现矩阵构造的共现邻接矩阵ACo,表达式如下:Adc=ηAd+(1‑η)ACo

其中,动态邻接矩阵Ad根据输入标签类别表示V自适应估计,对于不同的标签内容都拥有不同的动态邻接矩阵Ad;

动态图的输出Z的计算过程如下:

Z=f(AdcKgWd)

Adc=ηAd+(1‑η)ACo

Ad=δ(WAKg)

其中, f(·)是指LeakyReLU激活函数,δ(·)为Sigmoid激活函数; 是状态更新矩阵的权重,D1代表常识静态图卷积的权重维度,D2代表共现动态图的权重维度; 是卷积层权重,用来更新动态邻接矩阵Ad;η代表在动态图中叠加先验共现矩阵的比例系数;

通过该叠加动态图卷积模块,完成从V到Z的类别表示,实现对于数据集指定特征和指定标签内容感知向量的上下文学习;

步骤S3中,将每个标签内容感知向量送入二元分类器中,再通过SoftMax函数处理,得到叠加动态图输出的分类得分向量Scorer:通过对映射对齐模块中所有种类隐激活映射图M进行全局空间池化得到另外一组分类置信分数:聚合分类得分向量和分类置信分数,预测分类结果,最终输出为O:O=τScorer+(1‑τ)Scoreg其中,τ为全局均衡因子;

采用动态权衡分类损失函数对Bi‑SDNet网络进行训练,动态权衡分类损失函数L(y,o)的表达式如下:其中,σ(·)代表Sigmoid(·)函数, 分别代表类别1和类别2的权重因子;Ni为每个标签出现的次数,Pclass1、Pclass2分别是常数,表示对不同类别进行调整的幂次c方;y代表当前样本的输出值。