利索能及
我要发布
收藏
专利号: 2022108750142
申请人: 北方民族大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-09-16
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种图文数据的多级关系分析与挖掘方法,其特征在于,包括以下步骤:

1)采集不同模态的图文数据,包含文本和图像;

2)对获取到的不同模态的图文数据分模态进行特征表示,提取文本和图像特征向量;

3)图文数据特征表示后,分别构建文本连接图和图像连接图,进行单模态内部关系挖掘,得到单模态内部关系相似度,即分别得到文本内部关系相似度和图像内部关系相似度;

包括以下两部分:

a、文本数据特征表示完后,构建文本连接图来进行文本内部关系挖掘,得到文本内部关系相似度;首先,使用NLP句法分析工具识别句子中的语义依赖关系,采用预训练BERT‑Large模型结合Bi‑GRU网络从输入句子中提取特征向量t;构建文本连接图时,将每个单词设置为节点,根据句法分析决定单词节点间是否连边,将文本连接图设为J=(X,F),X是单词节点的集合,F是边的集合,记单词节点数为c;通过内积公式计算文本连接图中两两单词节点间相似性,从而获得连边权重:设所求单词表示t的相似矩阵为Q,tx和ty分别表示第x个单词节点和第y个单词节点,Qxy代表第x个和第y个单词节点间的相似性,λ是一个比例因子,使用参数λ乘以内积结果进行运算,利用softmax归一化得Q;由于F为文本连接图中边的集合,设f为单词节点之间的连边,单词节点间的语义依赖性用连边权重Wf来表示,具体公式为:式中,矩阵K表示节点的邻接矩阵,连边权重Wf通过相似度矩阵Q和邻接矩阵K相乘得到;

b、图像数据特征表示完后,构建图像连接图来进行图像内部关系挖掘,得到图像内部关系相似度,主要从空间关系和语义关系两个层面进行;首先,给定两个区域对象,通过三元组<实体‑关系‑实体>形式表示,即qU,V=来表示其空间相对位置,用objectU和objectV来表示两个实体,用R来表示关系信息;将空间区域图设为Zsp=(v,qsp),式中,v代表图像特征向量,qsp是带方向性的空间相对位置,qu,v和qv,u是对称方向的边;原始GCN不包含有向边,因此空间图中不同的方向要通过变换矩阵进行转换;这里采用带多头注意力机制的GCN对空间图进行推理,把每个注意头的输出特征连接起来,通过聚焦重要边来挖掘空间关系,得到相应的区域图像表示,其计算公式为:式中,N表示头注意力的数量,Re LU(·)是激活函数,N(vi)表示vi的邻居集合,vi表示区域i的图像特征向量,dir(i,j)为对每条边方向性敏感的变换矩阵, 是一个相关n权重矩阵,αij是多头注意力系数,vj表示区域i的邻域j的图像特征向量,v′i代表经过多头注意力机制增强GCN之后得到具有空间关系感知的区域图像特征向量,注意力系数αij计算公式为:式中,Wβ为变换矩阵,Vdir(i,j)表示一个相关变换矩阵,通过基于注意力的空间关系编码器对区域进行编码后,区域特征学习到了对象间更精准的空间关系;

获得具有空间关系感知的区域图像特征向量v′i后,将其连接起来构成图像连接图M=(V,H),V代表图节点的集合,H代表由n个图节点组成的n×(n‑1)个节点对构建的连边集合,计算每个节点对的相似度,计算公式如下:式中,λ是比例因子,v′j表示带空间关系v′i的邻域区域特征,Pij代表第i个和第j个图像区域节点间的相似性,使用参数乘以内积进行计算,用softmax层归一化得到最终的相似度矩阵,即通过计算连边权重来度量图节点间的相似性;

4)参照文本连接图和图像连接图,计算连接图中局部某个节点与另一模态节点间的相似度,利用“节点切分方法”进一步实施局部相似性操作,得到图文局部关系相似度;联合考虑从图像到文本、从文本到图像的局部相似性来学习全局相似性,采用带多头注意力机制的GCN通过相邻节点进行对应关系补全与传播,得到图文全局关系相似度;

5)加入基于注意力机制的连边权重剪枝策略,来增强重要关系展示,去除无用关系信息;

6)根据计算出的单模态内部关系相似度、图文局部关系相似度、图文全局关系相似度得到最终图文关系融合相似度,将关系相似度排序,取前k个候选集作为与检索例子有高度语义关联的结果。

2.根据权利要求1所述的一种图文数据的多级关系分析与挖掘方法,其特征在于,在步骤1)中,将采集到的图文数据表示为:式中,E表示文本实例,I表示图像实例,y=1表示第一对文本图像数据,整个式子C表示Y对图文数据。

3.根据权利要求1所述的一种图文数据的多级关系分析与挖掘方法,其特征在于,所述步骤2)包括以下两部分:a、文本特征提取与表示:给定一个句子E,采用NLP句法分析工具进行预处理后,添加两个特殊的标记:[CLS]和[SEP],并将其输入预训练的BERT‑Large模型作为整个模型的文本编码层,其计算公式为:Dx=BERT‑L arg e(Ex),x∈[1,z]

式中,Ex是包含x个单词的句子向量,Dx代表将句子向量Ex输入到BERT‑Large模型后的结果向量,z为组成句子的z个词,也就是句子中的最大单词量,将结果向量Dx通过双向GRU网络即Bi‑GRU网络映射到h维嵌入空间中生成最终文本表示,其计算公式为:Tx=Bi‑GRU(Dx),x∈[1,z]

式中,Tx表示利用前向GRU和后向GRU读取Dx后的结果;

b、图像特征提取与表示:输入一张图像I,使用Faster‑RCNN网络结合预训练的ResNet‑

101提取区域级图像特征;给定在图像中检测到的区域i,在平均池化操作后选择2048维特征ei,利用全连接层将ei转换为h维嵌入空间,其转换公式为:vi=Wvei+pv

式中,vi表示区域i的图像特征向量,Wv和pv分别为图像特征向量的权重矩阵和偏差;图像区域特征提取的边界框用一个四维空间坐标Si={Ai,Bi,Gi,Hi}表示,式中,Si表示区域i的边界框特征向量,(Ai,Bi)表示框中左上点坐标的横坐标与纵坐标,(Gi,Hi)是边界框的宽度和高度;每张图像用一组对象O={o1,o2,…,ot,…,oa}来表示,a代表图像区域数,每个对象ot都与图像特征向量vi、边界框特征向量Si相关联,整个图像写成O=[v1||S1,v2||S2,…,vi||Si,…,va||Sa]。

4.根据权利要求1所述的一种图文数据的多级关系分析与挖掘方法,其特征在于,所述步骤4)包括以下步骤:

4.1)参照文本连接图J=(X,F)和图像连接图M=(V,H),式中,X是单词节点的集合,F是单词节点间边的集合,V代表图节点的集合,H代表图节点连边的集合;输入句子后,需要从c×dim文本连接图中找到和图像节点相似的文本节点,将单词嵌入节点表示为J′α∈R ,图像中n×dim节点表示为M′β∈R ,其中R表示矩阵,c和n分别表示文本连接图和图像连接图的节点数,dim表示矩阵的维数,然后计算内积,再乘λ权重进行归一化操作,即Um→j表示句子中有哪些词是和图像中节点对应,计算公式为:T

Um→j=softmaxα(λM′βJ′α)J′α

式中,λ是比例因子,M′β表示图像中节点,J′α表示单词嵌入节点,α代表从句子中查找与图像节点相关的词;Uj→m表示图像连接图中有哪些节点和句子中的单词节点对应,β代表从图像中查找与单词节点相关的区域节点,计算公式为:T

Uj→m=softmaxβ(λJ′αM′β)M′β

4.2)每个节点与其对应的另一模态节点采用“节点切分方法”进一步实施局部相似性操作,得到图文局部关系相似度,具体操作是:将每个节点切分为等值大小的j个小节点[tm1,tm2,…,tmj],tmj代表第j个小节点,其对应节点也划分为等值大小的j个小节点[vm1,vm2,…,vmj],vmj代表第j个小节点,小节点和小节点之间计算相似性,计算公式为:hme=cos(vme,tme),e∈[1,j]

式中,hme是个标量值,cos(·)是余弦相似度函数,tme代表将文本中词的集合划分为等值大小的子文本节点,vme代表等值大小的子图像节点,e代表将节点划分为小节点的数量范围;再将每个小节点计算出来的余弦相似性拼接,计算公式为:hm=hm1||hm2||…||hmj

式中,“||”表示串联,hmj是一个代表图文数据对应小节点间余弦相似性的第j个标量值,hm代表第m个文本节点的对应向量,通过连接所有小节点间的相似性计算得出,即hm表示第m个文本节点对应的局部节点相似性;

4.3)在得出从图像到文本和从文本到图像局部相似度的基础上,为了对全局模式下的多模态数据特征进一步融合,采用GCN应用k个内核来进行局部对应关系的传播与推理,关系的补全与传播通过相邻局部聚合信息来更新,GCN具体计算公式为:式中,σ(·)表示tanh激活函数,Nm为第m个节点的邻域,Wf为连边权重,Wk和d是k核需要学习的参数,he表示第e个文本节点对应的局部节点相似性,其被添加到h′m中,h′m表示通过一层GCN应用k个内核进行局部对应关系传播与推理后第m个文本节点对应的节点相似度;

采用多头注意力机制增强上述GCN,计算公式为:

式中,P代表头注意力的个数,Re LU(·)表示非线性激活函数,N(h′m)表示h′m的邻居集p合,W表示头注意力个数为P的投影矩阵, 是多头注意力系数,h′e为通过一层GCN应用k个内核进行局部对应关系传播与推理后第e个文本节点对应的节点相似度,将h′e添加到中, 为经过多头注意力机制增强GCN后的第m个文本节点对应的节点相似度;

4.4)综合所有局部对应关系做推理,逐步学习到全局对应关系;从文本到图像的相似性Simj→m、从图像到文本的相似性Simj→m,计算公式为:j′ m′ j′

式中,Wg 、 为文本MLP参数,Wg 、 为图像MLP参数,tanh(·)为激活函数,Wh 、m′为文本图像融合的全连接层可训练参数,Wh 、 为图像文本融合的全连接层可训练参数,n表示图节点数,c表示单词节点数,把之前计算出来的特征向量经过两层MLP后变为标量, 为最终经过局部关系挖掘后的第m个文本节点对应的节点相似度, 为最终经过局部关系挖掘后的第e个文本节点对应的节点相似度;计算图文数据整体相似性时,需要把文本到图像的全局相似性、图像到文本的全局相似性相加,计算公式为:S(J,M)=Simj→m+Simm→j

式中,S(J,M)表示图文全局关系相似度,J表示文本连接图,M表示图像连接图,通过联合考虑从图像到文本、从文本到图像的相似性来学习到全局相似性,进而建立起全局对应关系,实现图文关系融合。

5.根据权利要求1所述的一种图文数据的多级关系分析与挖掘方法,其特征在于:在步骤5)中,为提升关系分析与挖掘效率,加入基于注意力机制的连边权重剪枝策略,来增强重要关系展示,去除无用关系信息,具体操作是:给经过关系挖掘后的第m个文本节点对应的节点相似度 计算聚合权重αg,其公式为:式中,Sigmoid(·)表示一种激活函数, 表示 的邻居集合,BN(·)函数表示d×1进行批量归一化处理,Wq∈R 是一个d维相似度向量的线性变换矩阵,R代表矩阵, 为经过关系挖掘后的第e个文本节点对应的节点相似度,为 聚合相似性表示,计算公式为:式中,αg表示相似度聚合权重,用hend来聚合相似性表示,根据hend具体大小来设置阈值ε,若相似度聚合权重乘以相似度大于或等于阈值,则保留其连边,小于则剪掉,通过此策略来增强重要关系信息,抑制无效关系,以保证挖掘关系的有效性。