1.一种基于细粒度注意力的医学影像报告生成方法,包含以下步骤:步骤1:将口腔X射线全景图片均压缩到512*512的尺寸,然后使用DenseNet‑121卷积神经网络对其提取全图特征,使用yolov5目标检测工具检测出图中的牙齿目标框和病灶目标框 对于每个牙齿和病灶目标框内的子图,也使用DenseNet‑121卷积神经网络提取子图的图像特征;最终得到图像的全图特征V、牙齿子图特征集合 病灶子图特征集合牙齿子图位置集合 以及病灶子图位置集合
和病灶对应疾病关键词嵌入 其中i、j代表
图像中的牙齿对象个数和病灶对象个数;其中
步骤2:使用Bert获取候选疾病标签的词嵌入 将全局图像特征和标签词嵌入输入跨模态互注意力编码器,编码跨模态全局级图像表示;跨模态互注意力编码器由两个多头互注意力模块组成,第一个多头互注意力模块由V作为Query,Wdes作为Key和Value,用于根据全局图像特征为可能的疾病标签分配权重,得到编码后的标签权重 第二个多头互注意力模块由 作为Query,V作为Key和Value,用于根据编码后的标签权重为全局图像的各个区域分配权重,得到图像中的重点区域 最后将二者归一化后相加,得到跨模态全局级图像表示V′pic;整个过程可由以下公式表示:其中,MHA表示多头注意力机制:
o
MHA(X,Y)=[Att1(X,Y);...;Attn(X,Y)]W (5)其中, 是可学习的参数矩阵;
步骤3:根据牙齿和病灶的相对位置构建一张几何关系图G,将相关的病灶区域和牙齿区域绑定,约束病灶区域的编码作用域;
步骤4:将病灶区域的细粒度图像特征和对应的标签词嵌入相加,得到跨模态细粒度对象级疾病图像表示步骤5:根据牙齿目标和病灶目标框在图中的位置坐标编码目标的绝对位置和相对位置嵌入,将各自的位置信息嵌入与细粒度对象级疾病图像表示、细粒度对象级牙齿图像表示相加,然后使用几何自注意力机制分别编码牙齿对象间的相互关系和病灶对象间的相互关系;得到牙齿对象自注意力表示 和病灶对象自注意力表示定义每个目标框的位置坐标为Bi=(x,y,w,h),其中x,y,w,h分别代表目标框的中心水平坐标、中心垂直坐标、宽度和高度;由此我们获得每个目标框的绝对位置编码(RPE):RPE(i)=BiWemb (7)
其中 是一个绝对位置嵌入参数矩阵;
对于每两个目标框Bi和Bj,它们的相对几何位置关系可以由一个四元组表示为:由此我们获得每个目标框对
定义几何自注意力机制(MHCSA)为:
O
MHCSA(X,Y)=[CSAtt1(X,Y);...;CSAttn(X,Y)]W (10)其中, 是可学习的参数矩阵;
步骤6:根据几何关系图G,使用图互注意力机制编码上一步得到的相关细粒度牙齿对象自注意力表示 和病灶对象自注意力表示 建模相关的疾病区域和牙齿区域间的细节关系,再通过前馈神经网络得到细粒度对象级图像特征V′obj;图互注意力机制(MHGCA)旨在通过将目标节点的信息嵌入源节点来增强源节点的表示;
步骤7:将全局级图像特征V′pis和细粒度对象级图像特征V′obj输入具有两层跨模态注意力并由一个句子状态遗忘门控制的transformer桥塔文本生成器(Region Control Generator)生成文本;生成器在一般的transformer基础上加入了两级跨模态注意力模块:句子级跨模态注意力模块首先对全局级图像特征整体应用跨模态注意力,为全局图像上的局部区域分配权重;随后词级跨模态注意力模块再进一步对细粒度对象级图像特征应用跨模态注意力,决定需要具体表述哪一颗牙齿对象的信息;句子状态遗忘门控制单元根据生成器当前时间步所处的句子状态与目前句子级跨模态注意力模块所关注的区域权重为当前输入的细粒度对象级图像特征分配一个遗忘权重,控制本句话所具体关注的牙齿对象,约束疾病标签的解码作用域;最后,将隐藏层输出送入线性层和softmax以预测下一个字;
步骤8:生成器迭代生成最终的文本。
2.如权利要求1所述的一种基于细粒度注意力的医学影像报告生成方法,其特征在于:步骤3具体包括:构建一张无向图,以牙齿对象集合Etooth和病灶对象集合Edes中的元素作为节点;对于每个病灶对象 以它的空间坐标为依据,寻找与它距离最近的牙齿对象 并在它们之间连一条边。
3.如权利要求1所述的一种基于细粒度注意力的医学影像报告生成方法,其特征在于:步骤6所述的图互注意力机制MGGCA具体包括:对于几何关系图G中的每一个牙齿节点 对与其相连的所有疾病节点 应用注意力机制编码它们的信息;对与其不相连的疾病节点,将它们的注意力权重置为0;定义图互注意力机制如下:O
MHGCA(X,Y)=[GCAtt1(X,Y);...;CSAttn(X,Y)]W (12)其中, 是可学习的参数矩阵。
4.如权利要求1所述的一种基于细粒度注意力的医学影像报告生成方法,其特征在于:步骤7具体包括:对于每个解码时间步t,RCG将当前输入字xt=wt+et作为输入(wt:字嵌入,et:位置嵌入):ht=MHA(xt,xt‑1) (14)
然后,将ht和全局级图像特征V′pic、细粒度对象级图像特征V′obj及当前句子状态Statet输入层次作用域控制跨模态注意力模块(HrcWMHCA):其中,当前句子状态Statet是指将输出文本按照句号分隔,同一句话内部的字会被赋予相同的句子状态值;由此我们获得每个时间步字的句子状态编码(SSE):SSE(xt)=StatetWsen (16)其中 是一个句子状态嵌入参数矩阵;
层次作用域控制跨模态注意力模块包含两个跨模态注意力模块:句子级跨模态互注意力模块和作用域控制词级跨模态互注意力模块(rcWMHCA);具体来说,ht和V′pic首先被输入句子级跨模态互注意力模块执行跨模态注意力:h′t=MHA(ht,V′pic) (17)
随后,通过将句子状态编码与句级互注意力层输出ht′相加,得到句子状态增强的当前隐藏层表示,再通过一个sigmoid层输出作用域控制门限:G
gatet=σ((h′t+SSE(xt))W) (18)随后,将h′t、gatet和V′obj输入作用域控制词级跨模态互注意力模块以编码细粒度互注意力表示:h″t=rcWMHCA(h′t,V′pic,gatet) (19)定义作用域控制词级跨模态互注意力如下:
O
rcWMHCA(X,Y,τ)=[rcWCAtt1(X,Y,τ);...;rcWCAttn(X,Y,τ)]W (20)最后,将 传递给FFN和线性层以预测下一个字:
5.如权利要求1所述的一种基于细粒度注意力的医学影像报告生成方法,其特征在于:步骤1所述的卷积神经网络包括ResNet、AlexNet等;所述的目标检测模型包括Faster‑RCNN、YOLO。
6.如权利要求1所述的一种基于细粒度注意力的医学影像报告生成方法,其特征在于:步骤2所述的词嵌入获取模型包括Word2vec、Glove等。