1.一种基于混合条件变分自编码的多样化图像描述生成方法,其特征在于,包括:分别获取输入的图像和文本的视觉特征I和生成文本描述x,引入句子级全局隐向量g和单词级序列隐向量s=[s1,s2,...,sT],构建混合条件变分自编码生成模型,其中T表示描述语句中单词个数;
获取基于时间步的变分证据下界,利用全局条件变分编码网络、条件序列变分编码网络和解码网络优化变分证据下界;其中混合条件变分自编码生成模型为:
pθ(x,g,s|I)=pθ(g|I)pθ(s|I,g)pθ(x|I,g,s)其中,pθ(g|I)、pθ(s|I,g)、pθ(x|I,g,s)为先验条件分布;
基于时间步的变分证据下界为:
其中, 表示用于生成单词序列的对数似然,DKL(qφ1(g|I,x)||pθ(g|I))表示句子级全局隐向量g的后验分布qφ1(g|I,x)和条件先验pθ(g|I)之间的KL散度, 表示每个时间步单词对应的序列隐向量st的后验qφ2(st|s<t,x,I,g)和条件先验pθ(st|s<t,x<t,I,g)之间的KL散度之和。
2.根据权利要求1所述的方法,其特征在于,全局条件变分编码网络处理数据的过程包括:0
对于视觉特征I,采用预训练的Swin Transformer提取图像网格特征V ,图像网格特征
0 N
V输入到由N个注意力块组成的编码器中得到视觉特征Vl+1 N
其中,当l=N‑1时获得第N个注意力块的输出,即V =V,MSA表示多头自注意力模块,AN表示残差归一化模块,FFN表示前馈网络层;
对于输入的长度为T的文本描述语句x={x1,x2,...,xT},通过单词嵌入和位置编码将N描述语句转换为 输入至由N个注意力块组成的编码器中得到文本特征W:0
描述语句是单词序列,W是内部表示;
N N
抽取视觉特征V和文本特征W的全局特征表示。
N N
3.根据权利要求2所述的方法,其特征在于,抽取视觉特征V 和文本特征W 的全局特征表示的过程包括:引入一个可学习向量作为查询向量并通过交叉注意力模块自适应地将非固定长度的向量融合为单一向量其中,Qc, VA和WA分别为图像和文本描述的全局表示;
VA和WA进行拼接后经过一个前馈层生成后验全局隐向量VA也同时输入一个前馈层生成先验全局隐向量g’;
后验全局隐向量 和先验全局隐向量g通过KL散度进行对齐得到全局隐向量g。
4.根据权利要求3所述的方法,其特征在于,将qφ1(g|I,x)建模为均值μ(x,I)和标准差σ(x,I)的高斯分布qφ1(g|I,x)=N(g;μ;σ),使用前馈网络将VA和WA映射为均值μ(x,I)与标准差σ(x,I),并通过重参数技巧采样得到
5.根据权利要求3所述的方法,其特征在于,先验分支网络pθ(g|I)使用前馈网络将VA映射为均值与标准差,通过重参数采样技巧得到先验全局隐向量g’。
6.根据权利要求3所述的方法,其特征在于,对后验概率模型qφ2(st|s<t,x,I,g)进行建模参数化为后验推断子网络,后验推断子网络中操作的具体过程包括:0
将单词嵌入后的高维语义向量进行位置编码得到输入向量U;
0 0
将U与全局隐向量g逐一相加得到融合向量W,输入多头自注意模块并经过AN层得q 0 0 0 0W=AN(MSA(W ,W ,W)+W)q N
通过多头交叉注意模块和残差归一化层将特征W与视觉特征V进行交互融合q q N N q
F=AN(CA(W ,V ,V)+W)使用两个前馈网络层生成均值与方差,并通过重参数技巧从后验概率qφ2(st|s<t,x,I,g)的多元高斯分布N(st;μt,σt)中采样得到后验序列隐向量
7.根据权利要求6所述的方法,其特征在于,对先验概率模型pθ(st|s<t,x<t,I,g)进行建模参数化为先验近似子网络,先验近似子网络中操作的具体过程包括:0
将输入向量U和全局隐向量g融合后输入掩码多头自注意模块;
将提取的语义特征先后输入共享的多头交叉注意模块以及AN和FFN层,实现对先验概率的参数化;
使用前馈网络层生成均值与方差,并通过重参数技巧 从先验概率先验概率模型pθ(st|s<t,x<t,I,g)的多元高斯分布N(st;μt,σt)中采样得到st'。
8.根据权利要求7所述的方法,其特征在于,后验序列隐向量 和先验序列隐向量st'通过KL散度进行对齐得到单词级序列隐向量s。
9.根据权利要求8所述的方法,其特征在于,解码网络中数据操作的具体过程为:序列条件变分编码网络输的特征经过线性层降维;
利用掩码多头自注意模块和残差归一化模块模块提取文本语义特征;
N
将文本语义特征与图像视觉特征V一同输入一个交叉注意力模块模块,获得加权视觉特征;
加权视觉特征依次经过残差归一化模块与前馈网络层与文本语义特征进行融合;
通过线性层和Softmax操作预测词汇表中单词出现的概率。