利索能及
我要发布
收藏
专利号: 2023110094131
申请人: 江苏建筑职业技术学院
专利类型:发明专利
专利状态:已下证
更新日期:2026-09-16
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于条件变分自编码和对比学习的图像多样化描述方法,其特征在于,包括:步骤S100,将训练集中的每一个图像‑描述对输入至一个单支路条件变分自编码器和解码器网络模型进行预训练,获得预训练后的序列隐变量zb;

步骤S200,引入另一单支路条件变分自编码器和解码器网络,计算变分下界损失函数L1(x,I),通过该支路条件变分自编码器获得编码的序列隐变量zc;

步骤S300,引入单词级双向对比学习损失函数Lr(zb,zc),提升序列隐变量zc的单词级判别能力;

步骤S400,利用预训练的序列隐变量zb生成对应的描述语句CN,利用序列隐变量zc生成对应的描述语句CG,利用真实语句CT和交叉熵损失函数对CG进行句子级的全局对比学习,获得全局对比学习目标函数L2(x,I);

步骤S500,获得联合优化目标Ltotal=λ1L1(x,I)+λ2L2(x,I)+λ3Lr(zb,zc),提升图像多样化模型的隐表示判别能力和细粒度的描述语句解码能力,从而获得高质量的多样化描述语句,其中λ1、λ2和λ3为平衡每部分损失的权重参数。

2.根据权利要求1所述的方法,其特征在于,步骤S200中,变分下界损失函数L1(x,I)通过下式获得其中 , 表示 解码 器生成 语 句的对 数条 件似 然

的期望, 表示在所有时间步中先验模

型 和后验模型pθ(zt|z<t,x<t,I)的KL散度,θ为模型参数,x表示T长度的描述,xt为第t步生成的单词,z为隐变量,zt为第t步的隐变量,t∈T,I表示图像。

3.根据权利要求2所述的方法,其特征在于,步骤S300中,单词级双向对比学习损失函数Lr(zb,zc)通过下式获得其中,m表示正向边界,(zb,zc)表示分别从双支路的条件变分自编码器对同一批次中相同的图像‑描述对编码而获得的成对隐变量,(zb',zc)和(zb,zc')则是同一批次中非成对的隐变量。

4.根据权利要3所述的方法,其特征在于,步骤S400中,全局对比学习目标函数L2(x,I)通过下式获得其中,LXE代表交叉熵损失,K表示批次大小,α为超参数。

5.根据权利要求4所述的方法,其特征在于,联合优化目标为

Ltotal=λ1L1(x,I)+λ2L2(x,I)+λ3Lr(zb,zc)其中λ1、λ2和λ3为平衡每部分损失的权重参数。