利索能及
我要发布
收藏
专利号: 2024100171278
申请人: 南京信息工程大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-09-16
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于实例的多视角视觉融合转导式零样本分类方法,其特征在于,包括以下步骤:(1)提取已见类图片和未见类图片的多视角视觉特征;

(2)将已见类图片的多视角视觉特征以及对应的类别语义属性送入多视角视觉‑语义映射模型,利用交替方向乘子法学习不同视角上的转换矩阵;交替方向乘子法具体如下:初始化:

, , , , , ,;

令迭代次数 ,确定收敛阈值 , 和参数 , , ;

通过求解以下 的方程得到 ;其中,为交替方向乘子法里面的参数,公式如下:;

通过求解以下 的优化问题得到 ,公式如下:;

通过求解以下 的方程得到  ,公式如下:;

通过下式更新 :

通过下式更新 :

通过以下公式更新拉格朗日乘子 , , 和 :;

如果

则收敛;否则,令 ,继续进行上述更新操作;通过迭代最终得到的转换矩阵为: ;

(3)利用学习到的转换矩阵预测未见类图片的语义投影;

(4)根据步骤(3)得到的语义投影进一步提取未见类图片的最终语义并对未见类图片进行识别。

2.根据权利要求1所述的一种基于实例的多视角视觉融合转导式零样本分类方法,其特征在于,所述步骤(1)具体如下:使用在ImageNet数据库上预先训练的ResNet和GoogLeNet提取视觉特征,分别代表视角A和视角B。

3.根据权利要求1所述的一种基于实例的多视角视觉融合转导式零样本分类方法,其特征在于,所述步骤(2)多视角视觉‑语义映射模型表示为如下优化问题:;

约束条件为:

其中, , ,

, , 是优化变量矩阵;

表示已见类图片第v个视角上的视角特征矩阵,其每一列对应一个已见类图片; 表示已见类图片的类别语义属性矩阵,其每一列对应一个已见类图片;

表示已见类语义属性均值矩阵,其每一列都为所有已见类语义属性的均值向量;

为第v个视角上的视角特征的维度;m为类别语义属性的维度;n为已见类图片数;

、 、 、 、 均为超参数;V为视角数。

4.根据权利要求1所述的一种基于实例的多视角视觉融合转导式零样本分类方法,其特征在于,步骤(3)得到未见类图片在单个视角上的语义投影为:;

其中, 表示未见类图片第v个视角上的视角特征矩阵,其每一列对应一个未见类图片; 为未见类图片数。

5.根据权利要求1所述的一种基于实例的多视角视觉融合转导式零样本分类方法,其特征在于,步骤(4)提取未见类图片的最终语义公式如下:;

其中, 为待提取的 未见类图 片的最终语 义表示,即 优化变量 ;

; 为对

角矩阵;

为超参数。

6.根据权利要求1所述的一种基于实例的多视角视觉融合转导式零样本分类方法,其特征在于, 通过下式计算得到:;

其中, 为分块矩阵,

7.根据权利要求1所述的一种基于实例的多视角视觉融合转导式零样本分类方法,其特征在于,步骤(4)对未见类图片的识别包括:对未见类图片在各个视角上的最终语义表示进行平均,公式如下:;

使用如下公式获取未见类图片的类别标记:;

其中, 返回表示输入矩阵每一列最大元素的编号向量; 为未见类语义属性; 为未见类别数; 为识别的未见类图片的类别标记。