利索能及
我要发布
收藏
专利号: 2020107615996
申请人: 浙江工业大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-07-29
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于无偏深度迁移学习的视频目标识别方法,其特征在于,包括以下步骤:(1)构建包含有任务标签和偏见标签的源域图像集,从视频中抽取的视频帧图像构成目标域图像集;

(2)构建偏见属性预测模型,以源域图像和偏见标签组成的样本作为偏见属性预测模型的输入,输出为偏见属性预测值;

(3)构建基于迁移学习的训练框架,包括与偏见属性预测模型结构相同的两条支路,并在每条支路的相同位置增加一个适应层,其中,第一支路的输入为以源域图像和任务标签组成的样本,输出为任务属性的预测值,第二支路的输入为视频帧图像,输出为任务属性的预测值;

(4)构建训练框架的损失函数,该损失函数包括偏见属性预测模型的偏见属性分类损失、第一支路的任务属性分类损失以及两条支路的适应层之间的MMD距离损失,其中,构建的损失函数Loss为:为偏见属性分类损失:

其中,c(xi)为偏见属性预测模型对第i个源域图像xi的偏见属性预测值,gi为第i个源域图像xi的偏见标签,为Lc(·)为交叉熵函数;

为任务属性分类损失和MMD距离损失组成的目标任务损失:

其中,λ为超参数,取值范围为0~1,XS为源域图像集,XT为目标域图像集,Y为源域图像2

集的任务标签,MMD(XS,XT)为XS与XT的MMD距离的平方,计算公式为:其中,xs为来自于XS的源域图像,xt为来自于XT的视频帧图像,φ(·)为适应层的输出,||·||为L1距离;

(5)根据源域图像集和目标图像集,利用损失函数对训练框架进行训练,训练结束后,提取参数确定的第二支路作为无偏视频目标识别模型;

(6)将待识别视频帧输入至无偏视频目标识别模型中,输出目标识别结果。

2.如权利要求1所述的基于无偏深度迁移学习的视频目标识别方法,其特征在于,所述偏见属性预测模型采用由卷积层和全连接层组成的CNN网络。

3.如权利要求1所述的基于无偏深度迁移学习的视频目标识别方法,其特征在于,所述偏见属性预测模型采用由5个卷积层和3个全连接层依次连接组成的CNN网络。

4.如权利要求1所述的基于无偏深度迁移学习的视频目标识别方法,其特征在于,以识别准确率高和使MMD距离最小为目标,全连接层之间优选选择适应层的设置位置和尺寸。

5.如权利要求3所述的基于无偏深度迁移学习的视频目标识别方法,其特征在于,在第二个全连接层和第三个全连接层之间设置适应层,适应层对输入数据做映射,尺寸为256。

6.如权利要求1所述的基于无偏深度迁移学习的视频目标识别方法,其特征在于,在获得源域图像集和目标域图像集之后,对源域图像和视频帧图像进行归一化处理。

7.如权利要求1所述的基于无偏深度迁移学习的视频目标识别方法,其特征在于,应用时,从视频中截取视频帧经归一化处理后输入至无偏视频目标识别模型中,经计算输出目标识别结果。