利索能及
我要发布
收藏
专利号: 2023101822500
申请人: 浙江工业大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-07-29
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于编码器解码器结构的增强样本和增强查询的交互检测方法,通过构建深度学习模型进行交互检测,其特征在于,所述深度学习模型包括特征提取模块,动态语言信息生成查询模块,掩码真值去噪模块和交互预测模块,所述基于增强样本和增强查询交互检测的方法,包括:取已标注的交互图片输入所述特征提取模块,得到由特征提取模块输出的图片特征,所述特征提取模块包括深度残差网络和编码器;

将所述图片特征同时输入所述动态语言信息生成查询模块和掩码真值去噪模块,分别两种输出输入到解码器得到用于人、物和交互的特征;

将所述两种模块经解码器得到的人、物和交互的特征输入所述交互预测模块,得到分别得到对应的预测结果Prl,Prg∈{人,物,交互};

根据多标签Focal损失和交互损失,对所述动态语言信息生成查询模块和交互检测模块进行监督,更新所述深度学习模型的网络参数;

取训练后最优的深度学习模型对待检测的交互图片输出预测结果。

2.如权利要求1所述的基于编码器解码器结构的增强样本和增强查询的交互检测方法,其特征在于,所述深度残差网络为深度残差网络ResNet‑50。

3.如权利要求1所述的基于编码器解码器结构的增强样本和增强查询的交互检测方法,其特征在于,所述动态语言信息生成查询模块和掩码真值去噪模块的处理过程包括:将输入的图片特征当作查询库E,再查询库E输入动态语言信息生成查询模块,生成含l有语言信息引导的查询Q  ,详细过程如下:

将查询库E输入FFNcand(·)得到生成语言信息的预测集predhoi,再根据Topk(·)得到生成语言信息的候选集Candhoi。

l

根据候选集Candhoi和Sem2Vis(·),生成含有语言信息引导的查询Q。

l

Q=Sem2Vis(Candhoi)    (2)g

根据真值GT输入掩码真值去噪模块,生成含有真值引导的查询Q,详细过程如下:gtitem=[boxk,ck,cdist,areau],k∈{h,o}    (3)根据真值gtitem,可以得到B×B的二值掩码图G,其中box,c,area,cdist分别表示人或物的框、中心点、面积和人和物的中心距离,h,o分别表示人和物。

Mask=Thres(P,T)%G    (4)再使用拉普拉斯概率函数 生成跟掩码图同大小的概率图P,根据阈值函数Thres(.,.),以概率T为分界点对概率图二值化。最后将二值化后的概率图和根据真值gtitem得到的二值掩码图进行与操作得到含有噪声真值样本Mask。

g

Q=FFNmask(Mask)    (5)

g

利用含有噪声真值样本和FFNmask(·)得到真值查询Q。

4.如权利要求1所述的基于编码器解码器结构的增强样本和增强查询的交互检测方法,其特征在于,所述预测结果如下:其中,Prl,Prg分别表示动态语言信息生成查询模块和掩码真值去噪模块预测结果输出, 分别表示主路和次路上用于人的回归或者分类函数,分别表示主路和次路上用于物的回归或者分类函数, 分别表示主路和次路上用于交互的回归或者分类函数。

5.如权利要求1所述的基于编码器解码器结构的增强样本和增强查询的交互检测方法,其特征在于,监督动态语言信息生成查询模块包括:将动态语言信息生成查询模块生成的predhoi和真值labelhoi通过b适应的Focal损失进行计算得到监督动态语言信息生成查询模块的多标签Focal损失LMFL,数学表达式如下:其中numpos表示正样本数和负样本数,indspos和indsneg是通过labelhoi得到的正负样本下标,γ是超参。多标签Focal损失可以衡量出动态语言信息生成查询模块生成的predhoi对于真值labe lhoi的覆盖情况。

6.如权利要求1所述的基于编码器解码器结构的增强样本和增强查询的交互检测方法,其特征在于,监督交互检测模块,包括:通用的交互损失监督包括包围框位置平均绝对误差Lb,包围框大小泛化交并比Lu,物体分类交叉熵Lc和交互分类交叉熵La,因此通用的交互损失函数Lhoi数学表达如下:Lhoi=λbLb+λuLu+λcLc+λaLa      (8)其中λb,λu,Lc和La均为超参。

由于动态语言信息生成查询模块和掩码真值去噪模块均会经过交互检测模块,产生预测结果,因此各自需要利用Lhoi得到 和 监督各自的预测结果,再根据权利要求5所述的LMFL,得到总损失Ltotal,数学表示如下:其中α是超参。