1.一种模型训练方法,其特征在于,所述方法包括:
从视频流中提取至少两个视频帧,若提取的至少两个视频帧满足设定的帧关系条件,则将提取的所述至少两个视频帧确定为正样本图片;若提取的至少两个视频帧不满足设定的帧关系条件,则将提取的所述至少两个视频帧确定为负样本图片;
将所述正样本图片和/或所述负样本图片输入至机器视觉学习模型,以由所述机器视觉学习模型中的编码器对输入的正样本图片和/或负样本图片进行编码得到特征编码并输出给所述机器视觉学习模型中的帧间关系预测器,以由所述帧间关系预测器根据输入的特征编码预测出所述正样本图片和/或负样本图片中至少两个视频帧之间的帧关系;
根据所述正样本图片和/或所述负样本图片中至少两个视频帧之间的帧关系、所述帧间关系预测器预测出的至少两个视频帧之间的帧关系对所述机器视觉学习模型的模型参数进行调整得到第二目标模型,所述第二目标模型用于预测两个以上视频帧之间的帧关系。
2.根据权利要求1所述的方法,其特征在于,所述根据正样本图片和/或负样本图片中至少两个视频帧之间的帧关系、所述帧间关系预测器预测出的至少两个视频帧之间的帧关系对所述机器视觉学习模型的模型参数进行调整得到第二目标模型,包括:根据正样本图片和/或负样本图片中至少两个视频帧之间的帧关系、所述帧间关系预测器预测出的至少两个视频帧之间的帧关系确定第二损失函数;
根据所述第二损失函数对所述机器视觉学习模型的模型参数进行调整,并检查所述第二损失函数是否满足设定的训练停止条件;
如果是,确定调整后的机器视觉学习模型为所述第二目标模型,如果否,获取正样本图片和/或负样本图片并返回将正样本图片和/或负样本图片输入至所述机器视觉学习模型的步骤。
3.根据权利要求2所述的方法,其特征在于,所述设定的训练停止条件包括:本次训练过程中确定出的损失函数的值与上一次训练过程中确定出的损失函数的值之间的差值不超过设定阈值。
4.根据权利要求1所述的方法,其特征在于,所述设定的帧关系条件包括:至少两个视频帧在视频流中的排列顺序连续。
5.根据权利要求1所述的方法,其特征在于,所述第二损失函数用于衡量机器视觉学习模型中帧间关系预测器的帧关系预测性能。
6.一种模型训练方法,其特征在于,所述方法包括:
从视频流中提取至少两个视频帧,并按照设定的图片遮挡方式对提取的每一视频帧中设定的部分内容进行遮挡得到训练图片;
将所述训练图片输入至机器视觉学习模型,以由机器视觉学习模型中的编码器对输入的训练图片中每一视频帧进行编码得到特征编码并输出给机器视觉学习模型中的解码器和帧间关系预测器,以由解码器根据输入的每一视频帧的特征编码重构出每一视频帧中被遮挡的内容,并由帧间关系预测器根据输入的每一视频帧的特征编码预测出训练图片中各视频帧之间的帧关系预测结果;
根据帧关系预测结果、训练图片中各视频帧之间的帧关系、各视频帧中设定的部分内容和解码器重构出的各视频帧中被遮挡的内容对机器视觉学习模型的模型参数进行调整得到第一目标模型,所述第一目标模型用于提取待识别图像的图像特征,还用于预测两个以上视频帧之间的帧关系。
7.根据权利要求6所述的方法,其特征在于,所述帧关系预测结果用于指示所述训练图片中的各视频帧之间是否满足设定的帧关系条件。
8.根据权利要求6所述的方法,其特征在于,所述根据帧关系预测结果、所述训练图片中各视频帧之间的帧关系、所述各视频帧中设定的部分内容和所述解码器重构出的各视频帧中被遮挡的内容对所述机器视觉学习模型的模型参数进行调整得到第一目标模型,包括:依据所述各视频帧中设定的部分内容和所述解码器重构出的各视频帧中被遮挡的内容确定第一损失函数;
依据所述帧关系预测结果和所述训练图片中各视频帧之间的帧关系确定第二损失函数;
根据所述第一损失函数和所述第二损失函数对所述机器视觉学习模型的模型参数进行调整得到第一目标模型。
9.根据权利要求8所述的方法,其特征在于,所述根据第一损失函数和第二损失函数对所述机器视觉学习模型的模型参数进行调整得到第一目标模型:将所述第一损失函数和所述第二损失函数进行设定运算得到第三损失函数;
利用所述第三损失函数对所述机器视觉学习模型的模型参数进行调整,并检查所述第三损失函数是否满足设定的训练停止条件;
如果是,确定调整后的机器视觉学习模型为所述第一目标模型,如果否,获取训练图片并返回将训练图片输入至所述机器视觉学习模型的步骤。
10.根据权利要求9所述的方法,其特征在于,所述设定的训练停止条件包括:本次训练过程中确定出的损失函数的值与上一次训练过程中确定出的损失函数的值之间的差值不超过设定阈值。
11.根据权利要求6至9中任一所述的方法,其特征在于,所述从视频流中提取原始图片,并按照设定的图片遮挡方式对所述原始图片中设定的部分内容进行遮挡得到训练图片,包括:从所述视频流中提取至少两个视频帧,并按照设定的图片遮挡方式对提取的每一视频帧中设定的部分内容进行遮挡得到训练图片,其中,提取的至少两个视频帧满足设定的帧关系条件;和/或,从所述视频流中提取至少两个视频帧,并按照设定的图片遮挡方式对提取的每一视频帧中设定的部分内容进行遮挡得到训练图片,其中,提取的至少两个视频帧不满足设定的帧关系条件。
12.一种特征提取方法,其特征在于,所述方法包括:
将待识别图像输入至按照如权利要求6至11中任一方法训练出的第一目标模型,得到所述待识别图像的图像特征,所述待识别图像的图像特征用于训练机器视觉识别模型。
13.一种电子设备,其特征在于,所述设备包括可读存储介质和处理器;
其中,所述可读存储介质,用于存储机器可执行指令;
所述处理器,用于读取所述可读存储介质上的所述机器可执行指令,并执行所述指令以实现权利要求1至12中任一所述方法的步骤。