1.一种基于深度学习的视频对象移除篡改时空域定位方法,其特征在于,包括以下步骤:
S1、训练时域定位模型和空域定位模型;
S2、将待测视频输入至时域定位模型,以获取篡改帧序列;
S3、将篡改帧序列输入空域定位模型,以获取篡改帧中的篡改区域定位结果。
2.根据权利要求1所述的一种基于深度学习的视频对象移除篡改时空域定位方法,其特征在于,所述步骤S1中,时域定位模型和空域定位模型的训练,包括以下步骤:S11、将视频数据集随机划分为制作训练集、验证集和测试集的视频序列;
S12、将制作训练集和验证集的视频序列分别按照时域定位算法和空域定位算法的输入要求制作出相应的训练集和验证集,采用各自的训练集和验证集分别对时域定位算法和空域定位算法进行训练和测试,得到时域定位模型和空域定位模型;
S13、将制作测试集的视频序列按照时域定位算法的输入要求制作测试集,输入至加载时域定位模型的时域定位算法进行测试,以获取篡改帧序列;
S14、将篡改帧序列按照空域定位算法的输入要求制作打包数据集,输入至加载空域定位模型的空域定位算法,以获取篡改帧中篡改区域定位结果。
3.根据权利要求2所述的一种基于深度学习的视频对象移除篡改时空域定位方法,其特征在于,所述时域定位算法包括时空三叉戟网络和帧分类神经网络;
所述时空三叉戟网络包括:设定输入形式为连续五帧三通道视频图像数据,首先经过三维最大池化层进行空域尺寸的降维,然后经过SRM层,SRM层为三个参数固定的卷积核构成的三维卷积层,分别输出三种不同的视频帧高频残差信号;最后使用切片操作,将输入时域维度为5的噪声图像进行切片,每连续3帧所产生的噪声图像切片为一个分支流,共切出三个分支流的噪声数据;其中,三维最大池化层步长设置为1×3×3;
时域定位算法输入为裁剪尺寸为5×(720×720)×3的数据块,其中3表示图像的通道数;输入数据经过时空三叉戟网络后将数据切片为3个分支的数据块;
3个分支的数据块输入帧分类神经网络的处理流程如下:3个分支的数据块流入3个权值共享的3D CNN网络结构中,同时提取连续3帧在时空域高频区域的特征,最后统一编码为
128维的向量,使用双向长短期记忆网络BiLSTM来作为解码器,以解码器两个方向的输出状态之和作为解码输出,最后使用全连接层和SoftMax层将结果转化为二分类问题,以达到对篡改帧在视频时域进行定位,获取篡改帧序列。
4.根据权利要求3所述的一种基于深度学习的视频对象移除篡改时空域定位方法,其特征在于,所述空域定位算法包括时空三叉戟网络和篡改区域定位神经网络;
所述时空三叉戟网络包括:设定输入形式为连续五帧三通道视频图像数据,首先经过三维最大池化层进行空域尺寸的降维,然后经过SRM层,SRM层为三个参数固定的卷积核构成的三维卷积层,分别输出三种不同的视频帧高频残差信号;最后使用切片操作,将输入时域维度为5的噪声图像进行切片,每连续3帧所产生的噪声图像切片为一个分支流,共切出三个分支流的噪声数据;其中,三维最大池化层步长设置为1×2×2;
空域定位算法输入为进行翻转操作扩充后的连续5帧的篡改帧数据集,输入数据块尺寸大小为5×(720×1280)×3;输入数据经过时空三叉戟网络后数据分为三个分支流;
三个分支流输入篡改区域定位神经网络的处理流程如下:三个分支流通过权值共享的骨干网络3D-ResNet12将特征图在时域空间进行合并操作,三个分支流的特征图分别经过三个相互独立的RPN网络进行篡改区域回归定位。
5.根据权利要求4所述的一种基于深度学习的视频对象移除篡改时空域定位方法,其特征在于,所述时空三叉戟网络在时域定位和空域定位中的预测理论基础,包括:在视频移除篡改时域定位中,输入连续五帧中,以中间帧为主帧,以前两帧和后两帧为辅助帧;若连续三帧均为篡改帧,其对应分支用0表示;若连续三帧均为篡改帧,其对应分支用1表示;若连续三帧中同时包含篡改帧和原始帧,则用X表示;
三个分支中,若至少有一个分支为1,则中间帧必为1,即篡改帧;
三个分支中,若至少有一个分支为0,则中间帧必为0,即原始帧;
三个分支中,若存在X,表示连续五帧中同时包含原始帧和篡改帧。
6.根据权利要求5所述的一种基于深度学习的视频对象移除篡改时空域定位方法,其特征在于,为三个分支中存在X的情况设置一个帧权重:X_weight设置为1,其他情况设置为
0,用于在Loss函数增加一个惩罚项。
7.根据权利要求6所述的一种基于深度学习的视频对象移除篡改时空域定位方法,其特征在于,所述时域定位算法的Loss函数定义为:其中,N为输入数据的批大小,FL为Focal loss函数,用于主要的视频帧分类任务,其参数为预测结果序列preds、真实值标注序列labels、用于调节类别不平衡的参数α和用于调节难易样本不平衡的参数γ;CE为交叉熵函数,frame_weights为X-weight参数序列,β为额外惩罚项的权重。
8.根据权利要求6所述的一种基于深度学习的视频对象移除篡改时空域定位方法,其特征在于,所述空域定位算法的Loss函数,定义为三个分支分类和回归的Loss之和:其中,FL为Focal Loss函数,用于分类单帧内的区域建议框为篡改区域对应的前景框还是原始区域对应的背景框,其参数preds为建议框的分类预测结果,labels为通过建议框boxAnchor与真实篡改区域boxGroundTruth的交并比iou与所设置阈值比较得到的结果:α是用来调节参与训练的前景框与背景框数量不均衡的参数;γ是调节难易样本不均衡的参数;GIoU_loss为框回归定位Loss函数,其参数须是预测框坐标和真实框坐标,经过与锚框编码后的预测框坐标bboxpreds和真实框坐标bboxtargs需要先进性解码操作,再计算定位的误差值。
9.根据权利要求7或8所述的一种基于深度学习的视频对象移除篡改时空域定位方法,其特征在于,所述RPN网络中建议框的初始化方法,包括:使用K-mean聚类方法分别在训练集所有篡改区域宽度和高度中迭代出3个值做为建议框的宽度、3个值做为建议框的高度,然后获得9种尺寸的建议框。
10.根据权利要求9所述的一种基于深度学习的视频对象移除篡改时空域定位方法,其特征在于,将三个分支的输出结果通过对置信度进行非极大值抑制操作,筛选出置信度最高的预测区域作为最终的篡改区域定位结果。