1.一种渐进式多模态语义对齐的教学视频内容提炼方法,其特征在于:包括如下步骤:S1、对教育视频进行采样,获得视频帧序列和对应句子序列;
S2、将视频帧序列输入视觉特征提取模型获取视频帧特征表示,将句子序列输入文本特征提取模型获取句子特征表示;
S3、建立渐进式多模态语义对齐模型以执行如下操作:
S31、利用双层注意力模块分别对视频帧特征表示和句子特征表示进行特征提取,对应生成粗粒度视频帧摘要集合和粗粒度文本摘要集合;
S32、根据粗粒度视频帧摘要集合和粗粒度文本摘要集合,对应构造视频帧图集合和句子图集合;
S33、利用图注意力模块分别对视频帧图集合和句子图集合进行特征提取,对应获得粗粒度视频帧图嵌入表征集合和粗粒度句子嵌入表征集合,所述图注意力模块包括三层依次连接的图注意力网络;
S34、分别根据粗粒度视频帧图嵌入表征集合和粗粒度句子嵌入表征集合,基于余弦相似度原理对应提取细粒度视频帧摘要集合和细粒度文本摘要集合;
S4、将待提炼的教学视频得到的视频帧序列、句子序列、视频帧特征表示和句子特征表示输入渐进式多模态语义对齐模型,获得细粒度视频帧摘要集合和细粒度文本摘要集合即为从教学视频提炼出的摘要内容。
2.如权利要求1所述的渐进式多模态语义对齐的教学视频内容提炼方法,其特征在于:所述视觉特征提取模型为预训练好的ResNet模型、DenseNet模型、GoogleNet模型、Vision Transformer模型其中一种;所述文本特征提取模型为预训练好的RoBERTa模型、BERT模型、GPT模型、XLNet模型、基于Transformer架构的语言模型其中一种。
3.如权利要求1所述的渐进式多模态语义对齐的教学视频内容提炼方法,其特征在于:所述利用双层注意力模块分别对视频帧特征表示和句子特征表示进行特征提取,对应生成粗粒度视频帧摘要集合和粗粒度文本摘要集合,具体如下:S311、构建视频模态注意力掩码矩阵 、文本模态注意力掩码矩阵
和跨模态掩码矩阵 ,其中,各掩码矩阵中的元素为1时,表示进行注
意力运算,否则,不进行注意力运算,N为视频帧序列中视频帧的总数, 为句子序列中句子的总数;
S312、建立由并行的第一自注意力层和第二自注意力层组成的自注意力模块,将视频帧特征表示和视频模态注意力掩码矩阵输入第一自注意力层、以及将句子特征表示和文本模态注意力掩码矩阵输入第二自注意力层,对应获得增强视频帧特征表示和增强句子特征表示;
S313、将增强视频帧特征表示、增强句子特征表示、跨模态注意力掩码矩阵输入跨模态注意力模块,获得跨模态视频帧特征表示和跨模态句子特征表示;
S314、分别将跨模态视频帧特征表示和跨模态句子特征表示输入前馈神经网络,对应获得对齐帧特征表示和对齐句子特征表示;
S315、将对齐帧特征表示和对齐句子特征表示输入分数预测模型,对应获得视频帧重要性得分和句子重要性得分,所述分数预测模型为线性层;
S316、分别选择视频帧重要性得分中得分最高的前 个视频帧和句子重要性得分中得分最高的前 个句子,对应形成粗粒度视频帧摘要集合和粗粒度文本摘要集合, ,。
4.如权利要求3所述的渐进式多模态语义对齐的教学视频内容提炼方法,其特征在于:所述前馈神经网络包括依次连接的线性层、GeLU激活函数和线性层。
5.如权利要求1所述的渐进式多模态语义对齐的教学视频内容提炼方法,其特征在于:所述视频帧图集合 ,其中, 为第 个粗粒度视频帧图, 为
第 个粗粒度视频帧 所对应的视频帧集合 , 为第 个粗粒度视频帧 所对应的视频帧边集合, 为粗粒度视频帧摘要集合中粗粒度视频帧的总数;所述句子图集合,其中, 为第 个粗粒度句子图, 为第 个粗粒度句子所对应的句子集合, 为第 个粗粒度句子 所对应的句子边集合, 为粗粒度句子摘要集合中粗粒度句子的总数,其中:
1)各粗粒度视频帧所对应的视频帧集合和视频帧边集合,构建如下:
以当前粗粒度视频帧在视频帧序列中的对应视频帧为中心,在视频帧序列中还向前和向后各取第一预设数量的视频帧,当超出视频帧序列则截取实际范围,获得对应视频帧集合;
从对齐帧特征表示中选取视频帧集合对应的对齐帧特征表示形成特征子集,计算特征子集中任意两个对齐帧特征表示之间的余弦相似度;
若两个对齐帧特征表示之间的余弦相似度大于等于第一阈值,认为对应的两个视频帧所在节点间存在连接关系,记为1,否则,认为对应的两个视频帧所在节点间不存在连接关系,记为0;
将全部视频帧所在节点间的连接关系表示为邻接矩阵作为视频帧边集合;
2)各粗粒度句子所对应的句子集合和句子边集合,构建如下:
以当前粗粒度句子在句子序列中的对应句子为中心,在句子序列中还向前和向后各取第二预设数量的句子,当超出句子序列则截取实际范围,获得对应句子集合;
从对齐句子特征表示中选取句子集合对应的对齐句子特征表示形成特征子集,计算特征子集中任意两个对齐句子特征表示之间的余弦相似度;
若两个对齐句子特征表示之间的余弦相似度大于等于第一阈值,认为对应的两个句子所在节点间存在连接关系,记为1,否则,认为对应的两个句子所在节点间不存在连接关系,记为0;
将全部句子所在节点间的连接关系表示为邻接矩阵作为句子边集合。
6.如权利要求5所述的渐进式多模态语义对齐的教学视频内容提炼方法,其特征在于:所述细粒度视频帧摘要集合,提取如下:
对于粗粒度视频帧图嵌入表征集合中第 个粗粒度视频帧图的嵌入表征集合,在对应视频帧集合中选取除第 个粗粒度视频帧在视频帧序列中的对应视频帧外的其他视频帧,并分别计算其他视频帧的嵌入表征与第 个粗粒度视频帧在视频帧序列中的对应视频帧的嵌入表征之间的余弦相似度;
选取前 个余弦相似度最高的视频帧构成对应细粒度视频帧集合, 为正整数;
将 个细粒度视频帧集合合并形成细粒度视频帧摘要集合;
所述细粒度文本摘要集合,提取如下:
对于粗粒度句子图嵌入表征集合中第 个粗粒度句子图的嵌入表征集合,在对应句子集合中选取除第 个粗粒度句子在句子序列中的对应句子外的其他句子,并分别计算其他句子的嵌入表征与第 个粗粒度句子在句子序列中的对应句子的嵌入表征之间的余弦相似度;
选取前 个余弦相似度最高的句子构成对应细粒度句子集合, 为正整数;
将 个细粒度句子集合合并形成细粒度文本摘要集合。
7.如权利要求6所述的渐进式多模态语义对齐的教学视频内容提炼方法,其特征在于:所述渐进式多模态语义对齐的教学视频内容提炼方法还在对待提炼的教学视频进行提炼前,采用训练集对渐进式多模态语义对齐模型进行训练并反向传播联合总损失以优化渐进式多模态语义对齐模型的模型参数。
8.如权利要求7所述的渐进式多模态语义对齐的教学视频内容提炼方法,其特征在于:所述联合总损失,计算如下:
分别将细粒度视频帧摘要的最终特征表示和细粒度句子摘要的最终特征表示输入预测层,对应获取细粒度视频帧的预测输出和细粒度句子的预测输出,所述预测层包括依次连接的线性变换层和 函数,所述细粒度视频帧摘要的最终特征表示即全部细粒度视频帧的嵌入表征,当存在细粒度视频帧在多个细粒度视频帧集合中出现时,取在最大序号的粗粒度视频帧图的嵌入表征集合中对应嵌入表征作为该细粒度视频帧的嵌入表征,所述细粒度句子摘要的最终特征表示即全部细粒度句子的嵌入表征,当存在细粒度句子在多个细粒度句子集合中出现时,取在最大序号的粗粒度句子图的嵌入表征集合中对应嵌入表征作为该细粒度句子的嵌入表征;
分别根据细粒度视频帧的预测输出和细粒度句子的预测输出,采用二分类交叉熵损失计算视频帧的分类损失和句子的分类损失,并将视频帧的分类损失和句子的分类损失相加作为多模态分类损失;
根据跨模态注意力掩码矩阵形成粗粒度的正样本集合和粗粒度的负样本集合、以及细粒度的正样本集合和细粒度的负样本集合;
基于全部正样本集合和负样本集合构造多个粗粒度跨模态三元组和多个细粒度跨模态三元组,并利用InfoNCE Loss损失函数分别计算各跨模态三元组的跨模态对比损失;
将各粗粒度跨模态三元组的跨模态对比损失相加形成粗粒度跨模态对比损失,将各细粒度跨模态三元组的跨模态对比损失相加形成细粒度跨模态对比损失;
将多模态分类损失、粗粒度跨模态对比损失和细粒度跨模态对比损失加权求和形成联合总损失。
9.如权利要求8所述的渐进式多模态语义对齐的教学视频内容提炼方法,其特征在于:所述粗粒度的正样本集合包括粗粒度视频帧正样本集合 和粗粒度句子正样本集合,所述粗粒度的负样本集合包括粗粒度视频帧负样本集合 和粗粒度句子负样本集合,其中:粗粒度视频帧正样本集合 表示与至少一个粗粒度句子在跨模态注意力掩码矩阵中存在关联的粗粒度视频帧的集合,粗粒度视频帧负样本集合 表示与所有粗粒度句子在跨模态注意力掩码矩阵中均无关联的视频帧的集合,跨模态注意力掩码矩阵中值为1表示关联,值为0表示无关联;
粗粒度句子正样本集合 表示与至少一个粗粒度视频帧在跨模态注意力掩码矩阵中存在关联的粗粒度句子的集合,粗粒度句子负样本集合 表示与所有粗粒度视频帧在跨模态注意力掩码矩阵中均无关联的句子的集合;
所述细粒度的正样本集合包括细粒度视频帧正样本集合 和细粒度句子正样本集合,所述细粒度的负样本集合包括细粒度视频帧负样本集合 和细粒度句子负样本集合 ,其中:细粒度视频帧正样本集合 表示与至少一个细粒度句子在跨模态注意力掩码矩阵中存在关联的细粒度视频帧的集合;细粒度视频帧负样本集合 表示与所有细粒度句子在跨模态注意力掩码矩阵中均无关联的视频帧的集合;
细粒度句子正样本集合 表示与至少一个细粒度视频帧在跨模态注意力掩码矩阵中存在关联的细粒度句子的集合,细粒度句子负样本集合 表示与所有细粒度视频帧在跨模态注意力掩码矩阵中均无关联的句子的集合;
所述粗粒度跨模态三元组包括第一粗粒度跨模态三元组 和第二粗粒
度跨模态三元组 ,所述细粒度跨模态三元组包括第一细粒度跨模态三元组和第二细粒度跨模态三元组 。
10.如权利要求7所述的渐进式多模态语义对齐的教学视频内容提炼方法,其特征在于:所述训练集为TVSum数据集。