利索能及
我要发布
收藏
专利号: 202410446159X
申请人: 南京邮电大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-09-16
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于图像引导视频编辑的文本生成视频方法,其特征在于,该方法包括如下步骤:S101,获取生成目标视频的基础文本  ,利用文本分析模块对基础文本进行多个角度语义分析,生成多维度文本特征向量 , 表示文本特征向量的总维度数;

S102,利用文本特征向量 和调整后的文本生成图像模型Stable Diffusion生成基础图像 ;

S103,利用文本特征向量 和文本生成视频模型Stable Video Diffusion生成基础视频 ;

S104,将基础图像 、基础视频 以及基础文本 作为输入,通过图像和文本引导视频编辑以生成目标视频;

S104的具体方法如下:

S201,对基础视频 进行拆帧,将视频转换成视频序列 , 表示视频总帧数, 表示上采样前图像横轴的像素总数, 表示上采样前图像纵轴的像素总数,将视频帧序列 上采样为视频帧图像序列,M表示上采样后图像横轴的像素总数,N表示表示上采样后图像纵轴的像素总数;

S202,将基础图像 分割成基础前景图像 和基础背景图像 ,将视频帧图像序列分割成视频帧前景图像序列 和视频帧背景图像序列 ;

S203,利用视频帧前景图像序列 和基础前景图像 生成辅助前景图像序列 ;

S204,利用视频帧背景图像序列 和基础背景图像 生成辅助背景图像序列 ;

S205,将辅助前景图像序列 和辅助背景图像序列融合渲染,获得辅助视频帧图像序列 ;

S206,利用基础文本判定视频变化幅度r,对辅助视频帧图像序列 进行补帧以生成最终目标视频;

步骤S201中,采用的上采样方法如下:上采样后的视频帧图像 的部分像素值,通过上采样前的视频帧 的像素值获得, ,计算公式如下:;

其中

其中, 表示上采样倍率, 表示坐标为 的上采样前的像素值, 表示坐标为上采样后的像素值;

步骤S202中,对基础图像 和视频帧图像分割前进行图像增强预处理的方法如下:(1)针对 的图像矩阵,分别计算出横向和纵向两个方向的类差分矩阵 和,其矩阵值分别为原图像矩阵像素值与横向或纵向相邻像素值之差的绝对值;

(2)计算两个方向的像素增强,计算公式如下:;

其中,设置的窗口大小为 , 表示对应的权重系数, 和 表示各个方位的权重向量, 和 分别表示纵向和横向增强的像素值, 和 表示矩阵和 横坐标从 到 ,纵坐标从 到 处的值形成的子矩阵;

(3)将增强像素与原图像叠加生成预处理图像,计算公式如下:;

其中, 表示坐标 叠加后的像素值, 表示坐标 叠加前的像素值,表示原图、横向以及纵向增强的权重系数;

步骤S203中的具体方法如下:

对视频帧前景图像序列 和基础前景图像 进行特征提取,包括关键点定位和轮廓提取,在保留视频帧前景图像序列 内容的位置、轮廓、结构基础上,通过扩散模型将其替换成基础前景图像 的内容,生成辅助前景图像序列;

步骤S204中的具体方法如下:

对视频帧背景图像序列 和基础背景图像 进行特征提取,包括关键点定位和风格提取,通过扩散模型将视频帧背景图像序列 和基础背景图像 逐一进行风格融合和图像融合,生成辅助背景图像序列 ;

步骤S206中,利用基础文本判定视频变化幅度r,对辅助视频帧图像序列进行补帧,生成最终目标视频,具体计算方法如下:(1)计算相邻图像相似度的函数如下:;

其中, 表示图像 和 之间的相似度, 和 表示两个图像的均值, 和表示两个图像的标准差, 和 表示稳定系数, ;

(2)通过基础文本 的关键词检索,计算每个相同关键词视频的帧间相似度:;

其中, 表示视频的帧间平均相似度, 表示视频第t帧图像和第t+1帧图像之间的相似度,T表示视频总帧数;

(3)计算所有相同关键词视频的平均的帧间平均相似度:;

其中, 表示所有相同关键词视频的平均的帧间平均相似度, 表示视频的帧间平均相似度, 表示对应视频的权重, 表示视频总数;

(4)计算变化幅度的函数如下:

其中, 表示相同关键词视频的帧间平均相似度最大值;

(5)根据变化幅度r设置帧间相似度差异阈值为 ,其中, 表示可设置的差异系数, ,若相邻图像帧之间的相似度差异大于阈值,则通过扩散概率模型预测生成一系列图像帧,完成补帧操作生成最终目标视频。

2.根据权利要求1所述的一种基于图像引导视频编辑的文本生成视频方法,其特征在于,步骤S101中,文本分析模块通过提取输入的基础文本 进行多角度的语义分析,包括但不限于主体分析、动作分析、背景分析、幅度分析、风格分析,输出多维度的文本特征向量。

3.根据权利要求1所述的一种基于图像引导视频编辑的文本生成视频方法,其特征在于,步骤S102中的具体方法如下:采用文本生成图像模型Stable Diffusion作为基础模型,在Stable Diffusion的基础上,将文本‑图像数据集LAION‑5B的超分辨率子集laion‑high‑resolution作为图像文本对集合,计算图像文本对的一致性分数,筛选出一致性分数前1/10的文本图像对子集LAION‑

5B‑H1_10,将LAION‑5B‑H1_10的文本图像对作为输入,对基础模型Stable Diffusion进行训练再调整,使得调整的模型能够通过文本输出更高质量的图像;

利用调整后的Stable Diffusion对多维度的文本特征向量 进行分析,获取数据集中的模板图像,通过正向的多级高斯噪声加噪生成噪声图像,再通过反向传播学习预测去噪过程生成不同的参考图像 ,表示参考图像总数,对参考图像进行图像质量评分计算,选出最优参考图像作为所述基础图像 。