利索能及
我要发布
收藏
专利号: 2026101803081
申请人: 南京信息工程大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-07-29
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于球面几何感知的全景视频显著性预测方法,其特征在于,包括如下步骤:步骤S1:将ERP格式的全景视频解析成连续的视频帧,将每个视频帧通过自适应球面分块投影机制转换为球面分块序列,包括如下子步骤:步骤S1.1:将ERP格式的全景视频解析成连续的视频帧,将视频帧的ERP像素坐标转换到球面经纬度坐标;

步骤S1.2:将球面经纬度坐标中的极角划分为固定角度间隔的纬度带;

步骤S1.3:根据每个纬度带的中心极角确定球面周长,由球面周长自适应调整每个纬度带的经度块数:其中, 表示第 个纬度带的经度块数, 表示第 个纬度带的中心极角,, 与 分别表示第 个纬度带的角度上界与下界, 表示每个纬度带的弧度跨度;

步骤S1.4:按照每个纬度带的经度块数划分纬度带,得到球面分块序列;

步骤S2:获取球面分块序列中的每个球面分块的投影特征,结合球面分块的位置编码确定球面分块的嵌入向量,包括如下子步骤:步骤S2.1:将球面分块序列中的每个球面分块的球面经纬度坐标映射为ERP像素坐标,将球面分块展平为一维向量,通过线性层投影,得到球面分块的投影特征;

步骤S2.2:利用每个球面分块的中心经纬度坐标生成球面位置编码向量:其中, 表示第 个球面分块的中心经纬度坐标,k表示特征向量的维度索引,表示频率索引, ,表示向量的维度, 表示第个频率对应的角频率参数, ,表示第个频率对应的波长参数, ,表示基准波长常数, 表示第 个球面分块中第k个维度的球面位置编码向量;

步骤S2.3:将球面分块的投影特征和球面位置编码向量进行加和,得到球面分块的嵌入向量;

步骤S3:将多视频帧的所有球面分块的嵌入向量按照球面块的空间顺序排列,得到分块嵌入特征张量;

步骤S4:将分块嵌入特征张量通过多个串联的空间Transformer块提取空间特征,将提取的空间特征按照时间步重塑,通过轻量化时序Transformer提取时空特征;

步骤S5:将提取的时空特征经全景帧重建与全景赤道先验特征融合,得到多视频帧的单通道显著性图,将多视频帧的单通道显著性图逐帧整合为显著性视频,包括如下子步骤:步骤S5.1:将提取的时空特征通过线性层投影回像素空间,基于每个球面分块的ERP像素坐标,通过双线性插值拼接回完整的三通道视频帧,将完整的三通道视频帧通过3×3卷积层融合为单通道显著性特征图;

步骤S5.2:根据单通道显著性特征图的高度和宽度设置高斯分布的均值和标准差,采用N组不同的标准差生成N张单通道高斯先验子图,将N张单通道高斯先验子图沿通道维度拼接,得到N通道的全景赤道先验特征图;

步骤S5.3:将单通道显著性特征图扩充到N通道,与N通道的全景赤道先验特征图拼接,经通道数为1的1×1卷积层映射为单通道特征图;

步骤S5.4:通过Sigmoid函数将单通道特征图归一化,并将归一化的单通道特征图放大

255倍,得到单通道显著性图,将所有视频帧单通道显著性图整合为显著性视频。

2.根据权利要求1所述的一种基于球面几何感知的全景视频显著性预测方法,其特征在于,步骤S4中每个空间Transformer块提取空间特征的过程为:其中,表示第个空间Transformer块提取的空间特征, 时, 表示分块嵌入特征张量; 表示 的查询可学习参数向量, 表示 的键可学习参数向量, 表示 的值可学习参数向量, 表示第个空间Transformer块中注意力头的维度, 表示归一化指数函数,表示转置操作。

3.根据权利要求1所述的一种基于球面几何感知的全景视频显著性预测方法,其特征在于,步骤S4中通过轻量化时序Transformer提取时空特征的过程为:其中, 表示最后一个空间Transformer块提取的空间特征按时间步重塑的特征,表示 的查询可学习参数向量, 表示 的键可学习参数向量, 表示 的值可学习参数向量, 表示轻量化时序Transformer中注意力头的维度, 表示轻量化时序Transformer提取的时空特征, 表示归一化指数函数,表示转置操作。

4.一种基于球面几何感知的视频压缩方法,其特征在于,包括如下步骤:步骤A1:将权利要求1‑3任一项所述的基于球面几何感知的全景视频显著性预测方法得到的显著性视频中的每一帧进行灰度归一化处理,生成单通道二值化ROI掩码;

步骤A2:将单通道二值化ROI掩码的反向矩阵通过欧式距离变换、数值裁剪归一化与高斯平滑滤波生成连续权重矩阵;

步骤A3:将ERP格式的全景视频的视频帧进行压缩,得到压缩的全景图像;

步骤A4:将ERP格式的全景视频的视频帧与压缩的全景图像基于连续权重矩阵进行加权融合,生成单帧压缩图像。

5.根据权利要求4所述的一种基于球面几何感知的视频压缩方法,其特征在于,步骤A1包括如下子步骤:步骤A1.1:将显著性视频中每一帧进行灰度归一化处理,得到显著性特征矩阵;

步骤A1.2:设置显著性阈值,将显著性特征矩阵生成初始的单通道二值掩码;

步骤A1.3:设置显著性视频中每一帧的ROI占比,结合每一帧的尺寸计算每一帧中目标像素数量;

步骤A1.4:构建椭圆形形态学算子,对每一帧的单通道二值掩码执行迭代形态学膨胀操作,直至每一帧的单通道二值掩码的像素数达到目标像素数量,得到单通道二值化ROI掩码。

6.根据权利要求4所述的一种基于球面几何感知的视频压缩方法,其特征在于,步骤A3包括如下子步骤:步骤A3.1:将ERP格式的全景视频的视频帧经滤波后进行下采样;

步骤A3.2:设置压缩质量系数,将下采样的视频帧进行有损编码压缩,生成压缩帧;

步骤A3.3:将压缩帧进行上采样恢复至视频帧的原始尺寸,得到压缩的全景图像。

7.根据权利要求4所述的一种基于球面几何感知的视频压缩方法,其特征在于,步骤A4中单帧压缩图像的生成过程为:其中, 为单帧压缩图像, 为ERP格式的全景视频的视频帧, 为压缩的全景图像, 为连续权重矩阵,⊙为逐元素相乘算子。