利索能及
我要发布
收藏
专利号: 2026100209363
申请人: 江西师范大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-08-04
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.基于多尺度动态注意力的树木图像语义抠图的方法,其特征在于:包括以下步骤,对原始树木图像和用户提供的目标边界框信息进行预处理,并将所述目标边界框信息编码为空间位置嵌入特征;

将预处理后的图像输入到语义感知编码模块中,提取多层级语义特征,并将所述空间位置嵌入特征与所述多层级语义特征进行融合,得到增强的多尺度语义特征集合;

将所述多尺度语义特征集合输入到动态增强抠图模块中,通过U‑Net主干网络进行特征提取与还原,其中,在所述U‑Net主干网络的瓶颈层嵌入多尺度动态空间注意力模块进行自适应特征增强,同时在解码路径中集成自适应边缘增强模块进行边界细化;

对经所述动态增强抠图模块处理后的特征进行融合,生成最终的透明度遮罩;

所述多尺度动态空间注意力模块执行以下操作:接收来自所述U‑Net主干网络瓶颈层的特征图作为输入;对输入的特征图在通道维度上进行全局平均池化,获取每个通道的全局特征;

将所述全局特征依次通过第一卷积层、ReLU激活函数及第二卷积层进行处理,生成一维权重向量,并将该一维权重向量重排为二维卷积核;

同时对输入的特征图在通道维度上进行求平均操作,生成单通道的空间特征图;

使用所述二维卷积核与所述单通道的空间特征图进行二维卷积运算,并将卷积结果通过Sigmoid函数进行归一化,生成空间注意力图;

将所述空间注意力图与输入的特征图进行逐元素相乘,输出加权的特征图;

所述自适应边缘增强模块执行以下操作:接收来自所述U‑Net主干网络解码路径的特征图作为输入;对输入的特征图并行进行多尺度边缘检测,分别使用第一、第二和第三卷积核提取边缘特征,其中所述第一、第二和第三卷积核具有不同的感受野;将得到的多尺度边缘特征图进行拼接,并通过融合卷积层生成统一的边缘特征图;同时对输入的特征图进行全局平均池化,并经由全连接层预测自适应的增强强度系数;将统一的边缘特征图与得到的增强强度系数相乘,得到自适应加权的边缘权重图;将边缘权重图与输入的特征图进行拼接,并通过至少一个卷积层与激活函数进行特征变换,得到初级增强特征;将所述初级增强特征与输入的特征图进行二次拼接,最终通过1×1卷积层进行通道融合后输出。

2.根据权利要求1所述的基于多尺度动态注意力的树木图像语义抠图的方法,其特征在于:对原始树木图像进行预处理包括:将图像统一缩放至预定分辨率,并进行像素标准化处理。

3.根据权利要求1所述的基于多尺度动态注意力的树木图像语义抠图的方法,其特征在于:所述语义感知编码模块包括: 补丁嵌入层,其被配置为将预处理后的图像划分为图像块并线性映射为特征向量,以形成初始特征序列;

编码器,其由多层多头自注意力层构成,连接至所述补丁嵌入层,用于对所述初始特征序列进行处理,以提取多尺度语义信息并生成深层语义特征序列;

特征融合层,其被配置为将所述空间位置嵌入特征与所述深层语义特征序列进行融合,并经重构后输出所述增强的多尺度语义特征集合。

4.根据权利要求3所述的基于多尺度动态注意力的树木图像语义抠图的方法,其特征在于:所述多层多头自注意力层至少四层,每层使用8个注意力头。

5.根据权利要求4所述的基于多尺度动态注意力的树木图像语义抠图的方法,其特征在于:对所述多层多头自注意力层中得到的所有层级特征进行层归一化处理。

6.根据权利要求1所述的基于多尺度动态注意力的树木图像语义抠图的方法,其特征在于:在训练过程中,采用跨域交叉训练策略,所使用的训练数据集包括人物、动物、日常物体的通用抠图数据集以及专门构建的树木抠图数据集。

7.根据权利要求1所述的基于多尺度动态注意力的树木图像语义抠图的方法,其特征在于:特征融合输出模块通过卷积层和上采样层对注意力增强和边缘细化的特征进行整合,生成最终的透明度遮罩。

8.根据权利要求1所述的基于多尺度动态注意力的树木图像语义抠图的方法,其特征在于:所述空间位置嵌入特征通过将目标边界框信息编码为特征向量,并与语义感知编码模块提取的多层级语义特征进行拼接融合。