利索能及
我要发布
收藏
专利号: 2026103689413
申请人: 南京信息工程大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-08-25
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种融合复用Transformer的基于Mamba框架的场景文字识别方法,其特征在于,包括如下步骤:步骤1、通过数据增强策略,构建多样化训练样本,并与原始样本一起输入深度神经网络进行训练,生成增广样本图像;

步骤2、对所述增广样本图像进行特征编码,并将编码结果送入分层特征编码器进行特征提取;

所述分层特征编码器包括多个级联的特征编码阶段,各阶段均通过下采样模块对特征的空间分辨率和通道维度进行自适应调整,逐级构建多尺度特征表示;

在分层特征编码过程中,基于状态空间模型的Mamba框架改进形成NA‑Mamba特征混合模块,对二维场景文字特征进行建模,通过引入参数共享的复用Transformer模块,对多阶段特征进行双向全局上下文建模与迭代增强,提取场景文字特征;

步骤3、将步骤2得到的场景文字特征作为内容流输入,送入基于双流注意力机制的序列解码器,通过查询流与内容流的交叉注意力生成字符序列,输出最终的文字识别结果;

所述步骤2具体为:

步骤201、将步骤1生成的增广样本图像输入特征编码器进行特征提取;

所述特征编码器通过图像块嵌入模块对输入图像进行处理,将输入场景文字图像划分为多个具有固定空间大小的图像块,并将所述图像块映射为保持空间对应关系的初始特征表示;

步骤202、将所述初始特征表示依次输入两个特征编码阶段,进行多阶段特征编码,每一特征编码阶段均由一个下采样模块和若干个NA‑Mamba特征混合模块顺序组成;经过两个特征编码阶段后,分别得到第一阶段输出特征 和第二阶段输出特征 ;

步骤203、将所述第二阶段输出特征 输入至复用Transformer模块,进行全局上下文建模;先将特征进行通道转换及对齐,再将对齐后的特征输入至复用Transformer编码器中,进行全局上下文建模得到特征并通道转换至原本维度;

步骤204、将经步骤203建模后的特征输入至后续特征编码阶段,通过下采样模块和NA‑Mamba特征混合模块进行特征建模,获得深层特征表示;并将得到的深层特征再次输入至与步骤203中相同参数集合的复用Transformer编码器,进行全局上下文建模,增强特征的长程依赖关系;

所述NA‑Mamba特征混合模块,基于状态空间模型的Mamba架构构建,针对场景文字识别任务对特征混合结构进行适应性改进,包括:将局部双向特征混合在NA‑Mamba特征混合模块中,通过一维卷积替代因果卷积,对输入特征序列进行局部双向特征混合,过程表示为:;

式中, 为输入序列, 为一维卷积核的长度,为卷积核在当前位置两侧覆盖的局部半径, 为卷积核在相对位置 处对应的可学习权重参数,为输入特征序列中的当前位置索引, 为输入序列中位置 处的特征向量,为经过局部双向特征混合后的输出特征序列;

将邻域注意力分支建模在状态空间建模路径之外,并行引入邻域注意力分支,对局部邻域范围内的特征进行自适应聚合;对于特征序列中位置 处的特征X,邻域注意力计算过程为:;

式中, 表示以位置 为中心的局部邻域窗口,用于限制注意力计算范围; 为位置对其邻域内位置 的归一化注意力权重,为位置 处特征对应的值向量, 为位置处特征对应的查询向量, 为位置 处特征对应的键向量,为查询向量和键向量的特征维度;

为归一化函数,上标T表示转置;

将状态空间建模路径与邻域注意力路径的输出特征分别通过映射函数进行维度对齐后进行融合,融合结果 表示为:;

式中, 为作用于状态空间建模路径输出的线性映射函数, 为作用于邻域注意力路径输出的线性映射函数, 为邻域注意力特征聚合运算, 为状态空间模型特征建模运算;

通过残差连接方式将融合结果 与模块输入特征 相结合,得到NA‑Mamba特征混合模块的最终输出。

2.根据权利要求1所述的场景文字识别方法,其特征在于,所述步骤1具体为:步骤101、以LMDB形式存储训练数据集,并按识别难度划分为若干子集,各子集在文字清晰度、字符尺度与方向、形变程度、遮挡情况及背景噪声复杂度方面存在差异;

步骤102、采用基于LMDB的数据读取方式,从训练数据集中读取训练样本图像,加载对应的文字标注信息,以RGB格式解码,并在加载过程中过滤空标注样本和超长字符样本;

步骤103、对读取的训练样本图像执行随机增强操作,基于RandAugment策略,从预设的增强算子集合中随机选取若干增强操作,并按随机顺序叠加;所述增强算子至少包括旋转、平移、模糊和噪声扰动中的一种或多种,旋转操作采用画布扩展方式;

步骤104、将处理后的图像统一调整至预设的输入尺寸,并采用双三次插值方式进行缩放处理;将图像转换为张量表示并进行归一化处理,将处理后的图像及相关元信息一并打包,作为训练样本输入深度神经网络。

3.根据权利要求1所述的场景文字识别方法,其特征在于,所述下采样模块,在每一特征编码阶段开始时对输入特征进行处理,对特征的空间分辨率和通道容量进行联合调整,使特征尺度与当前特征编码阶段的表示需求相匹配;

所述下采样模块采用MBConv结构,基于深度可分离卷积构建,依次通过扩展卷积提升通道维度、深度卷积提取空间特征、SE块完成通道重标定,再经逐点卷积进行维度投影与信息融合,实现空间尺度变换与通道调整,有效保留字符笔画、边缘相关关键局部结构信息,降低特征冗余。

4.根据权利要求1所述的场景文字识别方法,其特征在于,所述步骤202,具体为:在第个特征编码阶段中,输入特征 通过下采样模块处理,得到阶段中间特征 :;

式中, 表示下采样;

将阶段中间特征 输入若干个连续堆叠的NA‑Mamba特征混合模块中进行特征建模;第个NA‑Mamba特征混合模块的输出为 ,并满足初始条件 ,则各NA‑Mamba特征混合模块按照如下递推关系依次执行特征混合过程:;

式中, 表示特征混合;最后一个NA‑Mamba特征混合模块的输出 作为第 个特征编码阶段的输出特征;

经过两个特征编码阶段后,分别得到第一阶段输出特征 和第二阶段输出特征 :;

其中, 、 为第一阶段、第二阶段NA‑Mamba特征混合模块的输出。

5.根据权利要求4所述的场景文字识别方法,其特征在于,所述复用Transformer模块,包括自注意力子层和前馈网络子层,通过修改自注意力子层的残差连接部分,融入SE机制,自注意力子层输出的中间特征表示为 ,则其中间输出 为:;

式中, 表示沿序列维度的全局平均池化操作, 表示Sigmoid激活函数,表示线性整流激活函数, 表示逐通道乘法运算, 、 分别为通道注意力生成过程中对应的第一全连接层权重参数和第二全连接层权重参数。

6.根据权利要求5所述的场景文字识别方法,其特征在于,所述复用Transformer编码器,操作如下:;

式中, 表示具有相同参数集合 的复用Transformer编码器, 和 分别表示输入和输出的通道变换, 和 表示 阶段对复用Transformer编码器的输入输出。

7.根据权利要求1所述的场景文字识别方法,其特征在于,所述步骤3具体为:步骤301、将步骤2输出的场景文字特征作为编码器侧的内容流特征,输入至双流解码器;在解码端构建用于字符序列建模的双流输入特征,包括:用于承载已生成或目标字符语义信息的内容流特征,以及用于提供位置查询与序列结构建模的查询流特征;

步骤302、在每一双流解码层中,分别对查询流特征与内容流特征执行预归一化处理后,对双流特征依次进行自注意力建模,捕获字符序列内部的长程依赖关系,并在内容流特征的引导下执行交叉注意力建模,将视觉全局上下文信息与字符序列表示进行融合;

步骤303、对经注意力建模后的解码特征施以前馈网络的非线性变换,并通过残差连接将注意力输出与前馈输出进行特征融合;在完成全部解码层处理后,对解码输出进行归一化处理,得到用于字符分类预测的最终序列特征表示,并基于线性映射与概率归一化输出字符类别分布,生成最终的字符序列识别结果;

其中,训练阶段采用因果掩码与真实标签进行引导训练,推理阶段采用自回归方式逐字符生成直至输出终止符或达到最大长度。

8.根据权利要求7所述的场景文字识别方法,其特征在于,所述内容流特征由字符token嵌入与位置编码叠加得到,所述查询流特征由可学习的位置查询向量或位置编码生成;

在最后一解码层中仅更新查询流特征而不更新内容流特征,减少冗余计算并获得用于字符预测的最终序列表示。