1.一种OCR图像字符识别和字符校正的方法,其特征在于:包括通过训练网络对待识别图像进行字符识别,获得字符识别信息;
预设校正规则对所述字符识别信息进行检验,获得字符校正结果;
其中所述通过训练网络对待识别图像进行字符识别包括:通过构造和拟合Pr函数,以横竖撇捺四个特征为变量,构造训练网络,计算汉字变形度;
并增设第二级相似字区分网络用于对训练网络第一次确定的最佳识别结果进行相似字区分。
2.根据权利要求1所述的OCR图像字符识别和字符校正的方法,其特征在于:所述通过训练网络对待识别图像进行字符识别,获得字符识别信息,包括:S11.设置神经网络训练已知的汉字图像库及其对应的汉字的横竖撇捺的数目;
S12.通过不同程度的GAN构造训练网络,计算汉字变形度。
3.根据权利要求2所述的OCR图像字符识别和字符校正的方法,其特征在于:所述构造训练网络,计算汉字变形度,包括构造包括所述神经网络和标准CNN神经网络的训练网络,通过训练网络获取待识别图像、待检测的汉字及训练获得的该目标汉字中横竖撇捺的数目,计算定量化误差函数Pr。
4.根据权利要求3所述的OCR图像字符识别和字符校正的方法,其特征在于:所述训练网络的训练数据从原始标准汉字图片数据加工得到;首先设置五个层次不同的GAN网络,五个GAN网络的数据集对应于形近字广度扩散的五重数据,则GAN1数据源于该汉字的形近字增强得到;GAN2的数据源于该汉字及其形近字以及其形近字的形近字的数据集增强得到;
以此类推,获得五种类型的GAN网络:GAN1~GAN5;
则,Pr值定义为:
0.0:原始图像;
0.1:5种均不可区分;
0.2:4种不可区分,1种可区分;
0.4:3种不可区分,2种可区分;
0.6:2种不可区分,3种可区分;
0.8:1种不可区分,4种可区分;
0.9:均可区分;
1.0:无关噪点图像或者其他动植物图像;
确定Pr值后,使用所述训练网络结构训练每个目标汉字的Pr值的网络,构成训练数据库。
5.根据权利要求3所述的OCR图像字符识别和字符校正的方法,其特征在于:所述第二级相似字区分网络用于对训练网络第一次确定的最佳识别结果进行相似字精确区分,包括训练网络第一次确定的最佳识别结果,调取该字所在相似字库进行匹配对比,如果匹配到相似字,调用预先训练好的所述第二级相似字区分网络,对匹配的相似字进行区分。
6.根据权利要求1-5任一项所述的OCR图像字符识别和字符校正的方法,其特征在于:所述预设校正规则对所述字符识别信息进行检验,获得字符校正结果,包括预置校正规则,对所述字符识别信息进行验证;
构造反馈模型,用于根据所述校正规则验证的符合程度,向上反馈可靠程度信息并给出进一步处理建议信息。
7.一种OCR图像识别的系统,其特征在于:包括文字识别模块以及文字校正模块;其中图像校正模块,用于通过训练网络对待识别图像进行字符识别,获得字符识别信息;其中通过训练网络对待识别图像进行字符识别包括:通过构造和拟合Pr函数,以横竖撇捺四个特征为变量,构造训练网络,计算汉字变形度;
并增设第二级相似字区分网络用于对训练网络第一次确定的最佳识别结果进行相似字区分;
文字校正模块,用于预设校正规则对所述字符识别信息进行检验,获得字符校正结果。
8.根据权利要求7所述的OCR图像识别的系统,其特征在于:文字识别模块的执行步骤包括:设置神经网络训练已知的汉字图像库及其对应的汉字的横竖撇捺的数目;
还包括通过不同程度的GAN构造训练网络,计算汉字变形度;其包括:构造包括所述神经网络和标准CNN神经网络的训练网络,通过训练网络获取待识别图像、待检测的汉字及训练获得的该目标汉字中横竖撇捺的数目,计算定量化误差函数Pr。
9.根据权利要求8所述的OCR图像识别的系统,其特征在于:文字识别模块执行所述第二级相似字区分网络用于对训练网络第一次确定的最佳识别结果进行相似字区分,包括训练网络第一次确定的最佳识别结果,调取该字所在相似字库进行匹配对比,如果匹配到相似字,调用预先训练好的所述第二级相似字区分网络,对匹配的相似字进行区分。
10.根据权利要求9所述的OCR图像识别的系统,其特征在于:所述文字校正模块的执行步骤包括预置校正规则,对所述字符识别模块输出的字符识别信息进行验证;
构造反馈模型,用于根据所述校正规则验证的符合程度,向上反馈可靠程度信息并给出进一步处理建议信息。