1.基于语义分析的多行文字纸质表格OCR方法,其特征在于:具体包括以下步骤:
步骤一、输入待数字化的表格图像,提取图像中的单元格,利用神经网络,通过训练好的字库对图像中每个单元格内的文字进行识别,输出识别结果;具体包括以下步骤:s1.1、对待数字化的表格图像进行灰度化和二值化处理;
s1.2、通过膨胀、腐蚀操作提取预处理后的表格图像中的线条,得到线条的交点坐标,再根据交点坐标确定表格图像中每个单元格的四个顶点的坐标,完成单元格的提取;
s1.3、通过神经网络对汉字数据集进行训练,得到字库;再根据字库对每个单元格内的内容进行识别,输出识别结果;
步骤二、使用bengio语言模型对步骤一输出的识别结果进行语义通顺度计算;假设识别结果中的词语ωt只与其前n‑1个词语ωt‑1、ωt‑2…ωt‑n+1关联;通过bengio语言模型计算识别结果中前n‑1个词语为ωt‑1、ωt‑2…ωt‑n+1时接下来词语为ωt的概率,作为语义通顺度;
步骤三、将步骤二的计算结果与设定阈值进行比较,若计算得到的语义通顺度大于设定阈值,则判断识别结果的语序正确;若计算得到的语义通顺度小于设定阈值,则判断识别结果的语序错误;
步骤四、若步骤三中判断识别结果的语序正确,则直接输出识别结果;若步骤三判断识别结果的语序错误,则进入步骤五;
步骤五、分别运用水平投影和垂直投影的方法,对步骤一提取的单元格内文字的行数与列数进行判断;所述水平投影法是将单元格中每行的黑色像素点个数相加,连续几行黑色像素点的总和不为0则构成了一行文字;若出现一行黑色像素点为0,则表明这一行没有文字;依此,来判断文字的行数;垂直投影法则是将单元格中每列的黑色像素点个数相加,连续几列黑色像素点总和不为0则构成了一列文字;若出现一列黑色像素点为0,则表明这一列没有文字;依此,来判断文字列数;
步骤六、根据步骤五得到的文字行数与列数构造矩阵,矩阵行数和列数分别与单元格内文字的行数和列数相等;然后将步骤四识别的文字依次填入矩阵的行中,最后按照矩阵的列的顺序输出文字,完成乱序文字的自动调整。
2.如权利要求1所述基于语义分析的多行文字纸质表格OCR方法,其特征在于:步骤三中判断识别结果语序是否正确的阈值设定为0.1。