1.一种基于检索和多阶段的中文文本校对方法,其特征在于,包括:S1:输入纠错文本,在数据库中寻找与纠错文本最相似的文本,并将最相似文本和所述纠错文本进行拼接,得到拼接文本;
S2:对所述拼接文本进行拼写纠正;
S3:对拼写纠正后的文本进行基于序列到编辑的语法纠正得到修改结果一;
S4:将所述修改结果一和纠错文本基于序列到序列的语法纠正通过设置阈值范围得到的修改结果二进行困惑度比较;
S5:将困惑度低的修改结果作为最后的修改结果。
2.根据权利要求1所述的基于检索和多阶段的中文文本校对方法,其特征在于,对所述拼接文本进行拼写纠正包括以下步骤:将错误和正确句对处理成字对齐的格式,送入Bert编码器中,得到原始句子特征,采用CNN结构的Glyce编码器作为视觉信息编码器,得到文本字音和字形的特征;
将文本字音和字形特征与原始句子特征集成输入Transformer编码器,经过一个全连接层,得到拼写纠正后的句子。
3.根据权利要求1所述的基于检索和多阶段的中文文本校对方法,其特征在于,对拼写纠正后的文本进行基于序列到编辑的语法纠正得到修改结果一的方法为:拼写纠正后的文本基于GECToR模型进行语法纠正得到修改结果一。
4.根据权利要求3所述的基于检索和多阶段的中文文本校对方法,其特征在于,所述GECToR模型的基本训练数据为错误‑正确的句子对,输入为错误句子,通过将输入句子转换为对应的变换标签,通过BERT编码器、序列标签变换进行迭代纠错,最终输出改正后的句子。
5.根据权利要求1所述的基于检索和多阶段的中文文本校对方法,其特征在于,所述纠错文本基于序列到序列的语法纠正通过设置阈值范围得到的修改结果二的方法为:纠错文本基于seq2seq模型通过设置阈值范围控制纠错得到修改结果二。
6.根据权利要求5所述的基于检索和多阶段的中文文本校对方法,其特征在于,所述seq2seq模型的基本训练数据为一个由原始句子和正确句子所组成的改错句子对,输入为错误句子,通过encoder‑decoder 模型,输出改正后的句子。
7.根据权利要求6所述的基于检索和多阶段的中文文本校对方法,其特征在于,所述错误句子输入encoder‑decoder 模型前需要进行BPE处理,输出encoder‑decoder 模型后需要进行还原处理。
8.根据权利要求1所述的基于检索和多阶段的中文文本校对方法,其特征在于,将所述修改结果一和纠错文本基于序列到序列的语法纠正通过设置阈值范围得到的修改结果二进行困惑度比较,其中困惑度公式表示如下:其中,表示句子, 表示句子长度, 表示第 个词, 表示第 个词的概率。
9.一种基于检索和多阶段的中文文本校对系统,其特征在于,包括:输入模块,用于输入纠错文本;
检索模块,用于寻找与纠错文本最相似的文本,并将最相似文本和所述纠错文本进行拼接,得到拼接文本;
拼写纠错模块,用于对所述拼接文本进行拼写纠正;
基于序列到编辑模块,用于对拼写纠正后的文本进行基于序列到编辑的语法纠正,得到修改结果一;
基于序列到序列模块,用于对所述纠错文本基于序列到序列的语法纠正通过设置阈值范围,得到修改结果二;
困惑度选择模块,用于对所述修改结果一和所述修改结果二进行困惑度比较;
输出模块,用于输出困惑度低的修改结果。
10.一种中文文本校对设备,其特征在于,包括权利要求1‑8所述的基于检索和多阶段的中文文本校对方法,用以实现中文文本校对。