1.一种应用于数据清洗工具的数据匹配方法,其特征在于,包括如下步骤:(1)根据输入表和输出表中的数据,导入若干差异化样本与样本生成模型参数,将模型参数配置到模型表;差异化样本中包含有分散在各个独立系统中的原始数据;
(2)对查询数据主键进行合法性判断;
(3)对非空值进行数据类型判断并进行查询生成记录;包括对内容主键的判断和时间主键的判断,内容主键的判断包括:①对主键数据进行拆分判断,如存在分隔符,则用拆分后的数字分别对目标数据库进行匹配;如拆分后判断为文字与数字的组合,则对拆分后根据的文字进行查询表,根据数字座位主键对表进行查询;
②在目标数据库里查询数据后并返回数据;
时间主键的判断包括:
①如数据主键中包含分隔符,则根据分隔符拆分形成日期字符串,进入下一步;如数据主键中包含文字,则根据汉字包含的日期关键字进行分隔形成日期字符串,进入下一步;
②对字符串数据进行长度、数值型合法判断,如和预设的模型相同,则判定合法;如和预设的模型不相同,则判断不合法,返回记录无法匹配后跳出;
(4)根据深度自学习算法,辨识所有记录中的数据,生成通用的匹配模型;
(5)使用ETL清洗,读取模型表清洗数据。
2.根据权利要求1所述的一种应用于数据清洗工具的数据匹配方法,其特征在于:步骤(2)对查询数据主键进行合法性判断中,合法性判断为对数据主键是否为规则规定内的数值进行判断,如为合法格式,则判定为非空值,进入步骤(3);如为非法格式,则判定为空值返回记录无法匹配后跳出。
3.根据权利要求1所述的一种应用于数据清洗工具的数据匹配方法,其特征在于:步骤(4)中,还包括校验匹配模型数据,设置匹配成功率的阈值,如小于阈值,则判定匹配模型不理想,增加差异化样本,循环步骤(1)~(4),直到满足阈值。
4.根据权利要求1所述的一种应用于数据清洗工具的数据匹配方法,其特征在于:步骤(4)中,模型生成公式为:其中D:表示训练数据样本,f(T):表示数据样本与表及字段映射关系,Y:表示匹配目标记录,λ:表示匹配目标记录中表名,ρ:示匹配目标记录中表对应的字段名称。