1.一种临床试验的数据管理及逻辑核查方法,其特征在于,该方法包括以下步骤:
获取若干病例的临床试验数据中的病例基础信息及病例试验信息;
获取每个病例的病例试验信息的段落向量,并作为每个病例的临床试验数据的特征向量,根据所有病例的临床试验数据的特征向量之间的余弦相似度将临床试验数据分为若干类别,对每个类别中的临床试验数据进行分词处理,将每个分词作为一个字符串,根据每个字符串在类别中所有临床试验数据中的分布获取每个类别的原始字典;
将任意一个类别的原始字典中任意两个字符串中每个字符作为一个元素得到两个字符串分别对应的集合,将两个集合的交集的元素数量与并集的元素数量的比值作为两个字符串的重要程度,根据重复程度获取两个字符串之间的重复词并得到每个类别的初始字典;
在每个类别的临床试验数据的每个句子进行压缩处理的过程中,获取每个类别的初始字典中每个字符串与后缀字符组成的字符串组合的完整程度,根据完整程度获取初始字典中每个字符串在类别中每个句子的最佳后缀字符个数,根据初始字典中每个字符串及最佳后缀字符个数,以及字符串在句子中相应的后缀字符,对每个类别的初始字典更新获取每个类别的最终字典,根据每个类别的最终字典对每个类别的临床试验数据进行压缩得到压缩后的临床试验数据;
所述获取每个类别的初始字典中每个字符串与后缀字符组成的字符串组合的完整程度,包括的具体方法为:
对任意一个类别的初始字典中的任意一个字符串在类别中临床试验数据的任意一个句子进行压缩处理过程中,对该字符串的后缀字符个数以预设步长进行迭代增加,第 次迭代形成的字符串组合的完整程度的计算方法为:其中, 表示该字符串在当前句子第 次迭代的字符串组合的完整程度,表示该字符串组合在该类别的所有临床试验数据中出现的次数, 表示该字符串组合第 次出现的句子的句向量, 表示该字符串组合第 次出现的句子去除该字符串组合后的句向量,表示去除前后第 次出现的句子的句向量之间的余弦相似度;
将压缩后的临床试验数据及每个类别的最终字典传输到服务器中进行存储。
2.根据权利要求1所述的一种临床试验的数据管理及逻辑核查方法,其特征在于,所述获取每个病例的病例试验信息的段落向量,包括的具体方法为:将每个病例的病例试验信息中的文本信息作为一个段落输入到Doc2vec模型中,模型的输出数据为每个病例试验信息的段落向量。
3.根据权利要求1所述的一种临床试验的数据管理及逻辑核查方法,其特征在于,所述根据所有病例的临床试验数据的特征向量之间的余弦相似度将临床试验数据分为若干类别,包括的具体方法为:将特征向量之间的余弦相似度大于第一预设阈值的两个病例的临床试验数据归入到一个类别中,并确保两个病例的临床试验数据的特征向量与类别中其他病例的临床试验数据的特征向量之间的余弦相似度均大于第一预设阈值,对所有病例的临床试验数据根据特征向量之间的余弦相似度进行归类,得到若干类别。
4.根据权利要求1所述的一种临床试验的数据管理及逻辑核查方法,其特征在于,所述根据每个字符串在类别中所有临床试验数据中的分布获取每个类别的原始字典,包括的具体方法为:将任意一个类别中每个字符串在类别中所有临床试验数据的所有分词中的出现次数与所有分词的数量的比值,作为每个字符串的分布概率,将所有字符串的分布概率降序排列,将预设数量的分布概率最大的字符串作为该类别的原始字典。
5.根据权利要求1所述的一种临床试验的数据管理及逻辑核查方法,其特征在于,所述根据重复程度获取两个字符串之间的重复词并得到每个类别的初始字典,包括的具体方法为:获取任意一个类别的原始字典中所有重复程度大于第二预设阈值的两个字符串的交集,判断每个交集中的元素在所属两个字符串中是否均为连续的字符,将交集元素中连续的字符组成的字符串作为对应两个字符串的重复词进行提取,若不存在两个字符串中均为连续的字符则两个字符串不存在重复词,获取所有重复程度大于第二预设阈值的两个字符串的重复词,将该类别的原始字典中不存在重复词的字符串及重复词作为该类别的初始字典。
6.根据权利要求1所述的一种临床试验的数据管理及逻辑核查方法,其特征在于,所述根据完整程度获取初始字典中每个字符串在类别中每个句子的最佳后缀字符个数,包括的具体方法为:任意一个类别的初始字典中的字符串在任意句子的压缩处理的迭代过程中,第一次出现字符串组合完整程度大于第三预设阈值,此时的迭代次数即为字符串在当前句子的最佳后缀字符个数。
7.一种临床试验的数据管理及逻辑核查的医疗系统,其特征在于,该系统包括:
数据获取模块,获取若干病例的临床试验数据中的病例基础信息及病例试验信息;
数据压缩模块:获取每个病例的病例试验信息的段落向量,并作为每个病例的临床试验数据的特征向量,根据所有病例的临床试验数据的特征向量之间的余弦相似度将临床试验数据分为若干类别,对每个类别中的临床试验数据进行分词处理,将每个分词作为一个字符串,根据每个字符串在类别中所有临床试验数据中的分布获取每个类别的原始字典;
将任意一个类别的原始字典中任意两个字符串中每个字符作为一个元素得到两个字符串分别对应的集合,将两个集合的交集的元素数量与并集的元素数量的比值作为两个字符串的重要程度,根据重复程度获取两个字符串之间的重复词并得到每个类别的初始字典;
在每个类别的临床试验数据的每个句子进行压缩处理的过程中,获取每个类别的初始字典中每个字符串与后缀字符组成的字符串组合的完整程度,根据完整程度获取初始字典中每个字符串在类别中每个句子的最佳后缀字符个数,根据初始字典中每个字符串及最佳后缀字符个数,以及字符串在句子中相应的后缀字符,对每个类别的初始字典更新获取每个类别的最终字典,根据每个类别的最终字典对每个类别的临床试验数据进行压缩得到压缩后的临床试验数据;
所述获取每个类别的初始字典中每个字符串与后缀字符组成的字符串组合的完整程度,包括的具体方法为:
对任意一个类别的初始字典中的任意一个字符串在类别中临床试验数据的任意一个句子进行压缩处理过程中,对该字符串的后缀字符个数以预设步长进行迭代增加,第 次迭代形成的字符串组合的完整程度的计算方法为:其中, 表示该字符串在当前句子第 次迭代的字符串组合的完整程度,表示该字符串组合在该类别的所有临床试验数据中出现的次数, 表示该字符串组合第 次出现的句子的句向量, 表示该字符串组合第 次出现的句子去除该字符串组合后的句向量,表示去除前后第 次出现的句子的句向量之间的余弦相似度;
数据管理模块,将压缩后的临床试验数据及每个类别的最终字典传输到服务器中进行存储。