1.一种普通外科手术智能采集存储系统,其特征在于,该系统包括以下模块:
文本数据采集模块,用于获取若干个普通外科手术的文本数据;
距离修正模块,用于根据每个文本数据中同一词的所有词向量之间的差异,对任意两个词向量之间的距离进行修正,得到两个文本数据中的词向量之间修正后的距离特征;
代表性分析模块,用于根据每个词的逆文档频率和两个文本数据中的词向量之间修正后的距离特征,得到两个文本数据之间的距离度量,根据两个文本数据之间的距离度量获得每个文本数据的代表性,所述每个文本数据的代表性是用来反映文本数据之间的相似重要程度;
存储模块,用于根据两个文本数据之间的距离度量进行对所有文本数据的聚类,得到若干个标记类簇,根据每个文本数据的代表性对每个标记类簇进行分裂,得到若干个参考类簇,然后根据参考类簇对文本数据进行压缩存储;
所述用于根据每个文本数据中同一词的所有词向量之间的差异,对任意两个词向量之间的距离进行修正,得到两个文本数据中的词向量之间修正后的距离特征,包括:根据每个词向量邻域内的所有词向量之间的差异,得到每种类型词的词向量的语境偏差性,根据两个文本数据中不同词向量的语境偏差性,对两个文本数据中的词向量之间的距离进行修正,得到两个文本数据中的词向量之间修正后的距离特征;
所述根据每个词向量邻域内的所有词向量之间的差异,得到每种类型词的词向量的语境偏差性,包括:
将从一个文本数据中选取同一种类型的词对应的词向量,按照文本的顺序组成一组序列,记为词向量序列;以词向量序列中每个词向量为中心,以 为邻域半径,获取每个词向量邻域内的所有词向量;其中, 为预设第一参数;
根据每个词向量邻域内的所有词向量之间的差异,得到每种类型词的词向量的语境偏差性,具体用公式表示为:式中, 表示第 种类型词的词向量序列中第 个词向量邻域内的第 个词向量,表示第 种类型词的词向量序列中第 个词向量邻域内的第 个词向量,表示每种类型词的词向量序列中所有词向量的集合, 表示第 种类型词的词向量序列中所有词向量邻域内的第 个词向量与第 个词向量之间矢量差的模长的标准差, 表示第 种类型词的词向量的语境偏差性, 表示矢量数据的模长;
所述根据两个文本数据中不同词向量的语境偏差性,对两个文本数据中的词向量之间的距离进行修正,得到两个文本数据中的词向量之间修正后的距离特征,包括:将每个文本数据中每个词向量的语境偏差性与任意一个文本数据中任意一个词向量的语境偏差性之和,记为每个文本数据中每个词向量与任意一个文本数据中任意一个词向量之间的第二数值,对所有文本数据中所有词向量与所有文本数据中所有词向量之间的第二数值进行线性归一化,将归一化后每个文本数据中每个词向量与任意一个文本数据中任意一个词向量之间的第二数值加1的结果,记为每个文本数据中每个词向量与任意一个文本数据中任意一个词向量之间的第三数值;
将每个文本数据中每个词向量与任意一个文本数据中任意一个词向量之间的距离和第三数值的乘积结果,作为两个文本数据中的词向量之间修正后的距离特征;
所述用于根据每个词的逆文档频率和两个文本数据中的词向量之间修正后的距离特征,得到两个文本数据之间的距离度量,包括:将任意一个文本数据中的任意一个词记为目标词,将目标词所在的类别中包含目标词的文本数据个数,记为目标词的第一个数;
根据每个文本数据的每个词的第一个数、每个词在每个文本数据中出现的次数,得到每个文本数据中的每个词修正后的逆文档频率,根据两个文本数据中的词向量之间修正后的距离特征得到每个文本数据中的每个词的逆文档频率的修正系数;
根据每个文本数据中的每个词修正后的逆文档频率、每个文本数据中的每个词的逆文档频率的修正系数,得到每个文本数据中的每个词的置信度,根据每个文本数据中的每个词的置信度和两个文本数据中的词向量之间修正后的距离特征,得到两个文本数据之间的距离度量。
2.根据权利要求1所述一种普通外科手术智能采集存储系统,其特征在于,所述根据每个文本数据的每个词的第一个数、每个词在每个文本数据中出现的次数,得到每个文本数据中的每个词修正后的逆文档频率,根据两个文本数据中的词向量之间修正后的距离特征得到每个文本数据中的每个词的逆文档频率的修正系数,包括:将1与每个文本数据的每个词的第一个数之和,记为每个文本数据的每个词的第四数值,将每个文本数据所在的类别中包含的文本数据的个数与每个文本数据的每个词的第四数值的比值,记为每个文本数据的每个词的第一比值,对每个文本数据的每个词的第一比值进行正相关映射,得到每个文本数据的每个词的第一映射值,将每个文本数据的每个词的第一映射值与每个文本数据中的每个词在每个文本数据中出现的频率之间的乘积,作为每个文本数据中的每个词修正后的逆文档频率;其中,每个文本数据所在的类别,即每种相同手术的文本数据对应同一个类别;
对每个文本数据中所有每两个词向量之间修正后的距离特征进行线性归一化,将归一化后每个文本数据中所有每两个词向量之间修正后的距离特征中的最小值,作为每个文本数据中的每个词的逆文档频率的修正系数。
3.根据权利要求1所述一种普通外科手术智能采集存储系统,其特征在于,所述根据每个文本数据中的每个词修正后的逆文档频率、每个文本数据中的每个词的逆文档频率的修正系数,得到每个文本数据中的每个词的置信度,根据每个文本数据中的每个词的置信度和两个文本数据中的词向量之间修正后的距离特征,得到两个文本数据之间的距离度量,包括:获取每个文本数据中的每个词的逆文档频率;
将每个文本数据中的每个词的逆文档频率的修正系数、每个文本数据中的每个词的逆文档频率之间的乘积结果,记为每个文本数据中的每个词的第一乘积值,将1减去每个文本数据中的每个词的逆文档频率的修正系数的结果,记为每个文本数据中的每个词的第五数值,将每个文本数据中的每个词的第五数值和每个文本数据中的每个词修正后的逆文档频率之间的乘积结果,记为每个文本数据中的每个词的第二乘积值,将每个文本数据中的每个词的第一乘积值和第二乘积值之和,作为每个文本数据中的每个词的置信度;
根据每个文本数据中的每个词的置信度和两个文本数据中的词向量之间修正后的距离特征,得到两个文本数据之间的距离度量,具体用公式表示为:式中, 表示第 个文本数据中的 个词的置信度, 表示第 个文本数据中的 个词的置信度, 表示第 个文本数据中第 个词向量和第 个文本数据中第个词向量之间修正后的距离特征, 表示第 个文本数据中所有词的个数, 表示第 个文本数据中所有词的个数, 表示线性归一化函数, 表示第 个文本数据和第 个文本数据之间的距离度量。
4.根据权利要求1所述一种普通外科手术智能采集存储系统,其特征在于,所述根据两个文本数据之间的距离度量获得每个文本数据的代表性,包括:将与每个文本数据之间的距离度量最小的 个文本数据组成一个集合,记为每个文本数据的近距离集合,其中, 为预设第二参数;
对每个文本数据和每个文本数据的近距离集合中任意一个文本数据之间的距离度量进行负相关映射,得到每个文本数据和每个文本数据的近距离集合中任意一个文本数据之间的第二映射值,将每个文本数据和每个文本数据的近距离集合中所有文本数据之间的第二映射值的均值,作为每个文本数据的代表性。
5.根据权利要求1所述一种普通外科手术智能采集存储系统,其特征在于,所述根据两个文本数据之间的距离度量进行对所有文本数据的聚类,得到若干个标记类簇,根据每个文本数据的代表性对每个标记类簇进行分裂,得到若干个参考类簇,然后根据参考类簇对文本数据进行压缩存储,包括:通过两个文本数据之间的距离度量通过CABDDCG聚类算法对所有的文本数据进行初次聚类,得到文本数据的若干个标记类簇;
根据每个文本数据的代表性对所有标记类簇中的所有文本数据进行遍历分裂,得到若干个参考类簇;
通过LZ77压缩算法对每个参考类簇分别进行压缩存储,则得到所有文本数据压缩存储后的结果。
6.根据权利要求5所述一种普通外科手术智能采集存储系统,其特征在于,所述根据每个文本数据的代表性对所有标记类簇中的所有文本数据进行遍历分裂,得到若干个参考类簇,包括:每个标记类簇的分裂过程为:
第一次分裂,选取每个标记类簇中代表性最大文本数据作为第一标记文本数据,计算标记文本数据和非标记文本数据之间的承受系数;当标记文本数据和非标记文本数据之间的承受系数小于或者等于分裂阈值时,继续选取下一个标记文本数据,从每个标记类簇中选取与第一标记文本数据相连中最大代表性对应的文本数据记为第二标记文本数据,计算标记文本数据和非标记文本数据之间的承受系数,当标记文本数据和非标记文本数据之间的承受系数小于或者等于分裂阈值时,继续选取下一个标记文本数据,从每个标记类簇中选取与第二标记文本数据相连中最大代表性对应的文本数据记为第三标记文本数据,计算标记文本数据和非标记文本数据之间的承受系数,当标记文本数据和非标记文本数据之间的承受系数大于分裂阈值时,则停止相连标记文本数据的获取,则将所有的标记文本数据从每个标记类簇中分裂出来,将分裂出来的标记文本数据作为一个参考类簇;至此,每个标记类簇的第一次分裂完成;
第二次分裂,将每个标记类簇中除分裂出来的标记文本数据之外的所有文本数据作为一个新的标记类簇,从新的标记类簇中根据第一次分裂的过程继续进行分裂,则将分裂出来的标记样本数据作为一个参考类簇;至此,每个标记类簇的第二次分裂完成;
依次,直至再没有一个文本数据可以分裂出时,则停止,此时每个标记类簇的分裂完成;其中,标记文本数据和非标记文本数据之间的承受系数和分裂阈值的计算获取过程为现有论文中的已知方法;
根据每个标记类簇的分裂过程对所有的标记类簇进行分裂,得到若干个参考类簇。