1.一种云档案一体化平台的档案分类系统,其特征在于,所述系统包括:
数据获取模块:获取所有待分类的档案文件;
文本特征分析模块:将各档案文件中的文本、图像、表格进行区分;对各档案文件中的文本进行分词处理,并获取各子词的语义向量、词频、重要性权重;获取各子词的共现词;根据单个子词及其所有共现词之间在所在档案中共现的频率获取单个子词的加权无向图,进而获取单个子词的加权无向图的平均节点重要性,并结合单个子词与其所在句中其他子词的语义向量的相似程度,获取单个子词的关联重要系数;根据单个段落的各句子中的所有关联重要系数与相邻段落中各句子的所有关联重要系数的距离获取单个段落的子词差异度,并结合单个段落中的词频靠前的多个子词与相邻段落中词频靠前的多个子词的相似程度,获取单个段落的一致性系数;根据单个段落中各子词的词性与相邻段落中各子词的词性的距离获取单个段落的风格相似系数,并结合单个段落的一致性系数,获取单个段落的主题关联强度值;
档案分类模块:根据各档案文件中各段落的主题关联强度值、各子词的关联重要系数和重要性权重获取各档案文件的核心词,并结合各档案文件中的图像和表格的特征,对各档案文件进行分类。
2.如权利要求1所述的一种云档案一体化平台的档案分类系统,其特征在于,所述各子词的共现词是指与各子词的次序值之差小于或等于预设值,且其对应的语义向量与各子词的语义向量之间的余弦相似度大于预设共现阈值的子词。
3.如权利要求1所述的一种云档案一体化平台的档案分类系统,其特征在于,所述获取单个子词的加权无向图的具体过程为:以单个子词及其对应的所有共现词作为节点,在互为共现词的两个子词对应的节点之间构建加权边,设置加权边的权重为两个子词在所在档案中共现的频率,可得到单个子词的加权无向图。
4.如权利要求1所述的一种云档案一体化平台的档案分类系统,其特征在于,所述单个子词的关联重要系数的计算公式为: ;式中, 为第j个子词的关联重要系数,表示第j个子词所在句中包含的子词总数, 表示以e为底的指数函数, 表示第j个子词与其所在句中第k个子词对应语义向量的余弦相似度, 表示第j个子词的加权无向图的平均节点重要性。
5.如权利要求1所述的一种云档案一体化平台的档案分类系统,其特征在于,所述单个段落的子词差异度的获取过程为:将每个句子内各子词的关联重要系数按词序的先后顺序排列,记为每个句子的第一特征序列;计算单个段落中每个句子对应第一特征序列与前后两个相邻段落中的每个句子对应第一特征序列的DTW距离,将所有DTW距离的均值作为单个段落的子词差异度。
6.如权利要求1所述的一种云档案一体化平台的档案分类系统,其特征在于,所述单个段落的一致性系数的计算公式为: ;式中, 为第i个段落的一致性系数, 为第i个段落的子词差异度, 为第i个段落的关键词匹配度;其中,第i个段落的关键词匹配度的获取过程为:选取第i个段落中词频靠前的多个子词作为关键词;将第i个段落中所有关键词组成的集合与相邻两个段落的所有关键词组成的集合之间的Jaccard相似系数的均值作为第i个段落的关键词匹配度。
7.如权利要求1所述的一种云档案一体化平台的档案分类系统,其特征在于,所述单个段落的风格相似系数的获取过程为:获取每个子词的词性及其对应的词性数字标签;将段落内各个句子所有子词的词性数字标签按其词序顺序排列,得到每个句子的第二特征序列;分别计算单个段落中每个句子的第二特征序列与前后两个相邻段落中的每个句子的第二特征序列的DTW距离,将所有DTW距离的均值的倒数作为单个段落的风格相似系数。
8.如权利要求1所述的一种云档案一体化平台的档案分类系统,其特征在于,所述单个段落的主题关联强度值为单个段落的一致性系数与风格相似系数的乘积。
9.如权利要求1所述的一种云档案一体化平台的档案分类系统,其特征在于,所述各档案文件的核心词的获取过程为:将单个档案文件中主题关联强度值最高的若干个段落作为档案核心段落;将各子词的重要性权重与关联重要系数的乘积作为各子词的核心系数;将单个档案文件的所有档案核心段落中核心系数最大的前若干个子词作为该档案文件的核心词。
10.如权利要求9所述的一种云档案一体化平台的档案分类系统,其特征在于,所述对各档案文件进行分类的具体过程为:
获取各档案中各图像的特征向量和各表格的特征向量,分别对各档案中所有图像的特征向量、所有表格的特征向量进行拼接融合,得到各档案文件的综合图像特征向量和综合表格特征向量;
将各档案文件的所有核心词的语义向量按照核心系数由高到低的顺序进行排列,并与对应档案文件的综合图像特征向量、综合表格特征向量拼接为一个信息表征向量;
将所有档案文件的信息表征向量作为BIRCH算法的输入进行档案分类,得到所有档案的分类结果。