1.法律案例智能检索与分析系统,其特征在于,包括:数据采集模块,其用于采集原始法律案例数据;
原始法律案例数据包括:案例编码、案例类型、案例摘要、诉讼请求、证据材料、法律条目、判决文书和判决结果;
数据处理模块,其用于对原始法律案例数据进行处理获得备用法律案例数据;
备用法律案例数据与原始法律案例数据的内容相同;
备用法律案例数据的案例类型、案例摘要的关键词和法律条目均通过向量化表示,其余内容通过地址链接表示;
知识图谱构建模块,其用于根据备用法律案例数据构建知识图谱;
知识图谱包括:实体、实体的初始属性和实体之间的连接关系;
实体包括:第一实体、第二实体和第三实体;
第一实体与备用法律案例数据的案例编码建立数据映射;
第二实体与备用法律案例数据的案例类型建立数据映射;
第三实体与备用法律案例数据的案例摘要的关键词建立数据映射;
实体的初始属性根据实体所数据映射的信息生成;
知识图谱检索模块,其用于根据用户的问题检索知识图谱获得由T个第一实体组成的子知识图谱;
子知识图谱和知识图谱的表示相同;
知识图谱分析模块,其用于将由T个第一实体组成的子知识图谱输入到法律案例分析模型中,输出与用户的问题匹配的应答文本,其中T为自定义参数;
第一实体的初始属性通过案例编码的八位二进制编码表示;第二实体的初始属性通过案例类型的向量化表示;第三实体的初始属性通过案例摘要的关键词的向量化表示;
实体之间的连接关系包括:第一实体与第二实体之间存在连接关系表示第一实体所数据映射的案例编码属于第二实体所数据映射的案例类型;第二实体与第三实体之间存在连接关系表示第三实体所数据映射的案例摘要的关键词属于第二实体所数据映射的案例类型;
对原始法律案例数据进行处理获得备用法律案例数据,包括以下步骤:步骤S201,通过正则匹配去除原始法律案例数据的案例摘要的敏感词汇,其中敏感词汇为人工自定义设置;
步骤S202,通过中文分词器对去除敏感词汇后的案例摘要进行分词处理;
步骤S203,通过关键词提取模型提取分词处理后的案例摘要的关键词,通过相关技术专家手动标注案例摘要中的关键词作为用于训练关键词提取模型的训练样本的样本标签;
步骤S204,通过词嵌入模型将案例摘要的关键词、原始法律案例数据的案例类型和法律条目进行向量化表示;
步骤S205,将原始法律案例数据中的诉讼请求、证据材料、判决文书和判决结果存储到分布式存储系统中,返回对应的地址链接;
根据用户的问题检索知识图谱获得由T个第一实体组成的子知识图谱,包括以下步骤:步骤S301,通过词嵌入模型将用户的问题进行向量化表示;
步骤S302,通过余弦相似度计算用户的问题的向量化表示与知识图谱的第二实体之间的第一相似度值,并获得第一相似度值大于等于第一阈值对应的第一实体,其中第一阈值为自定义参数;
步骤S303,判断当第一相似度值大于等于第一阈值对应的第一实体的数量小于T,则减小第一阈值,直至获得第一实体的数量等于T,否则进入步骤S304;
步骤S304,通过余弦相似度计算用户的问题的向量化表示与知识图谱的第三实体之间的第二相似度值,并获得第二相似度值大于等于第二阈值对应的第一实体,其中第二阈值为自定义参数;
步骤S305,判断当第二相似度值大于等于第二阈值对应的第一实体的数量小于T,则减小第二阈值,否则增大第二阈值,直至获得第一实体的数量等于T。
2.根据权利要求1所述的法律案例智能检索与分析系统,其特征在于,案例类型包括:刑事案件、民事案件、行政案件和经济案件。
3.根据权利要求1所述的法律案例智能检索与分析系统,其特征在于,知识图谱的实体还包括第四实体,第四实体与法律条目建立映射关系,第四实体与第一实体存在连接关系表示第四实体所数据映射的法律条目属于第一实体所数据映射的案例编码。
4.根据权利要求1所述的法律案例智能检索与分析系统,其特征在于,法律案例分析模型包括:第一隐藏层、提取层、拼接层和第二隐藏层;
第一隐藏层输入由T个第一实体组成的子知识图谱,输出更新矩阵,更新矩阵的一个行向量表示一个实体的更新属性;
提取层用于提取更新矩阵中第一实体对应的更新属性;
拼接层用于将第一实体对应的更新属性进行拼接获得应答向量;
第二隐藏层输入应答向量,输出与用户的问题匹配的应答文本,第二隐藏层基于转换器模型构建。
5.根据权利要求4所述的法律案例智能检索与分析系统,其特征在于,法律案例分析模型的计算公式包括:更新矩阵Z的计算公式如下:
其中 表示第b个实体的更新属性,Pile表示堆叠操作;
第b个实体的更新属性 的计算公式如下:
其中Na表示与第a个实体存在连接关系的实体的集合,αab表示第a个实体与第b个实体之间的归一化注意力分数, 和Bab分别表示第a个实体与第b个实体之间的第一权重参数和偏置参数,Hb表示第b个实体的初始属性,sigmoid表示sigmoid激活函数;
第a个实体与第b个实体之间的归一化注意力分数αab的计算公式如下:其中Na表示与第a个实体存在连接关系的实体的集合,eab表示第a个实体与第b个实体之间的注意力分数,eac表示第a个实体与第c个实体之间的注意力分数,exp表示自然常数的幂运算,LeakyReLU表示LeakyReLU激活函数;
第a个实体与第b个实体之间的注意力分数eab的计算公式如下:其中Ha和Hb分别表示第a个实体和第b实体的初始属性, 和 分别表示第a个实体与第b个实体之间的第二权重参数和第三权重参数,concat表示拼接操作,MLP表示多层感知机。
6.根据权利要求1所述的法律案例智能检索与分析系统,其特征在于,构建用于训练法律案例分析模型的训练样本的样本标签,包括以下步骤:步骤S401,根据用户的问题检索知识图谱获得由T个第一实体组成的子知识图谱;
步骤S402,重复M次将子知识图谱输入到法律案例分析模型中,获得与用户的问题匹配的M个应答文本,其中M为自定义参数;
步骤S403,相关专家依次对M个应答文本进行满意度评分,并选择满意度评分最高的应答文本作为一个训练样本的样本标签,满意度评分的取值范围为1到10;
步骤S404,重复步骤S401到步骤S403,直至获得N个训练样本,其中N为自定义参数。