1.一种实现国际疾病分类的自动编码方法,其特征在于,包括以下步骤:(1)从医疗数据库中获取电子病历数据,并对数据进行初步清洗;
(2)提取电子病历文本,与医生诊断的ICD编码关联,构建训练数据集;
(3)构建多元知识库,包括UMLS同义词库、非结构化知识库和利用LLM生成辅助知识库;
(4)构建ICD编码模型,包括上下文编码模块、辅助知识筛选模块、多重注意力交互模块以及融合预测模块;
(5)采用二元交叉熵损失函数优化ICD编码模型,输出每个ICD编码的概率,实现对电子病历文本的ICD编码自动预测。
2.根据权利要求1所述的一种实现国际疾病分类的自动编码方法,其特征在于,所述步骤(2)实现过程如下:对于每位患者的电子病历,选择出院小结部分作为电子病历文本,将提取的电子病历文本与医生诊断的 ICD 编码关联,形成训练数据;汇总所有患者的电子病历文本及其对应的 ICD 编码,形成ICD自动编码训练数据集;统计训练数据集中出现的全部 ICD 编码,并汇总每条训练样本的 ICD 编码作为训练集标签。
3.根据权利要求1所述的一种实现国际疾病分类的自动编码方法,其特征在于,所述步骤(3)实现过程如下:UMLS同义词库:通过ICD编码与UMLS概念唯一标识符(CUI)对齐,提取同义术语集合;
非结构化知识库:检索ICD编码相关条目,提取疾病定义、症状描述及生理特征,构建结构化知识条目 ;
利用LLM生成辅助知识库:设计提示模板,通过Qwen大模型生成扩充文本。
4.根据权利要求1所述的一种实现国际疾病分类的自动编码方法,其特征在于,步骤(4)所述上下文编码模块为:采用RoBERTa预训练模型,分块编码临床文本,生成上下文表示:;
其中, 为第c个文本块的词向量, 为输出表示,T为块内词数,d为隐藏层维度。
5.根据权利要求1所述的一种实现国际疾病分类的自动编码方法,其特征在于,步骤(4)所述辅助知识筛选模块为:将多源知识条目编码为向量:
;
利用最大多样性筛选算法MDP,选择语义覆盖最广的M个知识向量,具体问题如下:;
其中, 为余弦距离, 为选择变量,最终得到
。
6.根据权利要求1所述的一种实现国际疾病分类的自动编码方法,其特征在于,步骤(4)所述多重注意力交互模块由标签注意力机制以及交叉注意力机制组成;
标签自注意力是建模ICD编码之间的全局依赖关系,解决长尾分布中低频标签语义稀疏的问题;输入为临床文本的上下文表示 和标签嵌入L;通过线性变换 将 映射为查询向量Q,键向量K直接采用 本身,值向量V则为 的原始语义表示;注意力权重α通过非线性激活函数tanh与softmax计算生成:;
其中, , 为可训练参数;接下来,通过将α应用于上下文表示 ,计算出特定于标签的上下文表示 ,而文档级别的特定于标签的表示 是通过对每个块的输出进行线性变换并汇总后来生成的:;
其中, 是一个可学习的权重矩阵,C是块的总数;
交叉注意力机制包括标签‑上下文交叉注意力和知识‑上下文交叉注意力,其中,标签‑上下文交叉注意力旨在对齐ICD编码与临床文本的细粒度语义,精准定位与诊断代码相关的关键文本片段;知识‑上下文交叉注意力通过引入外部多源知识,填补临床文本与诊断代码间的语义鸿沟。
7.根据权利要求6所述的一种实现国际疾病分类的自动编码方法,其特征在于,所述标签‑上下文交叉注意力输入为标签嵌入L和临床文本表示 ;查询向量Q直接采用L,表示标签的语义需求;键K与值V均来自 ,表示文本的上下文特征;通过缩放点积注意力计算交互表示:;
其中, 是一个可学习的权重矩阵,C是块的总数;输出 中,每个标签向量聚合了与其语义最相关的文本片段。
8.根据权利要求6所述的一种实现国际疾病分类的自动编码方法,其特征在于,所述知识‑上下文交叉注意力通过引入外部多源知识输入为筛选后的知识表示 ,M为知识条目数,d代表模型隐藏层维度; 为临床文本表示,查询Q采用 ,表示外部知识的语义需求;键K为 ,值V为知识向量的平均池化结果 ,以聚合全局知识语义,注意力计算如下:;
其中,CA代表交叉注意力机制,最后输出 将外部知识语义注入文本表示中。
9.根据权利要求1所述的一种实现国际疾病分类的自动编码方法,其特征在于,所述融合预测模块为将多模态交互模块生成的标签、文本及知识表示进行融合,并通过轻量级卷积网络生成最终的ICD概率分布;将标签自注意力、标签‑上下文交叉注意力及知识‑上下文交叉注意力的输出叠加拼接为统一表示:;
其中,C为文本分块数,3d为三种注意力输出的拼接维度;然后通过两级一维卷积与非线性激活函数,将融合表示映射为ICD编码的概率分布:;
其中,第一层卷积用于从融合表示中提取局部语义模式,LeakyReLU激活函数用于缓解梯度消失问题,第二层卷积用于将中间特征映射到ICD标签空间,生成多标签概率分布。
10.根据权利要求1所述的一种实现国际疾病分类的自动编码方法,其特征在于,步骤(5)所述采用二元交叉熵损失函数优化ICD编码模型实现过程如下:;
其中, ,表示第j个ICD编码的真实标签,1表示存在,0表示不存在,表示模型对第j个ICD编码的预测概率; 为ICD编码标签总数。