利索能及
我要发布
收藏
专利号: 2023114016659
申请人: 安徽农业大学
专利类型:发明专利
专利状态:已下证
更新日期:2025-10-14
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于波动阈值与分割化的多意图口语理解方法,其特征在于,包括以下步骤:对于一段输入的话语将其编码为隐藏状态序列后得到初步预测的意图和槽值,将初步预测的槽值与意图转化为向量形式嵌入到模型中;

利用SD计算一个范围加权矩阵与输入的意图对应相乘,划定其范围后结合注意力机制融合意图检测和槽位填充结果的语义信息,使用波动阈值进行最终结果的判断输出;

所述对于一段输入的话语将其编码为隐藏状态序列后得到预测的意图和槽值的步骤包括:将输入的话语送入编码器,利用编码器将文本形式的话语转换成隐藏状态的序列;

基于编码器生成的隐藏状态序列,进行初步的槽位填充和意图检测操作,得到初步预测的槽值和意图;

所述利用编码器将文本形式的话语转换成隐藏状态的序列的步骤包括:用编码器将文本形式的话语转换成隐藏状态序列:  ;其中, 表示Transformer模型的输入和输出维度大小,所述编码器由两个Transformer编码器层组成;

所述将初步预测的槽值与意图转化为向量形式的步骤包括:初步预测的槽值和意图结果表示为:

          (1)

          (2)

通过softmax激活函数与全连接矩阵将未规范化的预测结果进行变换,得到槽值的结果向量和意图的结果向量:      (3)

      (4)

其中,是输出的槽值序列;是输出的意图的预测序列; 是输出槽值序列中对应的第j个;是槽标签的类别;是意图标签的类别;b是偏置矩阵;E是一个全连通矩阵;是经过激活函数变换后的第j个槽值的结果向量;是经过激活函数变换后的第j个意图的结果向量; 是输入的隐藏状态序列的第j个序列;softmax是一个激活函数;Pool是指平均轮询操作;表示将数据整合的连接操作;W是权重矩阵;y是做过平均轮询操作的平均值;

所述利用SD计算一个范围加权矩阵与输入的意图对应相乘,划定其范围后结合注意力机制融合意图检测和槽位填充结果的重要语义信息,使用波动阈值进行输出判断的步骤包括:在SD中,计算一个范围加权矩阵,利用所述范围加权矩阵,生成范围敏感的隐藏状态和结果嵌入向量;

通过使用注意力机制来指导融合意图检测和槽位填充结果的重要语义信息,将不同任务的结果进行集成,生成一个结果语义向量;

通过联合波动阈值的解码器,合并结果语义向量和范围敏感的隐藏状态,生成最终的任务结果并输出;

所述在SD中,计算一个范围加权矩阵,利用所述范围加权矩阵,生成范围敏感的隐藏状态和结果嵌入向量的步骤包括:计算一个权重矩阵 ,对其进行空间上的线性转换:         (5)

     (6)

其中,A是权重因子;W是一个全连通矩阵;W,I,S都存在于同一个欧氏空间中,计算范围隐藏状态和获得具有范围敏感结果嵌入的意图和槽值:       (7)

    (8)

        (9)

其中,表示范围敏感的隐藏状态序列,表示范围敏感的结果槽值嵌入向量,表示范围敏感的结果意图嵌入向量; 是指在这个 隐藏序列周围的所有话语信息向量; 是指在当前 槽值周围所有的槽值信息向量; 是指在当前 意图周围所有的意图信息向量;

是范围权重矩阵;

所述合并结果语义向量和范围敏感的隐藏状态的步骤包括:把范围敏感信息融入结果语义向量,利用范围信息获得综合隐藏状态序列:    (10)

其中,R是指融合了槽值与意图结果嵌入向量的高维度向量, ;FNN指全连接层;

Norm是一个规范化步骤,通过调整衰弱这一层的权重,对输出含有范围信息的隐藏状态序列进行L2正则化:    (11)

这里的W指的是综合隐藏状态序列输入层的权重值,这里的H就是综合隐藏状态序列,是前一阶段的输入,、、为可学习参数;

将综合隐藏状态序列带入后得到意图和槽值的最终结果:      (12)

    (13)

输出槽值和意图的概率:

       (14)

            (15)

其中, 表示意图结果的概率; 表示槽值结果的概率;

这里输出的结果带有标签概率信息,进一步通过波动阈值选择合适的意图与槽值进行最终结果输出;

所述通过波动阈值选择合适的意图与槽值进行最终结果输出的步骤包括:运用斯皮尔曼系数 与余弦相似度轮询对于每一个初预测意图和当前意图范围内的每个词进行计算,然后对系数 、进行调整,设置基准阈值记为 ,得出波动阈值为K,采用K值进行输出筛选,通过波动阈值K进行联合判断输出,选择标签概率大于阈值的意图与槽值进行输出;

其中,系数 、通过训练神经网络模型来调整,结合斯皮尔曼相关系数和余弦相似度的估计相似性得分得到, 是当前意图范围内的每个词,是每一个初预测意图的结果嵌入向量:      (16)

          (17)

其中,是斯皮尔曼系数; 是向量差异的平方和;n是样本容量。

2.根据权利要求1所述的基于波动阈值与分割化的多意图口语理解方法,其特征在于,在模型训练的过程中,还包括最小化整体损失的步骤:当总损失函数未达到预设条件时,迭代更新上述模型的参数,直至总损失函数达到预设条件;

其中,进行槽值和意图损失函数的计算:

       (18)

             (19)

          (20)

其中,K(*)表示经过波动阈值成功输出的意图; 表示汉明损失函数,汉明损失函数是一个指示函数,输出为0或1;

其中,BCE是一种常用于二分类问题的损失函数,BCE损失函数的定义如下,利用最大似然进行计算:    (21)

其中:是真实的标签,为0或1,表示样本的实际类别;是模型的预测输出,是一个介于0和1之间的值,表示模型对样本属于正类的置信度;表示自然对数;BCE损失函数的目标是最小化真实标签和模型预测之间的差异;

总体损失如公式(22)所示:

         (22)

其中 、、都是超参数,用于平衡三种损失对总损失的影响。