1.基于低秩自适应技术的大语言模型优化系统,其特征在于,该优化系统包括:指令初步分析模块:提取初始指令关键词做检索词条,获取大模型可调用检索数据,分类成检索数据集,依检索数据集的子集数量分为初步与可舍弃检索数据集,舍弃后者;
数据比对模块:接收初步检索数据集,按子集数量降序排列,取前若干作为优选数据集,计算其在初步检索数据集中占比并与筛选比例阈值比对;并根据占比结果,将初步检索数据集或比对数据作作为首次检索结果,分析预估影响指数并发出核对指令;
指令优化模块:收到核对指令,按数据库分类标准对优选数据集二次分类,分析评估值,结合历史检索趋向输出优化指令,反馈后的指令为二级指令,筛选、输出二次分类检索数据,其中,历史检索趋向表示在相同检索词条下,各种分类标准的选取次数;
二次分类的数据分类评估值的分析过程如下:
调取数据库存储分类标准对优选数据集进行二次分类,并获取分类后分类集,其中,优选数据集为分类集的子集,并获取子集数量最大和最小的两个分类集,两个分类集中子集的数量分别记为 、 ;
当 ≥预设的均匀度阈值时,则发出分类不合格指令,并重新进行二次分类;反之,则发出分类合格指令,记录该二次分类对应的分类标准;
在接收到分类合格指令时,获取二次分类后所有分类集以及对应子集的数量,分别记为 、 ,并调取基于该分类标准下子集数量最大和最小的两个分类集,其中子集的数量分别记为 、 ;
通过分析公式:
得到
二次分类的数据分类评估值 ,式中, 表示二次分类后分类集的总数,表示第m个分类集, 表示第m个分类集对应的子集数量,
表示单位数据集合数量识别的速度, 表示第m个分类集中子集的数量,均为权重;
通过计算得到分类标准的评分系数 ;依据分类标准的评分系数 按照由大到小的顺序选取对应的分类标准,作为优化指令发出;
模型评估模块:获取优选数据集占比、预估影响指数及指令优化前后子集数量,生成模型优化效率评估系数,系数低于优化效果阈值时,调取优化方案修正策略;
其中,模型优化效率评估系数所依据的公式如下:
式
中, 表示模型优化效率评估系数,Y表示优化指令前优选数据集的总数,表示优化指令前第k个优选数据集, 表示优化指令前第k个优选数据集对应的子集数量, 表示初步检索数据集的总数, 表示第i个初步检索数据集,表示第i个初步检索数据集内的子集数量, 表示预估影响指数,X表示优化指令后优选数据集的总数, 表示优化指令后第x个优选数据集,表示优化指令前第x个优选数据集对应的子集数量, 分
别表示权重;
在初步检索数据集总数≤平均阅览量时, 记为1。
2.根据权利要求1所述的基于低秩自适应技术的大语言模型优化系统,其特征在于:在指令初步分析模块执行前,以清洗、预处理后的输入数据训练大语言模型,用低秩自适应技术对初始模型做低秩分解与优化;其中,输入数据通过所有训练层,再由训练层的输出与经过新参数调整的输入相结合,生成新的调整输出。
3.根据权利要求1所述的基于低秩自适应技术的大语言模型优化系统,其特征在于:检索数据集的子集表示:依据检索词条直接获取的检索数据;在对检索数据集进行分类时,将其与预设的舍弃阈值进行比对;
若检索数据集中子集的数量小于预设的舍弃阈值,则记为可舍弃检索数据集;
反之,则记为初步检索数据集;
其中,在依据二级指令进行检索时,如果可舍弃检索数据集中子集的数量增加,且增加数量与原子集数量的比值大于20%时,则发出复用指令,将对应的可舍弃检索数据集记为初步检索数据集;反之,则将对应的可舍弃检索数据集记为该检索词条下的非检索数据集。
4.根据权利要求3所述的基于低秩自适应技术的大语言模型优化系统,其特征在于:舍弃阈值的调整所依据的过程如下:设定调整比例 ;
获取当前检索词条下可舍弃检索数据集数量 和初步检索数据集数量,计算可舍弃检索数据集占初步检索数据集数量的比值 ,并将 与预设的舍弃比例阈值区间比对;
其中,舍弃比例阈值包括:舍弃上限阈值和舍弃下限阈值;
当 >舍弃上限阈值或 <舍弃下限阈值时,则发出调整指令,并执行调整策略,计算所有检索数据集的平均子集数量 ;当平均子集数量 >舍弃上限阈值×时,则发出上调指令,以 ×舍弃上限阈值作为调整后的舍弃上限阈值;当平均子集数量 <舍弃下限阈值× 时,则发出下调指令,以×舍弃下限阈值作为调整后的舍弃下限阈值;
反之,则不作响应。
5.根据权利要求4所述的基于低秩自适应技术的大语言模型优化系统,其特征在于:优选数据集占比分析过程如下:从数据库中调取前n次检索指令下的平均阅览量、当前阅览量和当前阅览总时长;
以平均阅览量作为从初步检索数据集中选取的数量,选取的初步检索数据集记为优选数据集,其中,当初步检索数据集总数≤平均阅览量时,则发出提前输出指令,以所有的初步检索数据集作为检索结果输出;反之,则将优选数据集在所有初步检索数据集中的占比与预设的筛选比例阈值进行比对;
在接收到提前输出指令时,当前阅览量≥平均阅览量且当前阅览总时长≤预设的阅览时长时,则发出调用指令,调取可舍弃检索数据集作为非常规检索数据集输出;反之,则生成当前阅览量下各检索数据集的停留时间分布图,并将未达到预设标准时长的检索数据集作为筛选标准,在未阅览的检索数据集中去除与筛选标准相同分类的检索数据集。
6.根据权利要求5所述的基于低秩自适应技术的大语言模型优化系统,其特征在于:预估影响指数的分析过程如下:调取前L次检索过程中,可舍弃检索数据集数量以及可舍弃检索数据集转化为初步检索数据集的数量,分别记为 、 ;
通过计算得到平均转化比例 ;
调度初步检索数据集和可舍弃检索数据集以及其内子集的数量,分别记为 、、 、 ;
通过分析计算,得到预估影响指数 ;
当预估影响指数 >预设的影响风险阈值时,则发出数据输出指令,按照所排顺序将初步检索数据集作为检索结果输出;反之,则发出合格指令,开始执行核对指令。
7.根据权利要求1所述的基于低秩自适应技术的大语言模型优化系统,其特征在于:修正策略:在模型优化效率评估系数低于优化效果阈值时开启,依据评分系数由大到小的顺序依次选取对应的分类标准,并分别计算对应的模型优化效率评估系数,之后再与优化效果阈值比对,选取模型优化效率评估系数低于预设的优化效果阈值时对应的分类标准,作为优化方案输出。
8.基于低秩自适应技术的大语言模型优化方法,使用权利要求1至7中的任一种所述系统,其特征在于,该优化方法包括如下步骤:将经过清洗和预处理的输入数据作为大语言模型训练的数据集,对大语言模型进行训练,再由低秩自适应技术对初始模型进行低秩分解和优化,其中,低秩分解是将原始的高维参数矩阵分解为两个或多个低秩矩阵的乘积;
提取所接收初始指令中的关键词作为检索词条,获取大语言模型可调用的检索数据,并按照类型分为对应的检索数据集,之后依据检索数据集中子集的数量分为初步检索数据集和可舍弃检索数据集,将可舍弃检索数据集舍弃;
在接收到初步检索数据集时,依据初步检索数据集中子集的数量由大到小排序,选取前若干个初步检索数据集作为优选数据集,并将优选数据集在所有初步检索数据集中的占比与预设的筛选比例阈值进行比对,当占比小于筛选比例阈值时,则按照所排顺序将初步检索数据集作为检索结果输出;反之,则将比对数据作为第一次检索结果输出,并分析核对指令执行的预估影响指数,发出核对指令;
在接收到核对指令时,按照数据库存储的分类标准,对优选数据集进行二次分类,并分析二次分类的数据分类评估值,将其与历史检索趋向结合选取对应的分类标准作为优化指令输出,之后将优化指令反馈后的指令记为二级指令,对二次分类后的检索数据进行筛选与输出;
获取检索过程中优选数据集在初步检索数据集中的占比、预估影响指数以及指令优化前后优选数据集的子集数量,生成模型优化效率评估系数,并在模型优化效率评估系数低于预设的优化效果阈值时,调取优化方案修正策略。