利索能及
我要发布
收藏
专利号: 2022116290070
申请人: 广东石油化工学院
专利类型:发明专利
专利状态:已下证
更新日期:2026-09-30
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种特征子集的选取方法,其特征在于,包括:获取高维特征数据;

对所述高维特征数据进行处理,得到目标随机森林模型,并基于所述目标随机森林模型的分析处理,得到特征重要性列表;

利用Spearman相关性对所述高维特征数据进行分析,得到特征互相关矩阵;

根据滑动窗口法,对各特征在所述特征互相关矩阵中的所在列进行处理,建立各特征预测数据集;

根据所述各特征预测数据集得到目标GRU模型,并基于所述目标GRU模型的分析处理,得到各特征拟合度量;

对所述特征重要性列表、所述特征互相关矩阵和各特征拟合度量进行特征关系型融合,得到各特征总体评价值;

不断对各特征总体评价值进行特征排序,从中剔除评价值最低的特征并判定剩余特征数量是否小于要求的特征数量,直至剩余特征数量不大于要求的特征数量;

将对应的剩余特征数据确定为特征子集。

2.如权利要求1所述的特征子集的选取方法,其特征在于,对所述高维特征数据进行处理,得到目标随机森林模型,具体包括:将所述高维特征数据划分为第一训练集和第一测试集;

将所述第一训练集导入随机森林以训练模型并采用网格搜索和交叉验证的方法对随机森林参数调优;

使用所述第一测试集对随机森林模型进行评估,得到所述目标随机森林模型及对应的各特征重要性。

3.如权利要求2所述的特征子集的选取方法,其特征在于,所述随机森林的构建过程包括:从所述第一训练集中随机有放回地抽样N次,使用对应的N个数据集合训练决策树模型;

从样本的M个属性中选取特征,以信息增益或基尼系数的策略作节点分裂特征;

重复上述步骤,直到节点不可分;

对N棵决策树集成,形成随机森林。

4.如权利要求1所述的特征子集的选取方法,其特征在于,所述基于所述目标随机森林模型的分析处理,得到特征重要性列表,具体包括:依次得到每个特征在随机森林中的重要性值,以得到所述特征重要性列表,所述重要性值的表示如下式:RandomForest→max{RFy}其中,RFy为第y个特征在随机森林中的重要性值。

5.如权利要求4所述的特征子集的选取方法,其特征在于,利用Spearman相关性对所述高维特征数据进行分析,得到特征互相关矩阵,具体如下式所示:SpearmanRelation→min{Ri,j},i≠j其中,Ri,j为第i个特征与第j个特征之间的相关系数。

6.如权利要求5所述的特征子集的选取方法,其特征在于,基于所述目标GRU模型的分析处理,得到各特征拟合度量,具体如下式所示:2

GRU Prediction→max{R‑adjusted}2

其中,R‑adjusted为调整决定系数。

7.如权利要求6所述的特征子集的选取方法,其特征在于,对所述特征重要性列表、所述特征互相关矩阵和各特征拟合度量进行特征关系型融合,得到各特征总体评价值,具体包括:采用下式计算:

2

其中,Fk为第k个特征的总体评价值;n为特征数量;SRk为第k个特征的R ‑adjusted值;

RFk为第k个特征在随机森林中的重要性值;Rk,为第k个特征与第j个特征之间的相关系数;

Ri,为第i个特征与第k个特征之间的相关系数。

8.一种特征子集的选取装置,其特征在于,包括:数据获取模块,用于获取高维特征数据;

特征重要性列表模块,用于对所述高维特征数据进行处理,得到目标随机森林模型,并基于所述目标随机森林模型的分析处理,得到特征重要性列表;

特征互相关矩阵模块,用于利用Spearman相关性对所述高维特征数据进行分析,得到特征互相关矩阵;

各特征预测数据集模块,用于根据滑动窗口法,对各特征在所述特征互相关矩阵中的所在列进行处理,建立各特征预测数据集;

各特征拟合度量模块,用于根据所述各特征预测数据集得到目标GRU模型,并基于所述目标GRU模型的分析处理,得到各特征拟合度量;

各特征总体评价值模块,用于对所述特征重要性列表、所述特征互相关矩阵和各特征拟合度量进行特征关系型融合,得到各特征总体评价值;

重复筛选模块,用于不断对各特征总体评价值进行特征排序,从中剔除评价值最低的特征并判定剩余特征数量是否小于要求的特征数量,直至剩余特征数量不大于要求的特征数量;

特征选择模块,用于将对应的剩余特征数据确定为特征子集。

9.一种计算机可读存储介质,其特征在于,所述计算机可读存储介质存储有计算机程序,其中,所述计算机可读存储介质所在设备执行所述计算机程序时,实现如权利要求1至7中任意一项所述的特征子集的选取方法。