利索能及
我要发布
收藏
专利号: 2021101696212
申请人: 中山大学
专利类型:发明专利
专利状态:已下证
更新日期:2025-11-27
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于样本边界值及集成多样性的数据分类方法,其特征在于:所述的方法步骤包括如下:

S1:将初始数据集划分为训练集Dtr、验证集Dva、测试集Dte;并采用bootstrap对训练集Dtr进行处理,得到采样集Dtr_t,1≤t≤T;

S2:对每个采样集Dtr_t采用基分类器进行训练,得到集成系统ES;利用集成系统ES的每个基分类器对验证集进行分类,得到验证集的分类预测结果矩阵;

S3:根据分类预测结果矩阵进行统计得到投票数向量、验证集样本个数NR,通过无监督形式的样本边界值度量标准算法计算出基分类器池中的每个分类器ht的平均边界值;

S4:计算关于数据集标签类别的概率分布,并引入J‑S散度,进而计算得到某个基分类器与其它基分类器之间的平均差异程度;

S5:结合平均边界值、平均差异程度进行综合度量,得到新的集成系统ES′,通过选取得到选择性集成后的分类器子集合ESnew;

S6:利用分类器子集合ESnew对测试集进行分类预测,获取最终的分类结果。

2.根据权利要求1所述的基于样本边界值及集成多样性的数据分类方法,其特征在于:步骤S1,采用bootstrap对训练集Dtr进行处理,具体如下:采用bootstrap进行m次有放回的随机采样,一直到bootstrap样本集中的样本数目与采样前的初始训练集的样本数目相同结束,重复T轮操作,得到T个包含m个训练样本的采样集Dtr_t,其中1≤t≤T,采样出的训练子集互不相同,且|Dtr_t|=|Dtr|。

3.根据权利要求1所述的基于样本边界值及集成多样性的数据分类方法,其特征在于:步骤S2,采用CART作基分类器,利用集成系统ES的每个基分类器对验证集进行分类,采用多数投票得到验证集的分类预测结果矩阵 其中,Rt=[CtT

(x1),Ct(x2),…,Ct(xi),…,Ct(xN′)]为分类器池中第t个基分类器对验证集的分类结果构成的向量。

4.根据权利要求1所述的基于样本边界值及集成多样性的数据分类方法,其特征在于:步骤S3,根据分类预测结果矩阵Mat,统计出验证集中各个样本属于每个类别的投票数矩阵对投票数矩阵Vote的各行元素进行降序排序,针对验证集中的每个样本xi得到其排序后的投票数向量

5.根据权利要求1所述的基于样本边界值及集成多样性的数据分类方法,其特征在于:步骤S3,将分类预测结果矩阵Mat与真实类标签向量对比,找出所有被正确分类的样本点Dva_t,并针对分类器池中的每个分类器,统计出被正确分类预测的验证集样本个数NR,公式如下:

式中,ht表示第t个基分类器,1≤t≤T;yi表示类标签;N′为验证集样本个数;I(ture)=

1,I(false)=0。

6.根据权利要求4或5任一项所述的基于样本边界值及集成多样性的数据分类方法,其特征在于:所述的无监督形式的样本边界值度量标准算法,其计算公式如下:针对验证集中某一个样本点(xi,yi)而言,其中, 代表投票数最多的类别的得票数,即集成系统中将样本(xi,yi)分类预测为c1类别的基分类器数量最多;而 代表投票数第二多的类别的得票数,依此类推, 代表投票数最少的类别的得票数;

计算出基分类器池中的每个分类器ht的平均边界值,其表达式如下:

7.根据权利要求6所述的基于样本边界值及集成多样性的数据分类方法,其特征在于:步骤S4,针对基分类器池中某一个分类器的分类预测结果:T

Rt=[Ct(x1),Ct(x2),…,Ct(xi),…,Ct(xN′)]计算其关于数据集标签类别的概率分布:T

Pt=(p1,p2,…,pl,…,pL)其中,pl为关于类别l的概率分布:根据J‑S散度计算得到两个不同分类器之间的J‑S散度为:其中,L为样本类别个数,T为基分类器个数,当基分类器池中两个不同的分类器之间的J‑S散度值越大,则表明其对应的分类结果的概率分布之间的信息差异越大。

8.根据权利要求7所述的基于样本边界值及集成多样性的数据分类方法,其特征在于:将第t个基分类器与其它基分类器之间的平均差异程度表示为:式中,1≤t≤T,1≤s≤T。

9.根据权利要求8所述的基于样本边界值及集成多样性的数据分类方法,其特征在于:步骤S5,结合平均边界值、平均差异程度,采用目标函数进行综合度量,其公式表达式如下:式中,λ∈[0,1]为正则化因子;

将基分类器池中的所有分类器按照TMD值进行降序排序,得到一个新的集成系统ES′={h1′,h2′,…,ht′,…,hT′},其满足TMD(h′t‑1)>TMD(h′t),0≤t≤T。

10.根据权利要求9所述的基于样本边界值及集成多样性的数据分类方法,其特征在于:通过选取前S个能使集成系统ES′在验证集上的平均分类正确率最大的基分类器,得到选择性集成后的分类器子集合:

ESnew=arg maxS,(1≤S≤T)accuracy(ES′)          (15)ESnew={h1′,h2′,…,hS′}                    (16)其中,