1.一种基于特征选取的SVM级联分类器方法,其特征在于包括以下步骤:
步骤1:在开放的网络环境中获取所需的网络游戏与网络视频业务数据,并对该数据流进行基本的流量统计特征计算;
步骤2:利用基于特征选取的SVM级联分类器方法,确定每一级SVM分类器需要识别出的数据类型,以及能有效区分出该类型数据与其他类型数据的最佳特征组合,具体步骤为:步骤3-1)对于样本空间P,由k种不同类型的数据组成,用矩阵S表示,共需设计出k-1级SVM分类器,首先设计第一级SVM分类器;
步骤3-2)对矩阵S进行无量纲化处理,由于实际环境中,大部分流统计特征的量级不同,首先对矩阵S中的元素进行无量纲化处理;
步骤3-3)随机选取训练集和测试集,从矩阵S的每种类型数据中随机选取出一定比例构成训练集S1,剩余的数据构成测试集S2;
步骤3-4)选取待识别类,修改类属性,选取矩阵S中的第一类数据作为待识别类,将训练集S1和测试集S2中对应待识别类的类属性改为1,其他类数据的类属性改为-1;
步骤3-5)离散化处理,以基于信息熵的连续型数据离散化方法,对训练集S1中的数据进行离散化处理;
步骤3-6)皮尔森相关系数和信息增益率的计算,计算离散后的训练集S1中特征与类之间以及特征内部之间的皮尔森相关系数和信息增益率;
步骤3-7)去除不相关特征,根据特征与类之间的信息增益率,对特征进行降序排列,去除信息增益率取值为0-0.5范围的特征;
步骤3-8)去除冗余特征,去除不相关特征后,依次对剩余特征进行两两比较,对于任意两个特征,若两者显著相关,则去除排序靠后者,显著相关的判断方法为:若这两个特征均符合皮尔森相关系数的适用条件,即这两者之间存在线性关系且均符合或近似符合正态分布,则采用皮尔森相关系数表示两者的相关程度;若不符合,则采用信息增益率表示,若相关程度的指标值大于等于0.7,则认为这两个特征显著相关;
步骤3-9)选取每次实验的最佳特征组合,去除冗余特征后,选取前两名特征作为本次实验待识别类的最佳特征组合,记录下每次实验的最佳特征组合;
步骤3-10)分类实验,以训练集S1和最佳特征组合作为输入,训练出能够区分该待识别类和其他类数据的SVM分类器,训练完成后,以测试集S2作为输入验证SVM分类器的正确性,同时记录下每次实验的正确率;
步骤3-11)分类正确率与最佳特征组合的选取,为了正确反映SVM分类器区分待识别类与其他类数据的正确率,重复M次步骤3-3至3-10中的实验,这M次实验中,每次实验均选取同一种数据为待识别类,计算M次实验的平均分类正确率作为区分该待识别类对应的分类正确率指标,从M次实验记录下的最佳特征组合中选择出现次数最多的两个特征,作为该待识别类最终的最佳特征组合;
步骤3-12)重新选取待识别类,依次选取其他类型的数据作为待识别类,重复步骤3-3至3-11,记录下每个待识别类对应的分类正确率指标和最佳特征组合;
步骤3-13)选取出第一级SVM分类器需要识别出的数据,根据每个待识别类对应的分类正确率指标,选取出分类正确率最高的待识别类作为第一级SVM分类器需要识别出的数据类型,同时记录下该类型数据对应的最佳特征组合;
步骤3-14)依次设计下一级SVM分类器,去除矩阵S中第一级SVM分类器需要识别出的数据类型,以步骤3-3至3-13的方法设计第二级SVM分类器,以类似方法依次设计下一级SVM分类器;
步骤3:根据设计出的SVM级联分类器对原始的网络数据流进行分类实验,通过多次实验得到最后的分类结果。
2.根据权利要求1所述的基于特征选取的SVM级联分类器方法,其特征在于步骤1具体包括以下步骤:步骤2-1)在开放的网络环境中,通过网络分析工具抓取所需的网络游戏与网络视频数据流,然后将抓取的原始数据流保存成包含包到达时间、源IP地址、目的IP地址、协议、包尺寸的五列数据的标准文本格式;
步骤2-2)对原始的网络数据流进行基本的流量统计特征计算,这些特征包括:包间隔信息熵、包大小信息熵、字节速率、分组速率、包大小的均值与方差、包间隔的均值与方差。
3.根据权利要求1所述的基于特征选取的SVM级联分类器方法,其特征在于步骤3-3所述的一定比例优选为50%。
4.根据权利要求3所述的基于特征选取的SVM级联分类器方法,其特征在于步骤3-7中去除信息增益率的取值优选为0.4。
5.根据权利要求3所述的基于特征选取的SVM级联分类器方法,其特征在于步骤3-11中的M优选为10。
6.根据权利要求1所述的基于特征选取的SVM级联分类器方法,其特征在于步骤3中包括:根据设计出的SVM级联分类器对原始的网络数据流进行分类实验,通过多次实验得到最后的分类结果,具体步骤为:步骤6-1:随机选取训练集和测试集,从矩阵S的每种类型数据中随机选取出50%构成训练集S1,另外50%的数据构成测试集S2;
步骤6-2:训练每一级的SVM分类器,根据已经设计出的SVM级联分类器中,每一级需要识别出的数据类型及其对应的最佳特征组合,训练该级的SVM二分类器;
步骤6-3:测试分类正确率,以测试集S2作为输入,测试设计出的SVM级联分类器的分类正确率;
步骤6-4:计算平均正确率,重复步骤6-1至6-3的实验N次,计算N次实验的平均分类正确率作为SVM级联分类器的分类正确率。
7.根据权利要求6所述的基于特征选取的SVM级联分类器方法,其特征在于步骤6-4中的N优选为50。