利索能及
我要发布
收藏
专利号: 2016108346948
申请人: 南京邮电大学
专利类型:发明专利
专利状态:已下证
更新日期:2025-04-10
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种分布式垃圾短信识别方法,其特征在于,将待识别短信数据集合拆分成各个待识别短信子任务,各个待识别短信子任务分别包括至少一条待识别短信,各个待识别短信子任务分别发送至分布式系统中的各个节点进行处理,各个节点分别按如下步骤,根据预设检测器库中各个检测器内的各个垃圾短信关键词,针对所接收到的待识别短信子任务进行垃圾短信识别;

步骤000.根据预设垃圾关键词库,初始化检测器库中的各个检测器,然后进入步骤

001;

步骤001.由待识别短信子任务队列中提取一条未处理的待识别短信,作为当前识别短信,获取当前识别短信中的各个关键词Gene1,Gene2,Gene3…Genei,进入步骤002;步骤002.将当前识别短信中的各个关键词Gene1,Gene2,Gene3…Genei通过HashMap,获得所有包含有这些关键词的检测器Index的索引值的集合,进入步骤003;

步骤003.将得到的索引值集合通过m个HashSet,判断是否存在亲和力大于或等于预设匹配率阈值brake的检测器Index,是则判定当前识别短信为垃圾短信,将其加入垃圾短信库,并由AVL树中提取出利用该检测器Index,进入步骤004;否则说明检测器库中不存在能与当前识别短信匹配率达到预设匹配率阈值brake的检测器,则判定当前识别短信为正常短信,将其加入至正常短信库,进入步骤009;其中,m=Testlength*brake;

步骤004.由被判断为垃圾短信的当前识别短信中的各个关键词,构建若干新检测器,接着判断正常短信库中正常短信的条数是否大于或等于预设正常短信库比对条数阈值,是则进入步骤005;否则将各个新检测器加入到检测器库中,并进入步骤009;

步骤005.由正常短信库队列中提取一条未参与针对各个新检测器自检的正常短信,分别针对各个新检测器,将该正常短信中各个关键词与新检测器中各个垃圾短信关键词进行匹配,获得彼此匹配相同关键词的数量Count,并获得新检测器中垃圾短信关键词的数量N,再根据Count与N的比值,获得新检测器针对该正常短信的垃圾匹配率,进而分别获得各个新检测器针对该正常短信的垃圾匹配率,然后进入步骤006;

步骤006.分别针对各个新检测器,判断新检测器针对该正常短信的垃圾匹配率是否大于或等于预设垃圾匹配率阈值,是则说明新检测器把正常短信判断为垃圾短信,即新检测器为不合格检测器,删除该不合格的新检测器,否则不做进一步操作,然后进入步骤007;

步骤007.判断是否存在新检测器,是则进入步骤008;否则进入步骤009;

步骤008.判断正常短信库中是否存在未参与针对该各个新检测器自检的正常短信,是则返回步骤005;否则判断新检测器为合格检测器,将合格检测器加入到检测器库中,并进入步骤009;

步骤009.判断待识别短信子任务中是否存在未处理的待识别短信,是则返回步骤001;

否则针对该待识别短信子任务垃圾短信识别方法结束。

2.根据权利要求1所述一种分布式垃圾短信识别方法,其特征在于,所述步骤000具体包括:根据预设垃圾关键词库,初始化检测器库中的各个检测器,其中,使用AVL树的数据结构将检测器装入内存,并利用HashMap存储每个基因所在检测器Index的集合,其中key为Gene,value为所有含有该Gene的检测器Index的链表集合,然后进入步骤001。

3.根据权利要求2所述一种分布式垃圾短信识别方法,其特征在于:还包括针对所述检测器库中原有各个检测器,以及新加入的各个检测器,均定义生命周期时长属性,并初始化生命周期时长检测值;所述各个节点分别按所述步骤001至步骤009,针对所接收到待识别短信子任务执行垃圾短信识别的同时,进行计时,并分别针对检测器库中的各个检测器,判断在生命周期时长检测值结束时,检测器是否检测出垃圾短信,是则将该检测器的生命周期时长设置为永久,否则将该检测器删除。

4.根据权利要求3所述一种分布式垃圾短信识别方法,其特征在于:所述各个节点分别按所述步骤001至步骤009,针对所接收到待识别短信子任务执行垃圾短信识别的同时,还包括按预设第一时长周期间隔,分别针对生命周期时长为永久的各个检测器,针对检测器中未与短信关键词成功匹配过的关键词,由预设垃圾关键词库中随机选择垃圾关键词进行替换。

5.根据权利要求1至4中任意一项所述一种分布式垃圾短信识别方法,其特征在于:所述各个节点分别按所述步骤001至步骤009,针对所接收到待识别短信子任务执行垃圾短信识别的同时,还包括按预设第二时长周期间隔,针对所述检测器库中的检测器进行如下步骤操作:步骤a01.分别获得检测器库中各个检测器的垃圾短信成功匹配率,按垃圾短信成功匹配率由高至低顺序,选择预设检测器总数百分比数量的检测器,作为各个高成功匹配率检测器,并获得高成功匹配率检测器的个数M,然后进入步骤a02;

步骤a02.分别针对各个高成功匹配率检测器,获得高成功匹配率检测器的垃圾短信成功匹配率与M的乘积,作为该高成功匹配率检测器的复制数量,由此分别获得各个高成功匹配率检测器的复制数量,并获得所有高成功匹配率检测器的复制总数K,然后进入步骤a03;

步骤a03.分别按各个高成功匹配率检测器的复制数量,针对各个高成功匹配率检测器分别进行复制,并提取所有复制检测器中的关键词,构成复制关键词集合,然后进入步骤a04;

步骤a04.将复制关键词集合中的所有关键词随机分配为K组,构成K个重组检测器,并进入步骤a05;

步骤a05.判断正常短信库中正常短信的条数是否大于或等于预设正常短信库比对条数阈值,是则进入步骤a06;否则将该K个重组检测器加入到检测器库中;

步骤a06.按所述步骤005至步骤008的方法,分别针对该K个重组检测器进行自检,删除不合格重组检测器,并将合格重组检测器加入到检测器库中。

6.根据权利要求5所述一种分布式垃圾短信识别方法,其特征在于,所述步骤a06中,分别针对该K个重组检测器,分别执行如下步骤进行重组检测器自检;

步骤b01.由正常短信库中随机提取一条未参与针对该重组检测器自检的正常短信,按所述步骤005的方法,获得该重组检测器针对该正常短信的垃圾匹配率,并判断该垃圾匹配率是否大于或等于预设垃圾匹配率阈值,是则判断该重组检测器为不合格检测器,删除该不合格检测器;否则进入步骤b02;

步骤b02.判断是否还存在重组检测器,以及正常短信库中是否存在未参与针对该重组检测器自检的正常短信,是则返回步骤b01;否则判断该重组检测器为合格检测器,将该合格检测器加入到检测器库中。