利索能及
我要发布
收藏
专利号: 2016103130913
申请人: 广东工业大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-10-10
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.基于Storm的产品评论信息实时采集方法,其特征在于:该方法在基于Storm平台的采集系统进行,所述的采集系统包括产品抓取模块、预处理模块、调度模块、更新检测模块、评论信息抓取模块、HBase数据存储模块、访问间隔调整模块;该方法包括:a.产品抓取模块由时间触发服务器激活,周期性的从网络中抓取数据,获取产品的属性参数并存入到HBase数据存储模块中,同时检查新抓取到的产品Id是否已经存在待爬队列,如果已经存在则忽略,否则将其送到预处理模块进行预处理;

b.预处理模块根据产品Id初始化产品的属性参数,将初始化后的产品Id经过url链接优化处理后放入待爬队列fetcher_queue;

c.调度模块不断的从fetcher_queue队列中读取数据,并将数据封装成Tuple发射到Storm集群中;

d.更新检测模块检查是否有新的评论产生,如果该产品有新评论产生,就将其送到评论信息抓取模块;

e.评论信息抓取模块对更新检测模块检测到有评论信息更新的产品进行分布式抓取;

f.访问间隔调整模块动态调整产品下一次采集的时间,包括以下步骤:

S1.获取产品历史最小更新频率fl、最大更新频率fu以及采集间隔interval;

S2.获取产品当前的采集次数nt、评论信息发生更新次数nc,计算出产品当前的更新频率fc=nc/nt;

S3.根据下列公式来调整产品的采集间隔interval,

next_interval=interval+Δt   (公式1)

其中μ(x)是单位阶跃函数,

S4.通过产品当前的评论量n、最近一次评论信息产生的时间间隔t1以及最近一次采集的产品评论信息的最大滞后时间t2作为其优先级量化因子,分别对n、t1、t2做0~1区间的归一化操作,按下式计算该产品此时的优先级p,重新放入待爬队列fetcher_queue;

2.如权利要求1所述的基于Storm的产品评论信息实时采集方法,其特征在于,预处理模块对产品进行预处理的步骤如下:S1.获取产品当前的评论总数和最近一次评论时间,根据评论总数和最近一次评论初始化其采集间隔interval;

S2.初始化产品的最大更新频率fu和最小更新频率fl,将产品Id经过url链接优化处理,然后将该产品的采集间隔和优化过的url链接放入频率初始化队列frequency_init_queue;只要frequency_init_queue不为空,频率初始化爬虫freCrawer即以该产品的采集间隔对该产品评论信息进行500次的采集,并记录评论信息发生更新的次数nc,采集结束后,计算其更新频率fc=nc/500,并用fc初始化产品的最大更新频率fu和最小更新频率fl;

S3.将预处理过后的产品Id经过url链接优化处理后放入待爬队列fetcher_queue。

3.如权利要求2所述的基于Storm的产品评论信息实时采集方法,其特征在于,更新检测模块获取产品最新的评论总数current_total,然后和产品的历史评论总数old_total对比,如果大于历史评论总数,则更新产品的历史评论总数、采集次数、评论信息发生更新次数以及最近一次采集时间,并将该产品发送给评论信息抓取模块进行评论信息采集,否则只更新产品的采集次数和最近一次采集时间。

4.如权利要求3所述的基于Storm的产品评论信息实时采集方法,其特征在于,所述的评论信息抓取模块分布式抓取的步骤如下:S1.获取该产品的最近一次评论时间recent_comments_time;

S2.根据更新检测模块的检测的结果,下载相应页数的评论信息;

S3.对下载的评论信息做进一步的清洗,找出对产品做出的最近一次评论时间,并更新该产品最近一次评论时间;

S4.将抓取的新的产品评论信息发送到HBase数据存储模块进行存储。