1.一种面向网页的可视化采集工具,其特征在于:包括web客户端,web客户端包括能加载于任一网页的可视化操作页面和任务配置页面,可视化操作页面包括新建任务按钮(600),拟采集网页显示区(100),悬浮于拟采集网页显示区域(100)内、当鼠标移动至拟采集网页上可点选区域后高亮显示的若干个拟采集区域(200),显示拟采集区域(200)拟采集结果的数据预览区域(300),对拟采集区域的拟采集结果满意欲保存拟采集结果的保存按钮(400),对拟采集区域的拟采集结果不满意欲放弃该拟采集结果的取消按钮(500);数据预览区域(300)又分为文本预览区(301)、URL预览区(302)和XPath预览区(303);
还包括任务管理服务器和数据采集服务器;所述web客户端与任务管理服务器互联,任务管理服务器与数据采集服务器互联,并通过如下流程进行采集:S1.web客户端新建基础采集任务,配置并发送拟采集网页的URL及各采集任务参数到任务管理服务器;
S2.任务管理服务器接收拟采集网页的URL经预处理得到网页的HTML源代码,HTML源代码清洗后生成唯一ID标识并返回给web客户端;
S3.web客户端根据接收到的HTML源代码和唯一ID标识进入可视化操作页面配置采集规则;
S4.web客户端在采集规则配置完成后,发送唯一ID标识和完整的采集规则至任务管理服务器保存;
S5.数据采集服务器从任务管理服务器获得唯一ID标识和采集规则,据此执行采集任务;
S6.数据采集服务器将执行采集任务产生的数据写入数据库和内存中,并将该数据以文件形式传送给web客户端;
S4的详细过程是:每个拟采集区域(200)点选后,在数据预览区域(300)的文本预览区(301)、URL预览区(302)和XPath预览区(303)展示拟采集区域(200)的文本、链接和XPath规则,并以递归循环HTML源代码DOM结构的方式,找到XPath规则节点相似组并在拟采集区域(200)中高亮显示;若展示的结果符合采集者的要求,按保存按钮(400)将XPath规则和唯一ID标识作为采集任务发送至任务管理服务器,否则点击取消按钮(500)结束任务;
任务管理服务器接收唯一ID标识和XPath规则,从其数据库中查询唯一ID标识指向的采集任务,并将XPath规则写入到采集任务数据中并将成功信息响应返回给web客户端的可视化操作页面;
web客户端的可视化操作页面接收到成功响应后,页面跳转至任务配置页面,并提示使用者立即执行还是延后执行采集任务;
选择立即执行,任务配置页面携带该任务的唯一ID标识异步发送请求至任务管理服务器,并提示任务已启动;选择延后执行,在延后时间到来后任务配置页面携带该任务的唯一ID标识异步发送请求至任务管理服务器,并提示任务已启动;
重复流程S1‑ S4,管理服务器可以得到多个任务。
2.根据权利要求1所述的一种面向网页的可视化采集工具,其特征在于:S1的详细过程是:web客户端启动后首先进入可视化操作页面,点击可视化操作页面上的新建任务按钮(600),进入任务配置页面,任务配置页面显示拟采集任务表单,拟采集任务表单必填的基础参数包括:拟采集任务自定义名称、拟采集网站的URL、页面类型,选填参数包括自定义COOKIE、分页规则;拟采集任务表单填写完成后点击下一步,所述web客户端将上述各项参数值发送至所述任务管理服务器。
3.根据权利要求1所述的一种面向网页的可视化采集工具,其特征在于:S2的详细过程是:任务管理服务器接收所述web客户端的各项的基础参数后,对拟采集网站的URL进行预处理,得到拟采集网站的HTML源代码,然后对拟采集网站的HTML源代码进行清洗,清洗HTML源代码中的标签及加入事先定义的脚本、样式文件,并把清洗后的HTML源代码和拟采集任务基础参数写入数据库,基础参数写入数据库后生成的唯一ID标识,并把唯一ID标识和清洗后的HTML源代码响应给所述web客户端。
4.根据权利要求1所述的一种面向网页的可视化采集工具,其特征在于:S3的详细过程是: web客户端接收到返回的清洗后的HTML源代码和唯一ID标识后, web客户端跳转进入可视化操作页面并使用
5.根据权利要求1所述的一种面向网页的可视化采集工具,其特征在于:S5的详细过程是:所述任务管理服务器接收任务的唯一ID标识,并根据唯一ID标识从数据库中获取任务完整配置信息,发送数据至数据采集服务器,数据采集服务器启用异步线程机制执行采集任务。
6.根据权利要求1所述的一种面向网页的可视化采集工具,其特征在于:S6的详细过程是:数据采集服务器接收任务完整配置信息后,获取并预处理配置信息中的拟采集URL得到网页HTML源代码;根据配置信息中的XPath规则,循环递归HTML源代码DOM结构得到节点相似组列表,并以特征处理得到节点相似组列表中的URL、文本信息并写入内存、数据库;采集任务执行期间,如果配置信息中分页规则非空,则循环预处理采集URL并以不同页数预处理不同页数的HTML源代码,最终以获取到重复数据为任务停止信号,任务停止后在数据采集服务器本地生成新文件,并将内存数据取出写入文件返回文件路径至任务管理服务器,任务管理服务器根据文件路径生成在线预览/下载URL返回web客户端。