利索能及
我要发布
收藏
专利号: 2018105727260
申请人: 武汉酷犬数据科技有限公司
专利类型:发明专利
专利状态:已下证
更新日期:2026-09-16
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种通用的网页主题内容提取方法,其特征在于,包括以下步骤:

步骤1,构建目标网页的DOM树,对所述DOM树的节点进行清理,并按照与正文内容的相关性对所述DOM树的剩余节点进行属性标记;

步骤2,遍历属性标记后的DOM树,将DOM树的剩余节点分类缓存为图片节点、日期节点、正文文本节点或可视标题节点;

步骤3,根据所述图片节点、所述日期节点以及所述正文文本节点分别与所述可视标题节点的距离判断所述图片节点的内容、所述日期节点的内容以及所述正文文本节点的内容是否为主题内容,并根据判断结果完成对目标网页主题内容的提取,所述主题内容包括正文图片、发布时间和正文;

其中,根据已缓存的正文文本节点提取正文具体包括以下步骤:

将所有可能的正文文本节点按照节点计数序号进行升序排序;

找到所有可能的正文文本节点中,第一个节点计数序号大于可视标题节点的节点计数序号的第一目标节点,且所述第一目标节点的句子数大于0或者第一目标节点的内容词语与可视标题节点的内容词语具有相关性,将所述第一目标节点记为p1节点;

以所述p1节点为起点向前反向找到与所述p1节点的节点计数序号差值小于3,且访问路径相似的第二目标节点,并替换为p1,然后重复本步骤,直到找不到新的第二目标节点为止;

清理所述p1节点之前的所有可能的正文文本节点,并对剩余的所有可能的正文文本节点按照节点访问路径进行分组,且各分组内部按照节点计数序号进行升序排序,分组之间按照各分组的第一个节点的节点计数序号进行升序排序;

计算每个分组的预设参数值,并将所述预设参数值导入到预先训练的预测模型进行打分,生成分数大于预设分值的目标分组;

将所有目标分组中的节点按照节点计数序号进行升序排序,并形成文本节点集合;

缓存所述文本节点集合。

2.根据权利要求1所述的通用的网页主题内容提取方法,其特征在于,所述步骤1具体包括以下步骤:S101,下载目标网页的源代码,并将所述源代码解析为一个DOM树;

S102,获取并缓存所述DOM树中title标签节点的内容,同时对title标签节点的内容进行中文分词和去除停用词,生成包括若干标题词语的标题词语集合;

S103,使用深度优先的方式遍历所述DOM树,清理所述DOM树中预设类型的节点后,判断剩余节点的id属性、class属性和/或style属性是否满足第一预设条件,并根据判断结果对所述剩余节点进行属性标记为确定与正文无关的元素、可能与正文无关的元素和其它元素。

3.根据权利要求2所述的通用的网页主题内容提取方法,其特征在于,所述步骤2具体包括以下步骤:S201,选择DOM树的body元素作为进行深度优先递归遍历的起始节点,生成DOM树中每个剩余元素对应的节点访问路径;

S202,根据DOM树中剩余元素的属性标记信息,将可能与正文无关的元素和其它元素均作为待收集元素,对所述待收集元素进行信息收集并分类缓存为图片节点、作者节点、日期节点、正文文本节点或可视标题节点。

4.根据权利要求3所述的通用的网页主题内容提取方法,其特征在于,步骤S202中,对所述待收集元素进行信息收集并分类缓存具体包括以下步骤:步骤a,判断所述待收集元素的元素标签是否是img标签,若是,则收集并缓存所述待收集元素为图片节点,若否,则执行步骤b;

步骤b,判断所述待收集元素的id属性或class属性是否包含image、photo或gallery标签,若否,则执行步骤c,若是,则判定所述待收集元素为确定的图片信息块节点,并全局标记DOM树的遍历进入图片信息收集块,当遍历所述待收集元素的子节点时,判断所述子节点是否为图片节点,若是,则收集并缓存所述子节点为图片节点,若否,则继续判断下一个待收集元素;

步骤c,判断所述待收集元素的id属性或class属性是否包含author、writtenby或byline标签,若否,则执行步骤d,若是,则判定所述待收集元素为确定的作者信息块节点,并全局标记DOM树的遍历进入作者信息收集块,当遍历所述待收集元素的子节点时,判断所述子节点是否为作者节点,若是,则收集并缓存所述子节点为作者节点,若否,则继续判断下一个待收集元素;

步骤d,判断所述待收集元素的id属性或class属性是否包含article、post、main或content标签,若否,则执行步骤e,若是,则判定所述待收集元素为确定的正文信息块节点,并全局标记DOM树的遍历进入正文信息收集块,同时如果当前全局没有收集确定的正文信息块而仅收集了非确定的正文信息块,则清空当前已收集的非确定的正文信息块;

步骤e,判定所述待收集元素是否有子元素,如果有子元素,则判断所述子元素是否可以被整合替换,如果可以,则将所有子元素的内容整合之后替换为所述待收集元素的内容,并执行步骤f,若不可以,则直接执行步骤f;

步骤f,遍历所述待收集元素的所有子节点并逐一处理,处理方法为:判断所述子节点的类型,如果子节点为元素节点,则全局节点计数加一,并返回步骤a再次进行递归深度遍历,若子节点为文本子节点,则对所述文本子节点的内容进行识别,根据识别结果将所述文本子节点缓存为可视标题节点、日期节点或可能的正文文本节点;

在进行以上深度优先递归遍历过程中,记录DOM树中待收集元素的节点计数序号、文本节点计数序号以及节点访问路径。

5.根据权利要求4所述的通用的网页主题内容提取方法,其特征在于,所述步骤3中根据已缓存的日期节点提取发布时间具体包括以下步骤:清理所有日期节点中的无效节点,所述无效节点为节点计数序号在第一个所述第一目标节点之后的节点;

获取清理后的剩余日期节点中离可视标题节点最近的目标日期节点,且所述目标日期节点的节点计数序号差值低于第一预设值,文本节点计数序号差值低于第二预设值。

6.根据权利要求5所述的通用的网页主题内容提取方法,其特征在于,所述步骤3中根据已缓存的图片节点提取正文图片具体包括以下步骤:步骤001,将已缓存的图片节点按照按节点计数序号升序排序;

步骤002,获取目标图片节点,将目标图片节点以及目标图片节点之后的其它图片节点全部清理,所述目标图片节点为最靠近最后一个第一目标节点且节点计数序号差值大于第三预设值的图片节点;

步骤003,获取节点计数序号位于正文文本节点和可视标题节点之间的图片节点,记为插值图片节点,然后将位于可视标题节点之前且与可视标题节点的节点距离低于第四预设值的图片节点也记为插值图片节点,并并入到插值图片节点集合,同时对非插值图片节点进行缓存;

步骤004,获取每个插值图片节点与可视标题节点的节点计数序号的距离,并按照距离对所有的插值图片节点进行升序排序;

步骤005,根据预设筛选规则对所有插值图片节点进行预筛选,过滤掉与正文无关的无效图片;

步骤006,获取预筛选后剩余插值图片节点的节点访问路径,并在步骤003中的插值图片节点集合中找到节点访问路径相同的节点,然后重复步骤004和步骤005,对再次筛选出的插值图片节点和非插值图片节点进行整合。

7.一种通用的网页主题内容提取系统,其特征在于,包括DOM树处理模块、缓存模块和提取模块,所述DOM树处理模块用于构建目标网页的DOM树,对所述DOM树的节点进行清理,并按照与正文内容的相关性对所述DOM树的剩余节点进行属性标记;

所述缓存模块用于遍历属性标记后的DOM树,将DOM树的剩余节点分类缓存为图片节点、日期节点、正文文本节点或可视标题节点;

所述提取模块用于根据所述图片节点、所述日期节点以及所述正文文本节点分别与所述可视标题节点的距离判断所述图片节点的内容、所述日期节点的内容或所述正文文本节点的内容是否为主题内容,并根据判断结果完成对目标网页主题内容的提取,所述主题内容包括正文图片、发布时间和正文;

所述提取模块包括正文提取模块,所述正文提取模块具体包括:

第一排序单元,用于将所有可能的正文文本节点按照节点计数序号进行升序排序;

第一目标节点生成单元,用于找到所有可能的正文文本节点中,第一个节点计数序号大于可视标题节点的节点计数序号的第一目标节点,且所述第一目标节点的句子数大于0或者第一目标节点的内容词语与可视标题节点的内容词语具有相关性,将所述第一目标节点记为p1节点;

循环单元,用于以所述p1节点为起点向前反向找到与所述p1节点的节点计数序号差值小于3,且访问路径相似的第二目标节点,并替换为p1,直到找不到新的第二目标节点为止;

分组单元,用于清理所述p1节点之前的所有可能的正文文本节点,并对剩余的所有可能的正文文本节点按照节点访问路径进行分组,且各分组内部按照节点计数序号进行升序排序,分组之间按照各分组的第一个节点的节点计数序号进行升序排序;

打分单元,用于计算每个分组的预设参数值,并将所述预设参数值导入到预先训练的预测模型进行打分,生成分数大于预设分值的目标分组;

第一提取单元,用于将所有目标分组中的节点按照节点计数序号进行升序排序,并形成文本节点集合,且缓存所述文本节点集合。

8.根据权利要求7所述的通用的网页主题内容提取系统,其特征在于,所述DOM树处理模块包括:解析单元,用于下载目标网页的源代码,并将所述源代码解析为一个DOM树;

标题词语生成单元,用于获取并缓存所述DOM树中title标签节点的内容,同时对title标签节点的内容进行中文分词和去除停用词,生成包括若干标题词语的标题词语集合;

标记单元,用于使用深度优先的方式遍历所述DOM树,清理所述DOM树中预设类型的节点后,判断剩余节点的id属性、class属性和/或style属性是否满足第一预设条件,并根据判断结果对所述剩余节点进行属性标记为确定与正文无关的元素、可能与正文无关的元素和其它元素。

9.根据权利要求8所述的通用的网页主题内容提取系统,其特征在于,所述缓存模块包括:路径生成单元,用于选择DOM树的body元素作为进行深度优先递归遍历的起始节点,生成DOM树中每个剩余元素对应的节点访问路径;

缓存单元,用于根据DOM树中剩余元素的属性标记信息,将可能与正文无关的元素和其它元素均作为待收集元素,对所述待收集元素进行信息收集并分类缓存为图片节点、作者节点、日期节点、正文文本节点或可视标题节点。