1.一种基于网页标签分析的数据自动采集方法,其特征在于,包括以下步骤:步骤S1:获取目标采集网页数据;对目标采集网页数据进行响应代码解析,生成初始DOM树快照数据;根据初始DOM树快照数据进行簇间结构特征提取,从而得到初始DOM树结构特征数据;其中,步骤S1具体为:步骤S11:获取目标采集网页数据;
步骤S12:根据目标采集网页数据进行初始网页响应处理,生成初始页面响应数据;
步骤S13:对初始页面响应数据进行响应代码解析,生成初始DOM树快照数据;
步骤S14:根据初始DOM树快照数据进行有效标签图构建,从而得到有效标签关系图数据;
步骤S15:通过预设的内部簇紧密度数据对有效标签关系图数据进行最优簇数量计算,生成最优簇数量数据;
步骤S16:根据最优簇数量数据进行层次聚类分析,生成节点层次聚类数据;
步骤S17:对节点层次聚类数据进行簇间结构特征提取,从而得到初始DOM树结构特征数据;
步骤S2:根据初始DOM树结构特征数据进行页面动态加载监听,生成页面动态加载数据;对页面动态加载数据进行快照节点结构变化检测,生成页面动态结构变化数据;根据页面动态结构变化数据进行动态标签组合处理,得到动态标签组合数据;根据动态标签组合数据进行品牌口碑标签识别,生成品牌口碑标签数据;其中,步骤S2具体为:步骤S21:根据初始DOM树结构特征数据进行页面动态加载监听,生成页面动态加载数据;
步骤S22:对页面动态加载数据进行动态DOM树快照捕捉,生成动态DOM树快照数据;
步骤S23:通过动态DOM树快照数据对初始DOM树结构特征数据进行快照节点结构变化检测,生成页面动态结构变化数据;
步骤S24:对页面动态结构变化数据进行时间戳标记,生成时序动态结构变化数据;
步骤S25:对时序动态结构变化数据进行标签频率提取,生成网页标签频率数据;
步骤S26:根据网页标签频率数据进行动态标签组合处理,得到动态标签组合数据;根据动态标签组合数据进行标签标注处理,生成动态标签标注数据;
步骤S27:基于预设的图神经网络模型通过有效标签关系图数据对动态标签标注数据进行标签识别迁移学习,生成动态标签识别模型;
步骤S28:将时序动态结构变化数据传输至动态标签识别模型进行品牌口碑标签识别,生成品牌口碑标签数据;
步骤S3:对品牌口碑标签数据进行实时元素识别,生成实时网页元素数据;根据实时网页元素数据进行自适应采集优化,生成自适应页面采集策略;根据自适应页面采集策略进行多模态品牌数据采集,生成多模态品牌数据;其中,步骤S3具体为:步骤S31:通过预设的浏览器插件架构对品牌口碑标签数据进行实时元素识别,生成实时网页元素数据;
步骤S32:根据实时网页元素数据进行自适应采集优化,生成自适应页面采集策略;
步骤S33:通过预设的网页数据采集规则对实时网页元素数据进行采样任务制定,得到采样任务数据;
步骤S34:对采样任务数据进行分布式队列处理,生成分布式采样任务数据;
步骤S35:基于分布式采样任务数据通过自适应页面采集策略进行多模态品牌数据采集,生成多模态品牌数据;
步骤S4:根据多模态品牌数据进行多模态数据融合,得到融合品牌数据;对融合品牌数据进行特征语义分析,生成语义分析数据;根据语义分析数据进行品牌倾向性评估,并进行商品口碑预测,从而得到商品口碑预测数据;其中,步骤S4具体为:步骤S41:对多模态品牌数据进行数据标准化处理,生成标准多模态品牌数据;
步骤S42:根据标准多模态品牌数据进行多模态数据融合,从而得到融合品牌数据;
步骤S43:对融合品牌数据进行自然语言处理,生成融合品牌文本数据;
步骤S44:通过预设的口碑关键词提取规则对融合品牌文本数据进行品牌口碑关键词提取,生成口碑关键词数据;
步骤S45:通过口碑关键词数据对融合品牌文本数据进行特征语义分析;
步骤S46:利用情感分析算法对语义分析数据进行品牌倾向性评估,生成品牌情感倾向分数;
步骤S47:根据品牌情感倾向分数进行商品口碑预测,生成商品口碑预测数据。
2.根据权利要求1所述的基于网页标签分析的数据自动采集方法,其特征在于,步骤S14包括以下步骤:步骤S141:对初始DOM树快照数据进行树层次遍历,生成树层次遍历数据;
步骤S142:根据树层次遍历数据进行节点类型划分,生成节点类型数据;
步骤S143:对节点类型数据进行有效标签节点检查,得到有效标签节点数据;
步骤S144:对有效标签节点数据进行子节点递归遍历,生成父子节点关系数据;对有效标签节点数据进行同级节点遍历,生成兄弟节点关系数据;
步骤S145:通过父子节点关系数据以及兄弟节点关系数据对有效标签节点数据进行图数据结构构建,生成节点图结构数据;
步骤S146:根据节点图结构数据进行有向标签关系图绘制,生成有效标签关系图数据。
3.根据权利要求1所述的基于网页标签分析的数据自动采集方法,其特征在于,步骤S32包括以下步骤:步骤S321:根据实时网页元素数据进行用户交互监听,生成用户交互监听数据,步骤S322:利用用户交互监听数据进行页面热度图生成,从而得到修正热度图数据;
步骤S323:根据修正热度图数据进行页面采集策略制定,生成初始页面采集策略;
步骤S324:对修正热度图数据进行行为关键指标数据提取,生成行为关键指标数据;
步骤S325:根据行为关键指标数据进行重要性评估处理,生成关键指标评估数据;
步骤S326:根据关键指标评估数据进行自适应采集权重更新,得到实时采集特征权重数据;
步骤S327:利用实时采集特征权重数据对预设的初始采集率进行动态采集率调整,得到动态采集率数据;
步骤S328:通过动态采集率数据对初始页面采集策略进行自适应采集优化,生成自适应页面采集策略。
4.根据权利要求3所述的基于网页标签分析的数据自动采集方法,其特征在于,步骤S322包括以下步骤:步骤S3221:对用户交互监听数据进行交互事件分类处理,分别得到交互事件分类数据,其中交互事件分类数据包括用户交互行为事件数据、鼠标移动轨迹事件数据以及键盘输入事件数据;
步骤S3222:根据鼠标移动轨迹事件数据进行时序行为处理,生成时序行为点数据;根据键盘输入事件数据进行关键字提取,生成输入关键字数据;
步骤S3223:对时序行为点数据进行交叉轨迹分析,生成兴趣区域轨迹数据;
步骤S3224:通过兴趣深度算法对兴趣区域轨迹数据进行兴趣深度计算,从而得到兴趣深度数据;
步骤S3225:通过用户交互行为事件数据对兴趣深度数据进行页面热度图生成,生成页面热度图数据;
步骤S3226:利用输入关键字数据对页面热度图数据进行热度图修正,生成修正热度图数据。
5.根据权利要求4所述的基于网页标签分析的数据自动采集方法,其特征在于,步骤S3224中兴趣深度算法公式如下所示:式中,D(i)表示为第i个兴趣区域的兴趣深度数据,i表示为兴趣区域的索引值,t表示为第i个兴趣区域的停留时间,T表示为用户在页面上的总停留时间,e表示为自然常数,k表示为时间敏感性参数,Ti表示为第i个兴趣区域的关注时间阈值,n表示为时序行为点的数量,j表示为时序行为点的索引值,wj表示为第j个时序行为点的权重,xij表示为用户在第i个兴趣区域对第j个行为点的交互强度值,xˉj表示为所有兴趣区域对第j个行为点的平均交互强度值,L表示为网页总深度值。
6.根据权利要求1所述的基于网页标签分析的数据自动采集方法,其特征在于,步骤S46中情感分析算法公式如下所示:式中,S表示为品牌情感倾向分数,e表示为自然常数,m表示为语义分析数据中特征元素的总数,a表示为特征元素的索引值,wa表示为第i个特征元素的权重值,K表示为情感敏感度系数,Pa表示为第a个特征元素的正面口碑数量,Na表示为第a个特征元素的负面口碑数量,γ表示为情感极性调整因子,θa表示为第a个特征元素的情感极性角度值,Ra表示为第a个元素的相关性评分。