利索能及
我要发布
收藏
专利号: 2022105749779
申请人: 易运盈(山东)网络科技有限公司
专利类型:发明专利
专利状态:已下证
更新日期:2024-12-10
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种融合多源可靠信息的移动应用推荐方法,其特征在于,具体包括以下步骤:获取移动应用样本及其对应的扩展数据;

提取应用各界面函数信息、权限信息和上下文文本信息,将信息输入子功能分类器,子功能分类器的输出为各个类型子功能名称及对应的界面数量;子功能分类器的获取过程包括:对于不同类别的移动应用,分别选择m个应用,人工试用每个应用并遍历应用的所有界面,为每个界面的功能打上标签;

获取每个界面下使用的函数名以及申请的权限名,并根据系统组件使用的回调函数,定位每个界面的入口点,即入口组件的ID;

动态运行应用,遍历应用的所有界面,并获取各个界面的Activity名称以及包含的文本信息作为上下文信息,并将入口组件的文本加入上下文信息;

将上下文文本进行预处理,并进行分词和去停用词后按照从上到下的顺序进行排序,生成文本向量;

将每个子功能对应的界面的文本向量作为训练集的正集,其他界面的文本信息作为训练集的负集,对子功能分类器进行训练,得到完成训练的子功能分类器;

将子功能分类器的输出与用户使用该类应用的时间信息和位置信息作为输入,得到用户对于该应用的偏好值;用户对于应用a的偏好值表示为:Prefera=λ1PRtime+λ2PRposition+λ3SIMfunc,λ1+λ2+λ3=1其中,Prefera代表用户对于应用a的偏好值,PRtime为当前时间段用户使用该类应用的概率,PRposition为当前地点用户使用该类应用的概率;λ1、λ2、λ3分别为PRtime、PRposition、SIMfunc的影响因子;应用与用户使用的同类型应用的功能相似度SIMfunc表示为:其中,n为用户使用的同类型应用的数量, 代表该应用a与用户使用的某个同类型应用bi的相同功能比率, 为应用a与应用bi相同子功能对应的界面的总数量,SUM_UIa为应用a的界面的总数量;

将流行度数据输入可靠性分类器进行可靠性计算,并根据可靠性为数据分配可靠性权重;可靠性分类器的训练过程包括:爬取恶意应用在不同应用商店的流行度数据作为训练集的正集,爬取良性应用的流行度数据作为训练集的负集;

对训练集中每个应用的评论数据进行抽取,从评论数据中获取评论用户ID、评论内容、评分和评论时间信息;

获取每个应用在每个应用商店的流行度数据并进行特征提取,提取包括评分变化向量、排名变化向量、好评数量变化向量、相同评论内容比率、相似评论内容比率共5个维度的特征;

结合应用在不同应用商店的流行度数据,进行跨商店特征提取,提取包括不同商店内应用评分变化速率偏差值、不同商店内应用排名变化速率偏差值、不同商店内应用评论数量变化速率偏差值、相同评论内容比率、相似评论内容比率供5个维度的特征;

将获取的10个维度的特征作为可靠性分类器的输入,并根据可靠性分类器分类结果的准确率和召回率选择合适的分类算法,得到完成训练的可靠性分类器;

可靠性分类器对数据进行可靠性分类时,分别得出数据为可靠数据和不可靠数据的概率,用户设定可靠阈值和不可靠阈值,当可靠概率大于设置可靠阈值且不可靠概率小于设置的不可靠阈值的数据设为可靠数据,将可靠概率小于设置的可靠阈值且不可靠概率大于设置的不可靠阈值的数据设置为不可靠数据;否则,将数据设置为可疑数据,在为每种数据分配权重时,令可靠数据的权重>可疑数据的权重>不可靠数据的权重;

根据应用的流行度数据以及其对应的可靠性权重,计算应用的流行度,包括:POPA=kλkRank(∑βmDatam),λ1+λ2+…+λk=1其中,POPA表示应用A的流行度;βm表示为第m个流行度数据Datam分配的可靠性权重,Rank函数计算得到该类型流行度数据在相同偏好值应用中的排名,λk为各类型流行度数据对于流行度值的影响因子;

根据用户对该应用的偏好值和应用的流行度综合进行排序,将排序的前N个应用推荐给用户。

2.一种融合多源可靠信息的移动应用推荐装置,其特征在于,用于实现权利要求1所述的一种融合多源可靠信息的移动应用推荐方法,包括输入模块、应用功能程序提取模块、数据可靠性度量模块以及应用推荐模块,输入模块包括移动程序单元以及扩展数据单元,应用功能程序提取模块包括应用解析模块、上下文信息提取模块以及功能分类模块,数据可靠性度量模块包括多元数据搜集模块、可靠性分析模块以及流行度计算模块,其中:移动程序单元,用于存储应用样本;

扩展数据单元,用于获取应用样本的应用描述信息、应用类别以及该应用的流行度信息,流行度信息包括用户评论信息、评分信息、排名信息;

应用解析模块,用于对应用样本各个界面使用的函数信息以及函数对应的应用权限信息;

上下文信息提取模块,用于获取应用样本的上下文信息;

功能分类模块,用于获取应用样本的子功能;功能分类模块为一个子功能分类器,子功能分类器的获取过程包括:对于不同类别的移动应用,分别选择m个应用,分别人工试用每个应用并遍历用用的所有界面,为每个界面的功能打上标签;

获取每个界面下使用的函数名以及申请的权限名,并根据系统组件使用的回调函数,定位每个节点的入口点,即入口组件的ID;

动态运行应用,遍历应用的所有界面,并获取各个界面的Activity名称以及包含的文本信息作为上下文信息,并将系统组件的文本加入上下文信息;

将上下文文本进行预处理,并进行分词和去停用词后按照从上到下的顺序进行排序,生成文本向量;

将每个子功能对应的界面的文本向量作为训练集的正集,其他界面的文本信息作为训练集的负集,对子功能分类器进行训练,得到完成训练的子功能分类器;

多元数据搜集模块,用于爬取在不同移动应用商店中各个时间段不同应用类型的流行度数据;

可靠性分析模块,用于根据多元数据搜集模块爬取的流行度数据对相关数据的可靠性进行度量;可靠性分类器的训练过程包括:爬取恶意应用在不同应用商店的流行度数据作为训练集的正集,爬取良性应用的流行度数据作为训练集的负集;

对训练集中每个应用的评论数据进行抽取,从评论数据中获取评论用户ID、评论内容、评分和评论时间信息;

获取每个应用在每个应用商店的流行度数据并进行特征提取,提取包括评分变化向量、排名变化向量、好评数量变化向量、相同评论内容比率、相似评论内容比率共5个维度的特征;

结合应用在不同应用商店的流行度数据,进行跨商店特征提取,提取包括不同商店内应用评分变化速率偏差值、不同商店内应用排名变化速率偏差值、不同商店内应用评论数量变化速率偏差值、相同评论内容比率、相似评论内容比率供5个维度的特征;

将获取的10个维度的特征作为可靠性分类器的输入,并根据可靠性分类器分类结果的准确率和召回率作为衡量可靠性分类器的标准进行训练,得到完成训练的可靠性分类器流行度计算模块,用于根据流行度数据以及可靠性计算每个应用的流行度;

应用推荐模块,用于根据应用的流行度和用户对每个类型应用的偏好获取综合排序,并推荐排序最靠前的N个应用给用户。