1.一种基于多视角二分k-means的高校图书馆用户画像模型构建方法,其特征在于,该高校图书馆用户画像模型以读者在图书馆产生的行为数据为基础,首先,从多个业务系统中通过ETL等数据清理工具将数据汇总,利用处理及汇总后数据构建多维度多视角的读者特征体系;然后,通过基于马氏距离的多视角二分k-means算法进行多视角聚类得出若干个读者群体,根据读者群体的特征提取用户特征;最后,利用可视化工具构建读者用户画像,并根据用户画像实现对读者的精准推荐和服务。
2.如权利要求1所述的基于多视角二分k-means的高校图书馆用户画像模型构建方法,其特征在于,所述方法包括以下步骤:第一步,原始数据收集处理
图书馆用户画像,是尽可能地从海量的行为数据中挖掘出隐藏的信息,从而勾画出用户的信息全貌,在高校图书馆中的用户行为数据来自于许多不同的数据库,所取到的数据为读者信息表(reader_info)、电子资源使用表(electronic_resources)、图书借阅表(book_lend)、图书馆馆藏表(book_info)、进馆数据表(gate_info)、IC空间使用数据(IC_use_info)、自助文印使用数据(print_info);由于收集来的原始数据来自于各个不同的库,所以通过etl工具对数据进行清洗后,整合成统一规范的数据格式;
第二步,构建多维度多视角的读者特征体系
用户特征包含显性特征和隐性特征,在图书馆用户画像中,显性特征即读者的基本信息,包括学院、专业、年级和性别,由读者的显性特征构建读者特征维度,从某个维度或多个维度结合对读者进行划分;读者的隐性特征能够更好地反映读者需求,读者的隐性特征包括读者活跃度、读者借阅率、电子资源使用率、公共资源使用率和读者借阅书籍文本特征这五个不同的视角特征;
2.1)读者活跃度
读者活跃度计算公式为
式中:RA代表读者活跃度;T为在时间区间内的进馆次数;D为读者在数据集时间区间内在图书馆的有效天数;
2.2)读者借阅率
根据读者的借阅次数和进馆次数得出读者借阅率的计算公式为式中:LR为读者借阅率;L为读者借阅次数;T为进馆次数;
2.3)电子资源使用率
电子资源使用率的计算公式为
式中:IR为电子资源使用率;E为电子资源数据库集合;dx为在x库中的下载量;sx为在x库中的搜索量;T为进馆次数;
2.4)公共资源使用率
公共资源使用率的计算公式为
式中:PR为公共资源使用率;pt为自助文印使用次数;st为座位预约使用次数;rt为阅读空间使用次数,以上使用次数均为该资源预约使用次数,从预约记录和使用记录中获取;
T为进馆次数;
2.5)读者借阅书籍文本特征
对书籍信息进行向量化表示,向量的每一维由特征项及其权重组成,权重用TF-IDF的方法来计算,计算公式为式中:w(ti,d)为特征项ti在所有信息文本中的权重;d为所有信息文本的集合;tf(ti,d)为特征项ti在所有信息文本中的词频;N为信息文本的总数;ni为文本集中出现特征项ti的文本数;分母为归一化因子;
第三步,基于马式距离的多视角二分k-means算法对于样本矩阵X可以得到样本的均值、自相关矩阵和协方差矩阵计算公式为式中:μ为均值; 代表元素均为 的m维列矢量;S为自相关矩阵;Σ为协方差矩阵,因此样本Xi到样本总体X的马氏距离定义为输入多视角数据集D和聚类簇数k,基于马氏距离的多视角二分k-means算法流程如下:
3.1)将所有数据看作一个簇,计算簇中心;
3.2)while簇中心个数h
3.3)for i=1,2,…,h do;
3.4)将第i个簇使用k-means算法进行k为2的划分;
3.5)计算划分后马氏距离总和;
3.6)比较h种划分后的马氏距离总和,选择马氏距离总和最小的划分方式;
3.7)更新簇的分配方式;
3.8)添加新的簇中心;
3.9)untill簇中心个数达到k;簇划分C=C1,C2,C3,…,Ck。