1.一种基于向量数据库的图书推荐方法,其特征在于,包括如下步骤:
S1、基于分布式存储系统,预备图书大数据P以及用户阅读行为大数据L,其中,所述分布式存储系统被配置为可识别词袋模型Bag of Words或词向量模型Word2Vec的数据库;
S2、在后台服务器的模型库中,预先部署词袋模型Bag of Words和词向量模型Word2Vec;
S3、预设模型随机轮询的方式,随机调取模型库中的词袋模型Bag of Words或词向量模型Word2Vec对所述图书大数据P进行图书向量提取,并判断两个模型是否都参与其中,若都参与其中,则生成不同维度下的图书特征向量,并基于所述图书特征向量构建对应的图书向量数据库;反之,重新利用两个模型轮询提取向量,其中所述图书特征向量包含图书类别、空间存放地址、名称、编号和图书属性;
S4、对所述用户阅读行为大数据L进行向量化处理‑embedding,生成对应不同维度下的用户阅读行为的行为特征向量;
S5、基于向量相似度的聚类,将向量相似的所述行为特征向量与所述图书特征向量进行最大相似度的聚类绑定;
S6、将所述向量数据库中各维度上的所述图书特征向量与所述行为特征向量,输入BERT预训练语言模型进行训练学习,生成相应的BERT模型,并将所述BERT模型部署后台服务器,用于图书推荐。
2.根据权利要求1所述的基于向量数据库的图书推荐方法,其特征在于,还包括:S7、前端用户登录后台服务器并输入图书爱好标签;
由所述后台服务器根据所述图书爱好标签,识别出所述前端用户对图书的行为爱好维度,并将所述行为爱好维度发送至所述BERT模型;
由所述BERT模型识别与所述行为爱好维度相匹配的所述行为特征向量,并输出所有与所述行为特征向量相互绑定的所述图书特征向量;
计算所述行为特征向量与对应的所述图书特征向量之间的相似度,并按照相似度的大小值排序,将各个所述图书特征向量依次写入预设的个性化图书推荐列表;
将所述个性化图书推荐列表发送至前端,供用户浏览并选择图书。
3.根据权利要求1所述的基于向量数据库的图书推荐方法,其特征在于,S1、基于分布式存储系统,预备图书大数据P以及用户阅读行为大数据L,其中,所述分布式存储系统被配置为可识别词袋模型Bag of Words或词向量模型Word2Vec的数据库,包括:在后台服务器上预设HDFS分布式文件系统,并进入所述HDFS分布式文件系统的配置中心,配置本次存储所述图书大数据P以及所述用户阅读行为大数据L的数据存储规则,其中,所述数据存储规则用于让所述HDFS分布式文件系统自动符合所述识别词袋模型Bag of Words或所述词向量模型Word2Vec的数据格式;
由所述HDFS分布式文件系统,向后台数据库发送包含所述数据存储规则的数据检索请求,请求调取并采集符合所述数据存储规则的所述图书大数据P以及所述用户阅读行为大数据L,并分别进行数据预处理;
将预处理的所述图书大数据P以及所述用户阅读行为大数据L,导入所述HDFS分布式文件系统,并将所述图书大数据P以及所述用户阅读行为大数据L,发送至管理节点‑‑‑master node;
所述管理节点‑‑‑master node统计各个存储节点‑‑‑data node的存储容量状态,并按照所述图书大数据P以及所述用户阅读行为大数据L的数据大小,分别为其分配对应的所述存储节点‑‑‑data node;
将所述图书大数据P以及所述用户阅读行为大数据L,分别保存在所分配的所述存储节点‑‑‑data node之中。
4.根据权利要求3所述的基于向量数据库的图书推荐方法,其特征在于,在步骤S2之前,还包括:建立所述模型库与所述HDFS分布式文件系统之间通信连接。
5.根据权利要求4所述的基于向量数据库的图书推荐方法,其特征在于,S3、预设模型随机轮询的方式,随机调取模型库中的词袋模型Bag of Words或词向量模型Word2Vec对所述图书大数据P进行图书向量提取,并判断两个模型是否都参与其中,若都参与其中,则生成不同维度下的图书特征向量,并基于所述图书特征向量构建对应的图书向量数据库;反之,重新利用两个模型轮询提取向量,包括:管理员向所述HDFS分布式文件系统发起请求,请求提取所述图书大数据P;
所述HDFS分布式文件系统响应该请求,由所述管理节点‑‑‑master node从对应的所述存储节点‑‑‑data node之中,提取出所述图书大数据P,并由所述HDFS分布式文件系统转发至所述模型库;
采用模型随机轮询的方式,选择所述词袋模型Bag of Words或者所述词向量模型Word2Vec,对所述图书大数据P进行图像向量提取,得到所述图书大数据P中由各个维度上的图书特征向量构成的图书特征向量数据集,其中所述图书特征向量包含图书类别、空间存放地址、名称、编号和图书属性;
按照上述模型随机轮询的方式,进行多轮提取后,合并相同维度上的图书特征向量,得到由各维度上的所述图书特征向量构成的所述图书特征向量数据集;在模型随机轮询的过程中,需要所述词袋模型Bag of Words和所述词向量模型Word2Vec均参与特征向量的提取过程中,后台对模型被调用的日志进行记录,轮询结束,判断是否存在未被调用的模型或者被调用次数占比少于1/2的模型:若存在,则生成不同维度下的图书特征向量;反之,则重新轮询提取特征向量或者增设该未被调用的模型或者被调用次数占比少于1/2的模型对特征向量的提取次数;
将所述图书特征向量数据集保存至预设的向量数据库的index数据存储中,构建得到本次用于图书推荐的图书向量数据库。
6.根据权利要求5所述的基于向量数据库的图书推荐方法,其特征在于,S3、对所述用户阅读行为大数据L进行向量化处理‑embedding,生成对应不同维度下的用户阅读行为的行为特征向量,包括:管理员向所述HDFS分布式文件系统发起请求,请求提取所述用户阅读行为大数据L;
所述HDFS分布式文件系统响应该请求,由所述管理节点‑‑‑master node从对应的所述存储节点‑‑‑data node之中,基于所述数据存储规则,提取出所述用户阅读行为大数据L,并由所述HDFS分布式文件系统转发至embedding模型;
在embedding模型中,对所述用户阅读行为大数据L进行数据向量化处理,提取并生成不同维度下的用户阅读行为的所述行为特征向量;
将所述行为特征向量独立保存至所述向量数据库的storage数据存储中。
7.根据权利要求6所述的基于向量数据库的图书推荐方法,其特征在于,S4、基于向量相似度的聚类,将向量相似的所述行为特征向量与所述图书特征向量进行最大相似度的聚类绑定,包括:采用聚类算法,将同一维度上的所述行为特征向量与所述图书特征向量聚集在一起,并通过向量的余弦距离公式,计算同一维度上的所述行为特征向量与所述图书特征向量之间的相似度;
按照所述行为特征向量与所述图书特征向量之间的相似度,找到所有与行为特征向量A相似的图书特征向量B:B={b1,b2,......},其中,b1,b2,......分别为与所述行为特征向量A相似的所述图书特征向量,将所述图书特征向量B中与所述行为特征向量A之间相似度排名前n的所述图书特征向量,与所述行为特征向量A进行绑定;
将各个维度上的所述行为特征向量A与对应的所述图书特征向量B的所述绑定关系,保存至所述向量数据库中。
8.根据权利要求7所述的基于向量数据库的图书推荐方法,其特征在于,S5、将所述向量数据库中各维度上的所述图书特征向量与所述行为特征向量,输入BERT预训练语言模型进行训练学习,生成相应的BERT模型,并将所述BERT模型部署后台服务器,用于图书推荐,包括:在后台服务器上部署BERT预训练语言模型;
将所述向量数据库中的各维度上的所述图书特征向量B以及与其绑定的所述行为特征向量A,作为不同维度上的训练数据特征并导入所述BERT预训练语言模型,并按照预设的迭代训练条件,进行特征学习训练,让所述BERT预训练语言模型学习识别各维度上的所述图书特征向量B以及与其绑定的所述行为特征向量A之间的绑定关系;
训练完毕,得到所述BERT模型;对所述BERT模型经过参数配置和调整后,部署在后台服务器,用于图书推荐。
9.一种实现权利要求1‑8中任一项所述基于向量数据库的图书推荐方法的系统,其特征在于,包括:前端,用于用户输入图书爱好标签至后台服务器;以及,接收并展示后端反馈的个性化图书推荐列表,供用户浏览并选择图书后端,通过后台服务器识别出前端用户的行为爱好维度,并将所述行为爱好维度发送至所述BERT模型;
以及,
通过部署在后台服务器上的BERT模型,识别所述行为特征向量,并输出所有与所述行为特征向量相互绑定的所述图书特征向量;
以及,
计算所述行为特征向量与对应的所述图书特征向量之间的相似度,并按照相似度的大小值排序,将各个所述图书特征向量依次写入预设的个性化图书推荐列表;
以及,
将所述个性化图书推荐列表发送至前端;
前端与后端通信连接。
10.一种电子设备,其特征在于,包括:
处理器;
用于存储处理器可执行指令的存储器;
其中,所述处理器被配置为执行所述可执行指令时实现权利要求1‑8中任一项所述的一种基于向量数据库的图书推荐方法。