1.动态短文本流聚类检索方法,其特征在于,包括以下几个步骤:
步骤1)对短文本流数据进行文本预处理,将每个文档用特征词序列表示;
步骤2)根据步骤1),对短时期内每个时间段的文档进行话题建模,得到话题基于文档的分布模型与特征词基于话题的分布模型;
步骤3)根据步骤2),对历史数据流进行话题建模,得到话题基于文档的分布模型与特征词基于话题的分布模型,为数据流中短时期话题模型的构建提供辅助信息;
步骤4)根据步骤2)和步骤3)利用吉布斯抽样算法简化短时期与长时期两种话题模型分别得到t时刻话题与特征词的概率分布;
步骤5)根据步骤2)、步骤3)、步骤4),利用聚类算法结合两种话题模型得到t时刻文档与簇之间的对应关系并利用基于聚类的检索模型得到用户查询信息与文档之间的关系。
2.依据权利要求1所述的方法,其特征在于,步骤1)利用分词技术将每个文档表示为词序列,再进行噪声与停用词的过滤得到每个文档的特征词序列d={v1,v2,v3...vV}。
3.依据权利要求1所述的方法,其特征在于,步骤2)根据多项式混合话题模型,得到t时刻基于t-1时刻的话题分布 与特征词分布其中θt表示t时刻的话题分布,Фt,z表示t时刻每个话题z的特征词分布,αt,z和βt,z表示分布模型t时刻与t-1时刻的联系与比较参数。将t-1时刻的两种分布作为t时刻话题与特征词对应分布的先验参数,并为上式设置初始化条件:当t=0时,话题分布为θ0,z=1/Z,基于话题的特征词分布为φ0,z,v=1/V。
4.依据权利要求1所述的方法,其特征在于,步骤3)考虑用户在信息检索时对某一话题的兴趣度与历史数据信息有较大的关联度,因此在短时期建模的基础上加入对长时期话题分布考虑,从而完善动态短文本流中可能存在的信息缺失;与步骤2)相似,根据多项式混合话题模型,得到t时刻基于历史话题数据L的话题分布与特征词分布
其中αt,z,l和βt,z,l表示表示t时刻的分布模型与前l个主题的相关性。
5.依据权利要求1所述的方法,其特征在于,步骤4),由于话题模型中的分布参数较复杂难以解决,因此利用收敛的吉布斯抽样算法得到分布参数的近似求解。针对步骤2)与步骤3)中短时期话题模型与长时期话题模型的特点分别计算t时刻文档d中话题与文档d的条件概率P(zd|zt,-d,dt,φt-1,θt-1,αt,βt)与其中zd代表文档流中的话题,zt,-d代表文档中除了文档d中的话题,并利用求解dt与zd联合概率P(dt,zd|φt-1,θt-1,αt,βt)极大值的方法分别得到对应短时期话题参数αt,z与βt,z,v的更新规则,长时期话题参数αt,z,l与βt,z,v,l的更新规则,从而根据每个文档中的话题与特征词的分布,得到t时刻短文本流中的话题分布与话题z中的特征词分布
其中mt,z表示文本流中分配给话题z的文档数量,nt,z表示时刻t分配给话题z的特征词数量;
当L取1时,是短时期话题模型也就是长时期话题模型的一个特殊情况。
6.依据权利要求1所述的方法,其特征在于,步骤5)利用聚类算法得到文档d与话题zd在t时刻的条件概率 提取话题zd使上式取最大值,因此可以将t时刻内文本流dt中的文档d聚类到话题z所属的簇c′z中;由于用户查询信息在本发明中是特定的关键词,用表示查询信息与文档间的关系,通过求解上述公式得到与用户查询信息最匹配的文档,其中v代表文档中的一个特征词及用户查询信息的关键词。