首页 期刊 情报学报 一个基于双向近邻技术的多层文档聚类算法 【正文】

一个基于双向近邻技术的多层文档聚类算法

作者:宋江春; 沈钧毅 西安交通大学电子与信息工程学院; 西安710049
文档聚类   最近邻技术   双向最近邻   文档主题特征向量   主题关键字特征向量  

摘要:提出了一个新的基于双向近邻技术的多层文档聚类算法.使用新的文档特征抽取方法构造了文档的主题和关键字特征向量.首先在主题特征向量空间中,改进了传统的最近邻技术,使最近邻概念由单向变为双向.利用改进后的方法对文档进行初始聚类,然后在基于主题关键字的新的特征向量空间中利用类间距和连接度对初始文档类进行求精,从而得到最终聚类.由于使用了两层聚类方法,使算法的效率和精度都大大提高.最后对算法的有效性、可伸缩性和时间复杂度进行了研究.

注:因版权方要求,不能公开全文,如需全文,请咨询杂志社

学术咨询 免费咨询 杂志订阅