首页 期刊 信息技术与网络安全 一种高效的新闻网页噪声过滤方法 【正文】

一种高效的新闻网页噪声过滤方法

作者:邹永强; 钟志农 国防科技大学电子科学与工程学院; 湖南长沙410073
统计规律   网页噪声过滤   正文提取  

摘要:网页噪声过滤是网页预处理中关键的一步,其处理结果对后续处理的效率和准确性都有很大的影响。本文基于文本块字符数的统计规律,在总结了新闻网页特点的基础上设计了一种高效的新闻网页噪声过滤算法。该算法不仅完成了新闻正文的提取,也实现了新闻标题和报道时间的提取。试验证明,该算法有很高的处理速度,同时其提取的准确率也有了进一步的提高。

注:因版权方要求,不能公开全文,如需全文,请咨询杂志社

学术咨询 免费咨询 杂志订阅