首页 期刊 微型电脑应用 基于开始定界符的自动Web信息抽取 【正文】

基于开始定界符的自动Web信息抽取

作者:白钰洁 东北石油大学计算机与信息技术学院; 大庆163000
web信息抽取   循环神经网络   开始定界符   lxml  

摘要:为了从网页中快速获得隐含的有用信息,提出一种基于开始定界符的Web信息抽取方法。首先通过网络爬虫获取样本网页;其次对样本网页进行预处理;再通过循环神经网络训练预处理后的样本网页,获得开始定界符;最后利用lxml解析库实现目标抽取页面Web信息的定位与抽取。这样将半结构化的网页自动整理成结构化的知识,以便人们的查询及再利用。通过三个慕课网站的抽取实验,证明该方法抽取效果良好,可以抽取有用信息并具有可移植性。

注:因版权方要求,不能公开全文,如需全文,请咨询杂志社

学术咨询 免费咨询 杂志订阅