首页 期刊 软件导刊 基于文本元素的PDF表格区域识别方法研究 【正文】

基于文本元素的PDF表格区域识别方法研究

作者:窦方坤; 曹皓伟; 徐建良 中国海洋大学信息科学与工程学院; 山东青岛266100
pdf   文字流   文本抽取   文本分类   表格识别  

摘要:为了对药学PDF文献中的表格进行正确识别,减少表格抽取过程中无关文本元素混入的噪音,以更准确地进行表格结构还原和信息抽取,基于pdf2xml对药学文献PDF中的文本元素进行抽取,将文本元素分类并对表格标题区域向下延伸,从而识别表格区域。实验结果表明,该算法在单栏药学PDF和双栏药学PDF中的识别率分别达到89.7%和93.7%,比tabula工具的识别结果分别提高了10.4%和60.4%,表明该算法能有效处理表格框线缺失和分栏文献等复杂情况。

注:因版权方要求,不能公开全文,如需全文,请咨询杂志社

学术咨询 免费咨询 杂志订阅