模式识别与人工智能
2025年4月11日 星期五   首 页     期刊简介     编委会     投稿指南     伦理声明     联系我们                                                                English
模式识别与人工智能  2015, Vol. 28 Issue (2): 125-131    DOI: 10.16451/j.cnki.issn1003-6059.201502004
论文与报告 最新目录| 下期目录| 过刊浏览| 高级检索 |
基于DOM树层次特征的多记录网页抽取*
陈巧灵,廖祥文,魏晶晶,陈国龙
福州大学 数学与计算机科学学院 福州 350108
Multirecord Webpage Extraction Based on DOM Tree Hierarchical Feature
CHEN Qiao-Ling, LIAO Xiang-Wen, WEI Jing-Jing, CHEN Guo-Long
College of Mathematics and Computer Science, Fuzhou University, Fuzhou 350108

全文: PDF (457 KB)   HTML (1 KB) 
输出: BibTeX | EndNote (RIS)      
摘要 现有的多记录网页抽取方法通常是对文件对象模型(DOM)树进行整体纵向结构分析,计算的结构相似度普遍偏低,使其不能正确识别记录区域.文中提出基于DOM树层次特征的记录抽取方法,该方法利用DOM树不同层次节点的不同作用对其进行横向分析,将寻找相似子树的问题转换为寻找节点块的相似子块,最后采用双向拓展搜索非重叠重复子块进行记录分隔.实验表明该方法能抽取现有抽取器无法处理的页面,多个数据源的抽取结果验证其有效性.
服务
把本文推荐给朋友
加入我的书架
加入引用管理器
E-mail Alert
RSS
作者相关文章
陈巧灵
廖祥文
魏晶晶
陈国龙
关键词 信息抽取多记录网页抽取算法    
Abstract:The existing multirecord webpage extraction methods usually make overall longitudinal analyses of the document object model (DOM) tree. The computional structural similarity is always low, and therefore record regions can not be identified correctly. Different from the previous work, a method named data record extraction based on DOM tree hierarchical feature (DEBHF) is proposed to make transverse analyses of the DOM tree by distinguishing different roles of nodes at different levels. Thus, the problem of searching similar sub-trees is converted into the problem of searching similar sub-blocks in data blocks. Finally, the two-way search for non-overlapped and repeated sub-blocks is adopted to segment the record regions. Experimental results show that the proposed approach can deal with webpages which can not be obtained by the existing methods and the extraction results of different data sources demonstrate its effectiveness.
Key wordsInformation Extraction    Multirecord Webpage    Extraction Algorithm   
收稿日期: 2013-11-29     
ZTFLH: TP391  
基金资助:国家自然科学基金青年科学基金项目(No.61300105)、教育部博士点基金联合项目(No.2012351410010)、福建省科技重大专项项目(No.2013H6012)、福州市科技计划项目(No.2013-PT-45)资助
作者简介: 陈巧灵,女,1989年生,硕士研究生,主要研究方向为Web数据挖掘.E-mail:chenql.fz@gmail.com.廖祥文(通讯作者),男,1980年生,博士,副教授,主要研究方向为文本倾向性检索与挖掘.E-mail:liaoxw@fzu.edu.cn.魏晶晶,女,1984年生,博士研究生,主要研究方向为智能信息处理.陈国龙,男,1965年生,教授,博士生导师,主要研究方向为智能信息处理.
引用本文:   
陈巧灵,廖祥文,魏晶晶,陈国龙. 基于DOM树层次特征的多记录网页抽取*[J]. 模式识别与人工智能, 2015, 28(2): 125-131. CHEN Qiao-Ling, LIAO Xiang-Wen, WEI Jing-Jing, CHEN Guo-Long. Multirecord Webpage Extraction Based on DOM Tree Hierarchical Feature. , 2015, 28(2): 125-131.
链接本文:  
http://manu46.magtech.com.cn/Jweb_prai/CN/10.16451/j.cnki.issn1003-6059.201502004      或     http://manu46.magtech.com.cn/Jweb_prai/CN/Y2015/V28/I2/125
版权所有 © 《模式识别与人工智能》编辑部
地址:安微省合肥市蜀山湖路350号 电话:0551-65591176 传真:0551-65591176 Email:bjb@iim.ac.cn
本系统由北京玛格泰克科技发展有限公司设计开发 技术支持:support@magtech.com.cn