详细信息
文献类型:期刊文献
中文题名:HTML数据内容的抽取与集成
英文题名:Data Extraction and Integration from HTML Documents
作者:欧建雄[1];张礼平[1]
机构:[1]华东理工大学计算机科学与工程系,上海200237
年份:2003
卷号:29
期号:6
起止页码:613
中文期刊名:华东理工大学学报(自然科学版)
外文期刊名:Journal of East China University of Science and Technology
收录:CSTPCD;;国家哲学社会科学学术期刊数据库;Scopus;北大核心:【北大核心2000】;CSCD:【CSCD2011_2012】;
语种:中文
中文关键词:XML;HTML;数据抽取
外文关键词:XML; HTML; data extraction
摘要:在XML基础上,利用HTMLTidy可实现轻量级的Web数据挖掘和转换。转换过程主要解决的是HTML文档及其集合要表达的模式信息的分离。转换步骤是利用HTMLTidy提供的标准类库,净化HTML文档,借助DOM生成树对HTML元素结构做进一步分析,最后通过XSL、XPATH等自动提取转换。
Using XML and HTML Tidy tools set, we can get a lightweight method of Web data mining and transformation. The purpose of transformation is to separate HTML document content from its schema. The processes included purifying HTML documents by HTML Tidy Standard class library, analyzing HTML element's structure through DOM, and extracting data with XSL and XPATH.
参考文献:
正在载入数据...
