美文网首页
HtmlParse:一款超轻量级的HTML文件解析和爬取工具

HtmlParse:一款超轻量级的HTML文件解析和爬取工具

作者: Java爱好者 | 来源:发表于2022-07-18 14:33 被阅读0次

    HtmlParse 是一款基于windwos平台的HTML文档解析工具,可快速构建DOM树,从而轻松实现网页元素的爬取工作。DOM树就是一个HTML文档的节点树,每个节点由:标签(Tag)、属性(Attribute)、文本(Text)三个值来描述。

    所谓的HTML文档解析,指的就是如何构建一颗DOM树,只有成功构建出DOM树,才有可能进行后续的数据爬取和分析工作。显然,构建DOM树是比较复杂的过程,因为不是每一个HTML文档都会严格按照规范来书写,因此解析过程需要具有一定容错能力。此外,解析效率也是一个需要考虑的因素,也就是说最好通过一次文档扫描即可建立起DOM树,而不是反复扫描。

    下面是HtmlParse介绍


    工具特点

    1、绿色纯天然,无任何第三方依赖库,文件大小不到150K;

     2、解析速度快,具有一定的HTML语法容错能力,可快速将HMTL文档解析为DOM树;

     3、基于命令行参数,可通过不同参数获取指定TAG的属性值和文本内容,从而实现网页爬取功能;

     4、可将爬取数据输出为json格式,方便第三方程序进一步分析和使用;

     5、可爬取script脚本到指定的js文件中;

    下载地址 需要的请移步主页找下获取方式

    使用方法

    解析指定的HTML文档,并将文档中指定的标签及属性输出到指定文件中。

    HtmlPathFile:必选参数,要解析的HTML文档路径名,如果文件路径中有空格,可使用双引号将文件路径包含;

    -tag:必选参数,用于指定要抓取的HTML标签名称;

     -attr:可选参数,用于指定标签的属性值,如果不指定,则返回该标签的所有属性值;

     -o:可选参数,用于指定抓取内容输出的文件,可将抓取的内容保存为json格式的文件。 如果该参数不指定,则进行控制台输出。 如果抓取的是script、style则会保存为js格式文件。

    如果要抓取doctype,可使用-tag doctype,将整个doctype内容获取。此时将会忽略-attr指定的任何属性值。

    举例说明

    1、爬取网页中所有超链接

    解析C盘下的sina.html文档,并提取该文档中的所有超链接到sina.json文件中。其中**-tag a -attr href,用于指定获取超链接标签ahref**属性。


    2、爬取网页中所有图片链接

    解析C盘下的sina.html文档,并提取该文档中的所有图片链接到sina.json文件中。


    3、爬取网页中所有脚本

    解析C盘下的sina.html文档,并提取该文档中的所有脚本函数到sina.js文件中。


    输出内容

    如果通过-o参数指定输出文件,则会生成一个json格式的文档。 TagName为爬取的标签名称,比如超链接的a,其值是一个json数组,数组中的每个内容为Json对象,每个Json对象,有属性和文本构成。如果-attr 指定了要爬取的属性,则AttrName为指定的属性名称,比如href或src。text为该标签的文本内容,有些标签不存在文本内容,比如img、meta等,则该值为空。json格式如下:

    下面是一个sina网页的所有超链接json

    相关文章

      网友评论

          本文标题:HtmlParse:一款超轻量级的HTML文件解析和爬取工具

          本文链接:https://www.haomeiwen.com/subject/ymajirtx.html