HtmlParse：一款超轻量级的HTML文件解析和爬取工具

HtmlParse：一款超轻量级的HTML文件解析和爬取工具

作者: Java爱好者 | 来源:发表于2022-07-18 14:33 被阅读0次

python网络爬虫爬取静态数据详解！
爬取豆瓣网首页的电影信息
Jsoup和正则表达式解析html
【python爬虫实战】批量爬取站长之家的图片
发现•分享—2019-01-18~2019-01-21
python数据爬取与写入
python爬虫之单纯用find（）函数来爬取数据
【入门】Python网络爬虫与信息提取1
SpiderMan(一)简单爬虫
nodeJS数据抓取

HtmlParse 是一款基于windwos平台的HTML文档解析工具，可快速构建DOM树，从而轻松实现网页元素的爬取工作。DOM树就是一个HTML文档的节点树，每个节点由：标签（Tag）、属性（Attribute）、文本（Text）三个值来描述。

所谓的HTML文档解析，指的就是如何构建一颗DOM树，只有成功构建出DOM树，才有可能进行后续的数据爬取和分析工作。显然，构建DOM树是比较复杂的过程，因为不是每一个HTML文档都会严格按照规范来书写，因此解析过程需要具有一定容错能力。此外，解析效率也是一个需要考虑的因素，也就是说最好通过一次文档扫描即可建立起DOM树，而不是反复扫描。

下面是HtmlParse介绍

工具特点

1、绿色纯天然，无任何第三方依赖库，文件大小不到150K；

2、解析速度快，具有一定的HTML语法容错能力，可快速将HMTL文档解析为DOM树；

3、基于命令行参数，可通过不同参数获取指定TAG的属性值和文本内容，从而实现网页爬取功能；

4、可将爬取数据输出为json格式，方便第三方程序进一步分析和使用；

5、可爬取script脚本到指定的js文件中；

下载地址 需要的请移步主页找下获取方式

使用方法

解析指定的HTML文档，并将文档中指定的标签及属性输出到指定文件中。

HtmlPathFile：必选参数，要解析的HTML文档路径名，如果文件路径中有空格，可使用双引号将文件路径包含；

-tag：必选参数，用于指定要抓取的HTML标签名称；

-attr：可选参数，用于指定标签的属性值，如果不指定，则返回该标签的所有属性值；

-o：可选参数，用于指定抓取内容输出的文件，可将抓取的内容保存为json格式的文件。如果该参数不指定，则进行控制台输出。如果抓取的是script、style则会保存为js格式文件。

如果要抓取doctype，可使用-tag doctype，将整个doctype内容获取。此时将会忽略-attr指定的任何属性值。

举例说明

1、爬取网页中所有超链接

解析C盘下的sina.html文档，并提取该文档中的所有超链接到sina.json文件中。其中**-tag a -attr href，用于指定获取超链接标签a的href**属性。

2、爬取网页中所有图片链接

解析C盘下的sina.html文档，并提取该文档中的所有图片链接到sina.json文件中。

3、爬取网页中所有脚本

解析C盘下的sina.html文档，并提取该文档中的所有脚本函数到sina.js文件中。

输出内容

如果通过-o参数指定输出文件，则会生成一个json格式的文档。 TagName为爬取的标签名称，比如超链接的a，其值是一个json数组，数组中的每个内容为Json对象，每个Json对象，有属性和文本构成。如果-attr 指定了要爬取的属性，则AttrName为指定的属性名称，比如href或src。text为该标签的文本内容，有些标签不存在文本内容，比如img、meta等，则该值为空。json格式如下：

下面是一个sina网页的所有超链接json

相关文章

python网络爬虫爬取静态数据详解！
目的爬取http://seputu.com/数据并存储csv文件导入库 lxml用于解析解析网页HTML等源码...
爬取豆瓣网首页的电影信息
爬取豆瓣网首页的电影信息，包括电影名、星级、导演、演员表，存入指定的文件。爬取步骤： 1、定义HTML解析类2、...
Jsoup和正则表达式解析html
一、解析html 背景：最近有个需求，需要爬取某个页面的数据，将整个页面的html爬取下来后，对html作解析，然...
【python爬虫实战】批量爬取站长之家的图片
概述：站长之家的图片爬取使用BeautifulSoup解析html通过浏览器的形式来爬取,爬取成功后以二进制保存...
发现•分享—2019-01-18~2019-01-21
工具这应该是你见过的最全前端下载总结爬取掘金小册，并将 html 文件转为 markdown 格式文件 910...
python数据爬取与写入
以爬取NASDAQ的股票数据为例依赖获取数据设置请求头请求网页数据解析和组装数据（解析规则参考html....
python爬虫之单纯用find（）函数来爬取数据
对于python软件爬取网页数据，一般采用BeautifulSoup库或者Xpath技术来解析html，然后寻找爬...
【入门】Python网络爬虫与信息提取1
理念：The website is API.... 定向网络数据爬取和网页解析的基本能力 Python开发工具的选...
SpiderMan(一)简单爬虫
简单爬虫就是爬取静态网页（比如Nature期刊的文献信息），然后用BeautifulSoup解析html代码，获取...
nodeJS数据抓取
工具 chokidar 文件监听 shelljs 执行命令行 cheerio html页面解析非常nice的解析...

网友评论

本文标题：HtmlParse：一款超轻量级的HTML文件解析和爬取工具

本文链接：https://www.haomeiwen.com/subject/ymajirtx.html

延伸阅读

深度阅读

您也可以注册成为美文阅读网的作者，发表您的原创作品、分享您的心情！

栏目导航

热点阅读

关于我们|服务条款|联系我们|HtmlParse：一款超轻量级的HTML文件解析和爬取工具|投稿指南|网站地图|RSS订阅|排版工具|手机版

提供经典美文摘抄,优美散文欣赏,现代诗歌精选,短篇小说,心情随笔,表白情书范文,故事会在线阅读欣赏

Copyright © 2014-2023 Haomeiwen.com All Rights Reserved. 好美文阅读网版权所有

备案信息：桂公网安备 45052102000051号 · 桂ICP备13007215号-3

本站所收录作品、热点评论等信息部分来源互联网，目的只是为了系统归纳学习和传递资讯

所有作品版权归原创作者所有，与本站立场无关，如不慎侵犯了你的权益，请联系我们告知，我们将做删除处理！