python 常用内建模块之HTMLParser

作者: Swift社区 | 来源:发表于2019-08-02 15:57 被阅读20次

python 常用内建模块之HTMLParser
python之HTMLParser解析HTML文档
Python常用模块
Python进阶记录之requests模块！
python 模块psutil获取进程信息
python 常用内建模块之requests
python 常用内建模块之chardet
python 常用内建模块之psutil
python 常用内建模块之Pillow
python 常用内建模块之XML

python学习笔记，特做记录，分享给大家，希望对大家有所帮助。

HTMLParser

如果我们要编写一个搜索引擎，第一步是用爬虫把目标网站的页面抓下来，第二步就是解析该HTML页面，看看里面的内容到底是新闻、图片还是视频。

假设第一步已经完成了，第二步应该如何解析HTML呢？

HTML本质上是XML的子集，但是HTML的语法没有XML那么严格，所以不能用标准的DOM或SAX来解析HTML。

好在Python提供了HTMLParser来非常方便地解析HTML，只需简单几行代码：

from html.parser import HTMLParser
from html.entities import name2codepoint

class MyHTMLParser(HTMLParser):

    def handle_starttag(self, tag, attrs):
        print('<%s>' % tag)

    def handle_endtag(self, tag):
        print('</%s>' % tag)

    def handle_startendtag(self, tag, attrs):
        print('<%s/>' % tag)

    def handle_data(self, data):
        print(data)

    def handle_comment(self, data):
        print('<!--', data, '-->')

    def handle_entityref(self, name):
        print('&%s;' % name)

    def handle_charref(self, name):
        print('&#%s;' % name)

parser = MyHTMLParser()
parser.feed('''<html>
<head></head>
<body>
<!-- test html parser -->
    <p>Some <a href=\"#\">html</a> HTML&nbsp;tutorial...<br>END</p>
</body></html>''')

feed()方法可以多次调用，也就是不一定一次把整个HTML字符串都塞进去，可以一部分一部分塞进去。

特殊字符有两种，一种是英文表示的，一种是数字表示的Ӓ，这两种字符都可以通过Parser解析出来。

网友评论

python 集

本文标题：python 常用内建模块之HTMLParser

本文链接：https://www.haomeiwen.com/subject/ysvcrctx.html

延伸阅读

深度阅读

您也可以注册成为美文阅读网的作者，发表您的原创作品、分享您的心情！

python 常用内建模块之HTMLParser

HTMLParser

相关文章

python 常用内建模块之HTMLParser

python之HTMLParser解析HTML文档

Python常用模块

Python进阶记录之requests模块！

python 模块psutil获取进程信息

python 常用内建模块之requests

python 常用内建模块之chardet

python 常用内建模块之psutil

python 常用内建模块之Pillow

python 常用内建模块之XML

网友评论

延伸阅读

深度阅读

栏目导航

热点阅读

python 集