美文网首页Python爬虫大数据 爬虫Python AI Sql爬虫专题
爬虫之非结构化数据与结构化数据提取

爬虫之非结构化数据与结构化数据提取

作者: 博行天下 | 来源:发表于2017-11-14 10:43 被阅读74次

    页面解析和数据提取

    • 一般来讲对我们而言,需要抓取的是某个网站或者某个应用的内容,提取有用的价值。内容一般分为两部分,非结构化的数据 和 结构化的数据。
      • 非结构化数据:先有数据,再有结构,
      • 结构化数据:先有结构、再有数据
      • 不同类型的数据,我们需要采用不同的方式来处理。

    非结构化的数据处理

    • 文本、电话号码、邮箱地址

      • 正则表达式
      • HTML 文件
    • 正则表达式

      • XPath
      • CSS选择器

    结构化的数据处理

    • JSON 文件

      • JSON Path
      • 转化成Python类型进行操作(json类)
      • XML 文件
    • 转化成Python类型(xmltodict)

      • XPath
      • CSS选择器
      • 正则表达式

    相关文章

      网友评论

        本文标题:爬虫之非结构化数据与结构化数据提取

        本文链接:https://www.haomeiwen.com/subject/oxuxvxtx.html