数据

作者: 錦魚 | 来源:发表于2018-11-22 08:49 被阅读0次

    页面解析和数据提取

    • 一般来讲对我们而言,需要抓取的是某个网站或者某个应用的内容,提取有用的价值。内容一般分为两部分,非结构化的数据 和 结构化的数据。

    非结构化的数据处理

    文本、电话号码、邮箱地址

    • 正则表达式

    HTML 文件

    • 正则表达式
    • XPath
    • CSS选择器

    结构化的数据处理

    JSON 文件

    • JSON Path
    • 转化成Python类型进行操作(json类)
    XML 文件
    • 转化成Python类型(xmltodict)
    • XPath
    • CSS选择器
    • 正则表达式

    相关文章

      网友评论

          本文标题:数据

          本文链接:https://www.haomeiwen.com/subject/djykqqtx.html