美文网首页python入门基础学习程序员
Python网络爬虫抓取动态网页并将数据存入数据库MYSQL

Python网络爬虫抓取动态网页并将数据存入数据库MYSQL

作者: 编程新视野 | 来源:发表于2019-01-14 13:38 被阅读12次

    简述

    以下的代码是使用python实现的网络爬虫,抓取动态网页http://hb.qq.com/baoliao/。此网页中的最新、精华下面的内容是由JavaScript动态生成的。审查网页元素与网页源码是不同。

    本人对于Python学习创建了一个小小的学习圈子,为各位提供了一个平台,大家一起来讨论学习Python。欢迎各位到来Python学习群:943752371 一起讨论视频分享学习。Python是未来的发展方向,正在挑战我们的分析能力及对世界的认知方式,因此,我们与时俱进,迎接变化,并不断的成长,掌握Python核心技术,才是掌握真正的价值所在。

    以上是网页源码

    以上是审查网页元素

    所以此处不能简单的使用正则表达式来获取内容。

    以下是完整的获取内容并存储到数据库的思路及源码。

    实现思路:

    抓取实际访问的动态页面的url – 使用正则表达式获取需要的内容 – 解析内容 – 存储内容

    以上部分过程文字解释:

    抓取实际访问的动态页面的url:

    在火狐浏览器中,右键打开插件 使用**firebug审查元素** *(没有这项的,要安装firebug插件),找到并打开**网络(NET)**标签页。重新加载网页,获得网页的响应信息,包括连接地址。每个连接地址都可以在浏览器中打开。本网站的动态网页访问地址是:

    http://baoliao.hb.qq.com/api/report/NewIndexReportsList/cityid/18/num/20/pageno/1?callback=jQuery183019859437816181613_1440723895018&_=1440723895472

    源码

    注意:使用python的版本是 2.7

    相关文章

      网友评论

        本文标题:Python网络爬虫抓取动态网页并将数据存入数据库MYSQL

        本文链接:https://www.haomeiwen.com/subject/rgbddqtx.html