一文入门Python + Selenium动态爬虫——从了解房价

一文入门Python + Selenium动态爬虫——从了解房价

作者: 天善智能 | 来源:发表于2019-02-19 09:34 被阅读11次

一文入门Python + Selenium动态爬虫——从了解房价
Django 创建第一个项目
3分钟带你了解世界第一语言Python 入门上手也这么简单！
Python爬虫入门
Python爬虫入门--了解爬虫---什么是爬虫？
selenium绕过爬虫特征检测
python爬虫-27-python之Selenium入门，动态
selenium和pantomjs学习
Python+PhantomJS+selenium+Beauti
详解基于python +Selenium的爬虫

欢迎关注天善智能，我们是专注于商业智能BI，人工智能AI，大数据分析与挖掘领域的垂直社区，学习，问答、求职一站式搞定！

对商业智能BI、大数据分析挖掘、机器学习，python，R等数据领域感兴趣的同学加微信：tstoutiao，邀请你进入数据爱好者交流群，数据爱好者们都在这儿。

作者：timber ，在一家电子商务(外贸)公司任职运维，平常工作时我觉得敲命令的样子也很帅 ---Python，Changed me！

个人博客地址：

https://blog.csdn.net/weixin_42946604

本文首发于：

https://blog.csdn.net/weixin_42946604

前言

我这里用到了的python+selenium来抓取链家房数据，因爲很多时候分析参数，头疼啊，能分析的还好。有些网页就很变态哦，参数都是经过加密的。

selenium自动化优点(我去找了一下度娘…哈哈)，完全可以模拟人工操作网页，而且相对其他爬虫不用写请求头(偷懒)，例如直接request的，听说更容易被封(403)，我只是听说！

最后希望更大家互勉互力，一同进步！现在跟大家分享一下python selenium的小知识…

整体流程

1、安裝selenium

命令行：pip install selenium 敲回车

2、下載chromedriver插件，對應自己的版本，链接在此：

http://chromedriver.storage.googleapis.com/index.html

直接放在Python的Scripts目录下就可以不能配置变量了，而且也不用声明路径

（后面会说到）

3、安裝pyquery 一样的用到pip安装敲回车

命令行：pip install pyquery

4、安裝pymysql

命令行：pip install pymysql 同上

5、以上安裝完成后，开始我們的骚操作了。

网页分析

我们不用声明请求头还有分析一些参数了，只要我们拿到URL，指哪爬哪！

此次抓取的数据如下：

那这些数据的提取正题就来了！

打开开发者工具，google浏览器直接挫F12

发现每个小区的售房信息都在ul下的li标签里面。直接上代码

第一步拿到html结构，然后用pyquery解析遍历li标签，我使用了items()方法

提取小区名称，找到a标签的class

提取房类的文本，span标签下面

其他的TEXT文本都是这样的方法提取

提醒的一点就是

我们这里判断一下ul的class，防止有时候网络加载的问题，导致发生错误。

模拟滚动，点击下一步操作

我们没跳转一页就滚动一下滚动条，这个有好处的哦有时候很多异步加载的，例如一下ajax加载的就是很好的例子了，查看评论的时候很多是这样的！我们来看一下

这也是个方法，根据个人不同来定义，我这里以800来滚动。

然后就是点击下一页的动作，网页有下一页的

代码实现直接上图

一些其他的小动作，可以自己添加哦！

数据存储

我这里用mysql存放数据，上图

我提前把数据表建好了的，表名为lianjie_data，数据库名是lianjie，这里根据个人情况。

你可以写一个data_save的方法，我这里简单粗暴点从上到下直接写完了。

好了运行程序

数据展示

是不是完完全全模拟人工操作呢，其实我没加太多动作嘻嘻

源码后续放出来，也会写一些更多的小知识更大家分享

千山万水总是情，点个「好看」行不行。

Python的爱好者社区历史文章大合集：

2018年Python爱好者社区历史文章合集（作者篇）

福利：文末扫码关注公众号，“Python爱好者社区”，开始学习Python课程：

关注后在公众号内回复“ 课程 ”即可获取：

小编的转行入职数据科学（数据分析挖掘/机器学习方向）【最新免费】

小编的Python的入门免费视频课程！

小编的Python的快速上手matplotlib可视化库！

崔老师爬虫实战案例免费学习视频。

陈老师数据分析报告扩展制作免费学习视频。

玩转大数据分析！Spark2.X + Python精华实战课程免费学习视频。

相关文章

一文入门Python + Selenium动态爬虫——从了解房价
欢迎关注天善智能，我们是专注于商业智能BI，人工智能AI，大数据分析与挖掘领域的垂直社区，学习，问答、求职一站式搞...
Django 创建第一个项目
python3之Django基础篇 python爬虫从入门到放弃（八）之 Selenium库的使用
3分钟带你了解世界第一语言Python 入门上手也这么简单！
一、Python入门 1. Python爬虫入门一之综述 Python爬虫入门二之爬虫基础了解 Python爬虫入...
Python爬虫入门
注：采转归档，自己学习查询使用 Python爬虫入门（1）：综述Python爬虫入门（2）：爬虫基础了解Pytho...
Python爬虫入门--了解爬虫---什么是爬虫？
Python爬虫入门--了解爬虫什么是爬虫？爬虫：一段自动抓取互联网信息的程序，从互联网上抓取对于我们有价值的...
selenium绕过爬虫特征检测
Python + selenium 如何绕过爬虫特征检测？ selenium绕过爬虫特征检测_服务器在信息时代，...
python爬虫-27-python之Selenium入门，动态
之前我们操作的对象都是静态网页，直接查看网页源代码即可，那么近几年动态网页的占有率越来越多，通过之前的方式不是那么...
selenium和pantomjs学习
Selenium + PhantomJS + python 简单实现爬虫的功能 Selenium 一、简介 sel...
Python+PhantomJS+selenium+Beauti
Python+PhantomJS+selenium+BeautifulSoup实现简易网络爬虫简易网络小爬虫，目...
详解基于python +Selenium的爬虫
详解基于python +Selenium的爬虫一.背景 1. Selenium Selenium 是一个用于we...

网友评论

本文标题：一文入门Python + Selenium动态爬虫——从了解房价

本文链接：https://www.haomeiwen.com/subject/fcfxyqtx.html

延伸阅读

深度阅读

您也可以注册成为美文阅读网的作者，发表您的原创作品、分享您的心情！

栏目导航

热点阅读

关于我们|服务条款|联系我们|一文入门Python + Selenium动态爬虫——从了解房价|投稿指南|网站地图|RSS订阅|排版工具|手机版

提供经典美文摘抄,优美散文欣赏,现代诗歌精选,短篇小说,心情随笔,表白情书范文,故事会在线阅读欣赏

Copyright © 2014-2023 Haomeiwen.com All Rights Reserved. 好美文阅读网版权所有

备案信息：桂公网安备 45052102000051号 · 桂ICP备13007215号-3

本站所收录作品、热点评论等信息部分来源互联网，目的只是为了系统归纳学习和传递资讯

所有作品版权归原创作者所有，与本站立场无关，如不慎侵犯了你的权益，请联系我们告知，我们将做删除处理！