美文网首页分布式爬虫
32、Python快速开发分布式搜索引擎Scrapy精讲—scr

32、Python快速开发分布式搜索引擎Scrapy精讲—scr

作者: 攻城狮笔记 | 来源:发表于2019-03-23 09:24 被阅读31次

百度云搜索,搜各种资料:http://www.81ad.cn

scrapy的每一个爬虫,暂停时可以记录暂停状态以及爬取了哪些url,重启时可以从暂停状态开始爬取过的URL不在爬取

实现暂停与重启记录状态

1、首先cd进入到scrapy项目里

2、在scrapy项目里创建保存记录信息的文件夹

image

3、执行命令:

scrapy crawl 爬虫名称 -s JOBDIR=保存记录信息的路径

如:scrapy crawl cnblogs -s JOBDIR=zant/001

执行命令会启动指定爬虫,并且记录状态到指定目录

image

爬虫已经启动,我们可以按键盘上的ctrl+c停止爬虫

停止后我们看一下记录文件夹,会多出3个文件

image

其中的requests.queue文件夹里的p0文件就是URL记录文件,这个文件存在就说明还有未完成的URL,当所有URL完成后会自动删除此文件

当我们重新执行命令:scrapy crawl cnblogs -s JOBDIR=zant/001 时爬虫会根据p0文件从停止的地方开始继续爬取,

相关文章

网友评论

    本文标题:32、Python快速开发分布式搜索引擎Scrapy精讲—scr

    本文链接:https://www.haomeiwen.com/subject/sxujvqtx.html