crawlSpider

作者: 白衣渡人_a063 | 来源:发表于2018-11-11 15:24 被阅读0次

crawlspider的使用
crawlspider爬虫总结
crawlspider爬虫总结
(八)Scrapy框架(三) ？python+scrapy爬虫5
39.scrapy的crawlspider爬虫
Scrapy扩展
scrapy之CrawlSpider
9.Scrapy之CrawlSpider
2018-12-09
CrawlSpider介绍

源码:

class CrawlSpider(Spider):

    rules = ()

    def __init__(self, *a, **kw):
        super(CrawlSpider, self).__init__(*a, **kw)
        self._compile_rules()

    def parse(self, response):
        return self._parse_response(response, self.parse_start_url, cb_kwargs={}, follow=True)

    def parse_start_url(self, response):
        return []

    def process_results(self, response, results):
        return results

    def _build_request(self, rule, link):
        r = Request(url=link.url, callback=self._response_downloaded)
        r.meta.update(rule=rule, link_text=link.text)
        return r

    def _requests_to_follow(self, response):
        if not isinstance(response, HtmlResponse):
            return
        seen = set()
        for n, rule in enumerate(self._rules):
            links = [lnk for lnk in rule.link_extractor.extract_links(response)
                     if lnk not in seen]
            if links and rule.process_links:
                links = rule.process_links(links)
            for link in links:
                seen.add(link)
                r = self._build_request(n, link)
                yield rule.process_request(r)

    def _response_downloaded(self, response):
        rule = self._rules[response.meta['rule']]
        return self._parse_response(response, rule.callback, rule.cb_kwargs, rule.follow)

    def _parse_response(self, response, callback, cb_kwargs, follow=True):
        if callback:
            cb_res = callback(response, **cb_kwargs) or ()
            cb_res = self.process_results(response, cb_res)
            for requests_or_item in iterate_spider_output(cb_res):
                yield requests_or_item

        if follow and self._follow_links:
            for request_or_item in self._requests_to_follow(response):
                yield request_or_item

    def _compile_rules(self):
        def get_method(method):
            if callable(method):
                return method
            elif isinstance(method, six.string_types):
                return getattr(self, method, None)

        self._rules = [copy.copy(r) for r in self.rules]
        for rule in self._rules:
            rule.callback = get_method(rule.callback)
            rule.process_links = get_method(rule.process_links)
            rule.process_request = get_method(rule.process_request)

    @classmethod
    def from_crawler(cls, crawler, *args, **kwargs):
        spider = super(CrawlSpider, cls).from_crawler(crawler, *args, **kwargs)
        spider._follow_links = crawler.settings.getbool(
            'CRAWLSPIDER_FOLLOW_LINKS', True)
        return spider

    def set_crawler(self, crawler):
        super(CrawlSpider, self).set_crawler(crawler)
        self._follow_links = crawler.settings.getbool('CRAWLSPIDER_FOLLOW_LINKS', True)

rules：

它是一个列表，存储的元素时Rule类的实例,爬取规则，其中每一个实例都定义了一种采集站点的行为。如果有多个rule都匹配同一个链接，那么位置下标最小的一个rule将会被使用。

LinkExtractor

链接提取器是其唯一目的是从scrapy.http.Response最终将跟随的网页（对象）提取链接的对象。
有Scrapy，但你可以创建自己的自定义链接提取器，以满足您的需求通过实现一个简单的界面。scrapy.linkextractors import LinkExtractor
每个链接提取器唯一的公共方法是extract_links接收一个Response对象并返回一个scrapy.link.Link对象列表。链接提取器意在被实例化一次，并且它们的extract_links方法被调用几次，具有不同的响应以提取跟随的链接。
链接提取程序CrawlSpider 通过一组规则在类中使用（可以在Scrapy中使用），但是您也可以在爬虫中使用它，即使不从其中CrawlSpider提取子类，因为其目的非常简单：提取链接。

LxmlLinkExtractor是推荐的链接提取器与方便的过滤选项。它使用lxml的强大的HTMLParser实现。

rules = (
        Rule(LinkExtractor(allow=r'Items/'), callback='parse_item', follow=True),
        Rule(LinkExtractor(allow=r'Items/',allow_domains=()),callback='parse_item', follow=True),
    )

参数	含义
allow	提取符合正则表达式的连接，如果没有给出（或为空），它将匹配所有链接。
deny	提取不符合正则表达式的连接。它优先于allow如果没有给出（或为空），它不会排除任何链接。
allow_domains（str或list）	允许提取域名
deny_domains（str或list）	不允许提取域名
restrict_xpaths	使用xpath表达式和allow共同作用提取同时符合的连接

init：

在源码中可以看到，它主要就是执行了_compile_rules方法，这边暂时不讲。

parse：

默认回调方法，同上章一样。不过在这里进行了重写，这里直接调用方法_parse_response，并把parse_start_url方法作为处理response的方法。

parse_start_url：

这个方法在源码中只看其定义是没有什么发现的，需要查看其使用环境。它的主要作用就是处理parse返回的response，比如提取出需要的数据等，该方法也需要返回item、request或者他们的可迭代对象。它就是一个回调方法，和rule.callback用法一样。

_requests_to_follow：

阅读源码可以发现，它的作用就是从response中解析出目标url，并将其包装成request请求。该请求的回调方法是_response_downloaded，这里为request的meta值添加了rule参数，该参数的值是这个url对应rule在rules中的下标。

_response_downloaded：

该方法是方法_requests_to_follow的回调方法，作用就是调用_parse_response方法，处理下载器返回的response，设置response的处理方法为rule.callback方法。

_parse_response：

该方法将resposne交给参数callback代表的方法去处理，然后处理callback方法的requests_or_item。再根据rule.follow and spider._follow_links来判断是否继续采集，如果继续那么就将response交给_requests_to_follow方法，根据规则提取相关的链接。spider._follow_links的值是从settings的CRAWLSPIDER_FOLLOW_LINKS值获取到的。

_compile_rules：

这个方法的作用就是将rule中的字符串表示的方法改成实际的方法，方便以后使用。

from_crawler：

这个就不细说了，看看源码就好，两行代码。

网友评论

本文标题：crawlSpider

本文链接：https://www.haomeiwen.com/subject/ifktfqtx.html

延伸阅读

深度阅读

您也可以注册成为美文阅读网的作者，发表您的原创作品、分享您的心情！

crawlSpider

源码:

rules：

LinkExtractor

init：

parse：

parse_start_url：

_requests_to_follow：

_response_downloaded：

_parse_response：

_compile_rules：

from_crawler：

相关文章

crawlspider的使用

crawlspider爬虫总结

crawlspider爬虫总结

(八)Scrapy框架(三) ？python+scrapy爬虫5

39.scrapy的crawlspider爬虫

Scrapy扩展

scrapy之CrawlSpider

9.Scrapy之CrawlSpider

2018-12-09

CrawlSpider介绍

网友评论

延伸阅读

深度阅读

栏目导航

热点阅读