美文网首页
爬虫去重策略

爬虫去重策略

作者: owolf | 来源:发表于2020-01-04 09:47 被阅读0次

1、将url保存到数据库中,检查时在数据库中查找。效率太低,频繁的切换内外存。使用mysql做去重,对url地址进行md5,base64加密,加密之后会得到一串字符,判断字符串是否在mysql表中,如果在表示已经爬取过了,如果不在,表示没有爬取,执行请求,将加密后的url地址存入表中。缺点: 但是这个方法对mysql压力过大,导致崩溃,不推荐

2、将url保存到程序内存set集合中,查询速度快,但是占用内存太大。


image.png

3、与第二种方法类似,只是进一步改进之后,将url通过哈希编码压缩在保存在程序内存set集合中,相较于第二种方法直接保存,可以大大压缩存储空间。scrapy采用此方法。使用scrapy_redis的去重策略,会将已经爬取的url地址经过编码后存入redis,并且会做数据持久化,当爬虫再次启动时,会重新加载本地的数据,对爬虫的url做去重。缺点:如果数据量较大的时候,会占用较多的内存空间。

4、用bitmap方法,将访问过的URL通过hash函数映射到某一位。这个方法将url通过哈希算法进一步压缩空间至某位上,存储空间大大减小,但是冲突率很高,很有可能两个不同的url哈希到同一个位,导致第二个没有的url被判断为已存在。

5、布隆过滤器:通过boolmfilter算法压缩url,在压缩存储空间的同时,也 大大降低冲突率,一亿url经过布隆过滤器后大约为11 M存储空间。布隆过滤器呢,原理是这样的,一个URL过来,通过M个特别的哈希函数对其进行运算,映射成一个M维位数组的M个维度。新的URL诞生时,进行同样操作并逐个与set中的位数组做“与”运算,若结果改变则说明URL一定没有被抓取过,若结果一致则说明URL有一定概率被抓取过。布隆过滤器的插入和查询效率都是O(M),远低于其他一般策略。

常用方法:

redis集合和布隆过滤器

相关文章

  • 爬虫去重策略

    1、将访问过的url保存到数据库中缺点:效率低2、将访问过的url保存到set中,只需要o(1)的代价就可以查询u...

  • 爬虫去重策略

    1.将访问过的url保存到数据库中,每次访问的时候通过数据库查询;效率低,使用少。2.将访问过的url保存到Set...

  • 爬虫去重策略

    数据库去重MySQL 有唯一字段可以去重(这不是数据库去重的唯一方法),但是这种太过依赖MySQL,会导致 MyS...

  • 爬虫去重策略

    1、将url保存到数据库中,检查时在数据库中查找。效率太低,频繁的切换内外存。使用mysql做去重,对url地址进...

  • 网络爬虫去重策略

    在爬虫中,我们经常遇到这样的问题。一是希望抓取过的URL不再重复抓取,节省资源;二是希望下载过的数据不再重复下载(...

  • 爬虫(3-6 3-7)

    3-6url去重方法爬虫去重策略:1将访问过的URL保存到数据库中:2将访问过的URL保存到set中,只需要0(1...

  • 爬虫去重方案

    去重一般是对URL去重,访问过的页面不在访问,但是也有例外,比如一些网站有用户评论,内容是不断变化的,若爬取评论,...

  • 最近面试的几个问题 (二)scrapy 的 request_ur

    去重策略 布隆去重的优点和缺点 优点 缺点

  • 2019-03-30学习笔记 去重策略

    爬虫去重策略 将访问过的url保存到数据库中,效率较低 将访问过的url保存到set(内存)中,只需要o(1)的代...

  • python分布式爬虫搜索引擎实战-3-爬虫网址去重策略+Pyt

    爬虫网址去重策略 将访问过的url保存到数据库中 将url保存到set中。只需要O(1)的代价就可以查询到url ...

网友评论

      本文标题:爬虫去重策略

      本文链接:https://www.haomeiwen.com/subject/fidxactx.html