我这样破解pexels获取的高清原图

作者: Wakingup88688 | 来源:发表于2017-03-23 16:42 被阅读640次

我这样破解pexels获取的高清原图
Python爬虫入门！破解pexels高清原图！零基础必学教程！
2020-06-26
「壁纸欣赏」仰望星空，我既是天命
PowerDesigner16.5
视频来叻
网站资源
五个高质量免费图库网
面试官：小伙子，听说你看过ThreadLocal源码？（万字图文
彩铅画手绘基础教程：教你画苹果

最近貌似对好看的图着迷，Pixabay爬不到原图不甘心呀。
百度+知乎了下，于是转向pexels,同样一个高人气图片网站。

打开界面是这样

随便一搜是这样

颜值逆天，画质不输Pixabay,瞬间感觉有了动力？
不到一下午就爬到高清原图，仅用re\requests几个库，随后又做了个下载器。
之前的博文泛泛带过的多，总感觉少了点什么，这次详细记录一下。

一、过程

1、分析查看
首先点击进入官网 https://www.pexels.com/ ，又见瀑布流，点击查看源码。

pageSource1.png

看到后面这一串，便可知晓网页有嵌入javascript脚本。由于前面踩过坑，立即用requests库检查了下，发现可以正常返回源码中数据，松了一口气。（爬取网站前先检查一下其反爬策略还是很有必要的，之前就曾遇到过返回乱码或者什么都没有的情况）

2、获取原图地址
搜索框中输入'water'，页面跳转到如下：

water.png
查看源代码和首页差不多，接着是图片真实地址链接。我在这里绕了几个弯，具体不叙述。
加上前面pixabay的坑，最后得到经验：直接点击官方下载按钮，从对话框中看到图片真实链接，这是最保险的模式。（因为有时“查看模式”并不能提供真实链接，而且有时也并不能下载得到。）

最后发现真实地址有两种形式，还发现图片有jpg和jpeg两种格式：

格式1.jpg

格式2.jpg

我第一次以为链接只有第二种，结果辛辛苦苦匹配正则下载的图确是这样的：

wrong.png

有些图并不能打开，又得到教训：爬虫爬下的图打不开时，有可能链接地址是错的。

pageSource2.jpg

对比源码，发现'data-pin-media'和'src'中皆含地址链接数据，用正则提取，再将images换成static即为链接。图片格式有两种，为了方便后面命名，我还是分成了两段来取。用最简单的(.*?)，结果又出问题了：

    #正则是这样的
    pattern=re.compile(r'<img.*?data-pin-media="https://images.pexels.com/photos/(.*?)/(.*?)?w=800.*?>',re.S)
    items=re.findall(pattern,result)

多了问号.png

每个链接后面都多了个'？'，如何去掉字符串最后一位字符，我记得string类是没有像list类的pop()方法的，又考验python基础。不过这个简单啦~

 for item in items:
     print 'https://static.pexels.com/photos/'+str(item[0])+'/'+str(item[1][:-1])

3、批量下载
这特么才是关键啊！
网页使用瀑布流模式，是没有页码的，无法像之前那样一页一页遍历。selenium还不熟练，这下如何是好。又倒回去看源码。然后发现了这一堆！

pageSource3.jpg
点击源码中href="/search/water/?page=2",页面跳转

page2.png
地址栏里链接变成 https://www.pexels.com/search/water/?page=2
熟悉的感觉，这几个图好像刚刚那个页面也出现过。。。
回第一页源码中数了下，一共才发现15张缩略图的链接。
然后全明白了，回page1一数正好吻合。
原来获取图片接口在源码里啊，每一页15张，308就是最大页数了。
接着就简单了，又可以循环遍历，避开瀑布流啦^_

试着下载图片，结果又出幺蛾子了：

403-forbidden.png

目测是爬虫被网站发现了，只好将urllib2改为requests的get方式，设置user_agent和header, user_agent还设了随机数，爬完一页time.sleep(3)。
通过。
最后查了一下，有个帖子总结的很好。

反反爬.jpg

最后用之前Pixabay的模版又做了个下载器。

二、结果

最后来看下结果
已经存在的图自动跳过。

图1.png

图2.png

图3.png

强迫症患者，终于等到10页图全部下载完才睡。。。
本来准备随便拿个图看效果
结果太大了上传不了。。。。
（比如上图第一排最右边的那个图就有27M）

904064.jpg

三、代码

源码我上传到Github了:
https://github.com/LUCY78765580/Python-web-scraping/blob/master/pexels.py
这个爬虫还是可以的，就是速度太慢了了，等学了多线程再回来优化。

我这样破解pexels获取的高清原图
最近貌似对好看的图着迷，Pixabay爬不到原图不甘心呀。百度+知乎了下，于是转向pexels,同样一个高人气图片...
Python爬虫入门！破解pexels高清原图！零基础必学教程！
最近貌似对好看的图着迷，Pixabay爬不到原图不甘心呀。百度+知乎了下，于是转向pexels,同样一个高人气图...
2020-06-26
每日壁纸分享，希望大家喜欢。高清原图获取方式见文末。高清原图及更多壁纸，私信“ 点赞+关注，美图不迷路
「壁纸欣赏」仰望星空，我既是天命
每日壁纸分享，星空主题第一期。高清无水印原图获取方式见文末高清无水印原图及更多壁纸免费领取，点击头像，私信“壁纸...
PowerDesigner16.5
单击可看高清原图、单击可看高清原图、单击可看高清原图 1、关于PowerDesigner PowerDesigne...
视频来叻
1 Pexels Videos https://videos.pexels.com/ 打开腾讯新闻，看更多高清图片...
网站资源
52破解高清范
五个高质量免费图库网
图库网站提供免费的商业级高清晰度图片下载。 1. Pexels 网址：https://www.pexels.c...
面试官：小伙子，听说你看过ThreadLocal源码？（万字图文
前言 (高清无损原图.pdf关注公众号后回复 ThreadLocal 获取，文末有公众号链接) 前几天写了一篇AQ...
彩铅画手绘基础教程：教你画苹果
原图：以下是高清教程图：

网友评论