美文网首页
python3.5爬虫实例(一)简单图片抓取

python3.5爬虫实例(一)简单图片抓取

作者: 下水道潜水员 | 来源:发表于2017-08-20 00:07 被阅读0次

为了提高教学的趣味性,先不从基本的正则表达式入手介绍,用到的时候会解释一下。

先直接一个图片抓取的实例(能快速保存页面的所有图片到本地):

读取网页源码和抓取信息用的是urllib库,正则表达式用的是re库(http://blog.csdn.net/twc829/article/details/50377952    这里有正则的详细介绍)。

step1:获取页面数据

def getHtml(url):

page = urllib.request.Request(url=url)

html=urllib.request.urlopen(page).read()

return html

这是最基本的代码,利用request函数可以获取页面的所有信息,但很多网站都会为了防止被爬取数据,会检查你的headers。所以还需要对程序进行伪装一下,加上自定义的headers:

headers = {'User-Agent':'Mozilla/5.0 (Windows NT 6.1; WOW64; rv:23.0) Gecko/20100101 Firefox/23.0'}

并将page改成page = urllib.request.Request(url=url, headers=headers)

网站中通常含有中文,还要将编译方式改成utf-8:

html = html.decode('utf-8')

综合一下获取页面数据:

def getHtml(url):

headers = {'User-Agent':'Mozilla/5.0 (Windows NT 6.1; WOW64; rv:23.0) Gecko/20100101 Firefox/23.0'}

page = urllib.request.Request(url=url, headers=headers)

html=urllib.request.urlopen(page).read()

html = html.decode('utf-8')

return html

step2:寻找图片先用正则表达式确定页面数据中需要的部分:  reg = r'src="(.*\.jpg)"'      . 是匹配任意字符,换行符\n除外      * 是匹配前一个字符0次或n次,即可以含有n个 .        \.是为了区分 .  表示一个真正的符号.      所以这条语句实在确定搜索目标是XXXX.jpg

然后把正则表达式编译成一个正则表达式对象:

imgre = re.compile(reg)

再读取html 中包含 imgre(正则表达式)的数据:

imglist = re.findall(imgre,html)

step3:保存图片

由于图片比较多,肯定要用循环来进行保存

x = 0

for imgurl in imglist:

urllib.request.urlretrieve(imgurl,'/Users/yangyanxin/Desktop/1/%s.jpg' % x)

x+=1

urlretrieve函数可以将指定url的文件保存到本地

综合一下寻找和保存图片:

def getImg(html):

reg = r'src="(.*\.jpg)"'

imgre = re.compile(reg)

imglist = re.findall(imgre,html)

x = 0

for imgurl in imglist:

urllib.request.urlretrieve(imgurl,'/Users/yangyanxin/Desktop/1/%s.jpg' % x)

x+=1

return imglist

step4:指定网站进行爬取:html=getHtml("http://www.douyu.com")

getImg(html)

运行后,斗鱼首页的所有图片就都在指定文件夹里了

综合所有代码:

#-*- coding: UTF-8 -*-

import urllib

import re

from  urllib import request

def getHtml(url):

headers = {'User-Agent':'Mozilla/5.0 (Windows NT 6.1; WOW64; rv:23.0) Gecko/20100101 Firefox/23.0'}

page = urllib.request.Request(url=url, headers=headers)

html=urllib.request.urlopen(page).read()

html = html.decode('utf-8')

return html

def getImg(html):

reg = r'src="(.*\.jpg)"'

imgre = re.compile(reg)

imglist = re.findall(imgre,html)

x = 0

for imgurl in imglist:

urllib.request.urlretrieve(imgurl,'/Users/yangyanxin/Desktop/1/%s.jpg' % x)

x+=1

return imglist

html=getHtml("http://www.douyu.com")

print (getImg(html))

相关文章

网友评论

      本文标题:python3.5爬虫实例(一)简单图片抓取

      本文链接:https://www.haomeiwen.com/subject/zhvxdxtx.html