美文网首页
python3.5爬虫实例(一)简单图片抓取

python3.5爬虫实例(一)简单图片抓取

作者: 下水道潜水员 | 来源:发表于2017-08-20 00:07 被阅读0次

    为了提高教学的趣味性,先不从基本的正则表达式入手介绍,用到的时候会解释一下。

    先直接一个图片抓取的实例(能快速保存页面的所有图片到本地):

    读取网页源码和抓取信息用的是urllib库,正则表达式用的是re库(http://blog.csdn.net/twc829/article/details/50377952    这里有正则的详细介绍)。

    step1:获取页面数据

    def getHtml(url):

    page = urllib.request.Request(url=url)

    html=urllib.request.urlopen(page).read()

    return html

    这是最基本的代码,利用request函数可以获取页面的所有信息,但很多网站都会为了防止被爬取数据,会检查你的headers。所以还需要对程序进行伪装一下,加上自定义的headers:

    headers = {'User-Agent':'Mozilla/5.0 (Windows NT 6.1; WOW64; rv:23.0) Gecko/20100101 Firefox/23.0'}

    并将page改成page = urllib.request.Request(url=url, headers=headers)

    网站中通常含有中文,还要将编译方式改成utf-8:

    html = html.decode('utf-8')

    综合一下获取页面数据:

    def getHtml(url):

    headers = {'User-Agent':'Mozilla/5.0 (Windows NT 6.1; WOW64; rv:23.0) Gecko/20100101 Firefox/23.0'}

    page = urllib.request.Request(url=url, headers=headers)

    html=urllib.request.urlopen(page).read()

    html = html.decode('utf-8')

    return html

    step2:寻找图片先用正则表达式确定页面数据中需要的部分:  reg = r'src="(.*\.jpg)"'      . 是匹配任意字符,换行符\n除外      * 是匹配前一个字符0次或n次,即可以含有n个 .        \.是为了区分 .  表示一个真正的符号.      所以这条语句实在确定搜索目标是XXXX.jpg

    然后把正则表达式编译成一个正则表达式对象:

    imgre = re.compile(reg)

    再读取html 中包含 imgre(正则表达式)的数据:

    imglist = re.findall(imgre,html)

    step3:保存图片

    由于图片比较多,肯定要用循环来进行保存

    x = 0

    for imgurl in imglist:

    urllib.request.urlretrieve(imgurl,'/Users/yangyanxin/Desktop/1/%s.jpg' % x)

    x+=1

    urlretrieve函数可以将指定url的文件保存到本地

    综合一下寻找和保存图片:

    def getImg(html):

    reg = r'src="(.*\.jpg)"'

    imgre = re.compile(reg)

    imglist = re.findall(imgre,html)

    x = 0

    for imgurl in imglist:

    urllib.request.urlretrieve(imgurl,'/Users/yangyanxin/Desktop/1/%s.jpg' % x)

    x+=1

    return imglist

    step4:指定网站进行爬取:html=getHtml("http://www.douyu.com")

    getImg(html)

    运行后,斗鱼首页的所有图片就都在指定文件夹里了

    综合所有代码:

    #-*- coding: UTF-8 -*-

    import urllib

    import re

    from  urllib import request

    def getHtml(url):

    headers = {'User-Agent':'Mozilla/5.0 (Windows NT 6.1; WOW64; rv:23.0) Gecko/20100101 Firefox/23.0'}

    page = urllib.request.Request(url=url, headers=headers)

    html=urllib.request.urlopen(page).read()

    html = html.decode('utf-8')

    return html

    def getImg(html):

    reg = r'src="(.*\.jpg)"'

    imgre = re.compile(reg)

    imglist = re.findall(imgre,html)

    x = 0

    for imgurl in imglist:

    urllib.request.urlretrieve(imgurl,'/Users/yangyanxin/Desktop/1/%s.jpg' % x)

    x+=1

    return imglist

    html=getHtml("http://www.douyu.com")

    print (getImg(html))

    相关文章

      网友评论

          本文标题:python3.5爬虫实例(一)简单图片抓取

          本文链接:https://www.haomeiwen.com/subject/zhvxdxtx.html