Python爬虫之初体验

作者: YungFan | 来源:发表于2017-06-13 13:21 被阅读132次

    Python爬虫,一般用于抓取特定的内容,最近想学学,通过网络抓取自己想要的内容,于是乎学习了一下Python,用一个小案例来纪念一下学习的成果。

    案例程序主要功能:抓取我们学校校园网新闻中的图片

    #coding=utf-8
    import urllib
    import re
    # 定义个函数 抓取网页内容
    def getHtml(url):
        webPage = urllib.urlopen(url)
        html = webPage.read()
        return html
    
    # 定义一个函数 抓取网页中的图片
    def getNewsImgs(html):
        # 正则表达式 
        reg = r'src="(.+?\.jpg)"'
        img = re.compile(reg)
        # 获取网页中所有符合条件的图片url
        imglist = re.findall(img,html)
        x = 0
        # 根据图片地址下载图片并重命名
        for imgUrl in imglist:
            urllib.urlretrieve("http://www.abc.edu.cn/news/"+imgUrl,'news-%s.jpg' % x)
            x += 1
    
    # 获取网页
    html = getHtml("http://www.abc.edu.cn/news/show.aspx?id=21413&cid=5")
    # 抓取图片
    print getNewsImgs(html)
    

    效果:成功抓取了新闻中的两张图片O(∩_∩)O~

    爬虫抓图片.gif

    相关文章

      网友评论

        本文标题:Python爬虫之初体验

        本文链接:https://www.haomeiwen.com/subject/kkydqxtx.html