美文网首页爬虫博客数据分析Web Scraper
爬虫工具实战篇(Web Scraper)- 京东商品信息爬取(原

爬虫工具实战篇(Web Scraper)- 京东商品信息爬取(原

作者: WoodyWu | 来源:发表于2019-02-19 18:06 被阅读111次

    一、背景与目的

    数字化营销时代,快速掌握了解数据是一项基本技能,本文主要讲解里面Web Scraper工具如何爬取公开数据,比如爬取京东的店铺售卖商品情况数据,以便我们更好地了解竞品对手的产品情况和定价情况等,从而采取有效针对性的手段应对,同时对于个人也是一项数据收集技能的提升。

    二、工具介绍和安装

    1> 介绍

    Web Scraper是一款可以从网页中提取数据的chrome网页数据提取插件,是一款非常好用的爬虫工具。

    2> 安装

    步骤一:安装Chrome浏览器的桌面版。

    步骤二::在webscraper.io下载谷歌Chrome浏览器插件,完全免费

    步骤三:安装完Web Scraper可以在Chrome右上角找到图标。

    步骤四:Windows操作系统,按F12键,Chrome开发者工具会弹出,Web Scraper在菜单项的最右边,至此安装工作结束。

    三、实战爬取操作

    1> 选取爬取平台的链接

    步骤一:获取爬取链接:打开京东首页,搜索手机之后,我们看到全部商品分类的选项,然后我们选取手机通讯->手机->品牌HUAWEI,进入相应页面后,选取第二页商品列表,之后得到如下链接。

    https://list.jd.com/list.html?cat=9987,653,655&ev=exbrand_8557&page=2&sort=sort_rank_asc&trans=1&JL=6_0_0&ms=9#J_main

    步骤二:分析链接:上面URL中加粗的参数sort、trans、JL和ms并没有用,有用的是cat、ev和page参数,其中cat代表品类,ev代表华为品牌,page代表商品列表页数

    步骤三:定义取值链接和爬取页数:根据上边分析和之前查看页数,获得总页数42页,故工具抽取链接如下(循环遍历抽取1~42页数据)。

    https://list.jd.com/list.html?cat=9987,653,655&ev=exbrand_8557&page=[1-42]

    2> 爬取配置

    步骤一:创建爬取网站项目,定义爬取网站地址

    在Web Scraper选项下边选取Create new sitemap,具体参数如下

    sitemap name :huawei_mobile

    Start URL:https://list.jd.com/list.html?cat=9987,653,655&ev=exbrand_8557&page=[1-42]

    创建完成后,进入Add new selector蓝色按钮的界面,此时我们的位置为_root,这里面selector就是CSS里面的CSS选择器,然后我们依次添加selector,圈选商品和商品项。

    步骤二:创建商品选择器,圈选爬取商品

    a> 点击按钮:CSS Selector的作用是在HTML中定位,我们点击蓝色按钮Add new selector,进入页面元素选取状态。

    b> 页面商品圈选:

    鼠标定位某一个商品,此时商品处于蓝色框选区域,具体如图所示

    然后鼠标双击,在Done Selecting!处获取圈选商品页面HTML元素,点击此蓝色按钮,具体获取元素为:li.gl-item:nth-of-type(1) div.gl-i-wrap

    点击Element preview按钮时,该块商品区域会再次高亮。

    我们此时需要选取所有商品,则需要调整刚才所选取元素,根据如下HTML Element则调整为#plist > ul > li

    备注:此处应用了页面Copy Selector的插件,可以在HTML Element右键复制

    当我们再次启用Element preview时,就能看到所有商品区域都高亮了。

    点击蓝色按钮Save selector保存,item的选择器创建成功

    步骤三:创建商品项选择器,圈选商品项

    依次在item选择器下创建商品属性项,分别为商品名称(product name)、商品价格(price)、商品评论数(comment_cnt)店铺(shop),具体如下图所示:

    此时如需预览数据,可以将之前sitemap里面的页数page=[1-42]调整为page=2,data preview具体如下:

    步骤四:数据爬取

    选取Scrape进行数据爬取,启动爬取

    步骤五:结果导出

    csv版本导出

    四、总结

    webscraper优缺点总结

    优点:免费、操作系统无限制(依赖于浏览器)、操作简便,容易上手(无技术背景人可配置操作)、功能强大(支持静态和动态数据抓取)

    缺点:不支持iframe的爬取(比如地图嵌入之类,经销商地图)、不支持爬取数据的过滤、其他的以后碰到在说吧,O(∩_∩)O哈哈~

    适用人群:

    技术人员

    商业分析人员

    咨询人员

    欢迎使用!!!!!!!!!!!!!!!!!

    相关文章

      网友评论

        本文标题:爬虫工具实战篇(Web Scraper)- 京东商品信息爬取(原

        本文链接:https://www.haomeiwen.com/subject/kauxyqtx.html