jsoup爬虫简书首页数据做个小Demo

作者: 下位子 | 来源:发表于2017-02-28 18:37 被阅读1616次

jsoup爬虫简书首页数据做个小Demo
Jsoup demo
Python -- 素数，简书和糗百爬虫
Python爬虫—简书首页数据抓取
android利用正则设计的爬虫工具
JFinal-美女图爬虫-一个不正经的爬虫代码
利用Nodejs抓取网上图片并保存至本地
Android实战，Jsoup抓取简书首页资源
给简友们的公开信
简书首页数据抓取的答疑

昨天LZ去面试，遇到一个大牛，被血虐一番，发现自己基础还是很薄弱，对java一些原理掌握的还是不够稳固，比如java反射注解，知道一点就是说不出来，很尴尬... 生命不止，学习不止啊

之前那个项目 QNews 用的是的第三方的数据平台，所以访问次数会有限制，这就很无奈。。。

我的博客地址

次数限制.PNG

每天只能请求100次....但是LZ这个穷屌丝也买不起服务器，所以就上网查，有什么别的方法可以获取数据，意外之间发现了jsoup这个强大的框架，就花了上午时间学习了一下，然后下午做了一个小Demo，功能比较单一，请见谅。

其实一开始的时候是想爬今日头条的数据，但是发现数据总是为空，我估计是上锁了... 然后就把矛头转向了简书，哈哈哈...果然简书就是好，数据直接就可以爬到了，好开心啊！！项目地址

先演示一波动态图：

整体效果.gif

话说这个布局就花了我半个小时...

一些基础的我就不说了，就简单说明一下我的数据是如何爬到的。可以直接去看一下我的源码，写的比较仓促，一些细节没有处理好，多多指教。

1. 准备

1. 相关资料

官方文档

中文文档

2. 添加依赖

compile 'org.jsoup:jsoup:1.9.2'

3. 打开简书首页

first.gif

在单个部分上右击，然后点击检查选项(我用的是QQ浏览器，其他未尝试)，底部就会跳出网页的源码，并且会跟踪到这个item对应的源码。

从上图可以大概了解到每个<li></li>标签里的内容就是我们每个item的信息。

2. 爬数据

1. 获取 `Document` 对象

    Document document = Jsoup.connect("http://www.jianshu.com/")
                             .timeout(10000)
                             .get();

这里通过建立与服务器的链接，并设置10s的超时连接来获取 Document 对象

2. 获取跟标签的 `Elements` 对象

first.PNG

Elements noteList = document.select("ul.note-list");
Elements li = noteList.select("li");

找到文章列表模块，发现 <ul class="note-list></ul> 是我们需要信息的跟标签。通过 select 方法查询节点所有信息。

for (Element element : li) {
    ...
}

下面全部都是 li标签的列表，里面的内容大致相似，我们就可以通过循环来遍历里面的信息。

3. 获取每个部分所有信息

因为信息比较多，我就选择比较有代表性的来将一下。

有个非常简单的方式：直接在你需要获取内容的部分右击，点击检查，就可以直接追踪到要查询的位置。

second.gif

1. 标题

就拿标题而言，直接在标题右击-->检查，即可，一目了然。然后我把数据截图一下。

second.PNG

String title = element.select("a.title").text()

通过 select 查询节点信息，然后.text 获取里面文本内容。

2. 头像：

third.PNG

String avatar = element.select("a.avatar").select("img").attr("src")

这个就是先找到头像节点，然后图片节点，最后通过 attr 获取图片 url

3. 首页链接

forth.PNG

String authorLink = element.select("a.blue-link").attr("abs:href")

这里注意 href 元素，他存放的就是跳转链接，不过是相对路径，这个时候就需要通过 attr("abs:href") 获取绝对路径。

其他就大同小异，其实我知道也就这么多，也是不断尝试通过打印得出来的，还是比较心酸的，比较没学过 js，不过对 js 挺有兴趣的。

3. 封装

剩下的就是将获取到的数据加载到bean对象中

1. 创建 bean 对象

public class JianshuBean {
    private String authorName;          // 作者
    private String authorLink;          // 作者链接
    private String time;                // 更新时间
    private String primaryImg;          // 主图
    private String avatarImg;           // 头像

    private String title;               // 标题
    private String titleLink;           // 标题链接
    private String content;             // 内容
    private String collectionTagLink;   // 专题链接
    private String readNum;             // 阅读量

    private String talkNum;             // 评论
    private String likeNum;             // 喜欢
    private String collectionTag;       // 专题

    // ... get set
}

2. 将获取到的数据添加到集合中

for (Element element : li) {
    JianshuBean bean = new JianshuBean();
    bean.setAuthorName(element.select("div.name").text()); // 作者姓名
    bean.setAuthorLink(element.select("a.blue-link").attr("abs:href")); // 作者首页链接
    bean.setTime(element.select("span.time").attr("data-shared-at"));   // 发表时间
    bean.setPrimaryImg(element.select("img").attr("src"));  // 主图
    bean.setAvatarImg(element.select("a.avatar").select("img").attr("src")); // 头像

    bean.setTitle(element.select("a.title").text());    // 标题
    bean.setTitleLink(element.select("a.title").attr("abs:href")); // 标题链接

    bean.setContent(element.select("p.abstract").text());       // 内容
    bean.setCollectionTagLink(element.select("a.collection-tag").attr("abs:href")); // 专题链接

    String[] text = element.select("div.meta").text().split(" ");
    if (text[0].matches("[0-9]+")) {
        bean.setReadNum(text[0]);
        bean.setTalkNum(text[1]);
        bean.setLikeNum(text[2]);
    } else {
        bean.setCollectionTag(text[0]);
        bean.setReadNum(text[1]);
        bean.setTalkNum(text[2]);
        bean.setLikeNum(text[3]);

    }
    mBeans.add(bean);
}

再来看一下效果：

整体效果.gif

项目地址

点击头像查看作者信息
点击图片或文字查看文章内容
点击专题查看专题内容
下拉刷新获取最新内容

希望大家多多支持我，谢谢！

我的博客

jsoup爬虫简书首页数据做个小Demo
昨天LZ去面试，遇到一个大牛，被血虐一番，发现自己基础还是很薄弱，对java一些原理掌握的还是不够稳固，比如jav...
Jsoup demo
jsoup爬虫小能手，总是时不时会用到，放个demo在这里，用到再回顾下。
Python -- 素数，简书和糗百爬虫
求素数结果如下：糗百首页爬虫：输出结果：简书首页爬虫：相比糗百的爬虫，简书的只需要设置一下请求头head...
Python爬虫—简书首页数据抓取
本该昨天完成的文章，拖了一天。可能是没休息好吧，昨天的在思路以及代码处理上存在很多问题，废话不多说，我们一起来看一...
android利用正则设计的爬虫工具
android利用正则设计的爬虫工具看过Jsoup之类的爬虫工具，觉得不太简洁，因为有时候爬虫并不需要爬大量数据...
JFinal-美女图爬虫-一个不正经的爬虫代码
去年我做了一个项目，大量使用爬虫抓取数据，使用JFinal+JSoup组合，抓取数据，数据清洗筛选，最终保存到数据...
利用Nodejs抓取网上图片并保存至本地
1)初步应用利用http以及fs模块抓取网络数据保存至本地 2)利用爬虫抓取简书首页的文章链接及内容以及图片保存...
Android实战，Jsoup抓取简书首页资源
百度百科：jsoup是一款Java 的HTML解析器，可直接解析某个URL地址、HTML文本内容。之前一直看郭霖...
给简友们的公开信
简书首页越来越像浏览器首页，你我都不该只做个看客。今天点开简书APP，首页内容除了一如既往的教你运营自媒体挣钱和...
简书首页数据抓取的答疑
有几位简友留言问到简书首页数据的抓取问题，说只能抓取到20条数据，如何抓取到更多；简书首页数据分页加载是怎么样处理...

网友评论

g小志:刚开完第一行代码自学中，真心喜欢你的文章因为你站在初学着的角度，让我懂了很多，比起那些上来就高深莫测的大神解释要强太多了，有些东西是要学精可是对于初学者来说循序渐进才比较合适，我现在正在把你的趣闻，当时是在code小生那里读到的，一行一行的敲一遍现在做到一半就收获颇多，虽然运用很多框架单基本结构清晰主要是注解太详细了。运用的框架也比较流行，现在知道原来你是原著，真心谢谢，Lz加油（第一次评论，不知不觉就写这么多）赞赏支持下-_-!!

g小志:@下位子嗯嗯。共勉

下位子:回头看写的代码还是很多漏洞，希望不会误导你，取其精华弃其糟粕吧，加油！！

下位子:大兄弟，说实话你吓到我了，我也只是 Android 初学者，刚转正，才发现会的东西太少了，要学习的东西实在太多了。
多谢你的打赏，希望能相互学习共同进步！

f3d1ee0e5071:现在简书已经防扒了，ajax里面返回得json对象也看不到文章列表。楼主有什么对策吗

下位子: @陈大自 👍，

f3d1ee0e5071:@下位子他只做了简单的防爬，给urlconnection设置浏览器的user-agent 就能正常得到数据了

下位子:@陈大自不好意思，这个我就没什么办法了，可能你要学一下 python 吧

43641a97164b:感谢

下位子: @感冒冲剂泡面加油

43641a97164b: @下位子我也要去偷东西……

下位子:@感冒冲剂泡面谢啥

MiBoy:那你要求到底多高

下位子: @MiBoy 不高…已经找到实习了

565c4534d640:能不能将它放到fragment中，而不是activity。

下位子: @爱上芥末你打log看数据有没有获取到

565c4534d640: @下位子我今天在fragment里面去实现这个，打死不显示数据。

下位子: @爱上芥末当然可以，这没什么影响吧

8937a1c7bdf0:你的启动图标怎么做的大神

下位子: @Quincy_Coder 哈哈，就是个艺术字，我上上篇文章最后有链接

8937a1c7bdf0:@下位子嗯嗯，做的启动图标不错呦

下位子: @Quincy_Coder 过奖了…什么启动图标？那个 "简"字吗

Otldan:不错

纳兰寒明:这和我最近做的抓去app中url解析json数据加载的道理款是一样的吧！只不过你抓取的是网页中的数据。

下位子: @Otldan 😃😃多谢

Otldan:小伙不错

下位子: @纳兰寒明差不多json和xml

code小生:这篇吗？👏👏👏

下位子: @code小生行吗？

下位子:嗯嗯

g小志:刚开完第一行代码自学中，真心喜欢你的文章因为你站在初学着的角度，让我懂了很多，比起那些上来就高深莫测的大神解释要强太多了，有些东西是要学精可是对于初学者来说循序渐进才比较合适，我现在正在把你的趣闻，当时是在code小生那里读到的，一行一行的敲一遍现在做到一半就收获颇多，虽然运用很多框架单基本结构清晰主要是注解太详细了。运用的框架也比较流行，现在知道原来你是原著，真心谢谢，Lz加油（第一次评论，不知不觉就写这么多）赞赏支持下-_-!!
g小志:@下位子嗯嗯。共勉
下位子:回头看写的代码还是很多漏洞，希望不会误导你，取其精华弃其糟粕吧，加油！！
下位子:大兄弟，说实话你吓到我了，我也只是 Android 初学者，刚转正，才发现会的东西太少了，要学习的东西实在太多了。
多谢你的打赏，希望能相互学习共同进步！
f3d1ee0e5071:现在简书已经防扒了，ajax里面返回得json对象也看不到文章列表。楼主有什么对策吗
下位子: @陈大自 👍，
f3d1ee0e5071:@下位子他只做了简单的防爬，给urlconnection设置浏览器的user-agent 就能正常得到数据了
下位子:@陈大自不好意思，这个我就没什么办法了，可能你要学一下 python 吧
43641a97164b:感谢
下位子: @感冒冲剂泡面加油
43641a97164b: @下位子我也要去偷东西……
下位子:@感冒冲剂泡面谢啥
MiBoy:那你要求到底多高
下位子: @MiBoy 不高…已经找到实习了
565c4534d640:能不能将它放到fragment中，而不是activity。
下位子: @爱上芥末你打log看数据有没有获取到
565c4534d640: @下位子我今天在fragment里面去实现这个，打死不显示数据。
下位子: @爱上芥末当然可以，这没什么影响吧
8937a1c7bdf0:你的启动图标怎么做的大神
下位子: @Quincy_Coder 哈哈，就是个艺术字，我上上篇文章最后有链接
8937a1c7bdf0:@下位子嗯嗯，做的启动图标不错呦
下位子: @Quincy_Coder 过奖了…什么启动图标？那个 "简"字吗
Otldan:不错
纳兰寒明:这和我最近做的抓去app中url解析json数据加载的道理款是一样的吧！只不过你抓取的是网页中的数据。
下位子: @Otldan 😃😃多谢
Otldan:小伙不错
下位子: @纳兰寒明差不多json和xml
code小生:这篇吗？👏👏👏
下位子: @code小生行吗？
下位子:嗯嗯