jsoup爬虫简书首页数据做个小Demo

本篇由 下位子 投稿，这是下位子的第2篇投稿

昨天LZ去面试，遇到一个大牛，被血虐一番，发现自己基础还是很薄弱，对java一些原理掌握的还是不够稳固，比如java反射注解，知道一点就是说不出来，很尴尬... 生命不止，学习不止啊

PS ：有兴趣的加入Android工程师交流QQ群：752016839 主要针对Android开发人员提升自己，突破瓶颈，相信你来学习，会有提升和收获。

之前那个项目 QNews 用的是的第三方的数据平台，所以访问次数会有限制，这就很无奈。。。

每天只能请求100次....但是LZ这个穷屌丝也买不起服务器，所以就上网查，有什么别的方法可以获取数据，意外之间发现了jsoup这个强大的框架，就花了上午时间学习了一下，然后下午做了一个小Demo，功能比较单一，请见谅。

其实一开始的时候是想爬今日头条的数据，但是发现数据总是为空，我估计是上锁了... 然后就把矛头转向了简书，哈哈哈...果然简书就是好，数据直接就可以爬到了，好开心啊！！项目地址：https://github.com/xiaweizi/jsoupJianshuDemo

先演示一波动态图：

话说这个布局就花了我半个小时...

一些基础的我就不说了，就简单说明一下我的数据是如何爬到的。可以直接去看一下我的源码，写的比较仓促，一些细节没有处理好，多多指教。

准备

1.1、相关资料

官方文档：https://jsoup.org/cookbook/

中文文档：http://www.open-open.com/jsoup/

1.2、添加依赖

compile 'org.jsoup:jsoup:1.9.2'

1.3、打开简书首页

在单个部分上右击，然后点击检查选项(我用的是QQ浏览器，其他未尝试)，底部就会跳出网页的源码，并且会跟踪到这个item对应的源码。

从上图可以大概了解到每个<li></li>标签里的内容就是我们每个item的信息。

爬数据

2.1、获取 Document 对象

Document document = Jsoup.connect("http://www.jianshu.com/")
                             .timeout(10000)
                             .get();

这里通过建立与服务器的链接，并设置10s的超时连接来获取 Document 对象

2.2、获取跟标签的 Elements 对象

找到文章列表模块，发现 <ul class="note-list></ul> 是我们需要信息的跟标签。通过 select 方法查询节点所有信息。

for (Element element : li) {
    ...
}

下面全部都是 li标签的列表，里面的内容大致相似，我们就可以通过循环来遍历里面的信息。

2.3、获取每个部分所有信息

因为信息比较多，我就选择比较有代表性的来将一下。

有个非常简单的方式：直接在你需要获取内容的部分右击，点击检查，就可以直接追踪到要查询的位置。

2.3.1、标题

就拿标题而言，直接在标题右击-->检查，即可，一目了然。然后我把数据截图一下。

通过 select 查询节点信息，然后.text 获取里面文本内容。

2.3.2、头像

这个就是先找到头像节点，然后图片节点，最后通过 attr 获取图片 url

2.3.3、首页链接

这里注意 href 元素，他存放的就是跳转链接，不过是相对路径，这个时候就需要通过 attr("abs:href") 获取绝对路径。

其他就大同小异，其实我知道也就这么多，也是不断尝试通过打印得出来的，还是比较心酸的，比较没学过 js，不过对 js 挺有兴趣的。

封装

剩下的就是将获取到的数据加载到bean对象中

3.1、创建 bean 对象

3.2、将获取到的数据添加到集合中

再来看一下效果：

总结

项目地址：https://github.com/xiaweizi/jsoupJianshuDemo

最后还是唠叨一下，我要求不是很高，怎么就没有公司要我呢？

希望大家多多支持我，谢谢！