分布式多爬虫系统——架构设计

其他 2018-08-28 16:41:51 阅读次数: 0

前言：

在爬虫的开发过程中，有些业务场景需要同时抓取几百个甚至上千个网站，此时就需要一个支持多爬虫的框架。在设计时应该要注意以下几点：

代码复用，功能模块化。如果针对每个网站都写一个完整的爬虫，那其中必定包含了许多重复的工作，不仅开发效率不高，而且到后期整个爬虫项目会变得臃肿、难以管理。
易扩展。多爬虫框架，这最直观的需求就是方便扩展，新增一个待爬的目标网站，我只需要写少量必要的内容（如抓取规则、解析规则、入库规则），这样最快最好。
健壮性、可维护性。这么多网站同时抓取，报错的概率更大，例如断网、中途被防爬、爬到“脏数据”等等。所以必须要做好日志监控，能实时监控爬虫系统的状态，能准确、详细地定位报错信息；另外要做好各种异常处理，如果你放假回来发现爬虫因为一个小问题已经挂掉了，那你会因为浪费了几天时间而可惜的（虽然事实上我个人会不时地远程查看爬虫状态）。
分布式。多网站抓取，数据量一般也比较大，可分布式扩展，这也是必需的功能了。分布式，需要注意做好消息队列，做好多结点统一去重。
爬虫优化。这就是大话题了，但最基本的，框架应该要基于异步，或者使用协程+多进程。
架构简明，要方便以后未知功能模块的添加。

需求如上，说的已经很清楚了。下面介绍一种架构设计，是去年做的了，现在分享一下。具体的代码实现就暂不公开了。

正文：

以下将通过解释两张图来说明架构的设计思想。
分布式多爬虫框架1

框架主要分成两部分：下载器Downloader和解析器Analyzer。Downloader负责抓取网页，Analyzer负责解析网页并入库。两者之间依靠消息队列MQ进行通信，两者可以分布在不同机器，也可分布在同一台机器。两者的数量也是灵活可变的，例如可能有五台机在做下载、两台机在做解析，这都是可以根据爬虫系统的状态及时调整的。
从上图可以看到MQ有两个管道：HTML/JS文件和待爬种子。Downloader从待爬种子里拿到一条种子，根据种子信息调用相应的抓取模块进行网页抓取，然后存入HTML/JS文件这个通道；Analyzer从HTML/JS文件里拿到一条网页内容，根据里面的信息调用相应的解析模块进行解析，将目标字段入库，需要的话还会解析出新的待爬种子加入MQ。
可以看到Downloader是包含User-Agent池、Proxy池、Cookie池的，可以适应复杂网站的抓取。
模块的调用使用工厂模式。

分布式多爬虫框架2

这张图是上张图的另一种表述。
Htmls队列和Seed是队列可以独立分开，甚至数量也可以多开，之间没有联系。完全可以灵活地根据爬虫状态和硬件环境作调整。另外8G的内容可以让Redis作为Seeds队列存放5~8千万个种子。
分布式爬虫非常关键的一点：去重。可以看到多个解析器Analyzer共用一个去重队列，才能够保证数据的统一不重复。去重队列可以放在一台机上。基于Redis实现了Bloomfilter算法（详细见《基于Redis的Bloomfilter去重（附Python代码）》），理论上8G的内存可以满足30亿条URL的去重，如果允许漏失概率再大点的话能去重更多。

结语：

要写一个支持分布式、多爬虫的框架，具体的实现上还是有一定难度的。在实现主要功能以外，还要注意做到代码严谨规范，爬虫高效健壮的要求。做完这些以后，你定会成长不少！

今天就分享这些，欢迎交流！

转载请注明出处，谢谢！（原文链接：http://blog.csdn.net/bone_ace/article/details/55000416）

猜你喜欢

转载自blog.csdn.net/Bone_ACE/article/details/55000416

分布式多爬虫系统——架构设计

分布式爬虫架构设计

分布式系统架构设计

分布式会话跟踪系统架构设计与实践

分布式、服务化的ERP系统架构设计

基于WCF大型分布式系统的架构设计

从Elasticsearch来看分布式系统架构设计

.Net 分布式系统架构设计（转）

基于分布式的实时推荐系统的架构设计

分布式缓存架构设计

分布式架构设计概述

分布式架构设计概述

【架构设计】分布式缓存

大型分布式架构设计

软考高级系统架构设计师：论分布式存储系统架构设计

系统架构设计笔记（39）—— 简单分布式系统设计

Java架构-美团即时物流的分布式系统架构设计

《架构设计》-08-分布式系统和Rpc架构

架构设计：系统存储（30）——分布式文件系统Ceph（RADOS结构）

架构设计：系统存储（29）——分布式文件系统Ceph（管理）

架构设计：系统存储（28）——分布式文件系统Ceph（挂载）

架构设计：系统存储（27）——分布式文件系统Ceph（安装）

系统架构设计笔记（11）——分布式数据库系统

分布式发布订阅消息系统 Kafka 架构设计

美团-分布式会话跟踪系统架构设计与实践

【大型分布式网站架构设计与实践】-系统稳定性

分布式存储系统架构设计，应该遵循什么样的原则？

美团即时物流的分布式系统架构设计

【好文分享】美团即时物流的分布式系统架构设计

一个分布式 MySQL Binlog 存储系统的架构设计

今日推荐

Arc Browser for Windows 1.0 正式 GA

90后程序员开发视频搬运软件、不到一年获利超 700 万，结局很刑！

《美国对全球网络空间安全与发展的威胁和破坏》报告发布

火速冲上 GitHub 热榜 —— 开源编程语言、框架哪有这么可爱？

北京人形机器人创新中心发布全球首个纯电驱拟人奔跑的全尺寸人形机器人“天工”

周排行

rbac——界面、权限

Apache CXF + SpringMVC 整合发布WebService

so插件化

Vue.js实战系列---图标字体制作（svg格式）

PAT乙级 1007 素数对猜想(孪生素数对) (20分) ---（C语言 + 详细注释）

被IRM保护的文档，打开失败

Calendar和Date计算日期差的小问题

win10子系统ubuntu18.4安装docker

利用Wrap Shell Script定位Android Native内存泄漏

MySQL: Transaction (Part I - Basic Concept)

每日归档

更多

2024-05-03(19)

2024-05-02(0)

2024-05-01(4)

2024-04-30(1)

2024-04-29(40)

2024-04-28(0)

2024-04-27(56)

2024-04-26(39)

2024-04-25(22)

2024-04-24(36)