Scrapy框架原理及流程 - 代码天地

Scrapy框架原理及流程

其他 2018-10-07 09:19:32 阅读次数: 0

这是一篇整理爬虫概念知识的文章。

Scrapy工作流程图

Scrapy数据流是由执行的核心引擎(engine)控制，流程是这样的：

1、爬虫引擎获得初始请求开始抓取。

2、爬虫引擎开始请求调度程序，并准备对下一次的请求进行抓取。

3、爬虫调度器返回下一个请求给爬虫引擎。

4、引擎请求发送到下载器，通过下载中间件下载网络数据。

5、一旦下载器完成页面下载，将下载结果返回给爬虫引擎。

6、引擎将下载器的响应通过中间件返回给爬虫进行处理。

7、爬虫处理响应，并通过中间件返回处理后的items，以及新的请求给引擎。

8、引擎发送处理后的items到项目管道，然后把处理结果返回给调度器，调度器计划处理下一个请求抓取。

9、重复该过程（继续步骤1），直到爬取完所有的url请求。

爬虫引擎(ENGINE)

爬虫引擎负责控制各个组件之间的数据流，当某些操作触发事件后都是通过engine来处理。

调度器 (SCHEDULER)

调度接收来engine的请求并将请求放入队列中，并通过事件返回给engine。

下载器

通过engine请求下载网络数据并将结果响应给engine。

Spider

Spider发出请求，并处理engine返回给它下载器响应数据，以items和规则内的数据请求(urls)返回给engine。

管道项目(item pipeline)

负责处理engine返回spider解析后的数据，并且将数据持久化，例如将数据存入数据库或者文件。

下载中间件

下载中间件是engine和下载器交互组件，以钩子(插件)的形式存在，可以代替接收请求、处理数据的下载以及将结果响应给engine。

spider中间件

spider中间件是engine和spider之间的交互组件，以钩子(插件)的形式存在，可以代替处理response以及返回给engine items及新的请求集。

猜你喜欢

转载自blog.csdn.net/WanYu_Lss/article/details/82951776

Scrapy框架原理及流程

Python爬虫 scrapy框架原理，scrapy开发流程

scrapy框架流程

scrapy框架流程补充

Scrapy框架的流程

Scrapy框架原理

scrapy的框架原理

Scrapy框架原理分析

scrapy框架-架构流程介绍

scrapy + selenium + phantom框架流程

scrapy框架爬虫基本流程

scrapy 框架的工作流程

scrapy框架的概念和流程

Scrapy框架原理及部件组成

Scrapy异步框架核心原理

Scrapy 爬虫框架工作原理

爬虫框架之Scrapy运行流程

scrapy框架 - 基础概念和流程

浅析Scrapy框架运行的基本流程

Scrapy框架的组件和执行流程

基于Scrapy框架的网络爬虫开发流程

Scrapy框架爬虫基本使用流程

scrapy 原理图及工作流程

爬虫框架Scrapy 之(四) --- scrapy运行原理(管道）

scrapy框架结构与工作原理

Python的爬虫框架scrapy----原理介绍

爬虫进阶之Scrapy框架原理及实现

对scrapy经典框架爬虫原理的理解

pyhton爬虫学习（十三）：scrapy框架原理

爬虫框架scrapy基本原理

今日推荐

Linus “吃狗粮”最积极！

开源日报 | Winamp播放器即将开源；生成式AI之战升级第二轮；Linus“吃狗粮”最积极；AI进入泡沫前期；吴泳铭为阿里云带来了什么？

NetBSD 禁止提交由 AI 生成的代码

Apache Doris 2.0.10 版本正式发布！

开源日报 | 大模型开战；大模型独角兽被曝卖身；周鸿祎建议谷歌开源所有产品；最大开源AI社区提供1000万美元共享GPU

开源日报 | Chrome内置Gemini的意义不在于Gemini；中国AI追随之路的五大误区；ECharts创始人“下海”养鱼；谷歌I/O开发者大会什么都有，只是没有惊喜

微软回应中国区AI团队“打包赴美”传闻

周排行

SVN服务端安装在阿里云

实战 | 相机标定

webpack核心概念

note20——》只要肯低头吃苦，人生就会有救

PAT甲级 1062 Talent and Virtue （25 分）排序

NG Toolset开发笔记--5GNR Resource Grid（26）

如何对待上司

oracle命令

第9章 STL迭代器

logstash使用es映射模板

每日归档

更多

2024-05-20(36)

2024-05-19(0)

2024-05-18(4)

2024-05-17(34)

2024-05-16(6)

2024-05-15(24)

2024-05-14(0)

2024-05-13(18)

2024-05-12(0)

2024-05-11(38)