6. Filter
Filter可以对解析好的新Task,进行过滤。
7. Handler
Handler对解析好的内容进行进一步处理,异步化处理和爬取解析。处理主要是将爬取的数据入库和索引。
一、 Task队列
Task队列,存放还没有被处理的新任务。
二、 Visited表
Visited表的判断其实是TaskFilter的一种,只是TaskFilter用了VisitedTable来存储已经爬取过的任务。
VisitedTaskFilter:判断Task是否已经被处理过
VisitedTable:存储已经被爬取过的任务