Java爬虫框架(三)--模块设计之二

 6.      Filter

Filter可以对解析好的新Task,进行过滤。



 

7.      Handler

Handler对解析好的内容进行进一步处理,异步化处理和爬取解析。处理主要是将爬取的数据入库和索引。

 

一、        Task队列

Task队列,存放还没有被处理的新任务。



 

二、        Visited

Visited表的判断其实是TaskFilter的一种,只是TaskFilter用了VisitedTable来存储已经爬取过的任务。



 

VisitedTaskFilter:判断Task是否已经被处理过

VisitedTable:存储已经被爬取过的任务

猜你喜欢

转载自ldd600.iteye.com/blog/1151961