python爬虫系列一 - 代码天地

python爬虫系列一

编程语言 2018-10-10 05:29:02 阅读次数: 0

Python爬虫这门技术你可以做得很简单，你也可以玩得很深入.打比方用简单的爬虫方式爬取1000万条数据可能需要一周时间，但如果你的爬虫玩得比较厉害，你可以采用分布式爬虫技术1天就能完成了1000万条数据。虽然都是爬虫，但这就是菜鸟与大牛的区别！这就和太极拳似的，易学难精！

聊聊爬虫需要涉及的知识点。

网页知识

html，js,css，xpath这些知识，虽然简单，但一定需要了解。你得知道这些网页是如何构成的，然后才能去分解他们.

HTTP知识

一般爬虫你需要模拟浏览器的操作，才能去获取网页的信息
如果有些网站需要登录，才能获取更多的资料，你得去登录，你得把登录的账号密码进行提交
有些网站登录后需要保存cookie信息才能继续获取更多资料

正则表达式

有了正则表达式才能更好的分割网页信息，获取我们想要的数据，所以正则表达式也是需要了解的.

一些重要的爬虫库

url,url2
beautiul Soup

数据库

爬取到的数据我们得有个地方来保存，可以使用文件，也可以使用数据库，这里我会使用mysql，还有更适合爬虫的MongoDB数据库，以及分布式要用到的redis 数据库

爬虫框架

PySpider和Scrapy 这两个爬虫框架是非常NB的,简单的爬虫可以使用urllib与urllib2以及正则表达式就能完成，但高级的爬虫还得用这两个框架。这两个框架需要另行安装。后面一起学习.

反爬虫

有时候你的网站数据想禁止别人爬取，可以做一些反爬虫处理操作。打比方百度上就无法去查找淘宝上的数据，这样就避开了搜索引擎的竞争，淘宝就可以搞自己的一套竞价排名

分布式爬虫

使用多个redis实例来缓存各台主机上爬取的数据。

爬虫要学的东西还是挺多的，想把爬虫玩得666，基本就是这些知识点吧！好了，上面的东西我也只是粗略整理，笔误在所难免，后面我们会一起来学习爬虫知识吧！而我也准备做这样一套完整的爬虫系列教程！

最后我们一起来一场愉快的爬虫之旅吧！

猜你喜欢

转载自blog.csdn.net/kevin_love_it/article/details/82961724

Python 爬虫系列（一）

python爬虫系列（一）

python爬虫系列一

python爬虫系列开发scrapy掌握（一）

python反反爬虫系列一（文本混淆）

python爬虫系列——开始入土（一）

$python爬虫系列（1）——一个简单的爬虫实例

Python爬虫系列

python爬虫系列（五）

python爬虫系列（四）

python爬虫系列（三）

python爬虫系列（二）

python爬虫系列版

python爬虫学习系列

python爬虫系列（六）

爬虫系列（一）

爬虫系列一

python爬虫系列之数据的存储（一）：json库的使用

python爬虫系列一——urllib基本请求库

【Python】爬虫入门强烈推荐系列一

Python爬虫系列（一）——手把手教你写Python爬虫

python 爬虫系列03--职位爬虫

python爬虫系列之初识爬虫!

python爬虫系列之初识爬虫

【python爬虫系列】11异步爬虫

Python爬虫学习系列教程

Python爬虫系列-BeautifulSoup详解

Python爬虫系列-PyQuery详解

python爬虫系列——requests库

Python最简单的爬虫系列！

今日推荐

TIOBE 5 月榜单：Fortran “复活”进入 Top 10

GCC 14.1 发布

面壁智能发布 Eurux-8x22B 开源大模型 —— 堪称「理科状元」

开源日报 | 谷歌扶持鸿蒙上位；开源Rabbit R1；Docker加持的安卓手机；微软的焦虑和野心；海尔电器把开放平台关了

中国码农的“35岁魔咒”

蘭雅 CorelDRAW 插件 2024.5.1 国际劳动节版，免费下载

Arc Browser for Windows 1.0 正式 GA

90后程序员开发视频搬运软件、不到一年获利超 700 万，结局很刑！

周排行

Java自定义时间格式

同步整形电路

在开发中最最最常用的字符串的属性大集合

Linux 查看端口占用并杀掉

Java基础四：ArrayList

多线程之死锁就是这么简单

mysql 基础命令集

awk 命令详解

Centos6.3编译安装nginx+php步骤

OCR （Optical Character Recognition，光学字符识别）

每日归档

更多

2024-05-08(42)

2024-05-07(14)

2024-05-06(40)

2024-05-05(0)

2024-05-04(7)

2024-05-03(19)

2024-05-02(0)

2024-05-01(4)

2024-04-30(1)

2024-04-29(40)