用Python爬网页需要了解以及掌握的基本知识 - 代码天地

用Python爬网页需要了解以及掌握的基本知识

其他 2019-09-06 23:40:22 阅读次数: 0

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接： https://blog.csdn.net/wcg541/article/details/100109044

爬虫其实就是一个数据获取的过程，无非就是两步，请求页面，解析数据，下面我大概介绍一下入门爬虫所需要掌握的基本知识：

1.要具有一定的前端知识，最起码应该能大概看懂网页内容，像基本的html元素，css样式，javascript等，不要求熟练掌握，这些是最基础的东西，数据都在网页里面嵌套着，要是连基本的网页都不会，如何解析数据呢？所以花个一两天时间了解一下网页知识：

2.要会进行抓包分析，会使用浏览器自带的开发者工具。网页中有些数据是动态加载的，只在请求网页时才加载数据，在网页源码中是不显示的，所以你需要会进行抓包分析，解析json数据等。我们经常模拟登录时，也需要进行抓包分析，需要post提交哪些内容等，只有在抓包分析后，才能构建相关提交数据：

3.防止被禁掉。短时间内频繁的访问服务器，很有可能会被服务器识别为爬虫，禁掉IP，这个时候你就需要使用IP代理池等，尽可能不被服务器发现。

4.存储数据。爬取下来的数据，我们需要进行存储，如果数据量大的话，这个时候你就需要了解一些常用的数据库的使用，像mysql，mongodb等，方便查询也方便管理：

如果你依然在编程的世界里迷茫，可以加入我们的Python学习扣qun：784758214，看看前辈们是如何学习的。交流经验。从基础的python脚本到web开发、爬虫、django、数据挖掘等，零基础到项目实战的资料都有整理。送给每一位python的小伙伴！分享一些学习的方法和需要注意的小细节，点击加入我们的 python学习者聚集地

5.最后就是学一些爬虫常用的框架，可以明显提高开发效率，避免重复造轮子，像python的开源爬虫框架scrapy等，使用起来也更快捷：

猜你喜欢

转载自blog.csdn.net/wcg541/article/details/100109044

用Python爬网页需要了解以及掌握的基本知识

用Python爬网页需要了解什么背景知识

学习流媒体之前需要了解的基本知识

企业需要了解的物联网（IoT）基本知识

就刚起步而言，我认为需要了解的基本知识（字符串）

做马拉西亚语翻译这些基本知识需要了解

javaScript需要掌握的基本知识

TensorFlow必须要了解的基本知识

必须要了解的 “ 索引 ” 基本知识

掌握SQL基础需要了解的小知识

Android 虚拟机：你需要掌握的基本知识

需要了解的Smbios知识

Java小白需要了解的行业信息以及需要掌握的技术

Python基本知识以及if语句

初学Python需要了解的知识点

Python爬虫初学者需要了解的知识与技能

网页美工的基本知识

kafka基本知识了解

了解Maven的基本知识

netty基本知识了解

想要熟练掌握Python元组？你需要了解这10件应知事项

python基本知识

python的基本知识

App开发需要了解的基本技术

前端需要了解的 SSO 与 CAS 知识

接口测试需要了解的知识

Service需要了解的理论知识

前端需要了解的http知识

需要了解的知识点

机器学习需要了解的知识

今日推荐

基于大语言模型的开源知识库问答系统 MaxKB GitHub Star 数量突破 5,000 个！

美国拟限制 AI 大模型出口中国和俄罗斯

苹果将与 OpenAI 达成协议，将 ChatGPT 应用于 iPhone

openKylin 社区生态委员会第六次会议圆满召开

阿里云正式发布通义千问 2.5

Python 3.13 发布首个 Beta：实验性自由线程模式和 JIT、改进交互式解释器

Stack Overflow 拿我的代码去训练 AI 大模型，还封了我的账号

Pop!_OS 的 COSMIC 桌面完成 App Store 上架工作

《2024 年一季度互联网投融资运行情况》研究报告

报告：Django 仍然是 74% 开发者的首选

15 年前上了“FFmpeg 耻辱柱”，今天他还得谢谢咱——腾讯QQPlayer一雪前耻？

TIOBE 5 月榜单：Fortran “复活”进入 Top 10

周排行

记一下去大梅沙的准备（2018-05-26）

Spring 注解事务

基于HTTP协议的客户端缓存

阿里云rds 备份和还原

[PHP] 几个拖慢 PHP 程序/API 运行速度的点

python 代码风格------------PEP8规则

js控制json生成菜单——自制菜单（一）

将字符串: 'k:1|k1:2|k2:3|k3:4 ' ,处理成 python 字典: {'k':1, 'k1':2, ...}

微信小程序转支付宝小程序

Qt551.窗口滚动条

每日归档

更多

2024-05-13(18)

2024-05-12(0)

2024-05-11(38)

2024-05-10(38)

2024-05-09(35)

2024-05-08(42)

2024-05-07(14)

2024-05-06(40)

2024-05-05(0)

2024-05-04(7)