urllib爬取百度贴吧贴子页面 - 代码天地

urllib爬取百度贴吧贴子页面

其他 2018-07-03 22:20:23 阅读次数: 0

# coding:utf-8
# 爬取百度贴吧.py

import urllib.request
import urllib
urllib2 = urllib.request

def loadPage(url,filename):
	"""
	作用：根据url发送请求，获取服务器响应文件
	url：需要爬取的url地址
	filename：处理的文件名
	"""
	print("正在下载"+filename)
	headers ={"User-Agent":
	"Mozilla/5.0 (Windows NT 6.1;) Apple....\
	Mozilla/5.0 (X11; Cros i686 2268.111.0)...\
	Mozilla/5.0 (Macintosh; U; PPC Mac OS X)...\
	Mozilla/5.0 (Macintosh;Intel Mac OS)..."
	}

	request = urllib2.Request(url,headers=headers)
	response = urllib2.urlopen(request)
	html = response.read()
	return html
	# return html.decode('utf-8')
def writePage(html,filename):
	"""
	作用：将html内容写入到本地
	html：服务器响应文件内容
	"""
	print("正在保存"+filename)

	# 文件写入，这样写无需写close(),需要编码转换
	with open(filename,"w+",encoding='utf-8') as f:
		f.write(html.decode("utf-8"))
	
	print('-'*30)

def tiebaSpider(url,beginPage,endPage,kw):

	"""
	贴吧爬虫调度器，负责组合处理每个页面的url地址
	url:贴吧url的前半部分
	beginPage:起始页
	endPage：结束页
	"""
	for page in range(beginPage,endPage+1):
		pn = (page-1)*50
		filename = str(kw)+"贴吧第" + str(page) + "页.html"
		fullurl = url + "&pn=" + str(pn)
		# print(fullurl)
		html = loadPage(fullurl,filename)
		# print(html)
		writePage(html,filename)
	print("已完成，谢谢使用！")

if __name__ == "__main__":
	kw = input("请输入需要爬取贴吧名字：")
	while True:
		try:
			beginPage = int(input("请输入要抓取'%s'贴吧的开始页数："%kw))
			endPage = int(input("请输入要抓取'%s'贴吧的结束页数："%kw))
			if int(endPage)>= int(beginPage):
				url = "http://tieba.baidu.com/f?"
				key = urllib.parse.urlencode({"kw":kw})
				fullurl = url + key
				tiebaSpider(fullurl, beginPage,endPage,kw)
				break
			else:
				print("请输入正确的页数,并且结束页数要大于等于开始页数")
		except:
			print("请输入正确的页数！")

猜你喜欢

转载自blog.csdn.net/z564359805/article/details/80888093

urllib爬取百度贴吧贴子页面

用urllib和re爬取百度贴吧

实例：批量爬取百度贴吧页面数据

Python爬虫【实战篇】百度贴吧爬取页面存到本地

python爬虫01-爬取静态页面（百度贴吧）

利用爬虫爬取百度贴吧内容

ulrlib案例-爬取百度贴吧

python爬取百度贴吧张国荣图片

python爬虫爬取百度贴吧图片

Python爬取百度贴吧图片

python爬取百度贴吧指定内容

python学习笔记--爬取百度贴吧

python爬取百度贴吧Jpg图片

爬取百度贴吧图片

百度贴吧图片爬取

爬虫学习（五）————百度贴吧的爬取

Scrapy 爬取百度贴吧全站图片

python爬虫爬取百度贴吧帖子

简单爬取百度贴吧图片

爬取百度贴吧图片（表情包）

go-百度贴吧-纵向爬取

001 爬取百度贴吧并保存

Python爬取百度贴吧内容

实现对任意百度贴吧的html爬取

爬虫实战--爬取百度贴吧

爬取百度贴吧热议榜

爬取百度贴吧帖子页内容

今日成果:爬取百度贴吧

爬取百度暗影精灵5贴吧

python百度贴吧爬取

今日推荐

openKylin 社区生态委员会第六次会议圆满召开

阿里云正式发布通义千问 2.5

Python 3.13 发布首个 Beta：实验性自由线程模式和 JIT、改进交互式解释器

Stack Overflow 拿我的代码去训练 AI 大模型，还封了我的账号

Pop!_OS 的 COSMIC 桌面完成 App Store 上架工作

报告：Django 仍然是 74% 开发者的首选

《2024 年一季度互联网投融资运行情况》研究报告

15 年前上了“FFmpeg 耻辱柱”，今天他还得谢谢咱——腾讯QQPlayer一雪前耻？

TIOBE 5 月榜单：Fortran “复活”进入 Top 10

GCC 14.1 发布

面壁智能发布 Eurux-8x22B 开源大模型 —— 堪称「理科状元」

开源日报 | 谷歌扶持鸿蒙上位；开源Rabbit R1；Docker加持的安卓手机；微软的焦虑和野心；海尔电器把开放平台关了

周排行

计算机组成与设计（七）—— 除法器

Integer Approximation(分治+枚举)

大话数据库索引

windows10系统JDK的配置及下载地址

mysql实现秒值转换中原六仔平台搭建

Codeforces Round #556 (Div. 1)

百练1064 网线主管

Codeforces 995F Cowmpany Cowmpensation

子集生成之增量构造法，位向量法，二进制法

ERROR: cmd.exe failed with args /c "/APK\gradle\rungradle.bat...

每日归档

更多

2024-05-10(38)

2024-05-09(35)

2024-05-08(42)

2024-05-07(14)

2024-05-06(40)

2024-05-05(0)

2024-05-04(7)

2024-05-03(19)

2024-05-02(0)

2024-05-01(4)