简单爬虫--爬取豆瓣阅读出版社信息并保存

先看看要爬取页面出版社信息格式:
在这里插入图片描述

import urllib.request
import re

data = urllib.request.urlopen("https://read.douban.com/provider/all").read().decode("UTF-8")
# print(len(data))
pat = '<div class="name">(.*?)</div>'
r = re.compile(pat).findall(data)
# print(r[0])
fh = open("C:/Users/Nicht_sehen/Desktop/cbs.txt","w")
for i in range(0,len(r)):
    fh.write(r[i]+"\n")
fh.close()

打开桌面的cbs文件:
在这里插入图片描述
可以看到爬下来的出版社信息已经写入了文件

发布了125 篇原创文章 · 获赞 56 · 访问量 7万+

猜你喜欢

转载自blog.csdn.net/Nicht_sehen/article/details/102017850
今日推荐