前言
今天给大家介绍的是Python爬虫电影短评数据
开发工具
Python版本: 3.6
相关模块:
requests模块
parsel模块
time模块
环境搭建
安装Python并添加到环境变量,pip安装需要的相关模块即可。
文中完整代码及文件,评论留言获取
数据来源查询分析
浏览器中打开我们要爬取的页面
按F12进入开发者工具,查看我们想要的电影短评在哪里
这里我们需要页面数据就可以了
代码实现
headers = {
'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/98.0.4758.102 Safari/537.36'
}
for page in range(1, 20):
url = f'https://movie.douban.com/subject/35613853/comments?start={
page*20}&limit=20&status=P&sort=new_score'
data_html = requests.get(url=url, headers=headers).text
selector = parsel.Selector(data_html)
comment_list = selector.css('.comment-item')
for comment in comment_list:
short = comment.css('.short::text').get().strip()
name = comment.css('.comment-info a::text').get().strip()
time = comment.css('.comment-time::text').get().strip()
vote_count = comment.css('.votes.vote-count::text').get().strip()
print(short, name, time, vote_count)
最后
为了感谢读者们,我想把我最近收藏的一些编程干货分享给大家,回馈每一个读者,希望能帮到你们。
里面有适合小白新手的实战教程给到大家~
快来和小鱼一起成长进步吧!
① 100+多本PythonPDF(主流和经典的书籍应该都有了)
② Python标准库(最全中文版)
③ 爬虫项目源码(四五十个有趣且经典的练手项目及源码)
④ Python基础入门、爬虫、web开发、大数据分析方面的视频(适合小白学习)
⑤ Python学习路线图(告别不入流的学习)