爬取起点小说总排行榜 - 代码天地

爬取起点小说总排行榜

其他 2018-07-06 09:05:14 阅读次数: 0

功能：在表格中按排名显示小说名字作者类型状态简介和字数
代码：import xlwt
import requests
from lxml import etree
import time
all_info_list = []

def get_info(url):
html = requests.get(url)
selector = etree.HTML(html.text)
infos = selector.xpath('//ul[@class="all-img-list cf"]/li')

for info in infos:
title = info.xpath('div[2]/h4/a/text()')[0]
author = info.xpath('div[2]/p[1]/a[1]/text()')[0]
style_1 = info.xpath('div[2]/p[1]/a[2]/text()')[0]
style_2 = info.xpath('div[2]/p[1]/a[3]/text()')[0]
style = style_1+'·'+style_2
complete = info.xpath('div[2]/p[1]/span/text()')[0]
introduce = info.xpath('div[2]/p[2]/text()')[0].strip()
word = info.xpath('div[2]/p[3]/span/text()')[0].strip('万字')
info_list = [title,author,style,complete,introduce,word]
all_info_list.append(info_list)
time.sleep(1)

if __name__ == '__main__':
urls = ['http://www.qidian.com/all/?page={}'.format(str(i)) for i in range(1,200)]
for url in urls:
get_info(url)
header = ['title','author','style','complete','introduce','word']
book = xlwt.Workbook(encoding='utf-8')
sheet = book.add_sheet('Sheetl')
for h in range(len(header)):
sheet.write(0, h, header[h])
i = 1
for list in all_info_list:
j = 0
for data in list:
sheet.write(i, j, data)
j += 1
i += 1
book.save('xiaoshuo.xls')
问题：- -爬取文件过大可能网速慢生成文件速度太慢

猜你喜欢

转载自www.cnblogs.com/zhentaoFrezt/p/9271690.html

爬取起点小说总排行榜

爬取360影视排行榜-总榜

Python爬虫实战：爬取全站小说排行榜

python爬虫爬取小说排行榜目录并导入Excel中，方便筛选

豆瓣电影排行榜爬取

爬取猫眼电影排行榜

requests爬取猫眼排行榜

python爬虫爬取酷狗音乐排行榜

python — 定时爬取猫眼电影排行榜

利用scrapy框架爬取网易新闻排行榜

爬取豆瓣电影排行榜前250

python爬取酷狗音乐排行榜

python爬取b站排行榜

使用xpath爬取猫眼电影排行榜

爬取豆瓣网电影排行榜

scrapy爬取猫眼电影排行榜

爬取中国大学排行榜

中国最好大学排行榜爬取

爬取微博热搜排行榜

爬取时代周报排行榜前十

Python爬取虾米音乐排行榜

爬取爱奇艺电影排行榜

爬取厦门特色小吃排行榜

爬取B站热门视频排行榜

爬取酷狗TOP_排行榜

爬取芒果TV电视剧排行榜

爬取百度排行榜

爬取zol索尼相机排行榜

python 爬虫爬取网易新闻网易排行榜

Python爬取酷我音乐排行榜歌曲~

今日推荐

《美国对全球网络空间安全与发展的威胁和破坏》报告发布

火速冲上 GitHub 热榜 —— 开源编程语言、框架哪有这么可爱？

北京人形机器人创新中心发布全球首个纯电驱拟人奔跑的全尺寸人形机器人“天工”

LFOSSA 源来如此公开课 | 掌握云原生未来：CNCF 认证全面攻略与备考秘籍

国产云输入法——仅华为无云端数据上传安全问题

周排行

Python环境安装与基础语法（1）——计算机基础知识

IMU预积分

ADAS中的LDW、FCW、BSD、LCA、ACC、AEB、APA、DMS代表的含义

B站笔试两道题

skyeye arm 硬件虚拟机环境的搭建

Web前端静态页面示例

数组-合并排序数组 II-简单

springcloud之版本问题启动报错

面向对象-------------匿名对象(六)

输入URL到页面呈现中间发生了什么？

每日归档

更多

2024-04-30(1)

2024-04-29(40)

2024-04-28(0)

2024-04-27(56)

2024-04-26(39)

2024-04-25(22)

2024-04-24(36)

2024-04-23(26)

2024-04-22(39)

2024-04-21(0)