开启线程池爬取视频数据 - 代码天地

开启线程池爬取视频数据

其他 2019-04-22 12:44:45 阅读次数: 0

使用线程池

#需求：使用线程池爬取视频数据
import requests
from lxml import etree
import re
import random
#导入线程池模块
from multiprocessing.dummy import Pool
pool = Pool(10)
#线程池的使用场景：应用在所有耗时的操作中

headers = {
    'User-Agent':'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/72.0.3626.121 Safari/537.36'
}
url = 'https://www.******.com/category_1'
page_text = requests.get(url=url,headers=headers).text
tree = etree.HTML(page_text)
li_list = tree.xpath('//ul[@id="listvideoListUl"]/li')
video_url_list = [] #装所有视频的连接
for li in li_list:
    detail_url = "https://www.******.com/"+li.xpath('./div/a/@href')[0]
    detail_page_text = requests.get(url=detail_url,headers=headers).text
    #使用正则对视频连接进行解析
    video_url = re.findall('srcUrl="(.*?)",vdoUrl=',detail_page_text,re.S)[0]
    video_url_list.append(video_url)
#对视频的连接发起请求获取视频数据
video_data_list = pool.map(getVideoData,video_url_list) #video_data_list存储的就是所有视频的二进制数据
#使用线程池进行持久化存储的操作
pool.map(saveVideoData,video_data_list)

def getVideoData(url):
    video_data = requests.get(url=url,headers=headers).content
    return video_data

def saveVideoData(data):
    fileName = str(random.randint(0,10000))+'.mp4'
    with open(fileName,'wb') as fp:
        fp.write(data)
        print(fileName,'下载成功')

猜你喜欢

转载自www.cnblogs.com/zhang-zi-yi/p/10749407.html

开启线程池爬取视频数据

梨视频，进程池、线程池爬取

使用较高性能的线程池_爬取梨视频

爬虫——使用多进程爬取视频数据

python selenium爬取街舞网站视频数据

超详细爬取bilibili视频数据

java开启多线程同时查询数据库（线程池+redis缓存优化）

基于multiprocessing.dummy线程池爬取梨视频的视频信息

线程池爬取好花网

线程池爬取汽车之家.py

线程池爬取小说实例

爬起腾讯视频数据的处理与分析爬取腾讯视频热播榜并处理分析

进程池，线程池与跨进程数据共享爬取某岸网图片

超实用工具you-get(爬取视频数据神器）

requests模块处理cookie,代理ip，基于线程池数据爬取

利用代理池和多线程爬取房天下上万条数据

使用线程池来进行发送爬取请求和存储数据

多线程+代理池爬取天天基金网股票数据

Python爬虫-进程池方式爬取头条视频

requests模块&代理IP池搭建&视频爬取

大众点评之线程池实现全站爬取

基于requests模块的cookie,session和线程池爬取

线程池爬取一本小说

爬虫项目代理操作和线程池爬取

异步爬虫-利用线程池爬取acg美图

Python3爬取今日头条文章视频数据，完美解决as、cp、_signature的加密方法

python的多线程异步爬取梨视频(原创）

Python3 多线程爬取梨视频

爬取网站上无法下载音频数据

多线程+代理池爬取天天基金网、股票数据(无需使用爬虫框架)

今日推荐

《美国对全球网络空间安全与发展的威胁和破坏》报告发布

火速冲上 GitHub 热榜 —— 开源编程语言、框架哪有这么可爱？

北京人形机器人创新中心发布全球首个纯电驱拟人奔跑的全尺寸人形机器人“天工”

LFOSSA 源来如此公开课 | 掌握云原生未来：CNCF 认证全面攻略与备考秘籍

国产云输入法——仅华为无云端数据上传安全问题

开源日报 | 工业开源项目OGG 1.0；姐姐，你要和我一起配置火狐吗；苹果AI遥遥落后？Fedora 40

周排行

购置笔记本常识

从源码看Spring Security之采坑笔记（Spring Boot篇）

大数据学习——高可用配置案例

如何避免选择不专业的建站公司?

Euclid's Game HDU - 1525（博弈）

面试笔记（六）---Js实现eventHandler

Windows 实例搭建的 FTP 在外网无法连接和访问

设计模式 : 桥接模式

USB 设备驱动开发之几个重要结构体分析

14-p14_sqrt求平方根

每日归档

更多

2024-04-29(40)

2024-04-28(0)

2024-04-27(56)

2024-04-26(39)

2024-04-25(22)

2024-04-24(36)

2024-04-23(26)

2024-04-22(39)

2024-04-21(0)

2024-04-20(6)