python学习笔记--爬取百度贴吧 - 代码天地

python学习笔记--爬取百度贴吧

其他 2018-11-11 11:21:07 阅读次数: 0

"""
爬取百度贴吧的内容
@author:一叶扁舟
"""
import urllib.request
import urllib




def loadPage(fullUrl, filName):
    """
    加载页面
    :return:
    """
    print("正在下载......"+filName+".....")

    headers = {"User-Agent" : "Mozilla/5.0 (Macintosh; Intel Mac OS X 10_7_0) AppleWebKit/535.11 (KHTML, like Gecko) Chrome/17.0.963.56 Safari/535.11"}

    request = urllib.request.Request(fullUrl,headers = headers)

    return urllib.request.urlopen(request).read()




def writePage(html,fileName):
    # print(html)
    """
    将页面写到磁盘
    :return:
    """
    with open("./spiderhtml/"+fileName,"wb") as f:
        f.write(html)
        print("-"*120)





def baiduTiebaSpider(url,startNum,endNum):
    """
    组装拼接的url
    :return:
    """
    for page in range(startNum, endNum+1):
        # 页数
        pn = (page  - 1) * 50
        # //将一页的数据保存下来
        fileName = "第"+str(page)+"页.html"

        # 加页数的访问路径
        fullUrl = url +"&pn=" + str(pn)

        html = loadPage(fullUrl, fileName)

        writePage(html,fileName)



if __name__ == "__main__":
    kw = input("请输入关键词:")
    startNum = int(input("请输入起始页:"))
    endNum = int(input("请输入结束页:"))
    dic = {"kw":kw}

    url = "http://tieba.baidu.com/f?"
    key =  urllib.parse.urlencode(dic)
    fullUrl = url + key

    baiduTiebaSpider(fullUrl,startNum,endNum)

猜你喜欢

转载自blog.csdn.net/u011662320/article/details/81211742

python学习笔记--爬取百度贴吧

学习笔记（爬虫）：爬取百度贴吧，美女吧图片

python爬取百度贴吧张国荣图片

python爬虫爬取百度贴吧图片

Python爬取百度贴吧图片

python爬取百度贴吧指定内容

python爬取百度贴吧Jpg图片

python爬虫爬取百度贴吧帖子

Python爬取百度贴吧内容

python百度贴吧爬取

爬虫学习（五）————百度贴吧的爬取

【Python学习1：爬取百度贴吧并按回复量生成排序】

【Python真的很强大】使用scrapy爬取百度贴吧-上海吧

Python 爬百度贴吧里面的图片分页分帖子爬取

利用爬虫爬取百度贴吧内容

urllib爬取百度贴吧贴子页面

ulrlib案例-爬取百度贴吧

爬取百度贴吧图片

百度贴吧图片爬取

Scrapy 爬取百度贴吧全站图片

简单爬取百度贴吧图片

爬取百度贴吧图片（表情包）

go-百度贴吧-纵向爬取

001 爬取百度贴吧并保存

实现对任意百度贴吧的html爬取

爬虫实战--爬取百度贴吧

爬取百度贴吧热议榜

爬取百度贴吧帖子页内容

今日成果:爬取百度贴吧

爬取百度暗影精灵5贴吧

今日推荐

openKylin 社区生态委员会第六次会议圆满召开

阿里云正式发布通义千问 2.5

Python 3.13 发布首个 Beta：实验性自由线程模式和 JIT、改进交互式解释器

Stack Overflow 拿我的代码去训练 AI 大模型，还封了我的账号

Pop!_OS 的 COSMIC 桌面完成 App Store 上架工作

报告：Django 仍然是 74% 开发者的首选

《2024 年一季度互联网投融资运行情况》研究报告

15 年前上了“FFmpeg 耻辱柱”，今天他还得谢谢咱——腾讯QQPlayer一雪前耻？

TIOBE 5 月榜单：Fortran “复活”进入 Top 10

GCC 14.1 发布

面壁智能发布 Eurux-8x22B 开源大模型 —— 堪称「理科状元」

开源日报 | 谷歌扶持鸿蒙上位；开源Rabbit R1；Docker加持的安卓手机；微软的焦虑和野心；海尔电器把开放平台关了

周排行

计算机组成与设计（七）—— 除法器

Integer Approximation(分治+枚举)

大话数据库索引

windows10系统JDK的配置及下载地址

mysql实现秒值转换中原六仔平台搭建

Codeforces Round #556 (Div. 1)

百练1064 网线主管

Codeforces 995F Cowmpany Cowmpensation

子集生成之增量构造法，位向量法，二进制法

ERROR: cmd.exe failed with args /c "/APK\gradle\rungradle.bat...

每日归档

更多

2024-05-10(38)

2024-05-09(35)

2024-05-08(42)

2024-05-07(14)

2024-05-06(40)

2024-05-05(0)

2024-05-04(7)

2024-05-03(19)

2024-05-02(0)

2024-05-01(4)