python爬虫3---BeautifulSoup实战 - 代码天地

python爬虫3---BeautifulSoup实战

其他 2020-02-12 14:25:31 阅读次数: 0

项目目标

我们要去爬取热门菜谱清单，内含：菜名、原材料、详细烹饪流程的URL。

import requests
# 引用requests库
from bs4 import BeautifulSoup
# 引用BeautifulSoup库

res_foods = requests.get('http://www.xiachufang.com/explore/')
# 获取数据
bs_foods = BeautifulSoup(res_foods.text,'html.parser')
# 解析数据

tag_name = bs_foods.find_all('p',class_='name')
# 查找包含菜名和URL的<p>标签
tag_ingredients = bs_foods.find_all('p',class_='ing ellipsis')
# 查找包含食材的<p>标签
list_all = []
# 创建一个空列表，用于存储信息
for x in range(len(tag_name)):
# 启动一个循环，次数等于菜名的数量
    list_food = [tag_name[x].text[18:-14],tag_name[x].find('a')['href'],tag_ingredients[x].text[1:-1]]
    # 提取信息，封装为列表。注意此处[18:-14]切片和之前不同，是因为此处使用的是<p>标签，而之前是<a>
    list_all.append(list_food)
    # 将信息添加进list_all
print(list_all)
# 打印


# 以下是另外一种解法


list_foods = bs_foods.find_all('div',class_='info pure-u')
# 查找最小父级标签

list_all = []
# 创建一个空列表，用于存储信息

for food in list_foods:

    tag_a = food.find('a')
    # 提取第0个父级标签中的<a>标签
    name = tag_a.text[17:-13]
    # 菜名，使用[17:-13]切掉了多余的信息
    URL = 'http://www.xiachufang.com'+tag_a['href']
    # 获取URL
    tag_p = food.find('p',class_='ing ellipsis')
    # 提取第0个父级标签中的<p>标签
    ingredients = tag_p.text[1:-1]
    # 食材，使用[1:-1]切掉了多余的信息
    list_all.append([name,URL,ingredients])
    # 将菜名、URL、食材，封装为列表，添加进list_all

print(list_all)
# 打印

knaha

发布了49 篇原创文章 · 获赞 7 · 访问量 1万+

私信关注

猜你喜欢

转载自blog.csdn.net/knaha/article/details/102925586

python爬虫3---BeautifulSoup实战

python3爬虫学习之beautifulsoup实战

python爬虫beautifulsoup4系列3

python3: 爬虫---- urllib, beautifulsoup

python3爬虫-urllib+BeautifulSoup

python爬虫（三）：BeautifulSoup 【3. 遍历】

python3 爬虫（requests+BeautifulSoup）

Python学习爬虫（3）——BeautifulSoup入门介绍

Python爬虫-3 BeautifulSoup基本语法

python3爬虫(基于requests、BeautifulSoup4)之项目实战(二)

python3爬虫(基于requests、BeautifulSoup4)之项目实战(一)

python3爬虫(基于requests、BeautifulSoup4)之项目实战(三)

python3爬虫实战-requests+beautifulsoup-爬取下载顶点网站的小说

基于BeautifulSoup的Python3实战：四周实现爬虫系统笔记

Python3网络爬虫实战-29、解析库的使用：BeautifulSoup

python爬虫实战：基础爬虫(使用BeautifulSoup4等) python爬虫实战：基础爬虫(使用BeautifulSoup4等)

爬虫学习3——BeautifulSoup

python beautifulsoup 爬虫实战--抓取acm队员atcoder比赛数据

python3爬虫实战-requests+beautifulsoup-杭电官网比赛信息实时爬取

Python爬虫-BeautifulSoup 库

Python爬虫-BeautifulSoup

python爬虫——BeautifulSoup库

python|爬虫beautifulsoup的用法

python爬虫-beautifulsoup匹配

python爬虫beautifulsoup

python网络爬虫--BeautifulSoup

python爬虫之BeautifulSoup

python爬虫之BeautifulSoup

爬虫：requests & BeautifulSoup 实战案例

爬虫实战：使用Scrapy与BeautifulSoup

今日推荐

美国拟限制 AI 大模型出口中国和俄罗斯

苹果将与 OpenAI 达成协议，将 ChatGPT 应用于 iPhone

openKylin 社区生态委员会第六次会议圆满召开

阿里云正式发布通义千问 2.5

Python 3.13 发布首个 Beta：实验性自由线程模式和 JIT、改进交互式解释器

Stack Overflow 拿我的代码去训练 AI 大模型，还封了我的账号

Pop!_OS 的 COSMIC 桌面完成 App Store 上架工作

报告：Django 仍然是 74% 开发者的首选

《2024 年一季度互联网投融资运行情况》研究报告

15 年前上了“FFmpeg 耻辱柱”，今天他还得谢谢咱——腾讯QQPlayer一雪前耻？

TIOBE 5 月榜单：Fortran “复活”进入 Top 10

GCC 14.1 发布

周排行

NEFU 117 素数个数的位数

Closest Common Ancestors (Lca,tarjan)

ELK部署

【转载】Hive笔记整理（三）

SQL语句（一）基本表的定义

关于Java web开发中的MySQL的事务语句

MFC创建自定义窗体

如何用一句话激怒程序员？

《逆袭大学》文摘——9.4 基础和应用的平衡中找到大学的节奏

【spring源码分析】@Value注解原理

每日归档

更多

2024-05-11(38)

2024-05-10(38)

2024-05-09(35)

2024-05-08(42)

2024-05-07(14)

2024-05-06(40)

2024-05-05(0)

2024-05-04(7)

2024-05-03(19)

2024-05-02(0)