CSDN21天学习挑战第十一篇_beautifulsoup4


活动地址:CSDN21天学习挑战赛

1,beautiful Soup

这是一个可以从HTML或XML文件中提取数据python库,能够通过你喜欢的转换器实现惯用的文档导航,查找修改文档的方式,能够帮忙节省很长的工作时间

可以将网页转换成为一颗DOM树
在这里插入图片描述

2 安装beautifulsoup4

PS C:\Users\T14\Desktop> pip install beautifulsoup4
Collecting beautifulsoup4
  Downloading beautifulsoup4-4.11.1-py3-none-any.whl (128 kB)
     ---------------------------------------- 128.2/128.2 KB 3.3 kB/s eta 0:00:00
Collecting soupsieve>1.2
  Downloading soupsieve-2.3.2.post1-py3-none-any.whl (37 kB)
Installing collected packages: soupsieve, beautifulsoup4
Successfully installed beautifulsoup4-4.11.1 soupsieve-2.3.2.post1

3,实战

常用解析器是lxml、HTML解析器,其次是html5lib

a 读取HTML字符串

from bs4 import BeautifulSoup
 
html = '''
<div class="panel">
    <div class="panel-heading">
        <h4>Hello</h4>
    </div>
    <div class="panel_body">
        <ul class="list" id="list-1" name="element">
            <li class="element">Foo</li>
            <li class="element">Bar</li>
            <li class="element">Jay</li>
        </ul>
        <ul class="list list-small" id="list-2">
            <li class="element">Foo</li>
                <a href="https://www.baidu.com">百度官网</a>
            <li class="element">Bar</li>
        </ul>
    </div>
</div> 
'''
# 创建对象
soup = BeautifulSoup(html, 'lxml')

b 读取HTML文件

from bs4 import BeautifulSoup
 
soup = BeautifulSoup(open('index.html'),'lxml')

c 基本方法

from bs4 import BeautifulSoup
 
html = '''
<div class="panel">
    <div class="panel-heading">
        <h4>Hello</h4>
    </div>
    <div class="panel_body">
        <ul class="list" id="list-1" name="element">
            <li class="element">Foo</li>
            <li class="element">Bar</li>
            <li class="element">Jay</li>
        </ul>
        <ul class="list list-small" id="list-2">
            <li class="element">Foo</li>
                <a href="https://www.baidu.com">百度官网</a>
            <li class="element">Bar</li>
        </ul>
    </div>
</div> 
'''
# 创建对象
soup = BeautifulSoup(html, 'lxml')
 
# 缩进格式
print(soup.prettify())
 
# 获取title标签的所有内容
print(soup.title)
 
# 获取title标签的名称
print(soup.title.name)
 
# 获取title标签的文本内容
print(soup.title.string)
 
# 获取head标签的所有内容
print(soup.head)
 
# 获取第一个div标签中的所有内容
print(soup.div)
 
# 获取第一个div标签的id的值
print(soup.div["id"])
 
# 获取第一个a标签中的所有内容
print(soup.a)
 
# 获取所有的a标签中的所有内容
print(soup.find_all("a"))
 
# 获取id="u1"
print(soup.find(id="u1"))
 
# 获取所有的a标签,并遍历打印a标签中的href的值
for item in soup.find_all("a"):
    print(item.get("href"))
 
# 获取所有的a标签,并遍历打印a标签的文本值
for item in soup.find_all("a"):
    print(item.get_text())

4 对象种类

Beautiful Soup将复杂HTML文档转换成一个复杂的树形结构,每个节点都是python对象,所有对象分为4种,Tag,NavigableString,BeautifulSoup,Comment

Tag就是HTML中的一个个标签,如下:

print(tag.name)
# 输出结果:b
# 如果改变了tag的name,那将影响所有通过当前Beautiful Soup对象生成的HTML文档:
tag.name = "b1"
print(tag)
# 输出结果:<b1 class="boldest">Extremely bold</b1>

a name属性

print(tag.name)
# 输出结果:b
# 如果改变了tag的name,那将影响所有通过当前Beautiful Soup对象生成的HTML文档:
tag.name = "b1"
print(tag)
# 输出结果:<b1 class="boldest">Extremely bold</b1>

b Attribute属性

# 取clas属性
print(tag['class'])
 
# 直接”点”取属性, 比如: .attrs :
print(tag.attrs)

c 添加、修改和删除属性

# 添加 id 属性
tag['id'] = 1
 
# 修改 class 属性
tag['class'] = 'tl1'
 
# 删除 class 属性
del tag['class']

猜你喜欢

转载自blog.csdn.net/wangxiaosheng11/article/details/126407386