美しいスープライブラリを使用するのは簡単

まず、ライブラリBeautifulSoupの簡単な使用

import requests
r=requests.get("http://python123.io/ws/demo.html")
demo=r.text
from bs4 import BeautifulSoup  #导入BeautifulSoup库
soup=BeautifulSoup(demo,"html.parser")  #使用html.parser进行解析
print(soup.prettify())  #打印解析结果

対応BeautifulSoup HTML / XML文書の内容全体

BeautifulSoup === === BeautifulSoupクラスタグツリー

第二に、シンプルなラベルの使用BeautifulSoup

次.nameのを使用して、.attrsはアクセス名、属性をピア:

ライブラリBS4 HTMLベースのコンテンツトラバーサル方法:

簡単なコード:

import requests
r=requests.get("http://python123.io/ws/demo.html")
demo=r.text
from bs4 import BeautifulSoup  #导入BeautifulSoup库
soup=BeautifulSoup(demo,"html.parser")  #使用html.parser进行解析
print(soup.title)  #若有多个类似标签,仅返回第一个
print(soup.a)
print(soup.a.name)   #返回名字
print(soup.a.parent.name)

tag=soup.a
print(tag.attrs)   #属性
print(tag.attrs['class'])
print(tag.string)   #两个尖括号之间的内容
print(type(tag.string))

print(soup.head)
print(soup.head.contents)   #contents返回其儿子

print(soup.title.parent)  #返回父节点

第三に、HTMLコンテンツBS4ライブラリに基づく方法を見つけます

以下のような:

soup.find_all(string='Basic Python')
soup.find_all(id=re.compile('link'))   #正则表达式的模糊查询

拡張メソッド:

 

公開された462元の記事 ウォン称賛55 ビュー320 000 +

おすすめ

転載: blog.csdn.net/LY_624/article/details/105149023