クールな犬の音楽をクロール使用beautifulsoup4パイソン

免責事項:唯一の技術交流のためではなく、そのため、この資料で。
小扁は、多くの場合、インターネット上のいくつかの音楽を聴くことが、いくつかのサイトは音楽の多くをダウンロードするために支払うがある私は、クローラ技術、アイドル時間を書きます正確にポイントで、4月の終わり問題のないよう、ちょうどBS4ライブラリに従って、カレントディレクトリにダウンロードされます以下のように、
メソッドの実装:PIPがbeautifulsoup4インストールし
、次のように完全なコードは次のとおりです。ダブルクリックで直接実行

from bs4 import BeautifulSoup
import requests
import re
headers = {
'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/72.0.3626.109 Safari/537.36'
}
url='https://songsearch.kugou.com/song_search_v2?&page=1&pagesize=30&userid=-1&clientver=&platform=WebFilter&tag=em&filter=2&iscorrection=1&privilege_filter=0&_=1555124510574'
#想要爬取别的网页直接修改这个json数据地址就行
r=requests.get(url,headers=headers)
soup=BeautifulSoup(r.text,'lxml')
title_list=soup.select('.pc_temp_songlist ul li')
hash=re.findall(r',"FileHash":"(.*?)"',r.text)
hash1=re.findall(r',"FileName":"(.*?)"',r.text)
#直接用正则匹配隐藏的数据
print(hash)
print(hash1)
q=0
for url in hash:
url_a=f'https://wwwapi.kugou.com/yy/index.php?r=play/getdata&callback=jQuery1910212680783679835_1555073815772&hash={url}&album_id=18784389'
#这个URL不用修改的
c=requests.get(url_a,headers=headers)
a=c.text[40:-3]
b=re.findall('"play_url":"(.*)","authors":',a)[0]
b1=re.sub(r"\\",'',b)
f = requests.get(b1)
with open(hash1[q]+'.mp3','wb')as d:
d.write(f.content)
print(hash1[q])
q+=1

唯一の難点クロールクールな犬は、より良い網易曇点よりも、見つけるために、より多くの時間よりも見つけるために、ハッシュ値を取得することであるハッシュ値を書き込むことが見つけることができる、独自の、クールな犬をせずに、自分のいる、網易雲が生成する必要の関数であり、 A。
上記、我々は手助けをしたい、紹介するクールな犬音楽TOP500ダウンロードMP3形式の小さなシリーズのPythonの買収で何かご質問が私にメッセージをお願いしている場合は、小扁は、速やかに全員に返信させていただきます。これで私はまた、家庭サイトスクリプティングのサポートのために非常に感謝しています!

おすすめ

転載: www.cnblogs.com/py-wensong/p/11983405.html