我々はクレソンTOP250映画名/評価/推奨の言語/リンクをクロール覚えているとき第三に、今、私たちはそれらを取り、店、今日のレッスン学校のCSVやExcelを使用するために覚えている、〜ああダウン保存されています
最初のステップ:問題の分析、明確な結果
問題は、映画の名/評価/推奨言語/リンクがダウンしてクロールされ、その結果がExcelで保存され、CSV /クレソンTOP250シリアル番号の内部を要求することです
ステップ2:コードクローラを書く
第3下部、レビューコード爬虫類
import requests, bs4
headers={'user-agent':'Mozilla/5.0 (Macintosh; Intel Mac OS X 10_13_6) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/71.0.3578.98 Safari/537.36'}
for x in range(10):
url = 'https://movie.douban.com/top250?start=' + str(x*25) + '&filter='
res = requests.get(url, headers=headers)
bs = bs4.BeautifulSoup(res.text, 'html.parser')
bs = bs.find('ol', class_="grid_view")
for titles in bs.find_all('li'):
num = titles.find('em',class_="").text
title = titles.find('span', class_="title").text
comment = titles.find('span',class_="rating_num").text
url_movie = titles.find('a')['href']
if titles.find('span',class_="inq") != None:
tes = titles.find('span',class_="inq").text
print(num + '.' + title + '——' + comment + '\n' + '推荐语:' + tes +'\n' + url_movie)
else:
print(num + '.' + title + '——' + comment + '\n' +'\n' + url_movie)