6.映画保存された情報

我々はクレソンTOP250映画名/評価/推奨の言語/リンクをクロール覚えているとき第三に、今、私たちはそれらを取り、店、今日のレッスン学校のCSVやExcelを使用するために覚えている、〜ああダウン保存されています

ここに画像を挿入説明
ここに画像を挿入説明
ここに画像を挿入説明

ここに画像を挿入説明
ここに画像を挿入説明

最初のステップ:問題の分析、明確な結果

問題は、映画の名/評価/推奨言語/リンクがダウンしてクロールされ、その結果がExcelで保存され、CSV /クレソンTOP250シリアル番号の内部を要求することです

ステップ2:コードクローラを書く
第3下部、レビューコード爬虫類

import requests, bs4

headers={'user-agent':'Mozilla/5.0 (Macintosh; Intel Mac OS X 10_13_6) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/71.0.3578.98 Safari/537.36'}
for x in range(10):
    url = 'https://movie.douban.com/top250?start=' + str(x*25) + '&filter='
    res = requests.get(url, headers=headers)
    bs = bs4.BeautifulSoup(res.text, 'html.parser')
    bs = bs.find('ol', class_="grid_view")
    for titles in bs.find_all('li'):
        num = titles.find('em',class_="").text
        title = titles.find('span', class_="title").text
        comment = titles.find('span',class_="rating_num").text
        url_movie = titles.find('a')['href']

        if titles.find('span',class_="inq") != None:
            tes = titles.find('span',class_="inq").text
            print(num + '.' + title + '——' + comment + '\n' + '推荐语:' + tes +'\n' + url_movie)
        else:
            print(num + '.' + title + '——' + comment + '\n' +'\n' + url_movie)
公開された71元の記事 ウォン称賛19 ビュー10000 +

おすすめ

転載: blog.csdn.net/Theo93/article/details/104197897