python - Web kit 的安装与使用

python - Web kit 的安装与使用

Web kit 是 一个网页渲染工具。Web kit 可以实现浏览器所能处理的任何事情。对于静态网页,我们只需要把网页地址栏中的url传到get请求中就可以轻松地获取到网页的数据并利用一定的规则从返回的 HTML 数据中提取出有效的信息。但如果想爬取的内容是用 JavaScript 动态加载出来的,我们必须经过渲染处理才能获得想要的数据。

Web kit 是 QT 库的一部分,因此需要安装 QT 和PyQT4 库来使用Web kit

Linux 下安装:

sudo apt-get install python-qt4

Windows 下安装:

whl包下载地址:https://www.lfd.uci.edu/~gohlke/pythonlibs/#pyqt4
下载python对应的版本的包。(温馨提示:目前最新只支持到python3.7)

然后打开cmd

pip install [包路径]

调用方法:

import sys
from PyQt4.QtWebKit import *
from PyQt4.QtGui import *
from PyQt4.QtCore import *
class Render(QWebPage):  # 用来渲染网页,将url中的所有信息加载下来并存到一个新的框架中
    def __init__(self,url):
        self.app = QApplication(sys.argv)
        QWebPage.__init__(self)
        self.loadFinished.connect(self._loadFinished)
        self.mainFrame().load(QUrl(url))
        self.app.exec_()
    def _loadFinished(self, result):
        self.frame = self.mainFrame()
        self.app.quit()

url = 'http://www.xxxx.com'
r = Render(url)
html = r.frame.toHtml()
print(html) #打印出经过浏览器渲染的网页

猜你喜欢

转载自blog.csdn.net/weixin_44823747/article/details/108173246