PHP加JavaScript爬取网页内容，超实用简易教程

php+js爬取网页内容—–先看下效果

我的网站目标网站

如何做到的呢？

我们一直以为只有Python才能爬取网页内容，那是因为Python本身集合很多类库用来爬取网页很方便，但是我们使用PHP+js的方法一样很方便，一样可以拿到我们想要的网页内容，而且也不用很繁琐。

首先我们需要PHP来模拟请求获取整个网站的HTML

  // 允许所有域访问
header("Access-Control-Allow-Origin: *");
// 接收一个参数，参数名叫parm
$parm=$_GET['mod'];
if (empty($parm)) {
    $url = 'http://m.80s.tw/';//目标网站
    $html = file_get_contents($url);
}else{
    $url = 'http://m.80s.tw/'.$parm;
    $html = file_get_contents($url);
} 
    preg_match("/<body[^>]*?>(.*\s*?)<\/body>/is",$html,$match1);//正则匹配body里面的内容
    echo $match1[0];//输出网页

注意：如果遇到 file_get_contents报错请尝试在 php.ini中找到extension=php_openssl.dll 开启就OK了

然后就是前端来获取数据进行处理了

首先写个异步请求

$.ajax({ 
        type:'get',
        url: '.././admin/test.php',
        success: function(data) {
        console.log(data)//可以看到获取的HTML，很简单吧，很兴奋吧
        }
    });

获取HTML后我们就可以随心所欲了

怎么来使用这些HTML呢？这是问题吗？不是

        //首先创建一个容器
        var div = document.createElement('div');
        // 把整个html的字符串存到这个div节点里
        div.innerHTML = data;
        //然后就可以对div一顿检查了
        //比如获取类list_mov_title下所有的a标签
        var list = div.querySelectorAll('.list_mov_title a');
        //赶紧打印出来看一下
        console.log(list)
        //想要的东西都在吧
        //然后就把想要的东西往自己的页面里面塞吧

PHP加JavaScript爬取网页内容，超实用简易教程

php+js爬取网页内容—–先看下效果

如何做到的呢？

首先我们需要PHP来模拟请求获取整个网站的HTML

注意：如果遇到 file_get_contents报错请尝试在 php.ini中找到extension=php_openssl.dll 开启就OK了

然后就是前端来获取数据进行处理了

获取HTML后我们就可以随心所欲了

怎么来使用这些HTML呢？这是问题吗？不是

一个爬取网页内容的教程就这样结束了，如果你豁然开朗了就转发一下吧，不明白的就留言吧

猜你喜欢