python爬虫-xpath爬贴吧图片---------------（1）
python爬虫-xpath爬贴吧图片---------------（2）
我正则用的不好，处理HTML文档感觉头很大。有了xpath后感觉头不疼了，腰不酸了，所以我们就来学学xpath在爬虫中的应用。我们可以先将 HTML文件转换成 XML文档，然后用 XPath 查找 HTML 节点或元素。

##什么是XML

XML 指可扩展标记语言（EXtensible Markup Language）
XML 是一种标记语言，很类似 HTML
XML 的设计宗旨是传输数据，而非显示数据
XML 的标签需要我们自行定义。
XML 被设计为具有自我描述性。
XML 是 W3C 的推荐标准
W3School官方文档：http://www.w3school.com.cn/xml/index.asp

<?xml version="1.0" encoding="utf-8"?>

<bookstore> 

  <book category="cooking"> 
    <title lang="en">Everyday Italian</title>  
    <author>Giada De Laurentiis</author>  
    <year>2005</year>  
    <price>30.00</price> 
  </book>  

  <book category="children"> 
    <title lang="en">Harry Potter</title>  
    <author>J K. Rowling</author>  
    <year>2005</year>  
    <price>29.99</price> 
  </book>  

  <book category="web"> 
    <title lang="en">XQuery Kick Start</title>  
    <author>James McGovern</author>  
    <author>Per Bothner</author>  
    <author>Kurt Cagle</author>  
    <author>James Linn</author>  
    <author>Vaidyanathan Nagarajan</author>  
    <year>2003</year>  
    <price>49.99</price> 
  </book> 

  <book category="web" cover="paperback"> 
    <title lang="en">Learning XML</title>  
    <author>Erik T. Ray</author>  
    <year>2003</year>  
    <price>39.95</price> 
  </book> 

</bookstore>

##什么是XPath？
XPath (XML Path Language) 是一门在 XML 文档中查找信息的语言，可用来在 XML 文档中对元素和属性进行遍历。

W3School官方文档：http://www.w3school.com.cn/xpath/index.asp

##XPath 开发工具
Chrome插件 XPath Helper

xpath使用

##选取节点
XPath 使用路径表达式来选取 XML 文档中的节点或者节点集。这些路径表达式和我们在常规的电脑文件系统中看到的表达式非常相似。

下面列出了最常用的路径表达式：
| 表达式|描述|
|-----------------
|nodename|选取此节点的所有子节点。
|/|从根节点选取。
|//|从匹配选择的当前节点选择文档中的节点，而不考虑它们的位置。
|.|选取当前节点。
|…|选取当前节点的父节点。
|@|选取属性。

在下面的表格中，我们已列出了一些路径表达式以及表达式的结果：

##谓语（Predicates）
谓语用来查找某个特定的节点或者包含某个指定的值的节点，被嵌在方括号中。

在下面的表格中，我们列出了带有谓语的一些路径表达式，以及表达式的结果：

|通配符|描述
|----------
||匹配任何元素节点。
|@|匹配任何属性节点。
|node()|匹配任何类型的节点。
在下面的表格中，我们列出了一些路径表达式，以及这些表达式的结果：

###实例

在下面的表格中，我们列出了一些路径表达式，以及这些表达式的结果：

|运算符|描述|实例|返回值
|-------------
|||计算两个节点集|//book | //cd|返回所有拥有 book 和 cd 元素的节点集
|+|加法|6 + 4|10
|-|减法|6 - 4|2
|*|乘法|6 * 4|24
|div|除法|8 div 4|2
|=|等于|price=9.80|如果 price 是 9.80，则返回 true。如果 price 是 9.90，则返回 false。
|!=|不等于|price!=9.80|如果 price 是 9.90，则返回 true。如果 price 是 9.80，则返回 false。
|<|小于|price<9.80|如果 price 是 9.00，则返回 true。如果 price 是 9.90，则返回 false。
|<=|小于或等于|price<=9.80|如果 price 是 9.00，则返回 true。如果 price 是 9.90，则返回 false。
|>|大于|price>9.80|如果 price 是 9.90，则返回 true。如果 price 是 9.80，则返回 false。
|>=|大于或等于|price>=9.80|如果 price 是 9.90，则返回 true。如果 price 是 9.70，则返回 false。
|or|或|price=9.80 or price=9.70|如果 price 是 9.80，则返回 true。如果 price 是 9.50，则返回 false。
|and|与|price>9.00 and price<9.90|如果 price 是 9.80，则返回 true。如果 price 是 8.50，则返回 false。
|mod|计算除法的余数|5 mod 2|1

##lxml库
lxml 是一个HTML/XML的解析器，主要的功能是如何解析和提取 HTML/XML 数据。

lxml和正则一样，也是用 C 实现的，是一款高性能的 Python HTML/XML 解析器，我们可以利用之前学习的XPath语法，来快速的定位特定元素以及节点信息。

lxml python 官方文档：http://lxml.de/index.html

需要安装C语言库，可使用 pip 安装：pip install lxml （或通过wheel方式安装）
这个貌似安装很容易出问题，我安装的时候缺了etree，这有个源码包地址ftp://ftp.zlatkovic.com/libxml/，不行就自己百度一下安装

初步使用
我们利用它来解析 HTML 代码，简单示例：

# lxml_test.py

# 使用 lxml 的 etree 库
from lxml import etree 

text = '''
<div>
    <ul>
         <li class="item-0"><a href="link1.html">first item</a></li>
         <li class="item-1"><a href="link2.html">second item</a></li>
         <li class="item-inactive"><a href="link3.html">third item</a></li>
         <li class="item-1"><a href="link4.html">fourth item</a></li>
         <li class="item-0"><a href="link5.html">fifth item</a> # 注意，此处缺少一个 </li> 闭合标签
     </ul>
 </div>
'''
#利用etree.HTML，将字符串解析为HTML文档
html = etree.HTML(text) 

# 按字符串序列化HTML文档
result = etree.tostring(html) 

print(result)

输出结果：

<html><body>
<div>
    <ul>
         <li class="item-0"><a href="link1.html">first item</a></li>
         <li class="item-1"><a href="link2.html">second item</a></li>
         <li class="item-inactive"><a href="link3.html">third item</a></li>
         <li class="item-1"><a href="link4.html">fourth item</a></li>
         <li class="item-0"><a href="link5.html">fifth item</a></li>
</ul>
 </div>
</body></html>

lxml 可以自动修正 html 代码，例子里不仅补全了 li 标签，还添加了 body，html 标签。

文件读取：
除了直接读取字符串，lxml还支持从文件里读取内容。我们新建一个hello.html文件：

<!-- hello.html -->

<div>
    <ul>
         <li class="item-0"><a href="link1.html">first item</a></li>
         <li class="item-1"><a href="link2.html">second item</a></li>
         <li class="item-inactive"><a href="link3.html"><span class="bold">third item</span></a></li>
         <li class="item-1"><a href="link4.html">fourth item</a></li>
         <li class="item-0"><a href="link5.html">fifth item</a></li>
     </ul>
 </div>

再利用 etree.parse() 方法来读取文件。

# lxml_parse.py

from lxml import etree

# 读取外部文件 hello.html
html = etree.parse('./hello.html')
result = etree.tostring(html, pretty_print=True)

print(result)

输出结果与之前相同：

##XPath实例测试

#coding=utf-8
from lxml import  etree

html=etree.parse('hello.html')
print type(html)

# 1. 获取所有的 <li> 标签
print '################# 1 ################'
result=html.xpath('//li')

print 'result:',result
print len(result)
print type(result)
print type(result[0])

# 2. 继续获取<li> 标签的所有 class属性
print '################# 2 ################'
result=html.xpath('//li/@class')
print 'class:',result

# 3. 继续获取<li>标签下hre 为 link1.html 的 <a> 标签
print '################# 3 ################'
result = html.xpath('//li/a[@href="link1.html"]')
print 'a:',result

# 4. 获取<li> 标签下的所有 <span> 标签
#result = html.xpath('//li/span')
#注意这么写是不对的：
#因为 / 是用来获取子元素的，而 <span> 并不是 <li> 的子元素，所以，要用双斜杠
print '################# 4 ################'
result=html.xpath('//li//span')
print 'span:',result

# 5. 获取 <li> 标签下的<a>标签里的所有 class
print '################# 5 ################'
result=html.xpath('//li/a//@class')
print 'a:class:',result

# 6. 获取最后一个 <li> 的 <a> 的 href
print '################# 6 ################'
result=html.xpath('//li[last()]/a/@href')
print 'last:',result

# 7. 获取倒数第二个元素的内容
print '################# 7 ################'
result = html.xpath('//li[last()-1]/a')
# text 方法可以获取元素内容
print result[0].text

# 8. 获取 class 值为 bold 的标签名
print '################# 8 ################'
result = html.xpath('//*[@class="bold"]')
# tag方法可以获取标签名
print result[0].tag

基础知识就到这了，下篇实战python爬虫-xpath爬贴吧图片---------------（2）

代码放在GitHub上，https://github.com/LoyalWilliams/python-learning.git
以上具体代码在目录/crawler/base/urllib2_re_xml/
有啥私活项目，可以邮箱联系
我的邮箱：[email protected]
我新建了一个大数据的学习交流群
QQ：2541692705
Q群：882855741

python爬虫-xpath爬贴吧图片---------------（1）

xpath使用

猜你喜欢