lxml

简介

lxml使用xpath对xml进行解析，XPath 是一门在 XML 文档中查找信息的语言。XPath 可用来在 XML 文档中对元素和属性进行遍历。
参考官方文档：https://lxml.de/index.html

xpath语法

选取节点

表达式	描述
nodename	选取此节点的所有子节点。
/	从根节点选取。
//	从匹配选择的当前节点选择文档中的节点，而不考虑它们的位置。
.	选取当前节点。
..	选取当前节点的父节点。
@	选取属性。

谓语

谓语用来查找某个特定的节点或者包含某个指定的值的节点。
谓语被嵌在方括号中。

路径表达式	结果
/bookstore/book[1]	选取属于 bookstore 子元素的第一个 book 元素。
/bookstore/book[last()]	选取属于 bookstore 子元素的最后一个 book 元素。
/bookstore/book[last()-1]	选取属于 bookstore 子元素的倒数第二个 book 元素。
/bookstore/book[position()<3]	选取最前面的两个属于 bookstore 元素的子元素的 book 元素。
//title[@lang]	选取所有拥有名为 lang 的属性的 title 元素。
//title[@lang='eng']	选取所有 title 元素，且这些元素拥有值为 eng 的 lang 属性。
/bookstore/book[price>35.00]	选取 bookstore 元素的所有 book 元素，且其中的 price 元素的值须大于 35.00。
/bookstore/book[price>35.00]/title	选取 bookstore 元素中的 book 元素的所有 title 元素，且其中的 price 元素的值须大于 35.00。

参考文档：http://www.w3school.com.cn/xpath/xpath_syntax.asp

requests与lxml结合

爬取豆瓣电影数据
import requests
from lxml import etree

response = requests.get("https://movie.douban.com/chart")
html = etree.HTML(response.text)
items = html.xpath("//tr[@class='item']")
for item in items:
    title = item.xpath("./td[2]/div/a/text()")[0].replace("/", "").strip()
    summary = item.xpath("./td[2]/div/p/text()")[0]
    rate = item.xpath("./td[2]/div/div/span[@class='rating_nums']/text()")[0]
    print("{}:{}:{}".format(title, summary, rate))

python爬虫入门（2）----- lxml

lxml

简介

xpath语法

选取节点

谓语

requests与lxml结合

猜你喜欢