Python爬虫基础之XPath语法与lxml库的用法详解

作者:qq52o 时间:2022-07-03 20:56:06 

前言

本来打算写的标题是XPath语法,但是想了一下Python中的解析库lxml,使用的是Xpath语法,同样也是效率比较高的解析方法,所以就写成了XPath语法和lxml库的用法

XPath 即为 XML 路径语言,它是一种用来确定 XML(标准通用标记语言的子集)文档中某部分位置的语言。

XPath 基于 XML 的树状结构,提供在数据结构树中找寻节点的能力。 XPath 同样也支持HTML。

XPath 是一门小型的查询语言。

python 中 lxml库 使用的是 Xpath 语法,是效率比较高的解析方法。

下面话不多说了,来一起看看详细的介绍吧

安装

为什么要用这个库呢,因为要写爬虫啊,利用lxml库来解析 HTML 代码,同时lxml也继承了libxml2的特性自动修正HTML代码,利用pip安装即可


pip install lxml

XPath语法

XPath是一门在XML文档中查找信息的语言,可以用于在XML文档中通过元素和属性进行导航

举个栗子 😎

我们可以使用XPath提取网站地图中的所有链接,也就是说可以使用XPath去找我们HTML中的一些具体的东西

节点关系

在XPath中,有七种类型的节点:元素、属性、文本、命名空间、处理指令、注释以及文档节点(或称为根节点)

再举个栗子 😎


<urlset>
<url>
<loc>https://qq52o.me</loc>
<lastmod>2018-04-28T19:00:42+00:00</lastmod>
<changefreq>daily</changefreq>
<priority>1.0</priority>
</url>
</urlset>

第一个:父(Parent)

每个元素以及属性都有一个父

url元素是 loc、lastmod、changefreq以及 priority元素的父

第二个:子(Children)

元素节点可有零个、一个或多个子

loc、lastmod、changefreq以及 priority元素都是url元素的子

第三个:同胞(Sibling)

拥有相同的父的节点

loc、lastmod、changefreq以及 priority元素都是url元素的同胞

第四个:先辈(Ancestor)

某节点的父、父的父,等等

loc元素的先辈是 url元素和 urlset元素

第五个:后代(Descendant)

某个节点的子,子的子,等等

urlset的后代是url、loc、lastmod、changefreq以及 priority元素

如果你分不清楚,就按照子元素从上到下的去找元素节点

选取节点

XPath使用路径表达式在 XML 文档中选取节点,节点是通过沿着路径或者 step 来选取的,也就是上面所说的按照子元素从上到下去找元素节点

这些是最有用的路径表达式 💡

表达式描述
nodename选取此节点的所有子节点
/从根节点选取
//从匹配选择的当前节点选择文档中的节点,而不考虑它们的位置
.选取当前节点
..选取当前节点的父节点
@选取属性

实例

路径表达式结果
urlset选取urlset元素的所有子节点
/urlset选取根元素 urlset
urlset/url选取属于urlset的子元素的所有url元素
//url选取所有url子元素,而不管它们在文档中的位置
urlset//url选择属于urlset元素的后代的所有url元素,而不管它们位于urlset之下的什么位置
//@href选取名为href的所有属性

其他XPath语法请参考w3school

XPath实例测试

提取本站网站地图中id属性为content的的子元素h3的内容以及子元素a的href属性,F12去看代码找这个属性

Python爬虫基础之XPath语法与lxml库的用法详解

div的id属性,下面的子元素h3的内容,直接利用 text 方法来获取元素的内容,然后输出

Python爬虫基础之XPath语法与lxml库的用法详解

这里的子元素层级关系必须按顺序写好,不然会报错的

IndexError: list index out of range

这就说明你的XPath规则没写好,list是一个空的,没有一个元素

XPath 是一个非常好用的解析方法,同时也是作为爬虫学习的基础

来源:https://qq52o.me/2203.html

标签:爬虫,lxml库,xpath
0
投稿

猜你喜欢

  • python解释模型库Shap实现机器学习模型输出可视化

    2022-04-27 08:00:10
  • sqlserver通用的删除服务器上的所有相同后缀的临时表

    2012-06-06 20:07:34
  • 如何高效地访问记录集?

    2009-11-22 19:25:00
  • python3基于OpenCV实现证件照背景替换

    2022-06-08 02:16:53
  • jQuery点击改变链接的文本

    2010-03-19 18:11:00
  • Python使用eval函数执行动态标表达式过程详解

    2022-05-29 07:03:30
  • Python实现提取XML内容并保存到Excel中的方法

    2022-03-14 19:06:43
  • php 模拟get_headers函数的代码示例

    2023-09-09 06:16:36
  • IE6局部调用PNG32合并图片

    2009-03-11 21:24:00
  • ASP 关于动态数据显示页面得锚点

    2007-11-04 20:28:00
  • python 执行函数的九种方法

    2021-03-10 18:12:08
  • Django自定义全局403、404、500错误页面的示例代码

    2021-07-27 20:03:33
  • 初学ASP编程易犯的一个错误要注意

    2008-11-07 15:08:00
  • Python cookbook(数据结构与算法)筛选及提取序列中元素的方法

    2023-04-27 19:46:34
  • asp 网站静态化函数代码html

    2011-03-16 11:21:00
  • 对Python中一维向量和一维向量转置相乘的方法详解

    2022-01-24 12:44:14
  • Web设计师的出路问题

    2009-06-08 13:07:00
  • 彻底弄懂CSS盒子模式之二(导航栏实例)

    2007-05-11 16:52:00
  • 在Python的Django框架中编写编译函数

    2022-01-04 16:53:34
  • GO语言入门学习之基本数据类型字符串

    2023-07-16 08:26:31
  • asp之家 网络编程 m.aspxhome.com