如何检索与找到的特定 HTML 节点相关的 parent 元素文本?
How to retrieve parent element text relative to specific found HTML nodes?
我正在编写一个通用的 HTML 资源管理器,它可以执行一系列操作,例如访问页面、查找 table、查找行、存储数据等。它使用 Goutte/Guzzle 在内部,因此可以使用 CSS 和 XPath 选择器。关于相对于现有结果集选择新结果集,我遇到了一个有趣的问题。
考虑这个演示 HTML:
<h2>Burrowing</h2>
<ul>
<li>
<a href="/jobs/junior-mole">Junior Mole</a>
</li>
<li>
<a href="/jobs/head-of-badger-partnerships">Head of Badger Partnerships</a>
</li>
<li>
<a href="/jobs/trainee-worm">Trainee Worm</a>
</li>
</ul>
<h2>Tree Surgery</h2>
<ul>
<li>
<a href="/jobs/senior-woodpecker">Senior Woodpecker</a>
</li>
<li>
<a href="/jobs/owl-supervisor">Owl Supervisor</a>
</li>
</ul>
<h2>Grass maintenance</h2>
<ul>
<li>
<a href="/jobs/trainee-sheep">Trainee sheep</a>
</li>
<li>
<a href="/jobs/sheep-shearer">Sheep shearer</a>
</li>
</ul>
<h2>Aerial supervision</h2>
<ul>
<li>
<a href="/jobs/head-magpie-ops">Head of Magpie Operations</a>
</li>
</ul>
我 运行 此 CSS 查询以获取 link 中的角色(这正确地获取了八个项目):
ul li a
对于每一个,我都想获得类别,即在每种情况下 <ul>
之前的 <h2>
。现在我可以用绝对 CSS 选择器来做到这一点:
h2
然而这得到了四个结果,所以我不知道哪个类别 (h2) 与哪个工作 (link) 对应。我需要获得八个结果:三个批次的第一类,两个第二类,两个第三类和一个第四类,所以每个类别对应每个角色。
我想知道是否为此需要一个 parent 选择器,所以我从 CSS 切换到 XPath,并首先尝试了这个,它让每个 h2 都有一个紧随其后的列表项:
//h2[(following-sibling::ul)[1]/li/a]
找到具有指定 parent 结构的 h2s,但再次返回四个结果 - 不好。
下一次尝试:
//ul/li[../preceding-sibling::h2[1]]
获得正确数量的结果(基于获得紧接其前的标题的列表项)但获得 link 文本,而不是类别文本。
我想过做一个循环——我知道我有八个结果,所以我可以这样做(X 是一个从 1 到 8 循环的注入变量)。这行得通,但我认为在这里添加一个手动循环相当不雅——我试图让我的规则尽可能通用:
//li[X]/../preceding-sibling::h2[1]
有没有XPath操作可以return得到需要的结果?为避免疑义,我正在寻找以下内容(或者只是文本元素就可以了):
<h2>Burrowing</h2>
<h2>Burrowing</h2>
<h2>Burrowing</h2>
<h2>Tree Surgery</h2>
<h2>Tree Surgery</h2>
<h2>Grass maintenance</h2>
<h2>Grass maintenance</h2>
<h2>Aerial supervision</h2>
CSS 也可以,但我认为这是不可能的,因为 CSS 没有 parent 运算符(无论如何,Goutte 只是转换 CSS 选择器转换为 XPath 选择器)。
因为我在 PHP (5.5),我相信我必须坚持使用 XPath 1.0。
所以我不确定你是如何尝试使用它的,但我会尝试类似的东西:
$links = $cralwer->filter('ul li a');
foreach ($links as $link) {
// do stuff with the link
// ...
// get the H2
$header = $link->parents()->filter('ul[../preceding-sibling::h2]');
// do stuff with the header
}
请注意,这是未经测试的,我通过直接查看 Symfony\Component\DomCrawler
API 得出它,但我认为它应该基于此工作(除非我的 XPath 错误 - 但如果我这样做应该是对你来说很容易锻炼。
您当然也可以使用 Symfony\Component\DomCrawler::each
并在闭包内执行此操作而不是执行 foreach...
不,没有一个 XPath 1.0 表达式可以returns您想要的。首先因为 XPath 1.0 不允许迭代中间结果,其次因为项目序列是 defined as a node-set - 其中不能有重复项。
我可以看到两种可能的解决方案来解决您的问题。要么写 PHP 代码
- 首先检索所有相关的
a
节点,例如用 //a
这样的表达式
- 依次对它们中的每一个应用第二个 XPath 表达式:
preceding::h2[1]
您必须自己编写 PHP 代码,因为我的技能很差。但我可以提供一个替代方案:您也可以使用 XSLT 1.0 转换,there are XSLT 1.0 processors in PHP.
样式表
<?xml version="1.0" encoding="UTF-8" ?>
<xsl:transform xmlns:xsl="http://www.w3.org/1999/XSL/Transform" version="1.0">
<xsl:output method="xml" omit-xml-declaration="yes" indent="yes" />
<xsl:template match="/">
<xsl:for-each select="//a">
<xsl:copy-of select="preceding::h2[1]"/>
</xsl:for-each>
</xsl:template>
</xsl:transform>
应用于您的输入(添加根元素后),结果为
<h2>Burrowing</h2>
<h2>Burrowing</h2>
<h2>Burrowing</h2>
<h2>Tree Surgery</h2>
<h2>Tree Surgery</h2>
<h2>Grass maintenance</h2>
<h2>Grass maintenance</h2>
<h2>Aerial supervision</h2>
在线试用 here. By the way, if you're interested in how to do it with XPath 2.0 using for
, as you mentioned in a comment, see this version instead:
for $a in //a return $a/preceding::h2[1]
我正在编写一个通用的 HTML 资源管理器,它可以执行一系列操作,例如访问页面、查找 table、查找行、存储数据等。它使用 Goutte/Guzzle 在内部,因此可以使用 CSS 和 XPath 选择器。关于相对于现有结果集选择新结果集,我遇到了一个有趣的问题。
考虑这个演示 HTML:
<h2>Burrowing</h2>
<ul>
<li>
<a href="/jobs/junior-mole">Junior Mole</a>
</li>
<li>
<a href="/jobs/head-of-badger-partnerships">Head of Badger Partnerships</a>
</li>
<li>
<a href="/jobs/trainee-worm">Trainee Worm</a>
</li>
</ul>
<h2>Tree Surgery</h2>
<ul>
<li>
<a href="/jobs/senior-woodpecker">Senior Woodpecker</a>
</li>
<li>
<a href="/jobs/owl-supervisor">Owl Supervisor</a>
</li>
</ul>
<h2>Grass maintenance</h2>
<ul>
<li>
<a href="/jobs/trainee-sheep">Trainee sheep</a>
</li>
<li>
<a href="/jobs/sheep-shearer">Sheep shearer</a>
</li>
</ul>
<h2>Aerial supervision</h2>
<ul>
<li>
<a href="/jobs/head-magpie-ops">Head of Magpie Operations</a>
</li>
</ul>
我 运行 此 CSS 查询以获取 link 中的角色(这正确地获取了八个项目):
ul li a
对于每一个,我都想获得类别,即在每种情况下 <ul>
之前的 <h2>
。现在我可以用绝对 CSS 选择器来做到这一点:
h2
然而这得到了四个结果,所以我不知道哪个类别 (h2) 与哪个工作 (link) 对应。我需要获得八个结果:三个批次的第一类,两个第二类,两个第三类和一个第四类,所以每个类别对应每个角色。
我想知道是否为此需要一个 parent 选择器,所以我从 CSS 切换到 XPath,并首先尝试了这个,它让每个 h2 都有一个紧随其后的列表项:
//h2[(following-sibling::ul)[1]/li/a]
找到具有指定 parent 结构的 h2s,但再次返回四个结果 - 不好。
下一次尝试:
//ul/li[../preceding-sibling::h2[1]]
获得正确数量的结果(基于获得紧接其前的标题的列表项)但获得 link 文本,而不是类别文本。
我想过做一个循环——我知道我有八个结果,所以我可以这样做(X 是一个从 1 到 8 循环的注入变量)。这行得通,但我认为在这里添加一个手动循环相当不雅——我试图让我的规则尽可能通用:
//li[X]/../preceding-sibling::h2[1]
有没有XPath操作可以return得到需要的结果?为避免疑义,我正在寻找以下内容(或者只是文本元素就可以了):
<h2>Burrowing</h2>
<h2>Burrowing</h2>
<h2>Burrowing</h2>
<h2>Tree Surgery</h2>
<h2>Tree Surgery</h2>
<h2>Grass maintenance</h2>
<h2>Grass maintenance</h2>
<h2>Aerial supervision</h2>
CSS 也可以,但我认为这是不可能的,因为 CSS 没有 parent 运算符(无论如何,Goutte 只是转换 CSS 选择器转换为 XPath 选择器)。
因为我在 PHP (5.5),我相信我必须坚持使用 XPath 1.0。
所以我不确定你是如何尝试使用它的,但我会尝试类似的东西:
$links = $cralwer->filter('ul li a');
foreach ($links as $link) {
// do stuff with the link
// ...
// get the H2
$header = $link->parents()->filter('ul[../preceding-sibling::h2]');
// do stuff with the header
}
请注意,这是未经测试的,我通过直接查看 Symfony\Component\DomCrawler
API 得出它,但我认为它应该基于此工作(除非我的 XPath 错误 - 但如果我这样做应该是对你来说很容易锻炼。
您当然也可以使用 Symfony\Component\DomCrawler::each
并在闭包内执行此操作而不是执行 foreach...
不,没有一个 XPath 1.0 表达式可以returns您想要的。首先因为 XPath 1.0 不允许迭代中间结果,其次因为项目序列是 defined as a node-set - 其中不能有重复项。
我可以看到两种可能的解决方案来解决您的问题。要么写 PHP 代码
- 首先检索所有相关的
a
节点,例如用//a
这样的表达式
- 依次对它们中的每一个应用第二个 XPath 表达式:
preceding::h2[1]
您必须自己编写 PHP 代码,因为我的技能很差。但我可以提供一个替代方案:您也可以使用 XSLT 1.0 转换,there are XSLT 1.0 processors in PHP.
样式表
<?xml version="1.0" encoding="UTF-8" ?>
<xsl:transform xmlns:xsl="http://www.w3.org/1999/XSL/Transform" version="1.0">
<xsl:output method="xml" omit-xml-declaration="yes" indent="yes" />
<xsl:template match="/">
<xsl:for-each select="//a">
<xsl:copy-of select="preceding::h2[1]"/>
</xsl:for-each>
</xsl:template>
</xsl:transform>
应用于您的输入(添加根元素后),结果为
<h2>Burrowing</h2>
<h2>Burrowing</h2>
<h2>Burrowing</h2>
<h2>Tree Surgery</h2>
<h2>Tree Surgery</h2>
<h2>Grass maintenance</h2>
<h2>Grass maintenance</h2>
<h2>Aerial supervision</h2>
在线试用 here. By the way, if you're interested in how to do it with XPath 2.0 using for
, as you mentioned in a comment, see this version instead:
for $a in //a return $a/preceding::h2[1]