国产成人精品亚洲777人妖,欧美日韩精品一区视频,最新亚洲国产,国产乱码精品一区二区亚洲

您的位置:首頁技術文章
文章詳情頁

xpath - python怎么用lxml處理

瀏覽:110日期:2022-09-22 09:54:52

問題描述

例如:

<p>沒<em><!--red_beg-->aa<!--red_end--></em></p><p>沒<em><!--red_beg-->aa<!--red_end--></em>沒<em><!--red_beg-->aa<!--red_end--></em></p><p>沒</p>

就是在p標簽里可能會出現同樣的em標簽,而且數量不定,那我怎么獲取p的內容,包括em里的內容。例如第二個p獲取輸出是‘沒aa沒aa’

或者獲取到p節點之后,怎么把里面的內容轉換為字符串

問題解答

回答1:

今天偶然學到處理這個問題的方法,特意翻出來這個問題回答。題主你可以看一下xpath的軸,比如你要取得第二個<p>標簽的“沒aa沒aa”,實際是取得它全部后代節點的文本內容,可以使用element_dom.xpath('//p[2]//descendant::text()')來取得,拿到的結果是一個這樣[’沒’, ’aa’, ’沒’, ’aa’]的list,然后自己手動拼接成字符串就可以了,比如''.join(list)。同理,如果你需要進行其他操作,也可以使用類似的方法。

回答2:

換bs4,string和text之間的異同就在這里。

回答3:

lxml.html的.text_content()方法,可以獲取當前節點和所有子節點的文本內容。

標簽: Python 編程
相關文章:
主站蜘蛛池模板: 中西区| 海安县| 盐亭县| 石首市| 渭南市| 遵义县| 泾川县| 土默特右旗| 涟源市| 塔城市| 宣威市| 济源市| 高陵县| 南陵县| 洮南市| 广宗县| 浦城县| 东乌珠穆沁旗| 辽中县| 临沧市| 万安县| 新泰市| 唐山市| 连江县| 蓬安县| 乌什县| 克拉玛依市| 邹城市| 古蔺县| 保亭| 宁国市| 台安县| 佛教| 银川市| 涡阳县| 通州区| 麦盖提县| 平塘县| 大渡口区| 基隆市| 师宗县|