Beautiful Soup - 可導航字串類



Beautiful Soup API 中最主要的 物件之一是 NavigableString 類 的物件。它表示大多數 HTML 標籤的開始和結束標籤之間的字串或文字。例如,如果<b>Hello</b> 是要解析的標記,則 Hello 就是 NavigableString。

NavigableString 類是 bs4 包中 PageElement 類的子類,也是 Python 內建 str 類的子類。因此,它繼承了 PageElement 方法,例如 find_*()、insert、append、wrap、unwrap 方法,以及 str 類的方法,例如 upper、lower、find、isalpha 等。

此類的建構函式採用單個引數,一個 str 物件。

示例

from bs4 import NavigableString
new_str = NavigableString('world')

現在可以使用此 NavigableString 物件對解析樹執行各種操作,例如 append、insert、find 等。

在下面的示例中,我們將新建立的 NavigableString 物件附加到現有的 Tab 物件。

示例

from bs4 import BeautifulSoup, NavigableString

markup = '<b>Hello</b>'
soup = BeautifulSoup(markup, 'html.parser')

tag = soup.b 
new_str = NavigableString('world')
tag.append(new_str)
print (soup)

輸出

<b>Helloworld</b>

請注意,NavigableString 是一個 PageElement,因此它也可以附加到 Soup 物件。檢查一下如果我們這樣做會有什麼區別。

示例

new_str = NavigableString('world')
soup.append(new_str)
print (soup)

輸出

<b>Hello</b>world

正如我們所看到的,字串出現在<b>標籤之後。

Beautiful Soup 提供了一個 new_string() 方法。建立一個與此 BeautifulSoup 物件關聯的新 NavigableString。

讓我們使用 new_string() 方法建立一個 NavigableString 物件,並將其新增到 PageElements。

示例

from bs4 import BeautifulSoup, NavigableString

markup = '<b>Hello</b>'
soup = BeautifulSoup(markup, 'html.parser')

tag = soup.b 

ns=soup.new_string(' World')
tag.append(ns)
print (tag)
soup.append(ns)
print (soup)

輸出

<b>Hello World</b>
<b>Hello</b> World

我們在這裡發現了一個有趣的行為。NavigableString 物件被新增到樹中的標籤內,以及 Soup 物件本身。雖然標籤顯示了附加的字串,但在 Soup 物件中,附加了文字 World,但它沒有顯示在標籤中。這是因為 new_string() 方法建立了一個與 Soup 物件關聯的 NavigableString。

廣告
© . All rights reserved.