您好,登錄后才能下訂單哦!
這篇文章主要介紹“Python爬蟲解析器BeautifulSoup4怎么使用”的相關知識,小編通過實際案例向大家展示操作過程,操作方法簡單快捷,實用性強,希望這篇“Python爬蟲解析器BeautifulSoup4怎么使用”文章能幫助大家解決問題。
Beautiful Soup 是一個可以從HTML或XML文件中提取數據的Python庫.它能夠通過你喜歡的轉換器實現慣用的文檔導航,查找,修改文檔的方式.Beautiful Soup會幫你節省數小時甚至數天的工作時間。
BeautifulSoup4將網頁轉換為一顆DOM樹:
1. window電腦點擊win鍵+ R
,輸入:cmd
2. 安裝beautifulsoup4
,輸入對應的pip命令:pip install beautifulsoup4
,我已經安裝過了出現版本就安裝成功了
3. 導包
form bs4 import BeautifulSoup
BeautifulSoup在解析時實際上依賴解析器,它除了支持Python標準庫中的HTML解析器外,還支持一 些第三方解析器(比如lxml):
解析器 | 使用方法 | 優勢 | 劣勢 |
---|---|---|---|
Python標準庫 | BeautifulSoup(html,’html.parser’) | Python的內置標準庫、執行速度適中、文檔容錯能力強 | Python 2.7.3及Python3.2.2之前的版本文檔容錯能力差 |
lxml HTML解析庫 | BeautifulSoup(html,’lxml’) | 速度快、文檔容錯能力強 | 需要安裝C語言庫 |
lxml XML解析庫 | BeautifulSoup(html,‘xml' | 速度快、唯一支持XML的解析器 | 需要安裝C語言庫 |
htm5lib解析庫 | BeautifulSoup(html,’htm5llib’) | 最好的容錯性、以瀏覽器的方式解析文檔、生成HTMLS格式的文檔 | 速度慢、不依賴外部擴展 |
對于我們來說,我們最常使用的解析器是lxml HTML
解析器,其次是html5lib.
1. 讀取HTML字符串:
from bs4 import BeautifulSoup html = ''' <p class="panel"> <p class="panel-heading"> <h5>Hello</h5> </p> <p class="panel_body"> <ul class="list" id="list-1" name="element"> <li class="element">Foo</li> <li class="element">Bar</li> <li class="element">Jay</li> </ul> <ul class="list list-small" id="list-2"> <li class="element">Foo</li> <a href="https://www.baidu.com">百度官網</a> <li class="element">Bar</li> </ul> </p> </p> '''# 創建對象soup = BeautifulSoup(html, 'lxml')
2. 讀取HTML文件:
from bs4 import BeautifulSoup soup = BeautifulSoup(open('index.html'),'lxml')
3. 基本方法
from bs4 import BeautifulSoup html = ''' <p class="panel"> <p class="panel-heading"> <h5>Hello</h5> </p> <p class="panel_body"> <ul class="list" id="list-1" name="element"> <li class="element">Foo</li> <li class="element">Bar</li> <li class="element">Jay</li> </ul> <ul class="list list-small" id="list-2"> <li class="element">Foo</li> <a href="https://www.baidu.com">百度官網</a> <li class="element">Bar</li> </ul> </p> </p> '''# 創建對象soup = BeautifulSoup(html, 'lxml')# 縮進格式print(soup.prettify())# 獲取title標簽的所有內容print(soup.title)# 獲取title標簽的名稱print(soup.title.name)# 獲取title標簽的文本內容print(soup.title.string)# 獲取head標簽的所有內容print(soup.head)# 獲取第一個p標簽中的所有內容print(soup.p)# 獲取第一個p標簽的id的值print(soup.p["id"])# 獲取第一個a標簽中的所有內容print(soup.a)# 獲取所有的a標簽中的所有內容print(soup.find_all("a"))# 獲取id="u1"print(soup.find(id="u1"))# 獲取所有的a標簽,并遍歷打印a標簽中的href的值for item in soup.find_all("a"): print(item.get("href"))# 獲取所有的a標簽,并遍歷打印a標簽的文本值for item in soup.find_all("a"): print(item.get_text())
Beautiful Soup將復雜HTML文檔轉換成一個復雜的樹形結構,每個節點都是Python對象,所有對象可以歸納為4種: Tag , NavigableString , BeautifulSoup , Comment .
(1)Tag:Tag通俗點講就是HTML中的一個個標簽,例如:
soup = BeautifulSoup('<b class="boldest">Extremely bold</b>','lxml') tag = soup.b print(tag) print(type(tag))
輸出結果:
<b class="boldest">Extremely bold</b> <class 'bs4.element.Tag'>
Tag有很多方法和屬性,在 遍歷文檔樹 和 搜索文檔樹 中有詳細解釋.現在介紹一下tag中最重要的屬性: name
和attributes
:
name屬性:
print(tag.name) # 輸出結果:b # 如果改變了tag的name,那將影響所有通過當前Beautiful Soup對象生成的HTML文檔: tag.name = "b1" print(tag) # 輸出結果:<b1 class="boldest">Extremely bold</b1>
Attributes屬性:
# 取clas屬性 print(tag['class']) # 直接”點”取屬性, 比如: .attrs : print(tag.attrs)
tag 的屬性可以被添加、修改和刪除:
# 添加 id 屬性 tag['id'] = 1 # 修改 class 屬性 tag['class'] = 'tl1' # 刪除 class 屬性 del tag['class']
(2)NavigableString:用.string
獲取標簽內部的文字:
print(soup.b.string)print(type(soup.b.string))
(3)BeautifulSoup:表示的是一個文檔的內容,可以獲取它的類型,名稱,以及屬性:
print(type(soup.name)) # <type 'unicode'> print(soup.name) # [document] print(soup.attrs) # 文檔本身的屬性為空
(4)Comment:是一個特殊類型的 NavigableString 對象,其輸出的內容不包括注釋符號。
print(soup.b) print(soup.b.string) print(type(soup.b.string))
1.find_all(name, attrs, recursive, text, **kwargs)
(1)name 參數:name 參數可以查找所有名字為 name 的tag,字符串對象會被自動忽略掉
匹配字符串:查找與字符串完整匹配的內容,用于查找文檔中所有的<a>
標簽
a_list = soup.find_all("a")print(a_list)
匹配正則表達式:如果傳入正則表達式作為參數,Beautiful Soup會通過正則表達式的 match() 來匹配內容
# 返回所有表示<body>和<b>標簽for tag in soup.find_all(re.compile("^b")): print(tag.name)
匹配列表:如果傳入列表參數,Beautiful Soup會將與列表中任一元素匹配的內容返回
# 返回所有所有<p>標簽和<a>標簽:soup.find_all(["p", "a"])
(2)kwargs參數
soup.find_all(id='link2')
(3)text參數:通過 text 參數可以搜搜文檔中的字符串內容,與 name 參數的可選值一樣, text 參數接受 字符串 , 正則表達式 , 列表
# 匹配字符串 soup.find_all(text="a") # 匹配正則 soup.find_all(text=re.compile("^b")) # 匹配列表 soup.find_all(text=["p", "a"])
我們在使用BeautifulSoup解析庫時,經常會結合CSS選擇器來提取數據。
注意:以下講解CSS選擇器只選擇標簽,至于獲取屬性值和文本內容我們后面再講。
1. 根據標簽名查找:比如寫一個 li
就會選擇所有li 標簽
, 不過我們一般不用,因為我們都是精確到標簽再提取數據的
from bs4 import BeautifulSoup html = ''' <p class="panel"> <p class="panel-heading"> <h5>Hello</h5> </p> <p class="panel_body"> <ul class="list" id="list-1" name="element"> <li class="element">Foo</li> <li class="element">Bar</li> <li class="element">Jay</li> </ul> <ul class="list list-small" id="list-2"> <li class="element">Foo</li> <a href="https://www.baidu.com">百度官網</a> <li class="element">Bar</li> </ul> </p> </p> '''# 創建對象soup = BeautifulSoup(html, 'lxml')# 1. 根據標簽名查找:查找li標簽print(soup.select("li"))
輸出結果:
[<li class="element">Foo</li>, <li class="element">Bar</li>, <li class="element">Jay</li>, <li class="element">Foo</li>, <li class="element">Bar</li>]
2. 根據類名class查找。.1ine
, 即一個點加line,這個表達式選的是class= "line "
的所有標簽,".”
代表class
print(soup.select(".panel_body"))
輸出結果:
</ul> <ul class="list list-small" id="list-2"> <li class="element">Foo</li> <li class="element">Bar</li> </ul> </div>]
3. 根據id查找。#box,即一個#和box表示選取id-”box "的所有標簽,“#”代表id
print(soup.select("#list-1"))
輸出結果:
[<ul class="list" id="list-1" name="element"> <li class="element">Foo</li> <li class="element">Bar</li> <li class="element">Jay</li> </ul>]
4. 根據屬性的名字查找。class屬性和id屬性較為特殊,故單獨拿出來定義一個". "
和“”
來表示他們。
比如:input[ name=“username”]這個表達式查找name= "username "的標簽,此處注意和xpath語法的區別
print(soup.select('ul[ name="element"]'))
輸出結果:
[<ul class="list" id="list-1" name="element"> <li class="element">Foo</li> <li class="element">Bar</li> <li class="element">Jay</li> </ul>]
5. 標簽+類名或id的形式。
# 查找id為list-1的ul標簽 print(soup.select('ul#list-1')) print("-"*20) # 查找class為list的ul標簽 print(soup.select('ul.list'))
輸出結果:
[<ul class="list" id="list-1" name="element"> <li class="element">Foo</li> <li class="element">Bar</li> <li class="element">Jay</li> </ul>] -------------------- [<ul class="list" id="list-1" name="element"> <li class="element">Foo</li> <li class="element">Bar</li> <li class="element">Jay</li> </ul>, <ul class="list list-small" id="list-2"> <li class="element">Foo</li> <li class="element">Bar</li> </ul>]
6. 查找直接子元素
# 查找id="list-1"的標簽下的直接子標簽liprint(soup.select('#list-1>li'))
輸出結果:
[<li class="element">Foo</li>, <li class="element">Bar</li>, <li class="element">Jay</li>]
7. 查找子孫標簽
# .panel_body和li之間是一個空格,這個表達式查找id=”.panel_body”的標簽下的子或孫標簽liprint(soup.select('.panel_body li'))
輸出結果:
[<li class="element">Foo</li>, <li class="element">Bar</li>, <li class="element">Jay</li>, <li class="element">Foo</li>, <li class="element">Bar</li>]
8. 取某個標簽的屬性
# 1. 先取到<p class="panel_body">p = soup.select(".panel_body")[0]# 2. 再去下面的a標簽下的href屬性print(p.select('a')[0]["href"])
輸出結果:
https://www.baidu.com
9. 獲取文本內容有四種方式:
(a) string
:獲得某個標簽下的文本內容,強調-一個標簽,不含嵌我。 返回-個字符串
# 1. 先取到<p class="panel_body">p = soup.select(".panel_body")[0]# 2. 再去下面的a標簽下print(p.select('a')[0].string)
輸出結果:
百度官網
(b) strings
:獲得某個標簽下的所有文本內容,可以嵌套。返回-一個生成器,可用list(生成器)轉換為列表
print(p.strings)print(list(p.strings))
輸出結果:
<generator object Tag._all_strings at 0x000001AA58E525F0>['\n', '\n', 'Foo', '\n', 'Bar', '\n', 'Jay', '\n', '\n', '\n', 'Foo', '\n', '百度官網', '\n', 'Bar', '\n', '\n']
(c)stripped.strings
:跟(b)差不多,只不過它會去掉每個字符串頭部和尾部的空格和換行符
print(p.stripped_strings)print(list(p.stripped_strings))
輸出結果:
<generator object PageElement.stripped_strings at 0x000001F9995525F0>['Foo', 'Bar', 'Jay', 'Foo', '百度官網', 'Bar']
(d) get.text()
:獲取所有字符串,含嵌套. 不過會把所有字符串拼接為一個,然后返回
注意2:
前3個都是屬性,不加括號;最后一個是函數,加括號。
print(p.get_text())
輸出結果:
Foo Bar Jay Foo 百度官網 Bar
關于“Python爬蟲解析器BeautifulSoup4怎么使用”的內容就介紹到這里了,感謝大家的閱讀。如果想了解更多行業相關的知識,可以關注億速云行業資訊頻道,小編每天都會為大家更新不同的知識點。
免責聲明:本站發布的內容(圖片、視頻和文字)以原創、轉載和分享為主,文章觀點不代表本網站立場,如果涉及侵權請聯系站長郵箱:is@yisu.com進行舉報,并提供相關證據,一經查實,將立刻刪除涉嫌侵權內容。