文章詳情頁

python - 怎么用爬蟲批量抓取網頁中的圖片？

瀏覽：118日期：2022-06-27 11:03:37

如圖，通過network查看加載圖片，要一張一張右鍵保存很麻煩，有沒有辦法寫個爬蟲批量抓取這里的圖片》？

問題解答

回答1：

這個需求, 如果你會爬蟲其實很簡單, 不外乎幾個步驟:

首頁或者有圖片的頁面, 通過正則或者其他框架, 獲取圖片的url

通過requests庫或者urllib庫, 訪問上面圖片url的地址

以二進制的形式, 寫入本地硬盤

參考代碼:

import re, requestsr = requests.get('http://...頁面地址..')p = re.compile(r’相應的正則表達式匹配’)image = p.findall(r.text)[0] # 通過正則獲取所有圖片的urlir = requests.get(image) # 訪問圖片的地址sz = open(’logo.jpg’, ’wb’).write(ir.content) # 將其內容寫入本地print(’logo.jpg’, sz,’bytes’)

更多詳情, 可以參考學習requests官方文檔: requests文檔

回答2：

可以的，爬蟲五個部分:調度程序url去重下載器網頁解析數據存儲對于下載圖片的思路是:獲取圖片所在網頁內容，解析img標簽，得到圖片地址，然后便利圖片網址，下載每張圖片，將下載過的圖片地址保存在布隆過濾器中，避免重復下載，每次下載一張圖片時，通過網址檢查是否下載過，當圖片下載到本地后，可以將圖片路徑保存在數據庫中，圖片文件保存在文件夾中，或者直接將圖片保存在數據庫中。python使用request+beautifulsoup4java使用jsoup

回答3：

如果多個網站或者一個網站需要爬到很深的情況下，樓上的方式直接遞歸或者深度遍歷就OK

Python 編程

上一條：python - Scrapy的spider在IDE中方便運行調試下一條：python3.x - 為什么設置了.pth文件，python還是找不到模塊？

相關文章：

1. css - 新手做響應式布局，斷點過后右側出現空白，求幫助，謝謝。2. python - 啟動Eric6時報錯：’qscintilla_zh_CN’ could not be loaded3. javascript - vue 怎么渲染自定義組件4. javascript - 關于<a>元素與<input>元素的JS事件運行問題5. mysql - 查詢字段做了索引為什么不起效,還有查詢一個月的時候數據都是全部出來的，如果分拆3次的話就沒問題，為什么呢。6. mysql - 記得以前在哪里看過一個估算時間的網站7. 大家好，我想請問一下怎么做搜索欄能夠搜索到自己網站的內容。8. ID主鍵不是自增的嗎為什么還要加null9. MySQL中的enum類型有什么優點？10. python - 安裝pyspider時出錯：No space left on device:

排行榜

					
					在windows下安裝docker  Toolbox 啟動Docker Quickstart Terminal 失敗！
javascript - nodejs 如何同步執行某些模塊函數?
大家好，我想請問一下怎么做搜索欄能夠搜索到自己網站的內容。
css - 新手做響應式布局，  斷點過后右側出現空白，求幫助，謝謝。
mysql - 查詢字段做了索引為什么不起效,還有查詢一個月的時候數據都是全部出來的，如果分拆3次的話就沒問題，為什么呢。
MySQL中的enum類型有什么優點？
javascript - vue 怎么渲染自定義組件
css3 - 純css實現點擊特效
android下css3動畫非常卡，GPU也不差啊
android - rxjava多線程并發怎么控制順序
python - 安裝pyspider時出錯：No space left on device:
				

熱門標簽

国产成人精品亚洲777人妖,欧美日韩精品一区视频,最新亚洲国产,国产乱码精品一区二区亚洲

python - 怎么用爬蟲批量抓取網頁中的圖片？