文章詳情頁

html - Python爬蟲，翻頁數據怎么爬，URL不變

瀏覽：133日期：2022-08-09 14:14:12

問題描述

網址：http://quote.eastmoney.com/ce...我想爬所有頁的名稱數據，（這里只有兩頁），判斷有沒有下一頁的條件該怎么寫呢？代碼：

from selenium import webdriverdriver=webdriver.PhantomJS()url=’http://quote.eastmoney.com/center/list.html#28003684_0_2’driver.get(url)usoup = BeautifulSoup(driver.page_source, ’xml’)n=[]while True: t=usoup.find(’table’,{’id’:’fixed’}) utable=t.find_all(’a’,{’target’:’_blank’}) for i in range(len(utable)): if i % 6 ==1: n.append(utable[i].text) if #停止條件怎么寫: break driver.find_element_by_xpath(r’//*@id='pagenav']/a[2]’).click() usoup = BeautifulSoup(driver.page_source, ’xml’)

后面這里就不會寫了。。。

問題解答

回答1：

可以判斷每一頁的條目，每一頁共20條，如果當前頁不足20條的時候，說明此頁是最后一頁了，爬完當前頁就該停止了

回答2：

話說這個表格不是都有個jsonp的返回接口嗎？為什么還要爬？

回答3：

走的就是jsonp接口，直接拿就好了。

非要抓取的話，只能用selenium + phantomjs 之類的模擬頁面去獲取了。

回答4：

http://nufm.dfcfw.com/EM_Fina...{rank:[(x)],pages:(pc)}&token=7bc05d0d4c3c22ef9fca8c2a912d779c&jsName=quote_123&_g=0.5385195357178545

Python 編程

上一條：python - Django ManyToManyField 字段數據在 admin后臺顯示不正確，這是怎么回事？下一條：python - pyspider 如何獲取某個列表中的第n個元素

排行榜

					
					docker gitlab 如何git clone？
debian - docker依賴的aufs-tools源碼哪里可以找到啊？
docker內創建jenkins訪問另一個容器下的服務器問題
golang - 用IDE看docker源碼時的小問題
如何解決Centos下Docker服務啟動無響應，且輸入docker命令無響應？
javascript - 求解答：實例對象調用constructor，此時constructor內的this的指向？
javascript - vscode alt+shift+f 格式化js代碼，通不過eslint的代碼風格檢查怎么辦。。。
angular.js - Angular-Strap  模態框(Modal) 報錯
java - 如何寫一個intellij-idea插件，實現編譯時修改源代碼的目的
IntelliJ IDEA無法解析導入javax.servlet。*;
WEB-INF / classes /與WEB-INF / lib / *。jar在類路徑優先級？
				

熱門標簽

国产成人精品亚洲777人妖,欧美日韩精品一区视频,最新亚洲国产,国产乱码精品一区二区亚洲

html - Python爬蟲，翻頁數據怎么爬，URL不變

html - Python爬蟲，翻頁數據怎么爬，URL不變