日本不卡不码高清免费观看,久久国产精品久久w女人spa,黄色aa久久,三上悠亚国产精品一区二区三区

您的位置:首頁技術(shù)文章
文章詳情頁

Python爬蟲之Spider類用法簡單介紹

瀏覽:196日期:2022-07-15 10:33:16

一、網(wǎng)絡(luò)爬蟲

網(wǎng)絡(luò)爬蟲又被稱為網(wǎng)絡(luò)蜘蛛(🕷️),我們可以把互聯(lián)網(wǎng)想象成一個蜘蛛網(wǎng),每一個網(wǎng)站都是一個節(jié)點(diǎn),我們可以使用一只蜘蛛去各個網(wǎng)頁抓取我們想要的資源。舉一個最簡單的例子,你在百度和谷歌中輸入‘Python’,會有大量和Python相關(guān)的網(wǎng)頁被檢索出來,百度和谷歌是如何從海量的網(wǎng)頁中檢索出你想要的資源,他們靠的就是派出大量蜘蛛去網(wǎng)頁上爬取,檢索關(guān)鍵字,建立索引數(shù)據(jù)庫,經(jīng)過復(fù)雜的排序算法,結(jié)果按照搜索關(guān)鍵字相關(guān)度的高低展現(xiàn)給你。

千里之行,始于足下,我們從最基礎(chǔ)的開始學(xué)習(xí)如何寫一個網(wǎng)絡(luò)爬蟲,實現(xiàn)語言使用Python。

二、Python如何訪問互聯(lián)網(wǎng)

想要寫網(wǎng)絡(luò)爬蟲,第一步是訪問互聯(lián)網(wǎng),Python如何訪問互聯(lián)網(wǎng)呢?

在Python中,我們使用urllib包訪問互聯(lián)網(wǎng)。(在Python3中,對這個模塊做了比較大的調(diào)整,以前有urllib和urllib2,在3中對這兩個模塊做了統(tǒng)一合并,稱為urllib包。包下面包含了四個模塊,urllib.request,urllib.error,urllib.parse,urllib.robotparser),目前主要使用的是urllib.request。

我們首先舉一個最簡單的例子,如何獲取獲取網(wǎng)頁的源碼:

import urllib.requestresponse = urllib.request.urlopen(’https://docs.python.org/3/’)html = response.read()print(html.decode(’utf-8’))

三、Python網(wǎng)絡(luò)簡單使用

首先我們用兩個小demo練一下手,一個是使用python代碼下載一張圖片到本地,另一個是調(diào)用有道翻譯寫一個翻譯小軟件。

3.1根據(jù)圖片鏈接下載圖片,代碼如下:

import urllib.requestresponse = urllib.request.urlopen(’http://www.3lian.com/e/ViewImg/index.html?url=http://img16.3lian.com/gif2016/w1/3/d/61.jpg’)image = response.read()with open(’123.jpg’,’wb’) as f: f.write(image)

其中response是一個對象

輸入:response.geturl()->’http://www.3lian.com/e/ViewImg/index.html?url=http://img16.3lian.com/gif2016/w1/3/d/61.jpg’

輸入:response.info()-><http.client.HTTPMessage object at 0x10591c0b8>

輸入:print(response.info())->Content-Type: text/htmlLast-Modified: Mon, 27 Sep 2004 01:23:20 GMTAccept-Ranges: bytesETag: '0f4b59230a4c41:0'Server: Microsoft-IIS/8.0Date: Sun, 14 Aug 2016 07:16:01 GMTConnection: closeContent-Length: 2827

輸入:response.getcode()->200

3.2使用有道詞典實現(xiàn)翻譯功能

我們想實現(xiàn)翻譯功能,我們需要拿到請求鏈接。首先我們需要進(jìn)入有道首頁,點(diǎn)擊翻譯,在翻譯界面輸入要翻譯的內(nèi)容,點(diǎn)擊翻譯按鈕,就會向服務(wù)器發(fā)起一個請求,我們需要做的就是拿到請求地址和請求參數(shù)。

我在此使用谷歌瀏覽器實現(xiàn)拿到請求地址和請求參數(shù)。首先點(diǎn)擊右鍵,點(diǎn)擊檢查(不同瀏覽器點(diǎn)擊的選項可能不同,同一瀏覽器的不同版本也可能不同),進(jìn)入圖一所示,從中我們可以拿到請求請求地址和請求參數(shù),在Header中的Form Data中我們可以拿到請求參數(shù)。

Python爬蟲之Spider類用法簡單介紹

(圖一)

代碼段如下:

import urllib.requestimport urllib.parseurl = ’http://fanyi.youdao.com/translate?smartresult=dict&smartresult=rule&smartresult=ugc&sessionFrom=dict2.index’data = {}data[’type’] = ’AUTO’data[’i’] = ’i love you’data[’doctype’] = ’json’data[’xmlVersion’] = ’1.8’data[’keyfrom’] = ’fanyi.web’data[’ue’] = ’UTF-8’data[’action’] = ’FY_BY_CLICKBUTTON’data[’typoResult’] = ’true’data = urllib.parse.urlencode(data).encode(’utf-8’)response = urllib.request.urlopen(url,data)html = response.read().decode(’utf-8’)print(html)

上述代碼執(zhí)行如下:

{'type':'EN2ZH_CN','errorCode':0,'elapsedTime':0,'translateResult':[[{'src':'i love you','tgt':'我愛你'}]],'smartResult':{'type':1,'entries':['','我愛你。']}}

對于上述結(jié)果,我們可以看到是一個json串,我們可以對此解析一下,并且對代碼進(jìn)行完善一下:

import urllib.requestimport urllib.parseimport jsonurl = ’http://fanyi.youdao.com/translate?smartresult=dict&smartresult=rule&smartresult=ugc&sessionFrom=dict2.index’data = {}data[’type’] = ’AUTO’data[’i’] = ’i love you’data[’doctype’] = ’json’data[’xmlVersion’] = ’1.8’data[’keyfrom’] = ’fanyi.web’data[’ue’] = ’UTF-8’data[’action’] = ’FY_BY_CLICKBUTTON’data[’typoResult’] = ’true’data = urllib.parse.urlencode(data).encode(’utf-8’)response = urllib.request.urlopen(url,data)html = response.read().decode(’utf-8’)target = json.loads(html)print(target[’translateResult’][0][0][’tgt’])

四、規(guī)避風(fēng)險

服務(wù)器檢測出請求不是來自瀏覽器,可能會屏蔽掉請求,服務(wù)器判斷的依據(jù)是使用‘User-Agent’,我們可以修改改字段的值,來隱藏自己。代碼如下:

import urllib.requestimport urllib.parseimport jsonurl = ’http://fanyi.youdao.com/translate?smartresult=dict&smartresult=rule&smartresult=ugc&sessionFrom=dict2.index’data = {}data[’type’] = ’AUTO’data[’i’] = ’i love you’data[’doctype’] = ’json’data[’xmlVersion’] = ’1.8’data[’keyfrom’] = ’fanyi.web’data[’ue’] = ’UTF-8’data[’action’] = ’FY_BY_CLICKBUTTON’data[’typoResult’] = ’true’data = urllib.parse.urlencode(data).encode(’utf-8’)req = urllib.request.Request(url, data)req.add_header(’User-Agent’,’Mozilla/5.0 (Macintosh; Intel Mac OS X 10_11_2) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/52.0.2743.116 Safari/537.36’)response = urllib.request.urlopen(url, data)html = response.read().decode(’utf-8’)target = json.loads(html)print(target[’translateResult’][0][0][’tgt’])

上述做法雖然可以隱藏自己,但是還有很大問題,例如一個網(wǎng)絡(luò)爬蟲下載圖片軟件,在短時間內(nèi)大量下載圖片,服務(wù)器可以可以根據(jù)IP訪問次數(shù)判斷是否是正常訪問。所有上述做法還有很大的問題。我們可以通過兩種做法解決辦法,一是使用延遲,例如5秒內(nèi)訪問一次。另一種辦法是使用代理。

延遲訪問(休眠5秒,缺點(diǎn)是訪問效率低下):

import urllib.requestimport urllib.parseimport jsonimport timewhile True: content = input(’please input content(input q exit program):’) if content == ’q’: break; url = ’http://fanyi.youdao.com/translate?smartresult=dict&smartresult=rule&smartresult=ugc&sessionFrom=dict2.index’ data = {} data[’type’] = ’AUTO’ data[’i’] = content data[’doctype’] = ’json’ data[’xmlVersion’] = ’1.8’ data[’keyfrom’] = ’fanyi.web’ data[’ue’] = ’UTF-8’ data[’action’] = ’FY_BY_CLICKBUTTON’ data[’typoResult’] = ’true’ data = urllib.parse.urlencode(data).encode(’utf-8’) req = urllib.request.Request(url, data) req.add_header(’User-Agent’,’Mozilla/5.0 (Macintosh; Intel Mac OS X 10_11_2) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/52.0.2743.116 Safari/537.36’) response = urllib.request.urlopen(url, data) html = response.read().decode(’utf-8’) target = json.loads(html) print(target[’translateResult’][0][0][’tgt’]) time.sleep(5)

代理訪問:讓代理訪問資源,然后講訪問到的資源返回。服務(wù)器看到的是代理的IP地址,不是自己地址,服務(wù)器就沒有辦法對你做限制。

步驟:

1,參數(shù)是一個字典{’類型’ : ’代理IP:端口號’ } //類型是http,https等proxy_support = urllib.request.ProxyHandler({})

2,定制、創(chuàng)建一個openeropener = urllib.request.build_opener(proxy_support)

3,安裝opener(永久安裝,一勞永逸)urllib.request.install_opener(opener)

4,調(diào)用opener(調(diào)用的時候使用)opener.open(url)

五、批量下載網(wǎng)絡(luò)圖片

圖片下載來源為煎蛋網(wǎng)(http://jandan.net)

圖片下載的關(guān)鍵是找到圖片的規(guī)律,如找到當(dāng)前頁,每一頁的圖片鏈接,然后使用循環(huán)下載圖片。下面是程序代碼(待優(yōu)化,正則表達(dá)式匹配,IP代理):

import urllib.requestimport osdef url_open(url): req = urllib.request.Request(url) req.add_header(’User-Agent’,’Mozilla/5.0’) response = urllib.request.urlopen(req) html = response.read() return htmldef get_page(url): html = url_open(url).decode(’utf-8’) a = html.find(’current-comment-page’) + 23 b = html.find(’]’,a) return html[a:b]def find_image(url): html = url_open(url).decode(’utf-8’) image_addrs = [] a = html.find(’img src=’) while a != -1: b = html.find(’.jpg’,a,a + 150) if b != -1: image_addrs.append(html[a+9:b+4]) else: b = a + 9 a = html.find(’img src=’,b) for each in image_addrs: print(each) return image_addrsdef save_image(folder,image_addrs): for each in image_addrs: filename = each.split(’/’)[-1] with open(filename,’wb’) as f: img = url_open(each) f.write(img)def download_girls(folder = ’girlimage’,pages = 20): os.mkdir(folder) os.chdir(folder) url = ’http://jandan.net/ooxx/’ page_num = int(get_page(url)) for i in range(pages): page_num -= i page_url = url + ’page-’ + str(page_num) + ’#comments’ image_addrs = find_image(page_url) save_image(folder,image_addrs)if __name__ == ’__main__’: download_girls()

代碼運(yùn)行效果如下:

Python爬蟲之Spider類用法簡單介紹

到此這篇關(guān)于Python爬蟲之Spider類用法簡單介紹的文章就介紹到這了,更多相關(guān)Python爬蟲Spider類內(nèi)容請搜索好吧啦網(wǎng)以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持好吧啦網(wǎng)!

標(biāo)簽: Python 編程
相關(guān)文章:
日本不卡不码高清免费观看,久久国产精品久久w女人spa,黄色aa久久,三上悠亚国产精品一区二区三区
国产色综合网| 亚洲精品大片| 国产精品网站在线看| 蜜臀91精品一区二区三区| 国产视频亚洲| 亚洲一区免费| 蜜臀精品一区二区三区在线观看 | 欧美日韩国产在线观看网站| 91精品啪在线观看国产18 | 国产中文在线播放| 欧洲精品一区二区三区| 久久久久欧美精品| 亚洲精品国产偷自在线观看| 黄色国产精品| 亚洲精品日韩久久| 国产精品一区二区三区www| 久久影院资源站| 91日韩欧美| 欧美~级网站不卡| 国产一级一区二区| 免费中文字幕日韩欧美| 亚洲人成亚洲精品| 国产精品亚洲四区在线观看| 久久99国产精品视频| 国产一区2区| 亚洲爱爱视频| 国产精品日本| 日韩成人在线看| 精品视频免费| 香蕉人人精品| 午夜精品福利影院| 美女性感视频久久| 亚洲高清av| 亚洲3区在线| 国产在线一区不卡| 精品欧美激情在线观看| 综合色一区二区| 国产精品啊v在线| 色婷婷精品视频| 日日夜夜免费精品视频| 精品在线网站观看| 婷婷中文字幕一区| 国产麻豆一区| 欧美日韩色图| 欧美亚洲tv| 久久国产直播| 亚洲久久在线| 日本精品黄色| 亚洲深夜福利在线观看| 久久超碰99| 91精品一区国产高清在线gif| 中文无码日韩欧| 国产一区二区三区国产精品| 亚洲电影在线一区二区三区| 18国产精品| 久久五月天小说| 久久激情五月婷婷| 蜜桃成人精品| 欧美日韩伊人| 欧美日韩国产亚洲一区| 日本亚洲不卡| 91精品一区二区三区综合在线爱| 日韩激情综合| 亚洲精品在线观看91| 欧美激情视频一区二区三区免费 | 亚洲青青久久| 日本高清不卡一区二区三区视频| 亚洲乱亚洲高清| 99热精品久久| 国产精品.xx视频.xxtv| 香蕉国产精品| 日韩1区在线| 日韩不卡一区二区三区 | 日本午夜精品久久久久| 尤物tv在线精品| 国产精品毛片久久久| 欧美~级网站不卡| 韩国一区二区三区视频| 丝袜脚交一区二区| 日韩一区二区三区在线免费观看| 欧美在线观看天堂一区二区三区| 亚洲高清av| www.九色在线| 亚洲理论在线| 在线亚洲国产精品网站| 涩涩av在线| 国产精品久久久久久av公交车| 久久成人国产| 久久免费大视频| 精品一区91| 国产探花在线精品| 亚洲精品无播放器在线播放| 午夜精品网站| 日韩欧美一区二区三区免费看| 久久xxx视频| 日韩精品五月天| 三级亚洲高清视频| 亚洲免费高清| 日韩欧美在线中字| 成人台湾亚洲精品一区二区 | 欧美精品aa| 日韩1区2区3区| 日韩精品一二三四| 狠狠干成人综合网| 免费毛片在线不卡| 蜜桃成人精品| 日本不卡免费高清视频在线| 精品一区二区三区在线观看视频| 国产调教一区二区三区| 日韩精品乱码av一区二区| 三级欧美在线一区| 欧美理论视频| 免费av一区二区三区四区| 欧美freesex黑人又粗又大| 高清不卡一区| 成人午夜在线| 成人台湾亚洲精品一区二区| 欧美精品成人| 久久99国产精品视频| 麻豆精品新av中文字幕| 国产麻豆精品久久| 久久丁香四色| 久久影院一区二区三区| 你懂的亚洲视频| 老牛国内精品亚洲成av人片| 麻豆久久久久久| 国产精品久久久久久久久久妞妞 | 亚洲激情久久| 一区在线观看| 影音先锋国产精品| 另类国产ts人妖高潮视频| 亚洲一区二区三区久久久| 亚洲一区欧美| 日韩精品三区四区| 日本免费新一区视频| 欧美亚洲tv| 精品资源在线| 欧美精品高清| 欧美freesex黑人又粗又大| 亚洲先锋成人| 日韩在线一二三区| 日韩三区四区| 国产精品天堂蜜av在线播放| 免费视频一区二区三区在线观看| 精品视频在线一区二区在线| 精品久久国产一区| 日韩精品水蜜桃| 亚洲永久字幕| 日韩动漫一区| 国产美女亚洲精品7777| 国产成人免费视频网站视频社区| 成人日韩在线观看| 久久高清一区| 国产精品porn| 日韩欧美另类一区二区| 伊人久久成人| 日韩不卡在线观看日韩不卡视频| 久久免费福利| 偷拍欧美精品| 日韩av电影一区| 精品九九在线| 欧美特黄a级高清免费大片a级| 亚洲精品看片| 久久伊人国产| 欧洲在线一区| 久久午夜精品| 国产精品久久久久久久久久白浆 | 亚洲天堂一区二区| 尤物精品在线| 欧美亚洲色图校园春色| 麻豆mv在线观看| 国产视频一区在线观看一区免费| 日韩精品视频一区二区三区| 成人亚洲精品| 爽爽淫人综合网网站| 日韩av电影一区| 肉色欧美久久久久久久免费看| 首页欧美精品中文字幕| 美女视频黄 久久| 五月综合激情| 国产麻豆精品久久| 日韩午夜精品| 九九99久久精品在免费线bt| 精品一区三区| 国产精品一区亚洲| 婷婷综合在线| 精品一区二区三区四区五区| 久久亚洲二区| 亚洲精品福利电影| 亚洲影院天堂中文av色| 美日韩一区二区三区| 伊人久久亚洲影院| 麻豆一区二区三| 欧美综合二区| 中文字幕在线高清| 日韩欧美久久| 香蕉精品视频在线观看| 麻豆成人综合网| 亚洲一区二区三区久久久| 97精品一区|