大战熟女丰满人妻av-荡女精品导航-岛国aaaa级午夜福利片-岛国av动作片在线观看-岛国av无码免费无禁网站-岛国大片激情做爰视频

專注Java教育14年 全國咨詢/投訴熱線:400-8080-105
動力節點LOGO圖
始于2009,口口相傳的Java黃埔軍校
首頁 hot資訊 網頁Cookie的獲取方式

網頁Cookie的獲取方式

更新時間:2021-11-11 09:12:19 來源:動力節點 瀏覽4811次

在爬蟲中cookie是非常有用的,可以解決反爬,封號等問題。接下來我們來說說獲取cookie的集中方式。

這里采用python2.7

第一種:mechanize

首先我們要使用mechanize,第一步:

pip install mechanize

第二步編寫獲取cookie代碼:

import os
import mechanize
import cookielib,re
br = mechanize.Browser()
cj = cookielib.LWPCookieJar()
br.set_cookiejar(cj)
br.set_handle_equiv(True)
br.set_handle_gzip(True)
br.set_handle_redirect(True)
br.set_handle_referer(True)
br.set_handle_robots(False)
br.set_handle_refresh(mechanize._http.HTTPRefreshProcessor(), max_time=1)
br.set_debug_http(True)
br.addheaders = [('User-agent', '用戶ua')]
br.set_proxies({"http": "代理"})
response = br.open('https://www.amazon.com')
cj = br._ua_handlers['_cookies'].cookiejar
for cookie in cj:
    print("cookieName:"+cookie.name)
    print("cookieValue:"+cookie.value)
cookie = [item.name + ":" + item.value for item in cj]
cookiestr={}
for item in cookie:
    name,value = item.split(":")
    cookiestr[name]=value

運行結果:

第二種:urllib

import urllib2
import cookielib
from http import cookiejar
from bs4 import BeautifulSoup
User_Agent = 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/73.0.3683.86 Safari/537.36'
header = {}
header['User-Agent'] = User_Agent
cookie = cookiejar.CookieJar()
cookie_handle=urllib2.HTTPCookieProcessor(cookie)
cookie_opener = urllib2.build_opener(cookie_handle)
# proxy_support = urllib2.ProxyHandler({"http":"5.62.157.47:8085"})
# proxy_opener = urllib2.build_opener(proxy_support)
urllib2.install_opener(cookie_opener)
# urllib2.install_opener(proxy_opener)
request = urllib2.Request("https://www.amazon.com",headers=header)
response = urllib2.urlopen(request)
for item in cookie:
    print('Name = ' +item.name)
    print('Value =' +item.value)

運行結果:

第三種:requests

import requests
headers = {'user-agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/73.0.3683.86 Safari/537.36'}
r = requests.get('https://www.amazon.com', headers = headers)
for cookie in r.cookies:
    print(cookie.name)
    print(cookie.value)
    print("=========")

運行結果:

第四種:selenium(個人感覺這個雖然加載比較慢,但是獲取cookie最全)

pip install selenium

代碼:

from selenium import webdriver
driver = webdriver.Chrome(executable_path='d:/seop/chromedriver.exe')
driver.get("https://www.amazon.com")
#for c in cookiestr.keys():
#    driver.add_cookie({'name':c,'value':cookiestr[c]})
#driver.get("https://www.amazon.com")
cookie = [item["name"] + "=" + item["value"] for item in driver.get_cookies()]
cookiestr = ';'.join(item for item in cookie)

運行結果:

第五種:總覺得selenium比較慢,打開還要加載瀏覽器,于是嘗試了 htmlunit以及phantomjs

htmlunit

phantomjs

from selenium import webdriver
browser = webdriver.PhantomJS()
browser.get("https://www.amazon.com")
cookie = [item["name"] + "=" + item["value"] for item in browser.get_cookies()]
cookiestr = ';'.join(item for item in cookie)

運行結果:

第六種:scrapy

這邊我們簡單測試一下,首先你電腦已經要安裝了scrapy,如果沒有安裝,pip install scrapy

然后我們輸入要獲取地址的cookie

scrapy shell "https://www.amazon.com"

cookie結果:

最后一種:chrome headless 使用無頭瀏覽器來獲取

這個目前我是在centos上面進行操作:

第一步:肯定你要安裝chrome啦

第二步:運行安裝腳本

curl https://intoli.com/install-google-chrome.sh | bash  

測試是否成功: 運行以下命令,如果成功會在當前目錄下面保存百度的截圖

google-chrome-stable --no-sandbox --headless --disable-gpu --screenshot     https://www.baidu.com  

這里我們開始獲取cookie信息

first:

google-chrome-stable --no-sandbox --headless --disable-gpu --user-data-dir="$HOME/Library/Application Support/Google/Chrome/" --remote-debugging-port=9222  https://www.amazon.com

second: 這里我們主要是獲取websocket的url

curl -s localhost:9222/json 

third: 這邊要注意哦,要安裝wsc,安裝wsc之前記得要安裝npm哦,然后在執行npm install -g wsc,然后在執行以下命令

wsc ws://localhost:9222/devtools/page/D42AFC3C9AF9C8A1511ADC60850BD5A8

然后輸入:

{"id": 1, "method": "Network.getAllCookies"}

最后cookie結果:

目前嘗試了mechanize、urllib、selenium、headless chrome、requests、htmlunit、phantomjs、scrapy

目前已經嘗試了以上八種,覺得還是selenium獲取cookie比較全,信息比較完整,獲取cookie的字段也是比較穩定的,經過研究cookie,就是selenium獲取cookie的速度比較慢,看看還有沒啥辦法優化速度,繼續查閱別的方式來獲取cookie。

以上就是關于“網頁Cookie的獲取方式”的方法,如果您想了解更多相關知識,不妨來關注一下動力節點的Java在線學習,希望對大家能夠有所幫助。

提交申請后,顧問老師會電話與您溝通安排學習

免費課程推薦 >>
技術文檔推薦 >>
主站蜘蛛池模板: 国产色站| 99视频精品全部 在线 | 狠狠色狠狠色88综合日日91 | 91精品视频网 | 国产精彩视频在线 | 免费在线激情视频 | 思99热精品久久只有精品 | 一级毛片全部免费播放 | 欧做爰xxxⅹ性欧美图片 | 欧美日本一区亚洲欧美一区 | 欧美777精品久久久久网 | 国产毛片一区二区三区 | 国产91久久精品一区二区 | 国产中文字幕视频在线观看 | 综合好色 | 亚洲视频在线播放 | 久草在线中文最新视频 | 中文字幕亚洲欧美一区 | 欧美伦禁片在线播放 | 国产一区二区三区免费 | 色视频在线 | 精品一区二区三区影片 | 久久天天躁狠狠躁夜夜不卡 | 九九热在线免费 | 色综合天天色综合 | a加勒比一本东京 | 国产午夜精品一二区理论影院 | 国产福利一区二区在线精品 | 处videossex第一次中 | 99色在线播放 | 久久亚洲国产午夜精品理论片 | 亚洲午夜一区二区三区 | 国产精品中文字幕在线 | 日本不卡免费高清视频 | 99热久久国产综合精品久久国产 | 国产合集福利视频在线视频 | 日韩欧美亚洲国产高清在线 | 天天干天天爽 | 成人小视频免费 | 国产日韩一区 | 国产在线视频不卡 |