- 在线时间
- 1630 小时
- 最后登录
- 2024-1-29
- 注册时间
- 2017-5-16
- 听众数
- 82
- 收听数
- 1
- 能力
- 120 分
- 体力
- 566435 点
- 威望
- 12 点
- 阅读权限
- 255
- 积分
- 175153
- 相册
- 1
- 日志
- 0
- 记录
- 0
- 帖子
- 5313
- 主题
- 5273
- 精华
- 3
- 分享
- 0
- 好友
- 163
TA的每日心情 | 开心 2021-8-11 17:59 |
|---|
签到天数: 17 天 [LV.4]偶尔看看III 网络挑战赛参赛者 网络挑战赛参赛者 - 自我介绍
- 本人女,毕业于内蒙古科技大学,担任文职专业,毕业专业英语。
 群组: 2018美赛大象算法课程 群组: 2018美赛护航培训课程 群组: 2019年 数学中国站长建 群组: 2019年数据分析师课程 群组: 2018年大象老师国赛优 |
4 @. s& N J c( n8 K2 B6 M/ @+ ~Python爬虫常用小技巧之设置代理IP , D* j" O6 r* k) u8 y+ W
) ~7 T u9 C7 `9 v; e
设置代理IP的原因4 ~3 Y* O( @% i
我们在使用Python爬虫爬取一个网站时,通常会频繁访问该网站。假如一个网站它会检测某一段时间某个IP的访问次数,如果访问次数过多,它会禁止你的访问。所以你可以设置一些代理服务器来帮助你做工作,每隔一段时间换一个代理,这样便不会出现因为频繁访问而导致禁止访问的现象。3 u; Z5 ]$ L9 J( p! P& R5 J/ q3 g
我们在学习Python爬虫的时候,也经常会遇见所要爬取的网站采取了反爬取技术导致爬取失败。高强度、高效率地爬取网页信息常常会给网站服务器带来巨大压力,所以同一个IP反复爬取同一个网页,就很可能被封,所以下面这篇文章讲述一个爬虫技巧,设置代理IP
. w' Z3 \& M" c0 \, p: S代理的获取有很多方式,网上有很多免费的可以去爬取一些试试,但是免费的代理使用起来也是 很吃力的。还有就是现在网上有很多的代理供应商,可以在网上寻找下,然后找家靠谱的使用。毕竟网络太大了,代理供应商肯定也是参差不齐的,所以找到合适的代理还是需要花点时间的。在这里我就是使用了我们长期使用的一家质量好的代理,亿牛云代理,而且是使用的他们的爬虫代理(动态转发)和一般的api模式不一样。这种更简单更方便,对于懒人来说绝对是最佳选择。
/ c' z( z1 E8 n. c. W3 \- G具体代码的使用
8 f: v0 d. ]3 Y% \( ~#! -*- encoding:utf-8 -*-, P: m3 r, c6 G
+ E: z' D# E% a# k6 A1 C import requests
) K: T4 G3 m& p+ `0 { import random
, b. g, W% j! n2 y" y& v" b
- @6 R- B' s M0 Z' q # 要访问的目标页面4 ]4 {5 r, y8 W7 z- [" O' ^
targetUrl = "http://httpbin.org/ip"+ O; q. u! O4 Q+ K O K
1 `1 b8 `: }, v5 f" s, }4 q6 E% m # 要访问的目标HTTPS页面( d4 V* T1 _2 [1 ~5 H+ z
# targetUrl = "https://httpbin.org/ip"6 g3 w a( s9 j
" K' x; \$ u- v
# 代理服务器
" e; a7 c3 `2 Y" u, D proxyHost = "t.16yun.cn": d8 N5 F) c+ L- Y x. Z8 |: E
proxyPort = "31111"
2 B& v5 s4 `2 B$ {) e" r& j* u$ e; ~$ B4 p$ w, @9 z0 V
# 代理隧道验证信息
, Y' [* V( }: `& G8 V proxyUser = "username"
2 [/ R% a7 a7 Q% f- f; |& } proxyPass = "password"( C9 r# _+ r: E, F! P; H+ W
0 x% S7 Y; ]6 Q& y/ P# D6 a) b proxyMeta = "http://%(user)s:%(pass)s@%(host)s:%(port)s" % {
5 Q3 g% ? Q4 ^ "host" : proxyHost,
9 G* f7 e# g0 X* e6 ]" W* K "port" : proxyPort,9 N' x- J9 D7 Y5 [5 Z" V1 [6 F
"user" : proxyUser,% C& L8 I% Z# s4 p& R
"pass" : proxyPass,
* M8 b, s; N9 \5 a& Y }! ~; [/ a, E: I z' A
% h P1 b( ^; _% w u3 E% Q0 t& [
# 设置 http和https访问都是用HTTP代理
" i% [% l* N+ n6 b proxies = {5 }$ N2 o" [4 f$ }6 Z& W6 \
"http" : proxyMeta, B( W& a, w) r6 \3 z
"https" : proxyMeta,
0 D" n8 J5 O& X }
+ C9 t0 H/ n( ]* x- }) c- @- E9 t: E
$ a* j3 S k, c( M1 ]5 U5 C # 设置IP切换头
4 O/ Q" `4 p6 a+ s U8 Q" h tunnel = random.randint(1,10000)
/ `9 j, q/ E% x" Z9 S5 B headers = {"Proxy-Tunnel": str(tunnel)}! ^" ~/ y' ?( P [* o* N
resp = requests.get(targetUrl, proxies=proxies, headers=headers)
3 Q: ~3 J4 C7 D. Q+ w5 [: {7 U! x/ }, Z. C- x7 F
print resp.status_code
& O9 x& g0 {$ P; F print resp.text8 ~% V7 g4 K, ^" `
总结
: Y+ F+ E, ]1 P4 p; |以上就是这篇文章的全部内容了,希望本文的内容对大家的学习或者工作具有一定的参考学习价值,如果有疑问大家可以留言交流# R6 O0 `7 ?: O* s
+ n: l5 u5 X, d8 A9 p% V |
zan
|