- 在线时间
- 1630 小时
- 最后登录
- 2024-1-29
- 注册时间
- 2017-5-16
- 听众数
- 82
- 收听数
- 1
- 能力
- 120 分
- 体力
- 565578 点
- 威望
- 12 点
- 阅读权限
- 255
- 积分
- 174896
- 相册
- 1
- 日志
- 0
- 记录
- 0
- 帖子
- 5313
- 主题
- 5273
- 精华
- 3
- 分享
- 0
- 好友
- 163
TA的每日心情 | 开心 2021-8-11 17:59 |
|---|
签到天数: 17 天 [LV.4]偶尔看看III 网络挑战赛参赛者 网络挑战赛参赛者 - 自我介绍
- 本人女,毕业于内蒙古科技大学,担任文职专业,毕业专业英语。
 群组: 2018美赛大象算法课程 群组: 2018美赛护航培训课程 群组: 2019年 数学中国站长建 群组: 2019年数据分析师课程 群组: 2018年大象老师国赛优 |
: y% c" k+ W4 Q0 v* Z* U
Python爬虫常用库总结
' g- q. b4 A& m% E4 I: ~文章目录6 O# Y8 j* ^5 a, m; G; U9 w5 U
requests
* N6 q+ S7 t' E y! q! _requests基础
$ d6 Z% u8 k a. frequests模块发送get请求
8 N& X! }- p, ?5 Rresponse响应对象4 O& r. G( [% ] U. e
response.text 和response.content的区别
" O# ?1 B4 A+ O' ?7 ]解决中文乱码% w$ k9 U" |5 T8 {& {! w3 \$ L
response响应对象的其它常用属性或方法% {# t! r7 b" q' {% c
requests实操/ ^3 @; a) q* R% @ m/ J# _
requests模块发送请求) u5 \ w; I N+ N n
发送带参数的请求
/ Z" o8 E7 R( L! e, G, u/ J7 K0 q超时参数timeout的使用
1 l: a; f& w; W$ y, trequests发送post请求的方法) u+ z0 b# b9 P8 N% [
BeautifulSoup
0 Z" b3 m3 W$ a1 L$ C, P9 u常见解释器的优缺点: W) f, _ E; y8 i* X, |5 i
常用操作
8 R3 Q8 S5 i; X几个简单的浏览结构化数据的方法
1 C. ^' G0 s6 S, Z1 A从文档中找到所有的< a>标签的链接6 y- u2 ~' ]4 H
在文档中获取所有的文字内容- e( f% O9 ^& `5 C
通过标签和属性获取
9 s1 i% M) p' T% @$ r' g' WName属性
v7 K& A! P4 T多个属性, @& o8 t7 f8 V2 Y1 H
多值属性
R& v# r/ B; b可以遍历的字符串2 ], G+ F* g7 T3 }
注释及特殊字符串: m- [8 r; \; G/ y5 F
遍历文档树3 r1 G5 e, f+ f6 t; L
子节点
; j$ ?! j$ T5 {% L$ U- ]6 g, A3 Jfind_all方法. e4 p3 h; Y9 g/ {+ q( j, e
.contents和.children- g0 b, H- O& q1 k$ R" J6 e
selenium
2 a' K0 c2 h' ~- Fselenium介绍) Y @2 C: X2 D+ A3 f4 ?+ I
chrome浏览器的运行效果( i6 a5 {6 O6 S+ G8 w, y
phantomjs无界面浏览器的运行效果0 e& T# B/ @6 ?/ j
selenium的作用和工作原理
0 G/ H0 H' J- R) O1 I+ p, zselenium的安装以及简单使用6 ]* M5 f3 D% G- z6 w
selenium的简单使用
1 m" ^6 [; W, M& a- w9 Tlxml$ E3 y, G% L; G/ H/ L
记得安装快速第三方库,Python经常需要安装第三方库,原始的下载速度很慢,使用国内的镜像就很快啦9 K* T. o" q% ~" q v: _
4 W( N1 v: N: m- w2 M4 n% @# R) [6 S1 g0 B+ B5 }
pip3 install -i https://pypi.tuna.tsinghua.edu.cn/simple 包名
( H6 o- T- \1 n, K" K5 o; u9 [13 q# h* O- F( h6 O
快速下载模块
. L4 B- ?7 W8 Q, x. S8 N% v
# M7 `- `- F' X5 O/ P' Z2 p; j0 B8 p4 k$ f) w' k
官方网址:
% O7 W5 J' t$ u7 m; t/ Z8 S. z# v3 a* g7 T6 Q4 x1 y( r
* n* c+ r9 k# j I0 E5 IRequests: 让 HTTP 服务人类6 _% u1 E5 G; X# A
Beautiful Soup 4.4.0 文档
* W8 B4 s9 _0 Y0 J( v7 CSelenium官网7 F, g- S N' K$ @0 @" P
lxml - XML and HTML with Python5 R9 p, o. G: O: j' r3 ~
requests* r( C2 ?' A6 u! C: }
requests官方文档 https://docs.python-requests.org/zh_CN/latest/
" t5 t5 d+ Y5 H5 j: {0 e
: M5 Y) C; x2 `. e/ u# n6 A o G$ @
, v, @! i# e Y! a# B0 q" i% V. X9 @5 a7 G) z* E( m# P
, X5 V/ L9 R) L" |' A1 |
" M' K* U' A6 Q, l
: a. s: y8 \" @/ L* D
进行爬虫,首先要对网址进行请求,这个时候就要用刀我们的requests模块了。requests是python的一个HTTP客户端库,跟urllib,urllib2类似。与urllib,urllib2相比,requests模块语法更加简单。正如他的官网所说:
2 d3 a1 B& _ {% L# A5 M) Z; @
( P* Q2 \$ C/ f: F8 ~7 J
$ [5 y3 N* ]% r( |$ P% [0 c! O, z( x1 `1 M; j- y
7 c+ N7 t& \) V3 F5 V3 jrequests模块介绍; }, v( O2 n2 ^% ~% Y
: H) {5 N9 g7 u2 Z0 i7 L
& D: l) }' T4 ?# E( K
发送http请求,获取响应数据
: o% m' ~' J2 s, y- y: o" ^7 S5 R+ d8 H- j |/ i6 b
- L$ P1 W4 d- s0 \9 W% Drequests模块是一个第三方模块,需要在你的python(虚拟)环境中额外安装 c6 V3 v ^! [/ |6 }
N7 E- l2 e- W3 P: d* u+ a5 M
6 r% c$ [; k5 v4 J. {' `: j6 n; A3 }pip/pip3 install requests: M: R9 k1 X: W. s. C
. d- C0 W: G/ L; m5 z, u
4 V- } }8 O; ?; B% crequests基础2 w4 ~4 `. l+ Z; b' a( j
requests模块发送get请求# y0 i8 }* @5 Q! _) N' O
#https://beishan.blog.csdn.net/
) W9 Y. a6 `. W# U# Uimport requests 5 N. y7 W0 ]' K& s
# 目标url* C/ o( z+ v- z* }7 ~
url = 'https://www.baidu.com' ) I, {; ]2 H% m/ H
# 向目标url发送get请求
! P. x9 K, H: j( Vresponse = requests.get(url)$ L" L1 f. u2 H0 j) x' C4 j- f
# 打印响应内容# C- e! f6 g8 j# G- b& r) g0 N3 g
print(response.text)
2 X% _/ z% X! D0 w3 C1% C; V" H$ A9 r: P
2
7 A5 w# [/ H2 J8 _ i4 p3
$ G, x6 O: u6 @9 C+ R3 O4
0 |5 `* H0 |" q' ^# P5( |2 b5 I) F" i% ]$ O- c9 s
6
! L" R c& ] {7$ u) K* f* b1 g8 _2 V" H
8) u5 r* ~/ k2 B, {
response响应对象
% k; c7 G& L1 s+ P观察上边代码运行结果发现,有好多乱码;这是因为编解码使用的字符集不同早造成的;我们尝试使用下边的办法来解决中文乱码问题
; N% z% N& z: j( o$ D1 i+ m+ O
! s6 B) V$ j' Z' c0 k3 O8 J$ Vimport requests % ~. H$ N# {: D _ M* a; u4 \
url = 'https://www.baidu.com'
7 q$ z8 K" F; x& x# 向目标url发送get请求
+ P {) f4 G' W: b: Wresponse = requests.get(url)
& o7 A+ P) d/ J* z8 H# 打印响应内容
' l& i# n! U3 p$ ?# print(response.text)
) c8 @% F( [$ `% o3 C6 Sprint(response.content.decode()) # 注意这里!
" q' K8 M/ y7 G$ m& h' a1
# b& G' O: B, y" Q9 J. ~6 u$ {" d2* T3 l4 a& I; O H- b
3
0 D7 A P/ C; ]; i6 Q5 J4
/ U9 E: R& I3 \+ O5
9 Y0 k" y& g( U4 X! {) A, y- g6
& ]+ s% }/ X9 |& I0 z: ]5 p71 l; X; B5 a* w
response.text是requests模块按照chardet模块推测出的编码字符集进行解码的结果* d0 M, O& G5 f: U8 K0 }) k9 h
网络传输的字符串都是bytes类型的,所以response.text = response.content.decode(‘推测出的编码字符集’)
% r, c# F, }2 q `我们可以在网页源码中搜索charset,尝试参考该编码字符集,注意存在不准确的情况
. u: f: V, e1 ^, t6 I: ?response.text 和response.content的区别
1 m5 { P8 ]. l$ ]response.text
, ~, l0 N' p/ p0 T: h类型:str/ j9 u! S: e3 W! A' [
解码类型: requests模块自动根据HTTP 头部对响应的编码作出有根据的推测,推测的文本编码
1 \% A+ ]1 O* |9 {& C1 F6 G, J/ z. Cresponse.content; r. e5 G r- S Q
类型:bytes
- r' j* `& p$ ~# |; E5 X; g# i9 |8 {解码类型: 没有指定6 o' X0 d" w# V& M1 W/ z4 C) a
解决中文乱码! M" Y/ c2 h4 ^0 V& B, n: K# ~
通过对response.content进行decode,来解决中文乱码, ^. H+ ~& Q- ?
" q$ Y0 N( E! @, k$ L: k9 u& \$ q1 J2 [- ]- O2 k. H
response.content.decode() 默认utf-8
1 \, X+ V5 m2 i- _response.content.decode("GBK")
$ u1 Q X) y: d, Y. M6 z! r; _常见的编码字符集
- R2 E; a& d& h: q3 x/ I0 N$ ]utf-84 L# H1 B! z% ]: x5 n
gbk
% u7 H% u( d# e$ rgb2312
6 j" e' O8 c# L% K9 Nascii (读音:阿斯克码)
; ?+ `+ y. t5 G. O( C- x1 V" miso-8859-1
. J: j& _) G: U* x8 ?: [# Mresponse响应对象的其它常用属性或方法; h: L* j: ?" C5 n8 S# ?$ l0 f
#https://beishan.blog.csdn.net/: F) y5 G- t2 n6 n5 G
# 1.2.3-response其它常用属性; N+ e; R% |) \, [
import requests, _- V( T8 v# ^+ e/ K% a' N
0 m# M0 u+ `) w$ j; [, `. K
6 [5 {4 v; h5 Z
# 目标url" r( Y6 R8 t; @+ y5 K9 X
url = 'https://www.baidu.com'+ C/ |2 v" V, {9 C q/ i, y5 S
7 y6 |( o% e5 B- X
- T/ L& I4 C: U: T: V6 o3 N# 向目标url发送get请求
' u* o: ~( Z! sresponse = requests.get(url)
. V# h: Y) L! J
- S1 M- F! S* Z" Y- k1 o" t- } p! N: m4 h J0 N
# 打印响应内容* z1 f% Y/ I( @/ J2 [7 o
# print(response.text)/ L( L+ \) S6 _+ }/ l* i' c
# print(response.content.decode()) # 注意这里!
9 t( R7 U+ x* i- Fprint(response.url) # 打印响应的url
# F+ a1 U' X- }print(response.status_code) # 打印响应的状态码
T! M/ K) q" c5 p- Zprint(response.request.headers) # 打印响应对象的请求头 W% g" r/ c- Y* [( h1 t- g
print(response.headers) # 打印响应头3 ?) O2 S8 n# H) l
print(response.request._cookies) # 打印请求携带的cookies9 F: ]# {" @4 m+ S0 F. [9 t
print(response.cookies) # 打印响应中携带的cookies
; a K5 q/ G% z' e. C1
; f8 T" S- W9 ^5 E( x3 t7 A: y2
6 y; ^- R0 k% s0 F3+ N- M; K' O6 I
4
! G5 | Q) H6 l5) E: d1 O: w# @. q8 `7 R
6
- K4 J; e8 b: ]7 P9 O* J7
1 ^& @, j, r- ]6 r% Z8! e! v, n0 U7 P1 j# S
9
9 h1 x- S) z1 r7 l( w1 C10/ |: t3 H C$ p8 I' G3 p' g! [
115 M2 C/ j) O' Q* i! C
12
5 n1 |; y# n! K13
, \9 L0 I8 @! j6 A145 x; m/ o/ x' i" a6 _1 a7 b0 p
152 s% l! W2 i# S4 F# a
16
& w- H& z1 d& [( Q9 k. V17
7 d- A7 ]0 l( M) `: ^( l* a181 {7 Q! q! S6 @- M: ~$ `
19 T1 c0 p0 b- y( j, D& s/ y- @
requests实操6 R0 u% f! r+ v$ Y' U3 ^3 S( g
requests模块发送请求- W$ K" h) Y( T* b! B3 G: ?) [
发送带header的请求
) ~8 g3 _' \; \% Z( w2 r6 e' }9 d2 q
# W5 a, |- L- |
我们先写一个获取百度首页的代码" {4 a' \# y e$ K6 E5 b; y
7 p' U4 @ O8 F: p" d, M, Q+ I
: L Y5 z0 E# B* [. u' Y; Y0 yimport requests( N. {. ]# H4 ?5 }. z! C6 r
url = 'https://www.baidu.com'
( @% _8 K8 @% B) D. `response = requests.get(url)
: T* n8 I0 R2 q3 G& vprint(response.content.decode())
! n' [; v. P' o* q7 s1 K" U# 打印响应对应请求的请求头信息
6 c/ r& x a O w! W1 ~4 Nprint(response.request.headers)5 s# z3 A4 ~% [6 f& p8 s! n) X
1
* p# I. [* l0 z3 X8 O2- P) t y9 p* x' ?
39 j. O1 ]1 V% ?- e
4
' e; L, m& I2 J5 h% J5: a/ n- {: D+ E8 m6 @
6
. [3 G2 G) u, T4 V# V从浏览器中复制User-Agent,构造headers字典;完成下面的代码后,运行代码查看结果
2 K, |; \* k6 d4 I, O9 T9 N# X. N( n( ^5 W9 B2 ]- p
# ^9 p) p) u) `6 d: G" B2 X3 }import requests7 z& }7 ]8 x5 K2 X' m% n
# I* K0 o# D0 `% | C1 t- i4 }6 X! M
url = 'https://www.baidu.com'( a: z2 a: r. s
& d. w7 z9 c9 A: s+ Q
, y& j2 l/ |) S% Z1 `: f: H
headers = {"User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/54.0.2840.99 Safari/537.36"}" p- w6 k: A& v' d
( e. I+ f9 {" C! q$ s% Q
. V- u |5 h/ p9 g# 在请求头中带上User-Agent,模拟浏览器发送请求( r, F! f9 C; X" A
response = requests.get(url, headers=headers) % p5 [* ^5 ^0 c3 f
: S) c" `- H: ]: R) K
4 @: [+ i& f1 G- ]4 Q7 o6 pprint(response.content)- W$ Y- a) {" J6 M1 W% F
! o1 v) y2 K* t* \; Q% d; ^$ w3 O. ^. Y) M) {
# 打印请求头信息: r6 c5 ?0 _$ x/ t* g- ~9 F
print(response.request.headers)
$ J' O% l8 G- M9 ~1( M9 v4 t# n! x
2
0 F/ \2 k ?0 N3
2 `2 c) \% q% C: H) D4
: I8 u: }+ P; }4 v5
# z/ }8 k5 f' ?1 ?6
, p- U, \" F3 b+ M5 T. J7! q- r, U* Q" q8 O- F) e) S. L
8
$ M3 j& J) z1 r; A* ]/ n90 `$ V! s- `, {' H! m# [; n4 J# K
10
, Y5 ?; r: C' r8 f8 T# w+ |11( C' g2 A6 D8 o$ L$ h
12
# Q. q, Q& I0 N0 ?5 ~! i6 D13, d0 p+ A, `0 g" m [$ y6 E
发送带参数的请求% K. S o" W( U8 c
我们在使用百度搜索的时候经常发现url地址中会有一个 ?,那么该问号后边的就是请求参数,又叫做查询字符串
2 W" p9 u4 |2 ~4 P& g5 p; h2 P
x- {7 X3 `* ]; f
! ^7 R4 Q9 z7 A在url携带参数,直接对含有参数的url发起请求
% X7 `9 N: U! R% ^- O( W% E _% n) V( g! p( o8 {
0 _) P$ H, Q. G, f" W
import requests# g0 g8 Q- p7 q1 \0 s) G. j1 `
4 r R" s" p: S/ L+ f4 ~
9 H5 r$ a7 B" L, \* S6 ]2 w- P1 a6 Bheaders = {"User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/54.0.2840.99 Safari/537.36"}. ~4 j, I# M- t
% H7 n2 K# S! h& N6 N% D
, J. m7 L" f$ U' Zurl = 'https://www.baidu.com/s?wd=python'/ z! @: r3 S. _1 m
2 C7 t$ f% F- E' f6 Z, q
7 w9 u5 Y- I! S8 oresponse = requests.get(url, headers=headers)# S9 U! d' j% k H+ x$ q- j/ x; K
- r+ @! H& K$ m) Q
! ]2 c- x1 Z" m
1
$ B! P5 O0 T% ?' A6 q/ h2. s# x! n, Z2 t+ _- z" F
30 D) y7 ^4 X+ U# F0 { Y; f
4
# W" i6 E6 \6 s5 T5
4 j, q* F7 W3 ^ p6
' b0 C/ C0 e2 a) o7
! H# j6 [* Y3 P: L5 \( W3 d! Y8
' ?$ N/ T9 d7 c- V+ D! }: B通过params携带参数字典" r, c! j, b% d% x
- V# r8 [6 `+ [! v+ ?2 ?9 Y' t% P
! K! P, p" I& h! Q 1.构建请求参数字典+ r# _( _ E: a
! ^3 l5 a1 @8 K( W% K7 d% a( C* t' ]8 y/ |$ r# C
2.向接口发送请求的时候带上参数字典,参数字典设置给params
. D; ?4 [5 X0 [6 m6 f# F/ I* E
. I5 q" h! c! U& t1 t
/ b# _: ~% h$ g0 e3 H* Pimport requests) z. z6 N ]( a& s: m5 J/ j
1 R, ?+ ^7 l* S! i* y
8 _9 k4 E6 j0 y8 R% m2 k
headers = {"User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/54.0.2840.99 Safari/537.36"}
3 p; v& W5 K; w# t4 i# k7 {7 a
' }3 t4 i- ?; Y$ y' ~
- X: i% K" v- G# 这是目标url: z6 M' ~" M3 N$ k5 o6 F4 [# `9 N
# url = 'https://www.baidu.com/s?wd=python'
! f- G7 t4 V3 w, @- S' O% ~3 y. g4 b z( N# ~
% _+ Q# d) h) F7 q' i: f+ I, z3 I# 最后有没有问号结果都一样7 c4 n4 ^! _7 }, X2 V; X8 ?
url = 'https://www.baidu.com/s?'
* g. b1 V, j3 L; `2 ^2 ^5 @0 a5 \9 `6 C3 S; t0 C' v
# [. J$ Q o- D4 F6 a$ F) G
# 请求参数是一个字典 即wd=python
; M4 a0 B! S9 A6 ]4 {kw = {'wd': 'python'}4 E* ~& g3 x* b4 |6 _
! t( Y, C' X& b" c ~# i, G3 H0 z1 H" G9 M9 }
# 带上请求参数发起请求,获取响应
# d5 E* {$ ~# E( y! x. ^8 lresponse = requests.get(url, headers=headers, params=kw)# G. A6 N6 U; h
, a- m% k" y9 U+ D
, N5 E8 ^, w) m0 B. h; eprint(response.content)
- I" h$ b: U0 p& N10 R6 M7 i& d0 v8 w; P
2& F7 E$ E7 K! q# S0 T
32 K' g f0 {: r' l5 l9 A6 W u1 o
4
( j$ A3 r* u7 l9 o5 M5
; ~- H+ |. v, b2 k* ?; t5 P. e6/ \( \; Y5 x. ^# A5 t
7$ O, N/ {! W* C2 D) E
8
* H# D6 s. I1 O7 @! k- F9
3 s( `2 \/ J# ~6 Q$ K10
$ H1 e) b. F# L& Z6 t b11$ `4 ?( _/ K) h. o0 G; O
12! b( h) \: a. `) S' h
139 Z' l, u- @$ s/ r% I5 L8 t% [
14: O0 f S2 y9 g( X
15
4 H' h; a; w. R4 K C; u9 _3 m8 P16$ A. Q& j3 @4 o) X( s+ M" ?5 _7 A
17
! J( b3 I+ B6 i) G从浏览器中复制User-Agent和Cookie
$ A! F: o0 c* F$ D% I Y$ t浏览器中的请求头字段和值与headers参数中必须一致1 b$ v+ e' l" L3 V. L; F9 j2 H
headers请求参数字典中的Cookie键对应的值是字符串
: p6 `$ L2 v% x) O3 Bimport requests" [/ m0 Z! F- A! F- \/ Q8 x$ p. i& O
1 D0 ~3 ^! M+ `9 e+ Q4 a4 J0 u, D; c2 H
url = 'https://github.com/USER_NAME'
}3 K# o% G1 N) |( q
3 l8 X& w& l$ R* p
, R6 U" L0 j% Z$ w# 构造请求头字典
2 h+ ~4 }8 `* d' @headers = {
, q1 Z- S+ u; s& f8 o) a3 ^ # 从浏览器中复制过来的User-Agent
* G8 s9 V( H U( e 'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/67.0.3396.87 Safari/537.36',% ]9 A3 f0 ~9 a9 }( L- ]1 p4 \
# 从浏览器中复制过来的Cookie& h. F3 |2 b" x6 J
'Cookie': 'xxx这里是复制过来的cookie字符串'1 |6 E# Z* y4 w( S5 Y. ~$ g
}
( \: l! S) [2 U6 s$ Y& f) n2 Y, N; E& `$ i
0 d7 A- U- o5 p* R) Z
# 请求头参数字典中携带cookie字符串
3 r; P3 z) p! W* C* Presp = requests.get(url, headers=headers)
) @% x& Y# i' \# c/ F% E$ k; ~8 m7 A3 l3 j* l9 \. U: y
+ w1 _5 e; R; w) ]4 {; o
print(resp.text)% V% S# j: k* ]" h
1# ~0 H- q( z, c2 q: {+ D: G
2: v; ^4 {: x% s) O& S
3
& R5 C, X( q O- F2 k4
$ c9 o H/ e8 h+ S5
% a) i) i- k; \1 }! i* S6
, v5 Y s0 X: i$ H) e77 x# p! ?) \$ c
8
. F3 ~) e8 C. w/ R" J! j( N9
3 |: O! K5 l+ D3 {10
1 a; K0 v/ z. r" M. p" K- B11/ U6 F& D/ A7 q. y9 u9 s3 w
12
/ {9 }+ p% Y# O" J0 q- \' n13
1 C/ R+ F0 S/ n. N14
! E9 m' Z. l) B, K" ?15
! f0 f- B9 \# z; n% o: z16: D( \1 e+ { F' d) z' |6 D1 t8 N+ F
超时参数timeout的使用
W6 A5 j: y4 i- ~4 c. z1 a4 p: h在平时网上冲浪的过程中,我们经常会遇到网络波动,这个时候,一个请求等了很久可能任然没有结果。* G$ W4 `8 ]% o) _) f- H6 E# O
5 t1 h2 Z) S& ]& \, X7 [, w
3 e3 r: [* \$ B( g% r+ k
在爬虫中,一个请求很久没有结果,就会让整个项目的效率变得非常低,这个时候我们就需要对请求进行强制要求,让他必须在特定的时间内返回结果,否则就报错。* F( x6 W& B5 ~- b- o
% s. ]6 W( j6 G4 ^, i
% j9 I6 a+ T( X x+ z: p% L超时参数timeout的使用方法- f7 Z' v1 U7 f! w& Y% \
% T" m+ U6 U6 b
; r, A; H6 ?% K/ P
response = requests.get(url, timeout=3)
4 u0 V$ e7 l' J7 E0 z+ i" o7 e7 S3 I/ g% B
* A( L! w! u3 |0 r2 l0 vtimeout=3表示:发送请求后,3秒钟内返回响应,否则就抛出异常
2 I9 K& p2 o7 `$ m ~. _; ]; p/ D4 c& g5 T6 _
" \1 @7 Z& U( H8 D0 h4 j" L8 wimport requests! K1 Z; `9 F1 T+ \2 f" {# u- S
}9 ?/ _2 I6 v- p5 q
) `* p: u) z7 p: z7 Z1 P* F! s; r) s0 k9 O7 ?* b# O
3 N3 E2 f$ D! z. S5 l9 V f7 Durl = 'https://twitter.com': y: k' e1 K+ K$ B
response = requests.get(url, timeout=3) # 设置超时时间2 k! N" b* S T
/ [& y# R' ]6 ?! B- a& J) b# ?
- Y1 E: |. |) t6 R+ L; g' M6 D1
; y3 g' b9 C3 e3 `25 ]6 a$ S% H" @" t a/ y) y
3; S. l7 Y# T/ {
4
2 `$ z3 w3 D0 |* U7 h ?5
4 ]7 j3 `8 U7 U3 F+ o' w% D6
; C% Y9 V% ^0 @( ?2 [' `2 g, yrequests发送post请求的方法
y% G1 C3 |8 X- p' M/ dresponse = requests.post(url, data)
( s: ]# i3 r! A# G
5 t1 A2 o8 Z* j% A
% S* G9 d/ i# z" K. zdata参数接收一个字典4 ~4 t6 f3 p: z* c% @
4 A+ g; t5 g; x# z
; Q1 H8 f! U3 o6 D# M' j1 O
requests模块发送post请求函数的其它参数和发送get请求的参数完全一致' Z/ Q* x- Y% e
, N/ H3 ~' k1 N9 p. d: ^9 A( s. U; i; n
8 g4 M- `: b' N( F- k4 qBeautifulSoup3 i/ m& r4 {0 Q# ?# s4 l
BeautifulSoup官方文档 https://beautifulsoup.readthedocs.io/zh_CN/v4.4.0/& G6 Y# c3 q: q
: i$ O/ F; ]) p+ `, x" ]# I g' i6 ^) O Z
Beautiful Soup 是一个可以从HTML或XML文件中提取数据的Python库.它能够通过你喜欢的转换器实现惯用的文档导航,查找,修改文档的方式.Beautiful Soup会帮你节省数小时甚至数天的工作时间.
$ W1 Z1 Y7 I# D7 W; g' k! D+ R/ o! z* O/ Q: p) C) ?8 ], u
2 X+ m+ O5 {2 u' p: y" q; Q( C
3 E' e# A1 i( t
! E( W% U* X4 ?
Q6 r5 \7 C) n, ^ R( m; C0 y
2 d) ?4 Z6 a7 h \文章目录 S4 g- ], s2 O/ `% n
requests. H# ]: A3 N; ?) I: }7 o; ~
requests基础$ y5 a' |. }& ^% ? z
requests模块发送get请求6 ^) `3 Q1 B+ Z: F/ v
response响应对象
9 b+ D7 E7 \7 x9 x* X- Vresponse.text 和response.content的区别
; V8 E9 b7 G2 t" h p5 N解决中文乱码
% A& c# N1 s# @response响应对象的其它常用属性或方法' S/ l* ~1 `9 V( k+ N/ e3 P
requests实操( n! c. p2 K5 _* N
requests模块发送请求
0 n8 U4 y, R6 K- f5 D; H, t2 G发送带参数的请求4 T; c' ~8 [' y2 @& H
超时参数timeout的使用
+ j/ T5 H/ i9 @1 q& Drequests发送post请求的方法# t% i l8 {9 F, S: c) d0 m
BeautifulSoup" o0 _/ H- R4 e" a3 w) x
常见解释器的优缺点
* Z: S+ o2 [: a# e" C' d1 H% ]常用操作
9 N3 O) o4 ?: s4 D9 Z" O几个简单的浏览结构化数据的方法
/ \; d: L6 X5 V$ @从文档中找到所有的< a>标签的链接9 C( k9 [* U5 |
在文档中获取所有的文字内容
7 H: P+ Z' h2 a; _通过标签和属性获取# G$ N2 r; G4 z+ g
Name属性) W/ `. }' C& r A
多个属性0 ~% b3 n7 l3 d
多值属性
# {# @5 M1 O' |' k可以遍历的字符串
' ?$ f1 E! \& K7 |2 H$ j注释及特殊字符串; D0 p9 u4 i" M% U. ~: F
遍历文档树" k$ \' D; ~9 o* d+ _7 W
子节点6 b' C+ T& s: n( p8 }" F2 u
find_all方法
D ^% n% } u8 D: Y.contents和.children
3 H; y" R6 e1 M$ g" @selenium0 O0 V2 O% ?" q+ e: p
selenium介绍! v, B* o1 B' \" t+ ^2 D* y
chrome浏览器的运行效果
; L0 v( y' X$ Q2 M* D7 yphantomjs无界面浏览器的运行效果0 m7 @6 k/ R* ~( m! e; _
selenium的作用和工作原理% V' E! D9 V3 C
selenium的安装以及简单使用* K3 b& a, Z* `: y
selenium的简单使用
5 a) U; c% i1 G: ^7 V+ `lxml) `- Q/ i- C3 U# q
常见解释器的优缺点
# s. S) X' z* l; I- b* j
6 ^3 S& P+ _5 W i* }: w7 j. ^# L$ Z& n
' `- _2 v3 w1 @( C: Q' s- Y, U
# j5 h% l {! c9 m1 w
常用操作( ~2 n ^4 H) ]6 y" ^) q' g/ W! ^
安装方法
- @" o+ q6 X1 t$ n! Q' B8 w4 Q! T; {5 Q
/ w7 g; E( j9 kpip3 install -i https://pypi.tuna.tsinghua.edu.cn/simple beautifulsoup4
4 p" _7 ~* Z) q/ j1
' c; z+ q z- \导入即可
( I6 O* C, X, {$ g5 @
; G$ g4 X, j) q8 n; V" q
% m' d8 G8 v C% Qfrom bs4 import BeautifulSoup
! {5 s& c! L ~* P" u1
8 `% X5 A7 w) @! q! d' Z% e' d* B0 Uhtml_doc = """
5 D( X* `8 P* B1 C3 ?) @<html><head><title>The Dormouse's story</title></head>
' }$ e' M& A/ T/ y$ q# t A# L<body>
, ? L8 ?, _" E- d" d<p class="title"><b>The Dormouse's story</b></p>
5 T6 X4 c4 C' C; h% \/ T, ^% s% S' s p% K! _* L
5 ?. G. O# h- I+ n
<p class="story">Once upon a time there were three little sisters; and their names were, r8 _7 ]9 }( W. B0 M8 |: s/ `! c
<a class="sister" id="link1">Elsie</a>,
% l5 r1 m4 U* B+ t5 w4 c! E<a class="sister" id="link2">Lacie</a> and$ v$ ~# y* u. ~/ |# O, `
<a class="sister" id="link3">Tillie</a>;
6 y! t L: Y* t+ K# t; e7 |; Tand they lived at the bottom of a well.</p>3 {0 A' G1 F2 K) I: s
- h+ Z% s( u9 ?8 ^' j+ o
1 B9 a6 q) U( E5 U3 C7 [<p class="story">...</p>/ S% H$ |4 s" O6 }. O5 z
"""& a2 l7 ~7 ?7 X7 @ k s- M6 ~' h- w3 {
1
& g9 e9 D" k0 [6 G' S2
# M% Z* E+ A. Z1 _: M3) W0 ~: e0 H* G. S% W r2 u; u
44 ^# t6 S8 p; V) Q2 d, a9 @
5" k# [, J- S5 ^
6
: A& o6 i/ C+ A& g8 Q3 e7" b& i4 Q+ S2 ]$ N' h
8
, b& L) M7 h4 _- V& n& F1 u1 G7 x9
6 X: C$ E$ v( u! M. |: Q; S10
/ j h+ R8 f# _) p/ o3 E11- y- G5 E7 @7 T! Y( I. h
129 ]' |0 U+ P' o4 O" A) j
13
& O; g* Y/ y+ t0 C" Ksoup = BeautifulSoup(html_doc,"lxml")! `/ Q/ V6 k* z
1
4 c. N4 U0 e% c* x2 ?, z. a' e几个简单的浏览结构化数据的方法1 v6 U- M( P% e
soup.title% S; \4 R. U7 L; c+ s- h7 d; t6 b
1
7 F5 y2 c( d" V+ _2 c6 v<title>The Dormouse's story</title>; Q7 {4 I% s# y( b0 n( M
1+ D0 g8 [8 _3 O# b2 R9 ^
soup.title.name7 R# b; G5 X' H# P K8 w
1% l0 C& V5 h* }
'title'* ~' ?8 Y' W! E
1
1 r p6 d# u- z; ?$ Ssoup.title.string$ C0 ]6 s1 u' X7 j
1: ?1 @) n) U* |* D S& O
"The Dormouse's story": ~! z# a4 e7 A
1
3 E6 s" \2 l5 Wsoup.title.text
7 m* Z' f$ p2 r6 `1 o17 h4 V+ Y5 v. P% d; D E' f
"The Dormouse's story"
2 h' H6 |# ]# G1
( Z0 Z* @6 F# v9 ksoup.title.parent.name
" {) B% ^" N5 u. R+ ^9 j1
# p. {9 ]/ A, S" S' V5 S'head'
- F; G5 t+ w1 ~# W" L$ v1 Y1 t1 K1" s# `3 P! Z% o4 t( _
soup.p4 v# @5 V( Q" ~6 e9 g B
19 k- j' O" M' W- N
<p class="title"><b>The Dormouse's story</b></p>
6 ?6 _. Q1 j3 N& v& F. r" g1! b6 i5 }8 M& }- t1 f7 ~9 q6 m) }
soup.p.name
7 S! `. u ^/ r9 t0 e1
1 Q8 Y- t. f0 G* g. `! V'p'& V! L& h4 c7 w1 V+ U( q) S
1
% c# p) o" N4 O& I3 tsoup.p["class"]5 D- }4 Z5 j+ ?8 s( r, d3 [0 ~2 ?
1
' m. f0 g& k, B+ A['title']
t3 m6 m( y& V# C2 L' V1
t, L1 @5 C1 ^4 @soup.a
" c7 b# i" o4 g( ~) k19 A1 P. }! y" \
<a class="sister" id="link1">Elsie</a>& @. ]/ f6 Y$ F" v! T
18 X+ R$ Q/ z( k G
soup.find("a"), }* `) m- I( f8 M, e
1$ u g5 N! N) |0 R
<a class="sister" id="link1">Elsie</a>
* F8 o, r" O" V* \) d1
; v2 r7 ^- a, s3 F, _soup.find_all("a")8 z* X% `) G7 D1 r1 U
1# {8 }% v T, \8 P
[<a class="sister" id="link1">Elsie</a>,* T' x, i- J9 C3 g1 y( W s
<a class="sister" id="link2">Lacie</a>,
7 |- m. ]# p2 J {& f0 u$ C: A. } <a class="sister" id="link3">Tillie</a>]
& j1 o) T# V I1
* q& _9 V: ^0 A- M; ?2
4 Z0 n! G; y: }0 a1 T6 i, R3' ^0 _1 v" q& H; U* O
从文档中找到所有的< a>标签的链接6 K; D; [1 x& ]9 n* o
for link in soup.find_all("a"):
/ g1 r7 f8 ?. _1 k% e print(link.get("href"))
1 e* z$ ?; k* }1& j: T0 o0 M9 u& Y+ @4 z0 o
2$ v' K" b" P& Q8 g( F6 x" u
http://example.com/elsie9 U, F+ W( T- @
http://example.com/lacie) z3 y) T# [7 a
http://example.com/tillie1 o* n! N0 v" f. }9 i
11 N* U0 {3 v7 @ t8 ?; e
2
* |/ y- d8 d" g3 K( }3 V" ?$ N3 B' O
在文档中获取所有的文字内容
0 }/ ~8 U% X: _5 f9 @+ uprint(soup.get_text())
, l+ f( P5 W6 o; H& d8 B# I0 Z1
0 Y; d5 S0 e! r' D8 r3 oThe Dormouse's story9 l* ^8 z* D; c
! [$ J9 s2 ^7 g2 i; j7 W" K
7 ^' ~3 C4 t; h+ ZThe Dormouse's story, K$ _6 v9 Z6 ]" h# M, A3 `# `
Once upon a time there were three little sisters; and their names were
* h9 `7 q5 R7 M5 a( wElsie,* x4 `; G: `5 C* {5 k3 c4 \
Lacie and
- b' ~# ?8 u: ~) v3 BTillie;* K! P; {% X# h `2 S# W# S
and they lived at the bottom of a well.
5 h0 s4 J' t" V" C...
5 q& X! \& D1 b, `1
+ T7 ?/ I6 a. S$ o. ~8 b" ~9 ~2/ i2 k& U9 i0 m: L" h
3
: K. `6 c# @) b. Y3 h1 `4
$ |; M6 i" ?( \! R5 O5
5 H5 K7 @9 H( z! `6
b7 D; D( A" `& D: ?: b7 S' |( [7
5 N" @8 g) \ v$ i$ Y84 e J: K+ s3 \
9
+ ?$ F, f8 K) }( E. i5 Y9 w
# P5 X) K. H4 y4 f; @6 Y3 J/ |: K
; V9 @3 K; @- L) p& p% k, E) l
通过标签和属性获取
$ ^" \6 j- u i4 pTag有很多方法和属性,在 遍历文档树 和 搜索文档树 中有详细解释.现在介绍一下tag中最重要的属性: name和attributes
, j9 F. H0 z- J& V) C6 ssoup = BeautifulSoup('<b class="boldest">Extremely bold</b>')$ {5 C$ U2 A5 N# ]4 a
tag = soup.b4 K8 |% W M; f8 O7 Z4 G, o1 N9 X
tag* Y# Z. U' B. J4 }8 T8 _& W* Q$ h- l
1: ^6 t0 A- C$ a6 e+ K
2
7 A% h: I( b/ R6 o- r( W* f3' J# P1 H) w) X' a; E" n/ a2 Q
<b class="boldest">Extremely bold</b>* N5 G+ Y$ m7 R
1- }( d' G" w& ?& h: n3 @
type(tag)
4 o: `5 _: i: j5 a" F: h) |1 w9 I19 i4 w% R9 j6 L* _3 w) _
bs4.element.Tag- K% G8 p- e* I$ Y
1
$ S A* ]) }* b$ I- A& y+ {Name属性
+ z3 f3 ~) {2 R+ t2 f2 y每个tag都有自己的名字,通过 .name 来获取:
0 q/ y3 ^# z* h- q1 b8 Mtag.name
3 ~2 b. A0 B8 Y$ a1 |6 ^1% J& @9 i, M2 v
'b'
, H' U3 w+ N6 q' Z, D0 \1
- ]9 S" L g* f) N9 |( A% ^" U如果改变了tag的name,那将影响所有通过当前Beautiful Soup对象生成的HTML文档
/ P. ~! Q- W; T# I$ Gtag.name = "blockquote"
' `& j! ?. R! O5 e5 btag. ]1 `5 ^# {" m
1( a% {4 H/ d( U& h6 N
2% n! p# p( O; T
<blockquote class="boldest">Extremely bold</blockquote>
. @7 n [4 F, m7 n+ i6 i1* p) Z4 D: ^( G, @7 _; N
多个属性
' m/ }* Z, a1 m$ K+ r- z一个tag可能有很多个属性.tag 有一个 “class” 的属性,值为 “boldest” . tag的属性的操作方法与字典相同:
8 F! ^- E6 y$ \8 g4 |9 I" |/ Q$ Ctag["class"]5 t- T3 z5 D) y# Z A4 i
1* t, C3 c3 M7 [* i
['boldest']
. q& E4 t: t6 Y( G0 f1 L. k1
6 F$ V2 I& R9 _; j0 I+ ^7 Y+ Mtag.attrs
+ b" I5 u# T6 l& `' l11 h2 k" J9 f' p# G7 R; U
{'class': ['boldest']}
& R/ ?- l) P$ s8 J& O, O, _10 E' Z( c8 I. y
tag的属性可以被添加,删除或修改. 再说一次, tag的属性操作方法与字典一样5 r( l" x' _' r8 W; A
tag["class"] = "verybold"
4 }: c. H# w1 Z/ R: S. ktag["id"] = 1
3 X) w1 i6 b% q% ntag; o6 F d6 q' U, n: r$ ~ J& m# f. y
1
% V" {: r! h' c7 s! j2. x" O8 P2 T8 p2 W( R! C# I
3
+ k) j6 y/ q2 L- V8 @9 G) a<blockquote class="verybold" id="1">Extremely bold</blockquote>3 l0 z/ `/ o2 R$ P% m7 c
1' k7 `( w) Y4 j& i; e; k
del tag["class"]) y8 f# _0 k @9 Y! s
tag3 Q5 Z8 f% Z/ e5 f1 w
12 a" U0 w$ ~! D4 A2 T- J
2; `8 l8 r% M7 R# b( o w# d
<blockquote id="1">Extremely bold</blockquote>
q, w9 ?. @1 z2 J" u1
5 p; k/ @3 G4 b* \9 O多值属性
6 A8 J' `6 t/ \( O1 ?1 R: lcss_soup = BeautifulSoup('<p class="body strikeout"></p>')4 P- f$ `2 e" }' a- \
css_soup.p['class']
. z* _8 }7 B; U" G1 Y1 E2 a1
* o8 R! L; i( G' R$ E. |6 d9 e( w20 m' p3 s4 m* p: l7 ~( X+ K
['body', 'strikeout']' `9 F& q- G8 I. A
13 H" v" P( M& {7 l5 u
css_soup = BeautifulSoup('<p class="body"></p>')
& w. M* A; r8 ~/ l$ _" |6 J5 M# p3 Xcss_soup.p['class']
$ K3 x( }" N% q+ N s1
4 e7 a8 C1 w& G% O0 c$ p2
% k! e: F! ?9 S. m: `. O['body']
% {) ?$ S- n9 e5 x) Z/ q; d4 R7 |1 u13 s/ p7 J% k1 W( ]
可以遍历的字符串
0 O# @4 f' r: l- C& @字符串常被包含在tag内.Beautiful Soup用 NavigableString 类来包装tag中的字符串:$ A- ]) N$ A7 C# j% u; g' Z
tag.string
5 h# y1 V) ]$ k' b. M1
4 i/ f* o8 L5 Y! s, E0 r+ V4 b6 @'Extremely bold'1 r& ^1 j q$ f; G: g8 v/ z
1 o2 N7 T" c2 Q3 [/ j' Z5 m* ]
type(tag.string)
7 B p1 @4 {: L; x# [# F1! Z! { C' r2 Q6 P% G+ t# D6 R
bs4.element.NavigableString
' }" } F2 Z) J" T( i9 f1+ y$ { _& U" c; ?! F
一个 NavigableString 字符串与Python中的Unicode字符串相同,7 y3 G+ E( h L
并且还支持包含在遍历文档树 和 搜索文档树 中的一些特性.
4 ]3 o8 j8 @ G+ U& b通过 unicode() 方法可以直接将 NavigableString 对象转换成Unicode字符串:% S! c, s& h7 L( H! a9 B1 T4 i" A
6 d' ^; Q) y& r
- j' N( d: F# o! r) o9 a8 b' Ytag中包含的字符串不能编辑,但是可以被替换成其他的字符串,用replace_with()方法! E& q" r/ K7 T
& k, n' M0 S4 A- A W: r
) Q: M9 B8 p8 T. y9 i6 _( K$ \tag.string.replace_with("No longer bold")
, ]6 Z, c4 Y: n" z: y# q _tag* e( X; {! _' Z. o+ X. [6 t
1
' d0 d1 T# c2 Y. n/ d$ N1 l23 S* u5 D, p6 h1 _) l: Q
<blockquote id="1">No longer bold</blockquote>
. ^/ X: J8 x$ o1 D" B1* ~. Q$ C# z# `
注释及特殊字符串: P* g6 D4 r- }* O2 W; L/ ]+ a: X5 j( y3 Y1 ?
文档的注释部分: g+ c/ S" `% I' I5 n3 v r
markup = "<b><!--Hey, buddy. Want to buy a used parser?--></b>"
' q& @$ y( O" M' X* Jsoup = BeautifulSoup(markup)
7 Y o( _4 O; ^' s9 u0 V+ w! Ocomment = soup.b.string' U3 Q* d6 j% l% a9 @$ o+ x' p
comment( f8 j; N' I2 {5 @1 X/ O! a
1
% T: u# U$ Z6 h+ `% P- n2& b; L) T" j0 ~- u! _# H$ m+ h
3
+ q* G6 J0 O. G! z! L* p2 |; c+ r* e4
% N T9 P6 ?5 Z$ a'Hey, buddy. Want to buy a used parser?'# C" s7 ~8 ^( y5 u7 a! c9 n
14 W' x( r* D# d) P, ~4 S0 c" s8 R8 B
type(comment)
& d! n2 t8 r5 V. m11 a! ` y0 R( g( a2 }; `
bs4.element.Comment) ~0 e& x, Z( s6 V
1
& E! k w$ R; xComment 对象是一个特殊类型的 NavigableString 对象:
6 R# \. t- ?% I B# S: o6 h0 ncomment7 u( R9 U% t7 |4 w
1, o& a8 H# P: l7 f2 I6 ]$ `
'Hey, buddy. Want to buy a used parser?'
% S- k9 p! T( B+ G7 z; j10 A$ }% a! l( Y0 u# W
但是当它出现在HTML文档中时, Comment 对象会使用特殊的格式输出:
) w2 `, C5 x' H& w4 n8 H! b2 I/ K+ t9 B# I0 T4 v' Q/ J1 S+ V
* h: [% ]( c% h5 s' {! nprint(soup.prettify())
! r+ J& M5 z8 y- K19 ~) [" k, J6 Q) ~
<html>
; ^. g2 }# Z; v9 `% D& t <body>
; D) ]* w0 I- v5 }3 [. m <b>
: K. ^" H3 j: e <!--Hey, buddy. Want to buy a used parser?-->& p& r9 Q4 @5 \3 x- V! P
</b>" e4 I1 K& q/ l' p! l+ Q
</body>' f& ? a4 I4 }0 e
</html>
0 L8 t+ E" R( f1 j8 L1 @9 h11 P4 L2 w0 P) ]# I% r$ G3 R6 K5 U
2+ r2 o: v0 \; m
39 N5 A2 F* y' l# [- u' d" E( h
45 x5 l5 Z" o4 H6 k3 ?
5
/ b& l2 x4 l6 l. v/ ]' B! P6: `1 W0 C6 w4 v& O( i1 w
7
5 H: k+ J5 I* I- X, M+ {9 sfrom bs4 import CData
2 u0 p' [ h9 l) ^0 _- s6 z4 jcdata = CData("A CDATA block"); `- w+ H; \$ o/ m
comment.replace_with(cdata)
" m6 k/ @! C9 ]print(soup.b.prettify()): G, F5 j' R& E5 i9 ~3 G
16 O2 Z/ S! F4 F4 c: o, c9 `
2. T& b- S9 y: T0 j# T
3
9 h0 f( D- B( v$ ~4
* V# E4 f3 @# k/ Q6 n8 ^0 X6 P<b>
6 v+ g& D5 P0 H$ p8 a8 I <![CDATA[A CDATA block]]>. }/ i$ Y: ^) | H D
</b>
7 B h1 P* u' x, h h- |" e1& g/ e R s% r. [7 R7 X. m
2
: i, f7 N" u. r% D$ i$ B' O* O! R3
+ u7 }! r A7 G$ l+ X遍历文档树
% U0 V( q% I shtml_doc = """1 L `. U6 M0 d, P. m; s! m* ^+ |
<html><head><title>The Dormouse's story</title></head>
: `5 I9 F4 r" h1 e+ M! ]% c% ]0 Q <body>: y& x0 [& c$ ?
<p class="title"><b>The Dormouse's story</b></p>
6 |: z) B* C7 v1 B9 Y- Z" x7 M% b8 W$ ^$ d0 y1 G( ]
, l& r. E5 y9 D* [5 W. ?, Q
<p class="story">Once upon a time there were three little sisters; and their names were
4 ] x) U6 z3 S1 C) s0 ]<a class="sister" id="link1">Elsie</a>,
. n4 ^8 O2 {0 h; {0 l9 G<a class="sister" id="link2">Lacie</a> and: h% g" j) ]" W7 ~
<a class="sister" id="link3">Tillie</a>;
" y0 ?0 Q, t/ q) N! o Nand they lived at the bottom of a well.</p>
" r, s: R; F& a5 C) u
( w6 P. k. i) B( q0 f0 Y; f& e& o/ V% e+ [
<p class="story">...</p>( i. J& b# j: J8 P( O1 e1 Z
"""
2 U& J9 L" P! ]1 Y1
9 w1 O' M$ d# b% T/ p) o2
& e; e8 j: `& @) B3+ u4 R. o% Q$ G
4
9 I9 H# f: P6 J, W3 t9 R2 g5, _$ a @2 q- k; i
6
4 o5 p: c+ j. d$ i1 f7; i5 I( R9 _+ y- k* N
8
% C3 Y$ c/ k7 U0 Y0 m9; ^9 v4 R' k* O v u( I5 F# B
10
/ W' G; A+ h: }$ q! d0 O; p; \; p117 V6 b: l9 M" X
12) H5 Z3 `; O, b6 j
13
9 q- c( H2 Z& w9 b- Wfrom bs4 import BeautifulSoup
# u* F5 D5 Y) [7 P" C( b, t4 i1
& |: B: |9 X/ qsoup = BeautifulSoup(html_doc,"html.parser"), a6 H; B& E/ q$ s8 `
1" }" m8 v& H( S2 d
子节点
" i/ A# |& A2 K0 k8 c. z0 ?8 e一个Tag可能包含多个字符串或其它的Tag,这些都是这个Tag的子节点.Beautiful Soup提供了许多操作和遍历子节点的属性.
+ [0 H3 q" V( K# R. _1 b6 {
) R: O/ A& z2 B& G2 y
, B/ D; }$ R) D" u8 Q. G% ]soup.head
' L- Q, n8 b4 Q( z0 _* n$ p1
( k' s$ l. {* Q x<head><title>The Dormouse's story</title></head>3 U8 m( A# C; ?
1( d' w$ y) c: P" H+ o U$ x
soup.title
3 ^" ~2 ?1 `, I13 \# v, |0 j: z, z9 v. f
<title>The Dormouse's story</title>- d- w% y" |' V% C% ?+ e0 Q
1
" r$ v4 s; G! n b, l这是个获取tag的小窍门,可以在文档树的tag中多次调用这个方法.下面的代码可以获取标签中的第一个标签:
6 c* f# L/ s- \$ P' |' B' m) Q* t G+ [: T) j8 d) l
8 g; m0 X4 k4 q& {7 R* h" [
soup.body.b
1 x! g& w% Q1 H/ u- O& [1
9 b% t4 y# Q9 J9 r' r<b>The Dormouse's story</b>5 Y+ y4 a& O7 f& `1 i, x; t
13 L7 v# O7 P5 f- H+ j0 g
通过点取属性的方式只能获得当前名字的第一个tag:2 y' _; H4 M/ E
# ~3 Y" C0 j- t
" W0 ^/ O7 S, J+ {soup.a1 L# L: o; j0 c8 v. Y6 J. s- }
1
V0 o+ I: ~1 h, @: n( U L3 M<a class="sister" id="link1">Elsie</a>
e# V: V- `) h# r, Y1
+ y* t1 r2 C0 C7 f+ Y# Vfind_all方法
3 n. i3 Y/ J" `: V% u如果想要得到所有的标签,或是通过名字得到比一个tag更多的内容的时候,就需要用到 Searching the tree 中描述的方法,比如: find_all()' p* w! G6 W* Q% H( }& n5 ^
2 O* s$ L4 H- T t" _, t" q# a3 `
, Z- {( ^7 e: i' u) t zsoup.find_all("a")" e% q/ C. d Q; \+ E+ u
1
) G8 I# n% [1 c[<a class="sister" id="link1">Elsie</a>,
1 ^+ r" ~, g3 x5 M4 D' f <a class="sister" id="link2">Lacie</a>,
% |1 u" v9 Q" |; T' K <a class="sister" id="link3">Tillie</a>]
8 g( A2 [& z* J; s0 N. k17 m* D" ]- R; w: P+ x# W, C) R
29 X- H: x1 }! F; I5 F
3
& t- z+ i0 a9 O! f8 p8 _.contents和.children3 u* W" ^8 R6 ^
head_tag = soup.head5 ?4 Z/ H. l) H0 |* F& F
head_tag
2 j* `9 q$ L) B: G1 `1
$ H- v1 M( }5 V% |2/ y( Q$ _2 ^- y0 W$ N# h
<head><title>The Dormouse's story</title></head>5 Q" m0 l. T9 w' v- j( ~
1- t$ v* m' W0 c% U, ~. E
head_tag.contents
6 M& a/ ~7 _. m5 N. I8 b4 E6 B11 t1 ?: j% L M& J/ r
[<title>The Dormouse's story</title>]
7 L3 q" N3 s" X1 k9 L1) d" r6 E. C* l+ Y1 N$ O6 E2 h
head_tag.contents[0]
0 ?- x2 @+ q7 k! E+ V1
% h! r1 Q7 a5 I$ n! ~<title>The Dormouse's story</title>8 ]7 F9 r* g& }0 M* {0 y
15 Z: s0 \" }/ O9 B4 V
head_tag.contents[0].contents1 P2 m' ~/ b; D" A; e
1
V/ \5 @( N, @1 }- v["The Dormouse's story"]$ i p" S% J1 D
1" J a5 R8 Z8 H, m9 N5 z% R% | |
selenium
! a0 f7 D) @" ?8 W/ L& c3 h+ @4 `% I: L
, N/ ~$ Z' x# \1 c
# l/ U. e0 c1 y: x
5 d& _1 ?3 U8 r8 s3 lselenium官方文档 https://www.selenium.dev/selenium/docs/api/py/api.html2 m2 I1 W9 O# i% {
Z+ F* ?$ j6 F& d3 w, H9 B a' i# o1 y `4 r' E) Q
selenium介绍6 V1 ]% R! }' h$ S
chrome浏览器的运行效果
0 L. j/ f# m0 F8 s在下载好chromedriver以及安装好selenium模块后,执行下列代码并观察运行的过程
; W' X& q( r/ ? M ~
1 [- r" r* K n( R
4 Y% F8 X4 ~) Pfrom selenium import webdriver
3 H% ]( t- _$ e5 _: C1 z2 K1 A3 |4 \/ ~1 e5 q0 R7 W) d
0 p' I0 s0 c$ X5 B# 如果driver没有添加到了环境变量,则需要将driver的绝对路径赋值给executable_path参数. m. k6 B4 V' P5 ]+ a
# driver = webdriver.Chrome(executable_path='/home/worker/Desktop/driver/chromedriver')
5 v% n$ P& N, b$ X8 B9 D i% Y7 f6 }
+ t3 ?3 i( n# c/ |1 f, C4 g# 如果driver添加了环境变量则不需要设置executable_path
0 ~: ?' A/ P% W5 C& I3 Adriver = webdriver.Chrome()& H( }; ^4 u" k% ~ B" _
& M) h% h- |& I O9 ?3 _9 Q$ |
9 ]. P( s& T( g5 `6 R/ f3 i4 j# 向一个url发起请求
; S% P$ v# \5 V# ?& l2 w4 Odriver.get("http://www.itcast.cn/")
' v# g% @7 U8 o# j& k {: K( ]' [3 |, H( Z6 Z( {& M
3 z I$ c2 ^( b; j& E# 把网页保存为图片,69版本以上的谷歌浏览器将无法使用截图功能
% m5 ^& ~$ A- `9 u# driver.save_screenshot("itcast.png")
! H/ T- z6 T4 e/ U3 Z# q
8 M7 N, M/ X" t9 W7 r9 m l
9 _4 \0 y2 C$ K. _print(driver.title) # 打印页面的标题
% Q- \9 W) z" m1 q, A* `4 l/ C+ K3 G% X# \' C! o! q
' [1 n/ q0 |$ S2 v# 退出模拟浏览器
1 f P7 U, \; H% I& Qdriver.quit() # 一定要退出!不退出会有残留进程!5 F! t3 H5 O* M! X. H$ f
1
3 x7 [ h$ D" B! C4 G2
/ ?, _3 u9 H/ S3
+ R# F( B+ [3 L* t, b! ~$ \4
/ n6 B& A. Z' l! I& u* I5: T( T1 z% Y7 p% N, P" M; j1 F
6) H3 E( {2 |) Z. h# B
7
( q( m$ f2 y! ?/ C+ \8" r) z- ?3 ?0 E/ e/ ?, w% Y
9
; r* k% v% x: p! Q; R10
8 U9 t+ h/ Y6 a9 b) Y# q11
* Y1 B+ Z! V: V5 V12- _# n+ J" g: w! v3 b" T/ c7 B# i: ?7 @
133 }! t2 L3 d2 M+ T/ r: n# ]- b
14, y4 {+ z9 x; t+ _% B4 u4 a
15
9 i* }7 G" B4 v) h1 O: d- F& n166 b( U7 d+ w! y( t( a# q" Y9 }
17
) h! L& |; }, \% [8 T" S4 j18
3 V+ C4 ^/ s/ o# cphantomjs无界面浏览器的运行效果
) L- h, ^8 ^" J! APhantomJS 是一个基于Webkit的“无界面”(headless)浏览器,它会把网站加载到内存并执行页面上的 JavaScript。下载地址:http://phantomjs.org/download.html( Q4 y- V4 Y8 z# C5 y4 E
* \" l9 L% ~- |& G
' j* U: m' P% i( a) Xfrom selenium import webdriver ( K) o0 W; m9 Q" p
0 R- d! F- H& ~. |' D# L: D+ w
/ } F/ O" n6 Z* N# [3 T# 指定driver的绝对路径
1 r3 x, l/ A7 |4 e/ rdriver = webdriver.PhantomJS(executable_path='/home/worker/Desktop/driver/phantomjs')
& u, @2 i; Y% T: S& s5 P4 z; ]4 i0 q# driver = webdriver.Chrome(executable_path='/home/worker/Desktop/driver/chromedriver')
/ K+ _, _- R5 r$ Q$ k$ Q; v
; Y5 Y; i8 H! I. m& L: E: c- c
# 向一个url发起请求- r5 L; A6 I* {0 _
driver.get("http://www.itcast.cn/")- i! r/ {' b1 l' F$ _7 I
! k3 X; }, g. {0 O% c5 P
- ~. _; |- @0 j2 v! I. S
# 把网页保存为图片
: {9 ^, M9 Y# Odriver.save_screenshot("itcast.png")) e* [+ K9 r% c+ @! M
# X. ]4 g- K9 k' x- Z6 K7 ]
- p: D8 e7 ]( @9 _ o9 ?- o
# 退出模拟浏览器' i( }! Q5 \# S; y k) Z2 h2 Z
driver.quit() # 一定要退出!不退出会有残留进程!& n& p/ U" G% f- z+ a7 y
1
3 O. ]" v. F) L' Z% A; j R% r; B& e20 B$ s% H7 k( z% D
3/ L4 J1 F! J$ q% z1 y
4& ~- M1 K- J. I/ ?9 ~
5
y8 c' B U, k% h( U6
! ], R" i) f. o2 c* \' \" v7$ n! J: i# j& b
8
3 Q6 o; `- E3 D6 A B& \5 a% `& L9
; f# _& O" v( n2 t5 K: | |109 @# L4 u6 `+ g5 ?6 ?6 U% E: m
11
, ^ e3 A& x4 W12
( [# H8 Y8 R8 |$ S# c13. m3 o1 N' J7 g6 W- \8 b7 a, u
14" E5 f z1 Z# Z2 ^4 K- Z5 E. ^8 ]) x- V- c
无头浏览器与有头浏览器的使用场景) R; J D9 H' l* Q
. @0 }& b! ^( ?! w2 K
6 R1 T" j! f+ K6 l6 M
通常在开发过程中我们需要查看运行过程中的各种情况所以通常使用有头浏览器
5 ^; ^3 W5 j1 K2 A; t" P' x0 R在项目完成进行部署的时候,通常平台采用的系统都是服务器版的操作系统,服务器版的操作系统必须使用无头浏览器才能正常运行- q. v% l9 C. u3 q7 |
selenium的作用和工作原理% _5 A# D# r) s+ ~7 B% k/ {
利用浏览器原生的API,封装成一套更加面向对象的Selenium WebDriver API,直接操作浏览器页面里的元素,甚至操作浏览器本身(截屏,窗口大小,启动,关闭,安装插件,配置证书之类的)
! Z7 E3 X# v" |* F( ^' k3 d
3 ~% i7 ]0 [. y$ B0 o$ K+ n( ^9 m( u. f" g5 L2 V5 x
selenium的安装以及简单使用
, Y9 L0 o9 f& g以edge浏览器为例 参见这个blog哦,驱动chrome浏览器同理
; Y; \$ y( h# g, O( Q1 ~! t% zselenium驱动edge浏览器5 m5 m' L/ b! H( P/ [; a2 u
. F# N! o$ R2 G) L W# i, q
5 c( g, K1 ]6 i0 y2 Hchromedriver环境的配置& V' s4 { g$ w' @3 l/ K+ P
windows环境下需要将 chromedriver.exe 所在的目录设置为path环境变量中的路径4 {$ d5 R# H6 j8 U8 ^8 Y
linux/mac环境下,将 chromedriver 所在的目录设置到系统的PATH环境值中
& A* |% J2 x) H+ \selenium的简单使用
; _! k% X" {. P9 v% N( p, r7 Q接下来我们就通过代码来模拟百度搜索
/ u, R! D, v8 F" n& W! N9 ^* B# l2 a, }" ^% ~$ w* G4 t
$ g7 Q# g) t& D) ]& y8 g, B
import time
3 x8 l+ b9 N* _9 q! n; v/ dfrom selenium import webdriver9 q/ C. K. M. [, `* {% G
s! V+ e3 c0 A* s6 ?
- H9 W9 u, Y: k6 {. b, W, E
# 通过指定chromedriver的路径来实例化driver对象,chromedriver放在当前目录。# P5 _$ O, f, b3 b: K
# driver = webdriver.Chrome(executable_path='./chromedriver'): r( Q! d0 i1 L) T
# chromedriver已经添加环境变量
; W+ e+ E1 i3 ?9 K+ Ldriver = webdriver.Chrome()) G% _+ C$ _( r. P
- g9 O: s+ s1 o8 B
" \2 s& D% T \4 h! K/ G" ^# d
# 控制浏览器访问url地址& P: X+ D- h( O/ u( V
driver.get("https://www.baidu.com/")' p) ?# A. ~/ Y, l& S- p; B; p
/ {2 A( z, \, f# Y
- k0 ?( A2 n* m6 l* _2 b6 D4 Z Y# 在百度搜索框中搜索'python'7 h2 V+ j- l- ]1 w/ d5 I7 ^
driver.find_element_by_id('kw').send_keys('python')! j; [* h5 ?; w2 h8 M1 ^& V$ c z/ L
# 点击'百度搜索'" K0 x# _1 j+ z, Z: o$ X
driver.find_element_by_id('su').click()6 g6 B4 M- T: c
/ |. Y T5 Y# v1 ]* V% J* d q: ~3 `. @6 S# L
time.sleep(6)& \9 c2 Z1 I2 ~. L4 H/ d8 z
# 退出浏览器
4 F; S B( h* R) m( \driver.quit()
( J( _ O7 e2 _7 j) [+ u1( u6 |# i5 n( |$ c1 Z" K' r
2
& [' N2 b# \4 j$ `$ Y8 [$ j; I3
6 a' A+ K0 J) T6 b: ^' S4
/ N Q0 W/ [" m5 m* Q- @* Q5
. `5 m& h# U; f8 b65 }( L8 _0 B* z# P2 D- q
78 {" U) e/ R$ n0 K n
87 u( c. z7 ]$ a9 o0 l7 m. F
9
5 q7 a; H1 l4 A5 |+ S10/ P% o$ V* w7 `" K/ `/ B3 `; p
11
7 J) {3 u) |! N12
9 T: l- @9 H9 Z/ s13, `. s8 ?) {) g7 `0 v7 U h
149 x- S* `; A+ P# v4 ?
151 }5 i, W+ l& I: ^' F; w( p
16
# U# d% K) W1 ~/ c17
3 |% \0 ?0 _. G( n% V18
. m, n6 l. P, a19
' G% b8 B- G2 ?5 Zwebdriver.Chrome(executable_path='./chromedriver')中executable参数指定的是下载好的chromedriver文件的路径
( m' \7 g7 }- n. z. ^ Ydriver.find_element_by_id('kw').send_keys('python')定位id属性值是’kw’的标签,并向其中输入字符串’python’* E; d5 H/ }) _( j; M
driver.find_element_by_id('su').click()定位id属性值是su的标签,并点击* I/ I' w" k! z
click函数作用是:触发标签的js的click事件1 y/ E0 S6 |, i: o+ Q
值是’kw’的标签,并向其中输入字符串’python’
' j+ H7 m. h3 A, T3 K& A6 _ T4 B) [( i1 K+ X7 K' Y$ |
& T) n |0 p, x: n, @
driver.find_element_by_id('su').click()定位id属性值是su的标签,并点击
: z/ M8 ?& ]5 F# Z# D0 q4 zclick函数作用是:触发标签的js的click事件
" G7 N4 Q/ i6 @6 i' s( m( W& |使用xpath来提取数据,爬取数据的简单语法。
. l D5 [( g* f2 o& B7 m. U
7 K+ O" _3 b7 p1 `, }7 e. ^. F! L) _
lxml
/ ?( C; q3 s& v1 ~$ p4 `4 u
/ P* F& ? _$ Q" r/ A8 ~
4 b0 g, a# y3 {) S: f6 a
! z; W. R- E$ r m2 r8 W( }+ E8 {! @" y& \2 S4 ~
requests官方文档 https://lxml.de/
' J; s4 c, n& `* o7 l/ W! O$ v+ X& m
1 {8 q* h2 J- p+ a6 M4 T
$ R! ]; ~# {3 A4 K- n1 ?( v" n7 Ipip install lxml5 k2 ^0 Y6 |6 H i {5 g
1' |2 u8 L |( e$ ^& H
导入模块
7 O* L$ V9 P! l" B/ H" d, Tfrom lxml import etree
+ c& D7 [4 ?6 g1) ?1 S5 @0 j$ I
利用xpath获取text或者href内容( ~: }6 [; W* Y6 c1 H4 ~' Y# {
/li/a/@href 这样取的应该是href的内容4 K8 b. _( t# u1 V
/li/a/text() 这样取得是text内容+ [9 w- e' M1 G% W+ _" S, B0 W& i
1
* Y4 G( @/ F3 ]- Z8 y27 S Y9 K+ C l. S+ a! s
etree的使用
/ g" N+ H4 ]; e# y% b! S. ?) a" ah=etree.HTML(response.text)#response.text是网页的源码5 m! J: U5 f9 |1 W
h.xpath('//img') #寻找所有的img结点,
( W7 `6 t. b% @h.xpath('//div').xpath('.//img')#寻找所有div下的所有img结点 K1 T5 F# L; _$ s, [! c# S( D: d
13 }9 _$ y/ u. i2 Z. _
2
* k# u( {& w0 U) j. ?1 i g) T3" J. G2 P* r* k/ |& s( K
xpath的语法7 T% G8 c6 T$ c$ B- F; |; k" h1 i
符号0 T, O5 ?/ h; S; \; A
XPath 使用路径表达式在 XML 文档中选取节点。节点是通过沿着路径或者 step 来选取的。
: a% J$ P+ x3 y# f
+ ?, }. `9 [( k4 j* B! b
6 K; ^# |" G$ A ~0 D. |( o; O4 G9 c" F表达式 描述6 s- z3 M) k) j; U+ q I$ P, @
/ 从根节点选取) [$ ]3 F; H) E3 Y3 j& {9 D% R% O
// 从匹配选择的当前节点选择文档中的节点,而不考虑它们的位置。1 `; e, e4 u0 {, Z5 V2 p
. 选取当前节点。
0 a; E% B1 K6 ~+ A. w. . 选取当前节点的父节点。
$ h h5 n0 D; ~! E0 L' B@ 选取属性。
* Y+ ~* F: W' I/ T( f| 在两个中结点中选择
, |+ x2 m- ]+ N) Y6 l8 r K() 用()来包含|4 ~3 n+ }. i5 |$ x
* 包含所有元素
3 C8 X! Z6 V% \: V; cnot 取反
_' U1 `4 c( O' f实例; @, k T A- {4 f+ a) |8 b
n4 b V8 ?2 W' z5 N4 |
9 \9 n5 c$ K' i2 G1 j4 b7 a. o6 o, M! Q路径表达式 结果
4 w) e4 l+ ~0 f* v7 [: j- G/ ybookstore 选取 bookstore 元素的所有子节点。" i' J! B# c3 V- E* h2 K! i
/bookstore 选取根元素 bookstore。注释:假如路径起始于正斜杠( / ),则此路径始终代表到某元素的绝对路径!/ w/ B6 h: w; ]$ \: k& F
bookstore/book 选取属于 bookstore 的子元素的所有 book 元素。
. _7 S) g! v/ m0 s4 D4 u6 ~//book 选取所有 book 子元素,而不管它们在文档中的位置。0 M- {+ l) r: b) h7 i Z
bookstore//book 选择属于 bookstore 元素的后代的所有 book 元素,而不管它们位于 bookstore 之下的什么位置。3 k5 p4 b$ c( |5 }
//@lang 选取名为 lang 的所有属性。
0 o3 V: {3 }1 m! Z+ s//*[@class] 选取带有class属性的所有元素% D* I5 r0 w8 z; Y; M; h
//div[@*] 匹配任意属性的div元素
% D D. l, _, r6 N/ n) L2 g- l& f: Z//a[not(@class)] 匹配没有class属性的a元素- K% ]* {' d( k2 `* B1 B1 _
谓语# }4 R" T. r G# K" S. l
带谓语的路径表达式3 X1 R8 o+ R# Y8 h
' {. j) c0 P# S6 R7 \& P! C3 u
# R* _: G B3 i2 a. E7 W1 x' O路径表达式 结果
& O: T9 A8 ~5 q; G8 j$ B/bookstore/book[1] 选取属于 bookstore 子元素的第一个 book 元素。
/ e W/ t5 W5 w5 @, U$ a+ k# {, ~/bookstore/book[last()] 选取属于 bookstore 子元素的最后一个 book 元素。
$ t& k3 {' {: z( |# A/bookstore/book[last()-1] 选取属于 bookstore 子元素的倒数第二个 book 元素。
, a0 f5 L3 l" Q- b5 N/bookstore/book[position()< 3] 选取最前面的两个属于 bookstore 元素的子元素的 book 元素。
: R# W4 j! b/ x4 w7 b//title[@lang] 选取所有拥有名为 lang 的属性的 title 元素。" o) G4 y( x1 b! K8 f! N6 c. L$ a
//title[@lang=‘eng’] 选取所有 title 元素,且这些元素拥有值为 eng 的 lang 属性。/ R6 R6 p0 k' I: E6 D/ F; }8 h
/bookstore/book[price>35.00] 选取 bookstore 元素的所有 book 元素,且其中的 price 元素的值须大于 35.00。4 \; q7 U* ^' S# a
/bookstore/book[price>35.00]/title 选取 bookstore 元素中的 book 元素的所有 title 元素,且其中的 price 元素的值须大于 35.00。1 R1 C8 E* d. y, o: T& d' \
————————————————
2 S( V7 U' O# b. `7 U5 j0 _7 p版权声明:本文为CSDN博主「北山啦」的原创文章,遵循CC 4.0 BY-SA版权协议,转载请附上原文出处链接及本声明。
2 {& |3 n8 P2 M原文链接:https://blog.csdn.net/qq_45176548/article/details/118187068
( R3 t% F( Y, }# F4 j1 U: h1 N) c( C) v
7 E4 R1 \7 R$ g& r |
zan
|