- 在线时间
- 1630 小时
- 最后登录
- 2024-1-29
- 注册时间
- 2017-5-16
- 听众数
- 82
- 收听数
- 1
- 能力
- 120 分
- 体力
- 565565 点
- 威望
- 12 点
- 阅读权限
- 255
- 积分
- 174892
- 相册
- 1
- 日志
- 0
- 记录
- 0
- 帖子
- 5313
- 主题
- 5273
- 精华
- 3
- 分享
- 0
- 好友
- 163
TA的每日心情 | 开心 2021-8-11 17:59 |
|---|
签到天数: 17 天 [LV.4]偶尔看看III 网络挑战赛参赛者 网络挑战赛参赛者 - 自我介绍
- 本人女,毕业于内蒙古科技大学,担任文职专业,毕业专业英语。
 群组: 2018美赛大象算法课程 群组: 2018美赛护航培训课程 群组: 2019年 数学中国站长建 群组: 2019年数据分析师课程 群组: 2018年大象老师国赛优 |
4 [& ~+ H" \2 ?5 O: p" P9 |
SparkCore:Spark原理初探(执行流程图)
6 D8 C% e$ e! U基本概念
, ]) \" ~9 S, B2 Y1 c8 P3 w2 g
& g1 K: T- m" m2 w, {+ N4 r- u" t" F, j7 W
+ {( h4 h7 o2 b8 C6 r) N0 Z5 C! f: }( t
- ]& ] n! s0 [# X; Z/ O5 |
4 N; j( v3 ?9 S- |* k8 `) k0 i
名词解释5 Z j& L0 I, a7 Q
Application:指的是用户编写的Spark应用程序/代码,包含了Driver功能代码和分布在集群中多个节点上运行的Executor代码。
3 `+ O. u2 S# |: S7 z5 L* [Driver:Spark中的Driver即运行上述Application的Main()函数并且创建SparkContext,SparkContext负责和ClusterManager通信,进行资源的申请、任务的分配和监控等+ {. k/ f ] L1 W1 T- Q6 z2 ?
Cluster Manager:指的是在集群上获取资源的外部服务,Standalone模式下由Master负责,Yarn模式下ResourceManager负责;
, f F* T/ M8 y4 P; Q6 z( T$ WExecutor:是运行在工作节点Worker上的进程,负责运行任务,并为应用程序存储数据,是执行分区计算任务的进程;
- A+ s. c* d* m sRDD:Resilient Distributed Dataset弹性分布式数据集,是分布式内存的一个抽象概念;
3 Z' W0 J+ o( nDAG:Directed Acyclic Graph有向无环图,反映RDD之间的依赖关系和执行流程;' g( q: S7 {: ^
Job:作业,按照DAG执行就是一个作业;Job==DAG
+ H z9 v, \) x9 J! c8 E0 \Stage:阶段,是作业的基本调度单位,同一个Stage中的Task可以并行执行,多个Task组成TaskSet任务集
E, S+ L7 Q# l. _" f* p6 U& _0 BTask:任务,运行在Executor上的工作单元,一个Task计算一个分区,包括pipline上的一系列操作
% c b/ i$ R5 U, l1 Y基本流程 F" m. l% a, [; W" s; k3 ?0 z
7 w1 n n9 M a9 X0 K A, U* g
Spark运行基本流程
! d$ ]. S; t$ r* F; t9 F) J当一个Spark应用被提交时,首先需要为这个Spark Application构建基本的运行环境,即由任务控制节点(Driver)创建一个SparkContext,2 e$ s5 K$ ?; R& N
SparkContext向资源管理器注册并申请运行Executor资源;0 `$ c( K# o1 ^( `' k7 I3 N
资源管理器为Executor分配资源并启动Executor进程,Executor运行情况将随着心跳发送到资源管理器上;$ E8 Y8 K' w& s q% y0 U. t6 n
SparkContext根据RDD的依赖关系构建成DAG图,并提交给DAGScheduler进行解析划分成Stage,并把该Stage中的Task组成Taskset发送给TaskScheduler。
8 F* _" A, `' iTaskScheduler将Task发放给Executor运行,同时SparkContext将应用程序代码发放给Executor。( V) u. B/ e# ]! [5 X
Executor将Task丢入到线程池中执行,把执行结果反馈给任务调度器,然后反馈给DAG调度器,运行完毕后写入数据并释放所有资源。6 j! x7 D+ g4 V; Y
流程图解
2 Y+ N/ I% K! ]! \. U, C" Z, @4 _, i; c# T# }# y7 @
: T- I' w a6 r& P8 n$ E8 A
; C7 U, T( q' F2 s: Y
6 `1 M7 n3 k! |/ C
* f' v; S3 V) C& ], M
0 ~: _2 r1 J8 s% O; f+ k z) H! S/ _. X# c
w, b8 D! z7 T a: {* R) C
- U) l8 l# N0 z- v) r# r7 f
' ?% S& W- Z0 z( M9 z! m9 g7 W, x* R; @/ b0 d4 {, K# n3 C8 `
' p$ w3 L( s/ i6 N% ^3 V
$ e v$ H( [: A
总结
; r+ u, k" Q' K) e6 N5 t3 @3 A
# \6 Q C" a0 r3 p6 g" hSpark应用被提交–>SparkContext向资源管理器注册并申请资源–>启动Executor" {+ B; k4 y$ d& H& Q" Z
RDD–>构建DAG–>DAGScheduler划分Stage形成TaskSet–>TaskScheduler提交Task–>Worker上的Executor执行Task
" e5 H7 v) D: ^; q- B$ B8 ?- `$ j' t$ @# W
————————————————# `( ?% Z* i5 ?- I1 P# T S" j
版权声明:本文为CSDN博主「真情流露哦呦」的原创文章,遵循CC 4.0 BY-SA版权协议,转载请附上原文出处链接及本声明。
" V! }% Z, Y3 @4 I5 u原文链接:https://blog.csdn.net/weixin_43563705/article/details/1056992684 c5 W5 |3 M* B( C- |( z
: _) u" B$ E' J* X
/ {1 p" i! B& ~ |
zan
|