- 在线时间
- 1630 小时
- 最后登录
- 2024-1-29
- 注册时间
- 2017-5-16
- 听众数
- 82
- 收听数
- 1
- 能力
- 120 分
- 体力
- 567257 点
- 威望
- 12 点
- 阅读权限
- 255
- 积分
- 175400
- 相册
- 1
- 日志
- 0
- 记录
- 0
- 帖子
- 5313
- 主题
- 5273
- 精华
- 3
- 分享
- 0
- 好友
- 163
TA的每日心情 | 开心 2021-8-11 17:59 |
|---|
签到天数: 17 天 [LV.4]偶尔看看III 网络挑战赛参赛者 网络挑战赛参赛者 - 自我介绍
- 本人女,毕业于内蒙古科技大学,担任文职专业,毕业专业英语。
 群组: 2018美赛大象算法课程 群组: 2018美赛护航培训课程 群组: 2019年 数学中国站长建 群组: 2019年数据分析师课程 群组: 2018年大象老师国赛优 |
风控建模】互金 风控模型岗 基本要求及面试问题总结; u4 t' b% Q- w/ N X7 Q4 v: S, H
一 准备工作
: M' g$ W' ~0 R K; W1 F
' ] n! ^" D! P$ j5 D( V 根据核心职业CD法则,找工作前,你得先清楚自己有什么,自己要什么;面试单位有什么,面试单位要什么。就笔者近一年的学习及工作经验总结而言:
3 }+ A7 B2 u' t
( F; [. ~3 A; j8 z: c 科班同学,最好直接从统计分析、应用统计角度入手,从事金融、生物、医药等领域里的数据分析或数据挖掘相关工作;- y1 r5 A& i( w# M( k1 L! Y3 V2 W) q
/ `' o- f; J* J+ D1 Z0 ^: t9 S
非科班转行来的,建议直接做金融,需要的专业知识不多,行业知识也易懂,而且信用中国还有很长的路要走,在这个领域扎根越久,收益越高,因为我们要学的这些知识首先是保值甚至是增值的。可掌握的技能基本可以选择大数据、数据提取、处理、分析、建模这五大块儿,内容及要求总结如下:* T. i: |6 d. [/ y* O/ _. P
3 f3 H' @7 g8 O1 m前搞MIS(报表分析):业务报表及报告的生产,掌握excel手动报表汇总、透视等功能,tableaue等线上BI报表制作、分析。0 i$ w; L+ @6 H/ w6 {4 W/ H& V
: |; {3 K1 n W8 V( k
后搭数仓(数据提取):数据仓库,包括关系型、非关系型、大数据、图数据等数据库、数据表的设计(常为后端人员开发,数据人员需要了解表结构、字段类型等),数据存储、提取、转换、清洗、处理;需熟练掌握SQL、HQL、NQL等语言,可以做json、dict、frame、pkl等数据格式的转换。
2 \* N0 f4 [3 {
` K" c6 l% h! ^左建模型(模型开发):金融风控模型,不单单指评分卡,而是针对产品营销、定价、授信、管理、催收、监测等业务流程开发的一系列策略、规则、评分卡的集合,通常我们认为,利用有监督、无监督、半监督、深度学习等算法开发的评分卡是风控模型中卓有成效的技术。
2 T0 G0 ~; ^6 \! |! @" f* o
9 v9 c' l6 W+ `7 S9 x7 ~5 [右通算法(数据挖掘):LR、RF、XGBoost、SVM等常见算法。对跨领域转行过来的同学来说,算法这块,既有趣,又神秘,关键还难懂,让人又爱又恨。好的算法工程师,需要扎实的计算机算法、算力、数据结构等基础,需要扎实的概率、统计、多元回归、矩阵等基础,我等渣渣励志做算法的话,3~5年起步吧。6 Z" j w; L+ v2 ]% L: R
, v' B5 }" a$ }+ \
核心懂业务:P2P、消费分期、现金贷、传统金融、大额、小额、信用卡、车贷、抵押、资产、标的等业态;风险定价、反欺诈、信用循环、信审、提额等环节;滚动、迁徙、账龄、递延、回收、坏账等指标。要懂的东西,也多也不多。+ G- U& O& x' }' d% \+ L. H
2 d# a* E( v3 b- m& q' q
所以,除非奔着算法工程师去,否则最好的入行策略就是熟知行业业务流程,从数据库、数据提取、数据挖掘、数据分析、风控建模等岗位中择一良木而栖,夯实基本数据提取、挖掘、建模等流程所用到的技术。算法这块儿,只需要掌握常用LR、树模型等算法的原理,能够使用编程工具实现即可。
' D# F1 O5 G/ v6 H; q* x3 M$ v
4 W6 s, @6 Z h6 w, A A
2 [ A; _( {6 |' n$ ?+ m! N画个VISIO: ( C! V) E% l$ x# T$ z; p* c
2 M9 p1 J' N3 Q# o* U 所有知识点都掌握,并且能够熟练运用,已然建立体系,胸有成竹,你就可以骄傲的自封一个全能数据战士的名号了,简直朝阳区中最靓的仔。(悄悄说一句,全栈离经理和总监更近,产品、前后端都得给你点个赞)3 J. a: m7 A9 \ u0 g- d
* L8 y' M5 Z& R* K3 l0 z4 c 那针对金融风控岗,我们的面试准备工作,就从以上几点出发,重点从模型着手。$ V( _& E; G. y3 P8 z0 q- i6 ~
0 Q! a, e* n+ ~
1、行业经验% M. I8 t9 H; z, P7 Y3 Z
; K! m, _; m! h5 V% x/ Y& l: X
互联网金融风控岗位的业务理解,比如:信用循环体系;核拨率、递延率、坏账率等运营指标;滚动率、账龄分析等分析指标。
$ J% R5 ]2 Q$ L1 [ G+ l( U风控模型的开发流程,比如:信用模型评分卡的开发、上线、优化等过程及方法。7 ^4 y. _2 {' S# e. c4 ^
2、知识基础
5 @% A4 Z1 U( M* }/ d2 {) R: i, X/ W- n* m
(以下详细内容请看笔者其他相关文章)
0 m) t4 U: n8 {; f6 U/ n, V' }( S5 `2 t4 N- G
数据存取与处理: 基础能力,这是数据分析类工作的技能基础,也是任何一个数据类工种都需要的基础能力,不熟练的话就再学一段时间。0 u+ O2 Q& i( U) @( T
统计学习: 机器学习的基础是概率论与统计学习,这块儿你可以不必特别扎实,但像五位数、方差、正态分布、相关系数、假设检验常用知识点得了解并掌握。) z/ I/ h6 R( U% a) H' t, V2 e
数据挖掘: 不论是规则还是评分卡,风控建模类工作的大量工作内容就是对用户特征的挖掘、定义、扩展、转换、处理、分析、运用,以产生对业务有帮助的决策数据。所以特征工程来龙去脉需要懂,并且会熟练使用。( A7 N% u1 T1 s2 q
常用算法: 用于特征工程及建模工作,同样不必全懂,但一到两种常用算法的推导及一到两种融合算法的原理必须掌握,常用的元模型为逻辑回归、决策树;常用的融合模型有随机森林;神经网络则有ANN。/ `8 S/ i7 H: T+ J
3、代码能力
$ E2 L+ U9 Z2 t6 T' B- Q' P p8 N9 z6 k t( a
python | R | sas,把一门代码类工具运用熟练即可。就python而言,像pandas、numpy、statsmodels、sklearn,这几个包学扎实就行。
8 T6 e( e# J5 u2 U9 m) d(选工具的话,建议python,别问为什么,怕被隔壁用R、spss、PHP、java、excel的媛儿们暴锤)
& ?2 w2 Y, l/ B) ?1 x f" p6 Q$ W; a& N
二 面试问题. o4 @# Y1 f, O$ n$ ^
/ Q; `# E' B3 b1 y$ o5 y9 ^
1、风控建模! X+ R- t- D6 M, E. |$ L% N- D
, j3 o2 u* _4 R w& V! ~0 e* f
谈谈你对风控模型的理解?
0 l/ H( S5 K$ i% S( h- C
) t4 N; ^: m* f模型如何设计?
0 K1 b/ o4 U# |$ O# Z可以从滚动率、迁徙率来回答,也可以从反欺诈、ABC卡回答。
: l5 S% g! b. o! }# c
- t, M9 o6 E1 g. ?5 ^* G对客群进行细分建模的本质是什么?
- e) O8 ]. H$ Q, ]其实分客群进行建模,实质也是一种交叉特征,能提高模型稳定性。( i4 E, c+ l( n
^# X" I b* g$ B0 t6 o: j4 u0 ?
拒绝推断应该怎么做,作用是什么?效果怎么样?; k" r0 ?% X1 O3 R3 M% Z h. D
(多查资料,博学审问慎思明辨)
! j; L, m, v. m+ w4 K; w' D( ?, H
% [, L; ]- K3 O1 Y简要说明下标准评分卡开发流程# o, W2 b! Q$ I, m5 s# C6 ?
(多查资料,博学审问慎思明辨)0 D0 f: c6 l) b% U7 ^9 I# N
! u& h8 ^9 {$ Y6 A1 W2、特征工程
/ i" g0 N& {4 l7 A* _; F9 ?
% S& _' r6 L4 q& j3 `如何对数据做质量检验?
" _3 D: S- {* p4 _- Q# D( i, L在完成数据匹配工作之后,建模之前,我们需要对数据进行整体的质量检测,主要有两个方面:
9 L# T" p2 F' J5 u! ?; E7 Y4 w1、数据分布。
5 ~" s2 N1 w: r; K+ u2、数据集中度检测。
. N# V( M) `, c8 [4 }: i/ f3、数据脏乱情况。缺失值(是否隐藏风险)、离群值、错误值、重复值,根据其是否符合业务逻辑,判断数据是否存在异常。# n% ^, J z+ g) l
特征工程流程
) H; ~1 y* N1 h' Z/ i& }' ~7 Z关键词: 特征预处理、特征选择、特征衍生、特征提取等。用到的技术主要有连续变量离散化、分类变量哑编码、卡方分箱、特征编码、共线性检验、PCA降维、交叉验证等。
( v2 O' K+ ^6 \$ m; n筛选变量的常用方法
6 }. r: b V( l! s, p! |5 h9 x筛选变量有很多种方法,随机森林、GBDT、逻辑回归显著性、VIF共线性、相关性图谱等、随机逻辑回归筛选、递归法筛选等。- D. F g# U+ r, Z, C
好的特征需要具备哪些优势?& x5 |3 z: o: p) ^
1、稳定性高
0 M& u: o, P/ M- g1 n; L! A3 @2、区分度高
6 J* _5 o; g2 p3、差异性大9 v+ P [7 G$ m K+ V: a
4、符合业务逻辑) J& L d2 h- Z$ r2 ^1 h2 y
如何衍生特征?
' S5 e% r4 w# e% G( m& a变量的衍生并不复杂,通常我们会从三种角度出发:
# H% \; B1 l. N, Z ~% `4 j1、数学运算。求和、比例、频率、平均等。
0 a; ^ G! f4 c5 G$ ]+ y2、时间窗口。有些变量的意义只有在一段时间内才有效,所以针对时间比如说注册如期、交易日期等变量,需要计算其到现在的时间段,完成变量的衍生。- L: f6 r4 X" Z- B. B p8 e& m+ u
3、交叉组合。GBDT\XGBoost、LDA主题模型、用户画像分等等都可以做特征衍生。
W( U K8 j8 j+ [# m7 @: i衍生出来的特征要符合实际业务含义,并且要保持稳定。9 ~# Y* N1 b+ V3 N, O9 w5 H$ w
3、机器学习算法
2 l" m$ x. s, I1 b j/ b9 \+ y! T% y. c/ y G( E0 A4 |% A$ c h$ ?6 ]
简单介绍你熟悉的几种算法及其在应用场景中的差别!
1 C% w& X, U2 c9 V' F- m一些基本公式的推导,比如LR、xgb之类的,这些可以自己推导一下。
+ n. X3 h* x- t0 \2 k简单评价几种常用算法的优缺点:# q1 {" j( S; c( s+ g& m
1、逻辑回归
- I& U% n8 k: E" B! ]优点:简单、稳定、可解释、技术成熟、易于监测和部署' G& }( }/ i9 b7 {" q
缺点:一定不能有缺失数据;必须是数值型特征,需要编码;准确度不高0 N+ f$ K2 I. a7 ^* u
2、决策树
) [' { u/ o( A1 x* P! |优点:对数据质量要求不高,易解释+ w, W3 [$ T# R/ M( H' ?
缺点:准确度不高; e* V) C5 W, t% o$ M2 \( K+ a
3、其他元模型
. p4 A! M! y( \# K# o4、组合模型7 f' U) k& A0 w" m$ Q5 Y! i
优点:准确度高,稳定性强,泛化能力强,不易过拟合
! y1 m2 [ u. k% i) A7 B9 B缺点:不易解释,部署困难,计算量大% |/ ?) [; s2 \# j7 O$ ?) p
4、模型评估, L3 A, W2 I3 n- Q8 Q0 j
# P- E+ c7 f, g' T, A7 L
模型评估的常用方法?
2 C& B% L. p9 g从三方面回答:* K$ o2 E2 t! Y: O1 w
1、区分度:主要有KS和GINI指标,理解KS的定义及用法) w% q2 `4 K: w: N
2、准确性:主要有roc曲线和AUC指标,理解AUC的定义及用法
6 y. R* ~( N- r8 r6 { [3、稳定性:主要有PSI指标,理解PSI的定义及用法9 _4 l X3 C( r. E! M+ h% y
auc和ks的关系?' @+ R; a1 z6 X; c* k
有人说auc是衡量整个模型的排序能力,KS是衡量某个分段的区分能力。
- e# e; K" b+ G' b s1 x" W& E: h U5、模型部署
" I& `( X* E# g4 O
5 t$ ~- R$ \* J) k模型的部署上线应用类似的问题,偏开发,分析人员可能不太擅长。主要就是api接口安装、测试、等级划分、额度设计、风险定价、ABtest的设计等等。
! e {0 J9 T4 _1 m' _4 k& Z6 a6 U1 h9 c. o6、模型监测+ F' W5 s, o* U% ?% `- |
' {% ]* b I" N上述一些运营数据和风控指标的关注1 v, C% S2 _) O4 W+ E2 ~: `! P
三 写在后边3 ?# ?' k+ {6 \9 y
' s- ?( Z& d0 h, V- W
在全世界,分析能力都有同质化的趋势——大量的技术已经进入这个领域,壁垒几乎已经没了。长期、可持续的优势,来自企业拥有的人才和你手里的数据。2 R& M$ O# M3 x4 p- P# X0 R& W# x4 a
5 y T, z0 i* X4 X; }& g 总体而言,中国的金融科技市场是全世界最先进的,而且领先了很多。不过,在一个领域,中国的进步没有世界上其他国家大,那就是综合数据分析领域。如何更明智地使用数据,是全世界留给中国人的机会。
; @3 o5 ]7 `# j- l
; P8 w3 [ @$ w+ D" ~ 关于学什么这件事情。原本一直非常犹豫要不要学习编程,现在非常明确了,这件事最好的开始时间是大学,其次是现在,而且必须是直接掌握最先进的编程语言,主攻数据挖掘和数据分析的方向,并与这方面的专业人士建立链接。
4 i$ R5 g7 E/ v( E8 j——北大经济学博士 香帅老师7 L) Y5 k5 I, d! ]& s8 i$ w3 g
风险管理绝不只是数据、模型,它是产品、流程和分析的有效结合。好的风险管理能真正理解流程,真正进入流程、着眼于流程。它能理解产品,理解客户和竞争对手的意图,然后将数据和分析与之结合。1 x" @- c" X9 r& Z
——数据驱动风险分析之父 阿什·古普塔
5 G- c1 O9 _; _. D 别怕,难者不会,会者不难,稀缺意味着价值。每当坚持不下去的时候,回头看看你自己走过的那段路,虽然曲折,但异彩纷呈,关键还有这么一群可爱又努力的人陪着。- v$ L' Q+ n* ?: l" T U! M5 N7 g" m
5 R, q! H, H) K7 `6 g3 ^9 o
总结经验,昂首阔步,心里装着善良和坚强,到哪都会散发光芒。0 M C; d1 r& V9 k
8 |+ R" z7 Z/ ~8 |# ], R
. m( j% }1 G1 N6 v- J& c0 W
: `2 |1 ?5 o5 f1 u$ l" B! x1 U5 x% n) o& w3 `, L; l6 y
, |! U6 T$ y ?. }4 n: e; f- c$ c7 o# f a( h9 T2 v
|
zan
|