- 在线时间
- 1630 小时
- 最后登录
- 2024-1-29
- 注册时间
- 2017-5-16
- 听众数
- 82
- 收听数
- 1
- 能力
- 120 分
- 体力
- 565664 点
- 威望
- 12 点
- 阅读权限
- 255
- 积分
- 174922
- 相册
- 1
- 日志
- 0
- 记录
- 0
- 帖子
- 5313
- 主题
- 5273
- 精华
- 3
- 分享
- 0
- 好友
- 163
TA的每日心情 | 开心 2021-8-11 17:59 |
|---|
签到天数: 17 天 [LV.4]偶尔看看III 网络挑战赛参赛者 网络挑战赛参赛者 - 自我介绍
- 本人女,毕业于内蒙古科技大学,担任文职专业,毕业专业英语。
 群组: 2018美赛大象算法课程 群组: 2018美赛护航培训课程 群组: 2019年 数学中国站长建 群组: 2019年数据分析师课程 群组: 2018年大象老师国赛优 |
2020全国大学生数学建模比赛C题总结( L' _9 ]" s% y( p l5 m
( u. U: P7 e$ w+ Z6 H0 E$ c5 L
首先瞎逼逼一番,吐槽一下题目和比赛经历,对这部分不感兴趣的可以跳过:
% b2 k1 g2 z3 f8 T, I. i虽然我是周六下午才开始做的… 总的比赛时间不到两天,不过好在一个人,不怕拖队友。至于题目,我第一眼就喜欢上了 C 题。我想,恐怕很多人都喜欢 C 题吧,因为赛后做了一个总结,发现学校选择 C 题的,比选 B、A 题的加起来还要多。
& i- h. L; M) {$ J
" g; I% ~1 u" O% B! U" t# p, X) i9 h0 w$ O
为什么选择 C 题呢?因为有数据处理…/ z0 i6 J- \" P3 B" W2 b6 J
# A2 y/ L2 |; m; E! a
$ c3 G: A. l) H' G, D3 e' P7 i9 Z0 Y所以无论它多难,我都选它,哈哈哈。
3 i7 M4 z+ z8 j5 l5 E+ z Z/ y4 U: J2 o; P# u
: U: O( u! L2 Q) p4 G! e3 N
仔细看这一题,它与机器学习好像有区别啊。说起机器学习,我会想到:* ` K0 b/ a) l: @4 r+ V5 A0 S
" f' ]' Z4 @* H0 W) T6 ]) M+ g1 n" ~3 j1 T8 A
分类1 Q- h( x1 F3 ?: l! }
回归
3 I: J7 p+ ^' ^( g' @0 q! ?. D! D拟合
' [4 Y+ c! |2 b预测
2 I* g' z8 {6 v- |# m& J但是,这题… 好像不是一种,用数据拟合,然后再预测的问题啊(机器学习的通俗定义)
9 A H0 s: l& w/ F$ a* Y8 D; ]8 d7 I1 J- p* z8 y0 p4 }3 q
3 J, D5 }9 @; B. `& y( S
好吧,选都选了,只能硬着头皮上了。
# l. E5 n' ?) ], D* b
6 t8 _& j. D8 P; K' U, A) n+ j! v% d9 o5 x$ A
问题分析
1 \3 w* x* W7 y4 i1 P1 c8 {根据附件1,定制一个量化的信贷风险;) d7 b! c0 m5 r0 B) B1 r
为银行制定一个信贷策略0 b; L0 j ~# g9 J3 C+ W Y( {
有突发状况是,上面两个问题应该怎么重新规划?
* |2 O: M, Q% r' h" l# c三个问题,我们分别称之为问题一、问题二、问题三。1 `- h2 s+ Y; T! ^' M8 A
" ]1 ?/ K7 K6 d1 s; ]/ r
6 e( t% n- D! b数据说明
2 v/ ]9 \9 c+ k附件1:sheet1:给出了企业的代号,企业有无违约的情况,信用等级* ~# g" Y& D& \9 j7 x7 i1 U
sheet2/3:给出了企业的大约 2 年的进/销 量的发票数据,
/ F! a, [. g5 F5 G$ i附件2:给出了企业的大约 2 年的进/销 量的发票数据。没有给是否违约、没有给信用等级
- h3 [8 M2 F1 s% @. l, x附件3:给出了银行的利率,以及相应利率下,不同信用等级的企业,不愿意贷款的概率(原作是比率,我感觉能用比率近似概率)$ M; G3 i+ ^7 R8 p0 j2 R7 H5 J
' {9 I- I6 I) c- U1 X N" }" T; Z$ l( \. N" C& x, B$ @9 |
问题一求解
7 t" |# w5 I0 r7 n3 K! D7 q& n! c8 B你们看,附件1 比 附件 2 多了什么?信用等级、以及有无违约记录。而问题二是要我们求附件二中的企业的信用风险的。所以,仔细一想,肯定是在暗示我们,1、用进/销 量数据,来评价企业的信贷风险。2、信贷风险的量化指标,需要建立在企业信用等级、是否违约两个变量上。3、设法建立进/销 量数据与信用等级、是否违约的关系。6 ~5 u" j& y; j' d" U
: A$ p# j8 \ V& f/ y
3 _1 K% I8 F: W( O9 E6 B6 s) g
好了,第一步咱们清楚了,就是要建立信贷风险与信用等级、是否违约的联系咯~, h4 k( R5 c% G8 J. p+ D7 s
( b9 @/ i4 N+ n
0 u2 n1 E7 B A3 m/ E
我查阅了一些文献,虽然说得都很复杂,但概括来说,就是一句话,我银行借钱给你,你还的起吗?这就是信贷风险了(说得比较通俗了,有点对不起学金融的同学们)
% F% x: M. i) Z5 d9 C
b) v5 P/ P [6 R$ x
1 _8 R/ [3 J. V3 F+ \ D! m于是,我将信贷风险定义为:企业违约(赖账不还)的概率。
7 V/ u& k, t ~) H' e; x8 x
5 @+ R! R7 a E" }2 q2 k% F# {% n1 }7 T* u- v" D# Y9 m* F
而机器学习的知识告诉我们,分类模型除了能够自动判断个体的类别之外,还能够计算出个体,属于该类别的概率。于是,这不就是一个机器学习问题了吗?* l5 ^9 z8 y7 Q
3 X; z" ?. M# W4 g& H/ y9 p# m* E9 ]5 Z3 ^4 Y8 u
这个问题就是:根据进/销 量数据,训练一个分类模型,然后将模型的输出,确切的说,概率输出,作为信贷风险,Over。
4 A, _" B# V+ d. M
) ~- B7 d: s7 X: h( j3 ~1 Y G9 v; \4 i3 Y" U, H$ z
但是,进/出 量数据是时序性的呀,如果按照上面的思路,那肯定是要一个企业作为一个样本个体。可是…,这个样本个体也太奇怪了吧,是一个时序数据,哇,都能构成一个表格了。。。* @1 W5 `( V) @* p5 [9 s/ ]* y! d
! @! X% c9 c H5 T1 u; O
7 [! f* {# E) ]7 }/ h( p按照上面的说法,这有点接近自然语言处理了,也就是一片文章,对应一个类别。这里是一张时序数据表,对应一个类别。天!麻烦!
F, y) p: J" q; l+ S7 O
& N7 h* m9 g: X+ ? ~( E; m& H5 f0 B4 _ I6 O2 N) e8 m) X9 t
有些大佬可能已经豁然开朗,用 NLP 来解决啊!!!0 d( N/ i; M- q; }7 V# d) Q3 J. }7 ~2 U
2 k/ ^0 @: q. H/ m0 g. B% X
+ M2 P! u5 V, U1 j9 K* \否也,这种跨越对我来说,有如天堑(虽然我是搞 NLP 的)9 p: y7 P5 C& `) e9 Y9 r
5 l$ y+ ~( T& a5 j, a" e* {+ M7 \
7 a( Q% Y+ D: H% [& z, E' ?5 j因此,我决定,转换一下我们的数据集。
, ~. Q# f4 R# j* Q+ Y# [6 o- j
+ `5 P3 i: i% I7 P( [" S( r1 ^ ?8 T! `+ m& X# J8 [, B/ ?1 _
数据处理
( ^8 x6 z9 K( I ]- U首先,如果按照上面的思路,用机器学习模型的输出,作为信贷风险。那么就要让数据变得简单一点。
# g. m" K+ o4 c6 r) w4 V6 b
( g8 G3 ]$ S( ^( |0 s6 y0 E
3 o/ E* Q$ G% P) Z原始数据是这样的:多个企业,一个企业包含了大约 2 年的进/销数据,一个企业对应一个标签(是否违约)。9 V# a' a7 D+ z
! l" e" f$ Q) x! p1 T5 W& k2 ^
; }8 {/ E" v/ z/ L. A1 Q( s我们希望的数据是这样的:一个企业,对应一个向量(行列都行),并对应一个标签,这样才能用机器学习模型。( T1 B+ q0 E3 Z& Y, Y, F
) N! W8 k' O6 S4 o" H
; y9 Z8 d! F% G7 H- f
因此,必须将时序数据弄掉!!!1 C' Y/ F0 B9 e+ m- R5 P& C
/ d* C9 U2 |# H8 `+ F
1 k7 F' a& C+ @* @! g
由于数据是按天给出的,首先,为了简化,我们以 30 天为单位,将数据合并!
3 _. U* b/ K6 _- t+ V- ^/ @! H* H% B
" B. \" z7 n2 x
然后,用一条曲线(我用的是 9 次多项式),拟合时序数据。有了曲线之后,我们不就可以用函数的系数,来替换原始数据了么?
+ V) L3 [$ @+ \1 ]+ I6 H4 J
: l' Q0 A, d% l P$ A6 F
" A- v3 V- y1 d* c0 d这样,一个企业的数据,就从对对应表格(时序数据表),转换为对应函数的系数(向量)了。
4 V, i$ ?3 x( d @ v6 T! N- W% X9 Q* D7 [7 M% s7 ]: w
; b3 V' k6 g/ s! }: ?( R# R) M- ]
等一等,误差怎么办?用曲线拟合数据,肯定有误差的嘛。
' ?' o4 O' J* y
; A2 B- J {2 J; v( n/ ?8 p
( C# C. E( W( }1 T: H好,误差我们是用什么来度量的? 常用的有 R 方对吧。那就计算出 R 方,然后把 R 方也作为企业的数据之一,不就得了。
: p, h2 v I+ v# K
/ R8 S- y" z- N9 K1 `0 O8 b
$ S$ b, {) L$ P j) H可能有人犹豫了,可以吗?6 o4 o* O7 s! B& `; b3 O
i, {- |9 v4 k* C
0 i& F8 J$ E Q+ U好,拟合的曲线可以一定程度代表企业进/销的基本规律,没问题吧?
( S i2 K) V+ F4 H3 Y6 ], @! W
' H" X1 r6 H. r* E0 r2 l; K7 c" k3 J3 s$ ~+ [
R 方计算了误差。换个角度想,可以代表企业的进/销,偏离拟合曲线的程度,对吧? l' n* Y& w# U
7 N9 i D2 e, Q s3 {) H; r5 |2 U# w; M+ X7 Q
这不就得了么?
_6 [6 f9 v9 F h7 `
9 S" |! T3 G3 y1 b+ e5 v1 j+ w" m' y) Q! E* h1 [" ^: \* j
当然,误差是肯定会有的。但至少经过这样的计算,解决了我们的燃眉之急吧。为了方便讲解,我们将这个数据成为 一数据 吧。
% g/ Q( A: p, I4 R% `1 b; U: C8 L; c' t% I
' T! X3 u. {! L: c
有人还会问,信用等级呢?我们不能忽视这个数据吧?da si ka ni。
! Z& o6 f( d2 e( f* s) a$ }& K) t7 O3 B" m
: a2 M* P6 }! M: g
8 x2 U! H* @! q: s7 g且看我怎么处理,我们可以像 NLP 的 Word2Vec 那样。我们用一数据为输入、信用等级为输出,训练一个模型,然后用模型的参数,或者其他东西作为 二数据 不就得了么?
; U) H2 J: D3 ?# Y N1 [6 ~( T2 ? Z& I u' F" k
9 V, x a. X, j; _2 W8 _之后再用 二数据 为输入,建立一个机器学习模型,用来计算企业是否违约的概率。 Case Close!) }% L- C# I% p% C2 s
5 E4 s% h$ [7 }" ]/ T6 B
: j/ K7 a7 b* w* @0 F4 k问题二 求解
8 B" [% p2 x8 K$ u8 o制定银行信贷策略是吧?' I9 H: ?: ?! k G2 B' R. c
; W% d. A; [8 g! A! K
. _: c- G$ c! G3 }% Y; v6 ]怎么制定?无非是利率、期限、额度咯~8 w0 J% b! y3 P- |
& z( i7 |+ B2 I' i t" z2 n- a# ~: Q) Z
期限我们不管,因为没依据。利率和额度紧密相连,都是钱的问题嘛。1 ]2 m, ^/ P3 n1 d" b" p! g3 \
+ Q7 F8 S* d$ B8 I7 O
8 R/ n4 J8 b! y; a
让我们想象银行是为了干什么的。商业银行肯定是为了赚钱啊,哈哈哈哈。# s+ o0 U5 D( U6 L6 |5 a
/ e8 ], k. R: I# y. E5 T
0 R! ^( m7 h3 J# L0 N- y* ~4 D, i+ {于是,问题转换为,求解一个优化问题,即选择合适的利率、额度,使得银行的利润最高。. D' I" V8 E+ _* k8 O
: Z3 n- r1 H4 |7 d$ g8 K, D, `, }" J* P- _' U, l. a
so easy?ok?
( T* i! d( l% D) h
" u- V% W% T: t# |' `! Y3 H/ }7 ?. t; ~0 w b
于是,最根本的问题,就要对银行的利润建模咯~~
1 t$ v8 j; M z! |/ X- t
" F1 ], T, U3 f/ p* |7 i4 E
" _, n& {+ d' B! A' M; A' T9 R利润的期望 = (1+利率)^(时间) X(企业不违规的概率)X(企业愿意借钱的概率): S; i# S# T3 Y3 o5 Q- \) F
+ T% q0 w; c: }1 [* f" q" P
# _& P0 ^! g$ F$ T& V4 O用期望近似利润,case close,say goodbye。4 z8 t% d+ S3 G) f1 R( e" e
9 J% @. `+ b" R. S, g& ]% u
7 \) _( z6 i1 M$ l( {+ x
至于优化问题,加上题目约束后,就是一个约束优化问题了,怎么求解?方法实在太多了。我们训练机器学习模型,不就是求解一个优化问题吗?作为弄机器学习的,你不会连求解一个优化问题都不会吧? x4 w6 j8 ?+ a' ]$ f
9 }$ l% T$ S( j, h0 m1 M
5 w* k& C' f/ A有的人会再次反驳:可我们这次求的是一个约束优化问题啊!
. {% V3 p, c: j4 P9 a/ p- I1 \! I `7 u5 v
* O1 g7 l& I, k1 v" s; p* G1 U
我会答:你用罚函数的方法,不就可以将约束优化问题,转化为无约束优化问题了吗?
' [/ y% M d5 t5 ^7 F* m
' ^5 r& A8 E3 k D6 G! k$ e( j M) b: y! J( {5 o( C' j
问题三
1 }( Q/ e- T9 w9 X+ \& s突发状况会影响企业的运营状况,所以我们只要将 一数据 的 R 方微调一下,不就得了吗?????
3 p9 r1 G3 U0 V
, M# P$ ?7 |# K) r7 w6 p$ N0 Y( Y1 o+ ]" M
有点简答吧?5 m! Q/ u3 X- v a- Y" D7 K, @- O
1 y6 b# u9 ]+ W6 v* G
2 J3 j9 g* P, ]6 s8 k! i最终总结$ _+ ?# U3 J; Y
C 题,似乎是最简单的。但处理数据,比较麻烦,可能很多人卡在这里的吧。最难的一个点就是:如何将一个时序表,对应到一个标签的问题了吧。
& v# f/ y, @$ a7 L; w q2 o# C( Z+ X3 v% A( m
- K1 f" {0 M7 Q6 D0 m好了,最后一次数学建模比赛了,大家江湖再见吧。
4 K+ w1 U0 E$ x/ Q; G! Y————————————————+ m) e; @; R- t( i! U: f
版权声明:本文为CSDN博主「zhuo木鸟」的原创文章,遵循CC 4.0 BY-SA版权协议,转载请附上原文出处链接及本声明。1 m! M) G8 \! h, w, F
原文链接:https://blog.csdn.net/weixin_42141390/article/details/108580140 Y6 J% a; O1 I) Z$ x
) N1 u4 M9 P; b) v! B! ^6 X
: s4 G/ i7 X! w" O7 ~2 P. P |
zan
|