数学建模社区-数学中国

标题: 极限多标签分类-评价指标 [打印本页]

作者: 杨利霞    时间: 2022-9-12 18:42
标题: 极限多标签分类-评价指标
  O# ~: ]) \- S7 e
极限多标签分类-评价指标. E/ h) K; Y! _+ @* ^( D0 C

+ A* {1 N3 g; c5 z/ J7 Y: a$ c; d极限多标签分类-评价指标
& H* V! t+ }, ^References:
0 p& c) c8 O4 I7 g5 }& chttp://manikvarma.org/downloads/XC/XMLRepository.html, Y/ B  d' U& Y7 [! P
https://blog.csdn.net/minfanphd/article/details/126737848?spm=1001.2014.3001.55026 {' A: c/ T+ m+ b+ E
https://en.wikipedia.org/wiki/Discounted_cumulative_gain
. l8 p$ d$ r5 w& g" a7 B" p, R: |8 ?3 O( O6 p2 i
什么是极限多标签分类 (eXtreme multi-label Classification (XC))?, W) s. G3 K# v( o7 Q- I
标签数非常多(Million),典型的就是BoW数据标签。
! u8 |3 E5 O: E- O# L( h" d极限多标签分类的典型应用:Image Caption(头大)。不过在Image Caption里面,Word之间存在序关系。XC可以看成是Image Caption的一个关键阶段,它能够选出与当前Image最相关的BoW。
. k; E/ T1 t8 i! r6 U! y(上述都是靠过往经验吹的,近期没调研)。
: t9 J! e9 H  @; L) u9 X8 P, [  e
# ?0 ?. q% i( p$ e7 x先来看一下评价指标:7 ~8 Y- Y+ P% }" Y
由于标签数非常多,且GroundTruth又非常小,因此通常意义上的分类精度、召回(多标签分类用macro或者micro的acc或者recall)等指标不work。
1 K& M+ N' m/ S2 ?3 J这些评价指标通常考虑了head/tail labels,也就是高频标签和低频标签;以及reciprocal pairs(互惠对)去除?
) U8 U/ z- W! Y; I互惠对似乎?是指彼此相关的标签对,比如针对一个数据点,如果预测了标签A,如果标签B和A相关,那可以自然预测B。
( C5 R2 ~% L8 T/ R+ _3 H为了避免这种trival prediction, reciprocal pairs应该被去除。9 ^6 ?; a: Z/ M

4 e. f* |4 Y- T1 x$ G5 J(1) Top-k kk Performance:
5 }$ J4 ~: x5 Z3 m8 J8 P+ v0 ](Precision@ k ) P @ k : = 1 k ∑ l ∈ rank k ( y ^ ) y l \text{(Precision@$k$)}\text{P}@k := \frac{1}{k}\sum_{l \in \text{rank}_k (\hat{\mathbf{y}})} \mathbf{y}_l1 ^( q  Q7 |3 w& j
(Precision@k)P@k:= ( G. h) ?8 h- i* G) a" h/ G/ @
k
0 r" k5 l9 Y# O. v) y1- ~$ R5 g: v6 u0 i4 R- S

* H4 {; H0 k  @. a9 O7 e) w% G! _& y5 O4 K# ~
l∈rank
% m  U, y' X+ V7 `5 H: gk
2 f6 b& ?* [4 I  x* s( t/ t& J' X' [0 G0 g; w
(
: }% Q, v  s* y: r, a8 ?y- I/ w1 C7 n( E5 n" R
^8 o- M* _/ Z: G5 v

" f! t0 O# o% P/ n4 Q )2 G* ~: i! y0 `. j

3 `8 ~+ [# ~3 F. D
0 S7 i2 v# U+ [  K/ ]/ j y & Y3 F# G) E5 t
l1 _5 J5 f* k. t2 v
' y. t- A) M; P7 [+ Q2 d

# e$ \- `& r" {7 m& _' X: g) o! }7 P: o( M
(Discounted Cumulative Gain (贴现累积收益))DCG @ k : = ∑ l ∈ rank k ( y ^ ) y l log ⁡ ( l + 1 ) \text{(Discounted Cumulative Gain (贴现累积收益))} \text{DCG}@k := \sum_{l \in \text{rank}_k(\hat{\mathbf{y}})} \frac{\mathbf{y}_l}{\log(l+1)}- `& N* D) Z0 N6 r; z
(Discounted Cumulative Gain (贴现累积收益))DCG@k:=   C. E& J1 ]9 ^
l∈rank
6 S# P5 @8 a0 Zk" {9 C9 N- D5 m- i, t% e

3 x6 ~2 _! x: v" g6 O; _/ e) p6 u7 B (
$ m- t- o, U: _9 M) b! b% ^/ T1 @y$ S- J" M9 g3 s$ _6 g; z
^
) G4 F. |% d1 m$ k% P
% [  V# \  v- J: t7 e, j4 H ), `& p5 N# @* F3 x

* L( p5 b) _9 L
4 f( D* q8 ?( o: D! t, G' m- a) @+ Y' V9 G" }
log(l+1)
- k# j: M! E* g+ Yy & |5 Z( t6 N$ p5 K2 r
l
3 F& d% g: H. t9 ?6 F4 u4 o( p) X2 W& [6 z! D& \
2 @4 h% p- s5 c9 `
. l  K3 |$ ?& m. I
2 z. T$ I+ W1 B9 X4 N3 {( d
3 J& O. R- G$ L7 T( L) x, |
(Normalized DCG)nDCG @ k : = DCG@ k ∑ l = 1 min ⁡ ( k , ∣ ∣ y ∣ ∣ 0 ) 1 log ⁡ ( l + 1 ) \text{(Normalized DCG)} \text{nDCG}@k := \frac{\text{DCG@$k$}}{\sum_{l=1}^{\min(k,||\mathbf{y}||_0)} \frac{1}{\log(l+1)}}/ `1 p- j$ D, M. ~, A( r0 _
(Normalized DCG)nDCG@k:=
. m8 c: x4 x9 f0 f; @. A
  W# w; I" d- o; L% K, }) E' K" Al=1( e' C# h5 p) d" a  M; P4 t6 I
min(k,∣∣y∣∣ $ ^* K1 l  Z  |' O$ x
0# n  Q  b/ U& d4 E

1 ~+ }2 [# Z( e- \7 A- e )# D/ Y8 n9 \; A, w

; v) {+ d: n# A' j, x
1 x' i5 }$ `2 |# I8 t5 m& |log(l+1)* x2 c5 D( L7 H2 C
1$ k& }: x4 o% ~
2 {( r+ s" [/ E7 q& N2 m( D
$ f8 Y  _" x8 E
DCG@k( [: h5 h' @, x, k
  `( _& b8 O. {1 _* V( q/ `
, F) t: f! z) J

) w' m+ e9 \5 a* Z5 O4 z# w8 Yrank k ( y ) \text{rank}_k(\mathbf{y})rank 1 y$ y. t5 S& o! I6 Z! E% N, t
k3 u4 L0 F" P4 v5 |
% \, i- g: e5 V, F
(y)为逆序排列y \mathbf{y}y的前k个下标。Note: DCG公式里的分母实际上不是l,而是from 1 to k.7 u" Z( Z' i, H) q$ P! I1 C8 H
- w1 e, C/ ?8 e. D8 F
靠后的标签按照对数比例地减小,说白了就是加权。至于为什么用log?两个事实:1. 平滑缩减; 2. Wang等人提供了理论支撑说明了log缩减方式的合理性。The authors show that for every pair of substantially different ranking functions, the nDCG can decide which one is better in a consistent manner. (看不懂,暂时不管)
/ u0 p0 }+ n3 F
2 e0 O( p6 M$ c(2) Top-k kk Propensity-score:
$ s7 C: e) Q# t. n; M7 A" _+ _2 d+ \& d+ o% _
有些数据集包含一些频度很高的标签(通常称之为head labels),可以通过简单地重复预测头部标签来实现高的P @ k \text{P}@kP@k。Propensity-score可以检查这种微不足道的行为。+ {% R! l* V/ D% @  I: M0 A: `
( Propensity-score Precision )  PSP @ k : = 1 k ∑ l ∈ rank k ( y ^ ) y l p l (\text{Propensity-score Precision}) \text{ PSP}@k := \frac{1}{k} \sum_{l\in \text{rank}_k(\hat{\mathbf{y}})} \frac{\mathbf{y}_l}{p_l}
0 y* h+ ?) |1 F  q(Propensity-score Precision) PSP@k:= * }' V- i8 l# x3 r8 s. U
k. M& }- q* ?6 c+ k8 J" V
1
0 c* C& A4 k7 n% N
, q$ T# v0 v) y" u
+ A, R" D+ s. T) r+ ?  Zl∈rank
  n' y1 l/ S8 _k
0 O/ {' R$ c" Y" c- f2 ^# H0 z9 s1 I/ u6 H0 J6 f8 w
( 3 u+ z, j- O; _* I7 l& }
y
. @+ p2 L$ F  y6 `6 d( J5 X^1 Z) R# f! f, v- r( F4 [3 ^3 d

* O5 r+ ?, Q9 { )
( R# y& G& t+ u
3 s' }3 ~7 k& K$ x: x/ |6 K" u8 v( f0 B6 k
! G9 M6 l. I$ @- v( r
p
( k4 S5 R& W0 w" Ll1 |; c( q9 F* R# c( v  k

( M2 t8 w- |1 a& _! o! @  J3 f* }/ B: y# U3 o: m
y   q" J2 q6 C2 ~
l6 {! x/ S# \( w, l, [+ h
! h; w7 t1 B& }% Q/ G  [( @% `

, P# @5 O5 ~, n4 c3 j/ F
7 k( J+ j, t$ A: C+ V" w+ A2 X6 h3 m1 G  [; J

' e3 ^8 E) T2 B( t; m! t& i$ yPSDCG @ k : = ∑ l ∈ rank k ( y ^ ) y l p l log ⁡ ( l + 1 ) \text{PSDCG}@k := \sum_{l \in \text{rank}_k(\hat{\mathbf{y}})} \frac{\mathbf{y}_l}{p_l\log(l+1)}
$ _  N  l9 \% M" S3 b4 wPSDCG@k:= 1 v; Q& b8 ^7 ^
l∈rank
$ y- K& }. f' z. X( d9 J4 ^k, q: s9 n6 E2 e; F

$ a2 e6 T2 n; m. J3 L (
6 a  K1 A, k' y2 R2 F/ s3 Q! Sy
, _, H. y7 v6 ~1 K! V+ K7 Z: u^
6 i" v0 w* |- x* W- u8 F3 z; X! I3 z- B- a! Y$ c
)
( |8 k6 Y9 d# U& z2 Z6 S3 \* P7 o  T
: \) U, _  E% R- W9 F! u/ M' Z% n3 R8 t( x: O2 u& G" ]  b$ V, W9 X
3 x+ g! |: p4 `, @7 p
p & x: m; S  m1 U
l/ l+ f6 O6 n% j
, G. R% _) f; r4 Q. ~. K7 `
log(l+1)# H/ n' U: a) ^' X+ W; M
y . Q3 m8 b6 A* }8 `  t
l. b" ?, m& P5 I  u

: B7 P! b4 d7 J8 u5 k7 b- S5 _# R6 p' I3 F
8 w( }7 X5 Z9 s; T, a, d! z- s5 z
" L% d6 Y. N# ]1 q) {# D2 {% d4 d
7 @' s8 B9 h1 r% V
PSnDCG @ k : = PSDCG@ k ∑ l = 1 k 1 log ⁡ ( l + 1 ) \text{PSnDCG}@k := \frac{\text{PSDCG@$k$}}{\sum_{l=1}^{k} \frac{1}{\log(l+1)}}
1 F  L6 R1 ]0 T9 F( @PSnDCG@k:= * z4 Z3 T8 S# X7 p# }  a0 K$ ?, S

6 E6 m/ K$ i$ xl=1
9 a3 |0 ^) e- n: Ok
) U% S/ y$ b( }3 m! ]$ v9 P+ v" ~$ }
3 c5 Z: g) s$ f( E2 [* d5 Q: ^3 {7 S. n- d
8 l) S- o/ w% C& vlog(l+1)5 c2 `9 \9 O% `! y7 e  |
1
: f5 W2 p; }6 H" q- x$ w9 ?, o  t- M: b( B
* {3 U1 \  Z3 L: E" a- [
PSDCG@k6 s* X1 N. ^, }( M. j
2 Z% J& @! j$ ^# H$ Z
$ J/ C: S4 R/ Z. A! H; Z

* y' @  d% i( L9 Y/ F其中p l p_lp
( X5 [& `: [* {l
# Q0 H2 c8 V- ^- m
1 @5 `2 {5 ^: d! c/ u 为标签l ll的propensity-score,使得这种度量在missing label方面无偏差(unbiased)。4 [3 K( \- ^' n: k/ q
Propensity-score强调在tail labels上的表现,而对预测head labels提供微弱的奖励。/ l$ b. s7 u# k; X' ?
————————————————
$ ^' Z$ P# R! t  s版权声明:本文为CSDN博主「摆烂的-白兰地」的原创文章,遵循CC 4.0 BY-SA版权协议,转载请附上原文出处链接及本声明。
/ x) R$ b! x! k- P! _3 L原文链接:https://blog.csdn.net/wuyanxue/article/details/1268051904 B6 _- x: }" x3 G5 I' I' a7 @
+ P; B! @4 O6 o; r
/ x9 j& ?; h7 G! w7 d2 v





欢迎光临 数学建模社区-数学中国 (http://www.madio.net/) Powered by Discuz! X2.5