5 C w# Y H/ u$ ~, N& j极限多标签分类-评价指标 p. I5 S4 P1 }& [) j$ j- i 6 u' A8 E1 I% b; e极限多标签分类-评价指标 ! \! I: A( b: f5 ~; d+ B3 jReferences: # G; O& B: D) i* Y Y- L. Ehttp://manikvarma.org/downloads/XC/XMLRepository.html! y# k: N. ~+ S; c
https://blog.csdn.net/minfanphd/article/details/126737848?spm=1001.2014.3001.5502% c4 y% Q2 s% p( x1 Z2 P
https://en.wikipedia.org/wiki/Discounted_cumulative_gain/ D2 U- X p, D O
9 W. a5 o. W! c; ^1 A+ t1 l2 r
什么是极限多标签分类 (eXtreme multi-label Classification (XC))?" c1 {- Y4 _. I+ e7 {- I( h q
标签数非常多(Million),典型的就是BoW数据标签。 $ ^; n0 W$ f. O& x( {极限多标签分类的典型应用:Image Caption(头大)。不过在Image Caption里面,Word之间存在序关系。XC可以看成是Image Caption的一个关键阶段,它能够选出与当前Image最相关的BoW。; |! D3 G( H4 L
(上述都是靠过往经验吹的,近期没调研)。 8 ~/ h, B2 |9 g* k% r 9 v1 X$ L$ X5 Y1 c先来看一下评价指标: . p5 c* r* P& W, X& H9 L由于标签数非常多,且GroundTruth又非常小,因此通常意义上的分类精度、召回(多标签分类用macro或者micro的acc或者recall)等指标不work。 * Y9 c& x! r- F; ]+ R这些评价指标通常考虑了head/tail labels,也就是高频标签和低频标签;以及reciprocal pairs(互惠对)去除?/ N. m8 X" r H
互惠对似乎?是指彼此相关的标签对,比如针对一个数据点,如果预测了标签A,如果标签B和A相关,那可以自然预测B。9 P$ X- u: m. w
为了避免这种trival prediction, reciprocal pairs应该被去除。 3 c$ w% s7 b" l . `' Z6 F, R) B1 F6 c3 p: [(1) Top-k kk Performance:$ x, B4 a1 F3 W+ W! y: O
(Precision@ k ) P @ k : = 1 k ∑ l ∈ rank k ( y ^ ) y l \text{(Precision@$k$)}\text{P}@k := \frac{1}{k}\sum_{l \in \text{rank}_k (\hat{\mathbf{y}})} \mathbf{y}_l, @! c" j' N @; X$ ?0 b# M# Z' ~" E
(Precision@k)P@k:= 1 x% l$ w1 E0 B; k! H+ sk! G! l; f# V3 ]' e
1+ g& J$ I9 Y1 i& T
; z+ }3 I- |# y+ }3 P
7 x9 h* _! N/ o2 m) Z
l∈rank ; n, c. y4 x0 F) @k/ Y8 n# H. x" c" j, C
" A7 ?. A) K9 P2 e, z/ M8 F$ A6 d
( 5 S0 u, A+ L+ p7 H2 Z( I; Cy 0 Q' G6 G" ?# `) `; p9 T^0 n; S6 ]7 q3 \( c
8 h* E" X0 u" c b
). R$ h$ B* d7 ]
∑ / g9 q# \8 y/ a8 n+ p; m1 c8 P% w$ G O1 A9 p% F7 f) I
y " s1 G N6 A5 kl' f& h3 {* S" ?5 j9 K
2 b- J( \2 w7 _# a% r+ R! v6 L8 F6 A% Z5 ]. w5 n2 }9 M
" F( e$ ]$ V5 O6 g/ m# N
(Discounted Cumulative Gain (贴现累积收益))DCG @ k : = ∑ l ∈ rank k ( y ^ ) y l log ( l + 1 ) \text{(Discounted Cumulative Gain (贴现累积收益))} \text{DCG}@k := \sum_{l \in \text{rank}_k(\hat{\mathbf{y}})} \frac{\mathbf{y}_l}{\log(l+1)}( h( m/ g1 u. Q* T) d D! k5 M! h
(Discounted Cumulative Gain (贴现累积收益))DCG@k:= 6 a5 [7 b4 c6 ~3 `l∈rank & h9 k% S3 e8 L& p" Q! B# O5 e
k ; K, e, V+ f& G W& j' k) Q: e2 M# c1 U6 j% W! p7 x
( 6 I% x9 z. X' z6 g G0 T- Ny - q. C5 l1 t4 y$ F0 H^. j, x( y1 B7 _
0 L6 X H# E* `7 e ) 2 n9 E$ O" a) ?4 W( N+ h$ z) C∑4 h( Y9 T6 O$ k& E$ C# D3 D
. Z4 ~( I K3 D$ F4 G: Y. P. N3 N( D' ~: F/ W8 A' [3 |
log(l+1): O5 j# t- U5 i5 e' |. H; z, z
y 5 C1 t+ M# c& C* V4 w% S: |0 cl 3 A( P6 B! G; w* d6 e& V& J9 K0 d/ o8 y- ?/ d8 N7 M6 B/ e' j
5 m) y; l: F3 {2 u9 {$ }, `3 ~) z
6 ?( P2 c8 [7 |5 W1 r+ o+ N0 x6 o
, Q% a3 M, I M- g5 e* `
5 T$ X) v2 X" z8 U. V2 C
(Normalized DCG)nDCG @ k : = DCG@ k ∑ l = 1 min ( k , ∣ ∣ y ∣ ∣ 0 ) 1 log ( l + 1 ) \text{(Normalized DCG)} \text{nDCG}@k := \frac{\text{DCG@$k$}}{\sum_{l=1}^{\min(k,||\mathbf{y}||_0)} \frac{1}{\log(l+1)}} 2 E4 ^3 m* t$ ]4 x2 [& P I(Normalized DCG)nDCG@k:= . K3 [9 }+ @2 ~; w- q5 g∑ 8 j2 y7 z/ f8 `. I! ql=14 @7 w* _% g! B9 B# ~3 J$ h
min(k,∣∣y∣∣ : R r% r7 R! o5 ?0( u" b0 G: R. F. J6 }0 q
; N3 p3 a8 u( L5 M )8 H: L0 F$ i) x( W7 i
1 t4 e) e) O, Y: q4 O/ i0 O5 v- j8 b* R: C6 C+ v! a- c+ _$ D
log(l+1): O: |* ?2 t- A
1 G2 @5 Y2 u; F5 y+ j9 [
9 n. w" B; J1 g$ P8 T" @ - `6 Q, B* v4 oDCG@k/ e; A- ]3 k7 A; j5 X. z
5 H3 T6 R- T+ @
* j. W$ ~3 K! Q1 E 6 J v5 t0 Z. u* k& Y. u2 Drank k ( y ) \text{rank}_k(\mathbf{y})rank 1 m- z7 g' o% q. l
k! g1 y& T5 F0 O4 {$ z
! r6 Y3 H9 }5 M7 g$ h. [ E (y)为逆序排列y \mathbf{y}y的前k个下标。Note: DCG公式里的分母实际上不是l,而是from 1 to k.3 z- D! M: B8 P
& Q9 v: a+ @* [3 w+ \! \) m3 M靠后的标签按照对数比例地减小,说白了就是加权。至于为什么用log?两个事实:1. 平滑缩减; 2. Wang等人提供了理论支撑说明了log缩减方式的合理性。The authors show that for every pair of substantially different ranking functions, the nDCG can decide which one is better in a consistent manner. (看不懂,暂时不管)+ J" Z- c. K5 h: I8 i. {
& r) X1 V# c9 l- x
(2) Top-k kk Propensity-score:: ~" o' [+ K" r$ N1 P. {, Q
+ F+ t9 ]7 P$ A# ~0 [1 l' z有些数据集包含一些频度很高的标签(通常称之为head labels),可以通过简单地重复预测头部标签来实现高的P @ k \text{P}@kP@k。Propensity-score可以检查这种微不足道的行为。 " K' U J5 x! Y# h( Propensity-score Precision ) PSP @ k : = 1 k ∑ l ∈ rank k ( y ^ ) y l p l (\text{Propensity-score Precision}) \text{ PSP}@k := \frac{1}{k} \sum_{l\in \text{rank}_k(\hat{\mathbf{y}})} \frac{\mathbf{y}_l}{p_l} 5 j6 ~5 Z' h& I4 ~3 Y5 X(Propensity-score Precision) PSP@k:= , ^% p/ z' z# b+ U4 sk7 r! }9 Y6 Z% f* h
13 ]! T" j- ~9 \9 `5 O) G7 G" j
9 X6 c: m- |9 a$ i6 F3 X
: R, u: N9 a5 E" ^7 b) {, V
l∈rank / Y6 ^8 q! B* a8 { Mk u, L, m2 a7 T' d! d; Z" N 7 x+ y# \0 c6 Q" c. f: I ( 5 \& w2 A. t: {) F# |
y0 U! x% m. j6 D: `( u
^ # R3 @2 `! Z+ P" k' u 4 q, M6 z( M8 u$ M0 u )' I2 N5 f2 T0 D; n: t6 n9 U# q' f7 u
∑" J9 T# h+ H3 I u2 Z q
$ C M: g3 B- F v$ A
6 D7 S- y5 e, M; d
p : o/ |4 o% \1 I- bl # a% o- c8 K. x3 K, F* A N( T$ q: Y
% l! n( U4 p8 u& I# {y ; N u% P4 d, y2 s" Vl# O; v: ^4 \+ d3 L
* u9 y- ^3 G& }- n0 I * f7 f: r0 }; {8 X. ?8 e & @7 ^$ J+ F+ H$ ]* G6 D* G9 h4 c& s g* X. Y# k$ N
8 S) ?- z: `5 ?6 o" B8 f4 p& o7 u; ^
PSDCG @ k : = ∑ l ∈ rank k ( y ^ ) y l p l log ( l + 1 ) \text{PSDCG}@k := \sum_{l \in \text{rank}_k(\hat{\mathbf{y}})} \frac{\mathbf{y}_l}{p_l\log(l+1)} " f3 ~* j; n7 S/ RPSDCG@k:= 8 | z% F/ \" u$ D
l∈rank & F) Z5 D5 k2 _9 o3 {5 F* Bk! G7 C4 N. ^; C3 r0 r4 g. q% L
' F4 F6 w. F/ }9 l# p0 F! {, H% n) r
( , g5 A) _" B p
y 2 E% ^6 I5 R U" y2 {^9 _+ _2 t F# d$ c' ]
' b9 `. ^% Q$ a7 Q9 R) f ) . g5 O/ G; ^4 `∑# d- Z- |/ w5 k# B5 v' ~1 W" L7 n8 y
' H9 H3 K+ n* _7 D% @, [ + V5 ]" q! j& @( e) x/ h; S7 Ap 0 S9 W$ P9 B9 U( o- ?, |) I% O4 u
l( {: S5 m5 w! W% D$ ~
) ~6 h" j( h) r# B7 E% C log(l+1) 1 H7 j4 V, f+ a" ~y $ @, [6 S0 R+ C8 j; `# w
l 7 S- h: E1 n5 Y7 ^! `+ D) v. o: c0 k' G6 O. B
0 U7 V% r; ?( {0 ^: A- Z9 J2 E( l! N, s+ O
$ @! J! l3 G* T7 |! Q" F/ R
* {7 V3 J; P; K
PSnDCG @ k : = PSDCG@ k ∑ l = 1 k 1 log ( l + 1 ) \text{PSnDCG}@k := \frac{\text{PSDCG@$k$}}{\sum_{l=1}^{k} \frac{1}{\log(l+1)}} 9 [% b1 O' u. m9 K& |# HPSnDCG@k:= 8 Y( ~9 b$ K0 [) W7 ~3 R* ?∑ ?' i) f( D9 r. c' ]) Vl=1 + k) _; l3 _5 T# {0 u& {k7 E$ h$ S1 n/ n( i2 v
. m0 q8 B$ n, ]& N# Z1 z $ J0 X+ L2 T% mlog(l+1) 0 Y7 v$ R% [" `, r* E" I' i1: A4 x. X' P, ?+ B4 t9 I
a) _, ^+ B* \% z+ Y7 _% h a O5 {: ]3 ^9 y% b8 ^- R" r+ S! {3 H0 H: P
PSDCG@k ]) n* c, T0 R; |! l , \ Y" Q2 X1 F% q% v9 X* A B5 n! G) s7 W& T" V1 k! Z
) `7 e$ q- W4 u1 n) d% a
其中p l p_lp : T, y. t4 s4 Z1 O
l ! a# x9 j' z7 {! M - j$ F0 `6 z' f2 P( U9 E% |- ~ 为标签l ll的propensity-score,使得这种度量在missing label方面无偏差(unbiased)。9 x' g) [/ Z! K
Propensity-score强调在tail labels上的表现,而对预测head labels提供微弱的奖励。 6 N% H* c( y N0 N. d* z———————————————— ) y6 o3 v6 b7 X& [! m0 S. [: ?版权声明:本文为CSDN博主「摆烂的-白兰地」的原创文章,遵循CC 4.0 BY-SA版权协议,转载请附上原文出处链接及本声明。 . A/ w3 h) ^( ?3 X原文链接:https://blog.csdn.net/wuyanxue/article/details/126805190 4 }( ^4 W3 j/ K9 h) _' s- M, ]/ v' R: W
- |. _# Y! ]4 A8 H6 {