- g/ N x n5 \ ~+ Z 知识图谱特征学习(Knowledge Graph Embedding)为知识图谱中的每个实体和关系学习得到一个低维向量,同时保持图中原有的结构或语义信息。一般而言,知识图谱特征学习的模型分类两类:基于距离的翻译模型和基于语义的匹配模型。5 `: W" b& Z, Y2 Y
: N8 W) ^$ l% r- HTransH模型:& l( M; B$ r2 l
为了解决TransE模型在处理一对多 、 多对一 、多对多复杂关系时的局限性,TransH模型提出让一个实体在不同的关系下拥有不同的表示。如图4.1(b)所示,对于关系r,TransH模型同时使用平移向量r和超平面的法向量wr w_rw # {6 S! X% x$ x' v/ o, o
r+ B% n, n) Y! R- `8 {& }9 R
% y, o4 P, u! X5 V6 H& c' y6 A2 |
来表示它。对于一个三元组(h, r, t) , TransH首先将头实体向量h和尾实体向量r,沿法线wr w_rw % b L3 \* @" L+ Y) ]r , Z8 ^7 w c. T) I0 a: F4 s 7 }! r% N/ m; t" t. x1 T
,影到关系r对应的超平面上,用h⊥ h_⊥h 6 u) I( d9 V; F4 o1 `
⊥ - A7 e: k2 f! x& N7 ?# o9 r! D- ? 2 U- v/ s% t4 j$ y& V: }& Q7 _ 和t⊥ t_⊥t - r* K/ w, i' A, k% [: l$ ~; S. g
⊥: ~% P( N, c: ]& v) ~/ Y$ Q( Y
; p6 k4 X5 V! G2 ]! s- d
表示如下:+ q O( w7 n2 m' Z/ u( H) ]( S
h⊥=h−wTrhwr,t⊥=t−wTrtwr. h_⊥=h-w_r^T hw_r, t_⊥=t-w_r^T tw_r., r+ r* ]# J" n4 ^
h " X$ H1 ^! Z( p7 p6 y8 _
⊥2 ^7 @3 ~' I ~ M) S
+ T9 o3 C6 B1 A4 d- n
=h−w - |5 u1 A: E- u0 vr # @! p% @' s: S8 X) e, [T1 d$ G) g/ y! L p0 r$ ~ w; h) n
6 ^ Q/ r _2 ~6 H& G hw ! d) S2 O a/ m- Hr( t# ~) W' X) E/ a
- }# }$ a$ x7 j6 b- n/ Z
,t & Q5 Z) L# p; K% ? [, b5 Y# f⊥3 w3 |! y% O8 E% Q: j# ?
0 ~) v6 a6 A5 b4 h& W" Z% \* B =t−w ( b, i! l, s/ v* }
r 7 @2 ]9 f$ |( w+ W6 gT / u& |, k! a! [4 C 0 u! C; k4 y( v# ?; e; U3 B, i% _. { tw 5 ^( E* F% S/ Y* a
r; W. Z" v/ I. |
\# ^+ q" k- ?+ O" \; u: D . & O% \; Z" M% }6 q- H, \& N 因此TransH定义了如下评分函数如表1中所示,需要注意的是,由于关系r:可能存在无限个超平面,TransH简单地令r与wr w_rw & S) x; w; V% [8 P4 yr* m0 u2 M3 Y6 ~+ M* d N- G
/ R0 W# c1 l" M8 f' J% B
,近似正交来选取某一个超平面。TransH 使不同的实体在不同的关系下拥有了不同的表示形式,但由于实体向量被投影到了关系的语义空间中,故它们具有相同的维度。 * Y, W. M+ }! [, r9 P( u$ H6 }* ^$ [ / }' o# w: Q2 X# i8 D0 a* XTransR模型:3 A f& B1 z& N( p+ L
虽然TransH模型使每个实体在不同关系下拥有了不同的表示,它仍然假设实体和关系处于相同的语义空间中,这一定程度上限制了TransH的表示能力。TransR模型则认为,一个实体是多种属性的综合体,不同关系关注实体的不同属性。TransR认为不同的关系拥有不同的语义空间。对每个三元组,首先应将实体投影到对应的关系空间中,然后再建立从头实体到尾实体的翻译关系。如图4.1(c)所示是TransR模型的简单示例。3 l4 U2 r3 A) q! ^6 z
对于每个三元组(h,r,t),我们首先将实体向量向关系r空间投影。具体而言,对于每一个关系r,TransR定义投影矩阵Mr,将实体向量从实体空间投影到关系r的子空间,用h⊥ h_⊥h + q& s) T/ y$ Q1 h⊥ + Q2 @# |. D4 T; A, O1 Z( k " ~+ {, q; I5 A4 l& A 和t⊥ t_⊥t , h9 {7 f9 |5 q$ |( }2 ~⊥5 }6 J2 N( _% L) ^
* K) P8 Y8 v: ]7 G# x
表示如下:8 O8 }0 x$ l- b* _) r$ H1 K) g
h⊥=Mrh,t⊥=Mrt. h_⊥=M_r h, t_⊥=M_r t.2 ]+ E) a9 f4 k& O+ X. T
h ; Y+ S# [, `; V7 U, S8 ?/ ^1 u⊥& P" H$ v( i |- l4 g6 V, V, L
2 \" }9 O* i7 \8 I1 B& q =M & _5 Q9 I9 ?2 L! A9 Xr* ^- K* `- V; I4 I8 \ I2 l* s$ L
" m$ ?1 e$ ^. ^$ J* t0 k5 m% W
h,t 7 T' |# X) o( ?/ I# f8 t3 _4 Y
⊥ ( f, J* p* B- k5 C, r 7 `9 e J' ?/ c9 W( n8 x8 F& W; J U' F( \
=M $ z+ w$ G5 c! b7 c8 T
r- M- J; l& M) }) E. @) Z8 `2 Q
# y: K' q! _, ~) f
t. 9 E$ ^* C$ W6 A; m" ^" c. e然后使h⊥+r≈t⊥ h_⊥+r≈t_⊥h 3 u( r4 Q) i5 i2 L⊥3 w7 d! c- T8 t; [7 n( i+ F6 g9 ~
6 s L+ d9 s' ]# J- |/ C
+r≈t # r2 d2 F8 ~1 `
⊥ 7 O# [$ b4 V# D ) v- {% U6 ~$ y" E1 B/ z" ` , 评分函数如表1所示。; w, w4 e! T- S$ [3 l" ?5 z
7 \* O, G* a5 f: j. G& }1 e
9 {( h! }7 @/ h
图4.1:TransE,TransH和TransR的简要说明 5 a/ `9 z# B5 t- Y1 @$ x9 y0 PTransD模型: ! [- V9 Q! w( e Q: K$ w0 r4 ~) ]* p 虽然TransR模型较TransE和TransH有显著改进,它仍然有很多缺点: (1) 在同一个关系:下,头、尾实体共享相同的投影矩阵。然而,一个关系的头、尾实体的类型或属性可能差异巨大.例如,对于三元组(美国,总统,奥巴马),美国和奥巴马的类型完全不同,一个是国家,一个是人物。(2)从实体空间到关系空间的投影是实体和关系之间的交互过程,因此TransR让投影矩阵仅与关系有关是不合理的。(3)与TransE和TransH相比,TransR由于引入了空间投影,使得TransR模型参数急剧增加,计算复杂度大大提高。 # _1 d+ }% L, \9 _0 _ 为了解决这些问题,Ji等人提出了TransD模型。给定三元组(h, r, t), TransD模型设置了2个分别将头实体和尾实体投影到关系空间的投影矩阵M_r1和M_r2,具体定义如下:8 M, W+ u% }/ V7 w7 k, E5 j( f! n
M1r=wrwTh+I,M2r=wrwTt+I. M_r^1=w_r w_h^T+I, M_r^2=w_r w_t^T+I.* M1 U" R7 g- J4 E2 G
M - J- v+ O* t- s: P4 O; a* p
r 8 U* h; S8 C# m0 F1 3 R0 I2 C+ l3 y \( L: F$ { ( n( g- Y- W( k1 i7 F
=w , z" j5 e: U: T% P3 ?r( T/ E2 n; y% k1 y1 e7 X6 Q
7 s2 e+ v" A& g3 K3 o& s w : v5 p2 O. t+ n- T* c
h 4 O7 Z+ ]1 N) T% B) q$ HT! H$ D/ F% {% ~' Z! t
7 H! |2 S# q3 _/ A +I,M 2 t/ j% W* \' i, O t
r5 L1 W7 |0 X2 u# n* h. C. k
2 L6 _# }2 ]% }) T$ w 6 ~! d& A% Q9 S/ W& k: ^* x =w + R2 [9 Q0 S! B' S: r0 X: br ' P) W( g% @6 K$ B ( _+ A- l/ Z3 r5 R8 x# c2 I w 4 I- M) [9 d, a6 C. g1 _* X
t9 L( i# s$ t' ^2 [7 X
T 9 |/ X5 A4 u* H: I 0 W9 [: c8 S; Y! e4 t0 K: j
+I.8 u/ ]: _, g I, l5 I
h⊥=M1rh,t⊥=M2rt. h_⊥=M_r^1 h, t_⊥=M_r^2 t. ' O) u/ e9 x( d' v# A f8 Ph 9 @- l9 D# G" ^0 M% U
⊥9 I/ g l8 D5 n* B5 |* H" _
! X9 J G4 G: F) Y
=M ' U8 T: x% C0 x$ f8 y; i# G& I8 v
r 4 Z: N$ S Z# v- t l) i3 k1 1 Y o7 |6 Q; T2 K7 ~1 g " ]1 f: H6 p% i8 z& T% j6 k
h,t 7 |: u5 T- i% c" L⊥$ {2 o( ?1 W- x1 v+ v0 F
8 B3 k: g5 r8 E2 O& Y/ u) ^
=M 9 r1 j' L4 p7 p3 ~8 A' t2 U
r8 k+ b0 N: D+ b4 t9 }" t
2: c8 O* D9 E/ N7 T* l P/ c
2 {. r( V8 F: |7 C! k% D
t., r" S8 A7 ~: l6 c
/ Z- q) r! ~' _* b3 V/ _8 k Y
TransSparse模型:5 `) O9 w- ]7 U4 g6 L+ C
TranSparse是通过在投影矩阵上强化稀疏性来简化TransR的工作。它有两个版本:TranSparse (共享)和TranSparse (单独)。前者对每个关系r使用相同的稀疏投影矩阵Mr,即: 9 P3 ?7 r8 d8 w$ ?h⊥=Mr(θr)h,t⊥=Mr(θr)t. h_⊥=M_r (θ_r )h, t_⊥=M_r (θ_r)t.. `6 s7 g: d, P3 O) g3 u
h ; q( o, O B, t⊥ . l: c2 c, d1 w; t- H/ I' k / `: l! h# j5 f0 G) I. R$ ~ =M 1 t2 {$ O* N& {0 c0 P
r5 ?1 m( }. O) T* u/ }9 W
/ _* W& F/ V; E, W& r& l/ p (θ * {: G; M5 f) N# q
r4 J" V3 c9 \: x4 T' S
/ U' B: z, B) d) w# v# n )h,t " p$ `" Z; s0 G4 h" W⊥9 H o9 P; x4 j& Z; I; L# Q. c
7 {5 c% a- W+ P: K/ U =M 7 G: N. K. I: {. R
r ; h) K. r/ r5 c- j2 ]0 ] . R1 N c8 g4 V8 a( j3 s
(θ 5 q* k% `: x$ d) e r
r $ l+ e: Z3 x4 k$ D& Q& H. Z $ e' l( c' d$ I# x )t.1 b8 `( ]" h, V2 f# l) B' ~ G
后者对于头实体和尾实体分别使用2个不同的投影矩阵Mr1 M_{r1}M 6 {0 o4 _; k. vr1 9 O R! I2 g7 Q' M8 B; V- p 9 A8 Y0 v! t! o- e. Y% d. e( t( U
和Mr2 M_{r2}M , P$ B# H |3 Q7 i$ ^/ h7 Y+ u
r2 & K3 D8 @$ C. M( P1 k S! z 9 t, m) `: u2 C4 k2 z 。. _( _7 c$ }; b7 W
h⊥=M1r(θ1r)h,t⊥=M2r(θ2r)t. h_⊥=M_r^1 (θ_r^1 )h, t_⊥=M_r^2 (θ_r^2)t.6 X( f+ e f( b- U0 z+ T
h 7 `! O' Z$ ?) U$ N0 M4 N
⊥ $ k* z$ u$ c, b9 B9 |1 y 6 S. X6 D& y. @9 D! Y, y0 f4 h
=M 3 N$ d0 ~2 {* ~9 i
r + d' m" \1 C# Y J1 . t6 _0 b% L) X; ? 7 G; A2 e8 |! V5 V (θ 2 j% |# U2 K3 nr! g ]7 _4 q: q$ i) i a7 [8 v6 W
1 6 J' L9 ]5 V* W6 ~" n0 h 5 ~$ D7 |# R% a& m i/ ^ )h,t 7 v& a# o8 J! I n⊥/ c5 r4 v' @; B' a% _" K) r. H
# `$ a6 u6 ] x =M " Z d2 p# g! p2 k6 A) r$ pr * I9 Q* ~2 w# {5 M/ E) v. S- N$ b2 1 h: x5 N/ Z* `/ u $ O& C6 V$ Z& w r" Z3 C# Y5 @ (θ 1 i# ]" `3 p6 i, x
r/ q; ?# i$ M+ |+ B: D1 M3 b
2( D- t3 Y; I: Y& x. t
3 I: H+ l4 `1 ~. d3 N! U )t.. x! V Y6 s, p A7 [
TransSparse模型评分函数如表1所示。通过引入稀疏投影矩阵,TransSparse模型减少了参数个数。1 d8 r- j- w- H8 k. Y8 d/ A2 }
, i3 [; F' w8 r% E |TransM模型: 0 o, @0 U+ U1 x/ E" r 除了允许实体在涉及不同关系时具有不同的嵌入之外,提高TransE模型性能可以从降低h+r≈t的要求研究开始。TransM模型将为每个事实(h,r,t)分配特定的关系权重theta_r,定义的评分函数如表1所示。通过对一对多、多对一和多对多分配较小的权重,TransM模型使得t在上述的复杂关系中离h+r更远。+ u" X6 r& M; E* |- {
; p7 [6 Z T' I) HManifoldE模型:# @# z& f# s4 R. l
ManifoldE模型则是对于每个事实三元组(h,r,t)将h+r≈t 转换为为(h+r-t)的L2范式约等于theta_r的平方。同样地,ManifoldE把t近似地位于流形体上,即一个以h+r为中心半径为theta_r的超球体,而不是接近h+r的精确点。评分函数如表1所示。TransF使用了类似的思想。而不是执行严格的翻译h+r≈t,TransF只需要t与h+r位于同一个方向,同时h与t-r也位于同一个方向。则评分函数(即t和h+r匹配,h也要与t-r匹配)如表1所示。 : Z6 Z5 O6 E7 U# d8 n! g: l% q, O3 s" y2 [, L* M& b& ^
TransA模型: ) I( D( g0 y1 B# |* Y% J# I TransA模型为每个关系r引入一个对称的非负矩阵Mr M_rM ; y, y! t- s& K- i
r3 o! W$ h% ]* G2 c1 }7 O
* ~; Z& j9 j, f5 Q1 S* f ,并使用自适应马氏距离定义评分函数,评分函数如表1所示。通过学习距离度量Mr M_rM 3 |0 k" n0 s4 |; v2 ]r; |- y6 J6 `: f3 ?7 s& w# h
, C6 V+ X! ~. C+ s; ?! t. W
, TransA在处理复杂关系时更加灵活。Xiao等人认为TransE及其之后的扩展模型均存在2个重要问题:1)评分函数只采用L1或L2距离,灵活性不够;2)评分函数过于简单,实体和关系向量的每一维等同考虑。为了解决这2个问题,Xiao等人提出TransA模型,将评分函数中的距离度量改用马氏距离,并为每一维学习不同的权重。对于每个三元组(h,r,t),TransA模型定义的评分函数如表1所示。其中Mr为与关系r相关的非负权值矩阵。如图4.2所示,(h1,r1,t1) ( h_1, r_1, t_1)(h % e# U+ z" _2 n' i o* w
1 " _0 o/ U8 d# ^9 z2 t. ^ " u( E6 ?! X1 F% a# v% L
,r ' J# A( y3 \1 [1 U1 o6 x
1 6 U7 K) Q' ~2 |! A/ K- e - C. Q. z) J% H9 t! m9 q ,t % K% |% y& ]) s6 N0 _
12 A r8 N: [' k, d$ d+ W/ f
) i" d# @$ p+ n# f5 a6 p4 p
)和(h2,r2,t2) (h_2,r_2,t_2)(h # G, @" p* S$ v24 V/ b- ]+ M& ]* n
9 F0 n& m M) i% G* n4 } ?
,r 2 W" [2 x; U- A# n3 [. ]7 {4 {2* D% j& ?. t2 p7 \4 Q
* i0 |" P6 A' p/ z
,t , l# S' U# @& j) B' w2/ R- \) m5 G$ n) \ y8 Q
* m9 N% e* H9 p @ )两个合法的事实三元组,t3是错误的尾实体。如果使用欧氏距离,如图4.2(a)所示,错误的实体t3会被预测出来。而如图4.2(b)所示,TransA模型通过对向量不同维度进行加权,正确的实体由于在x轴或者y轴上距离较近,从而能够被正确预测。 + |1 p' V- E" @7 Q, I0 k & E( z/ p2 h/ ^8 O$ E# A # @7 B% ~+ Q: k: A7 i Y3 S图4.2:传统模型和TransA模型比较$ e* I9 o, t* P5 A" p$ |
高斯嵌入模型(KG2E模型和TransG模型)* |% m! Y' ~/ R: ~/ Q
' Q( V+ j0 x( ?* H
KG2E模型:- c/ R% ^& m; a5 Q
He等人认为,知识库中的关系和实体的语义本身具有不确定性,而过去模型中都忽略这个因素。因此,He等人提出KG2E,使用高斯分布来表示实体和关系。其中高斯分布的均值表示的是实体或关系在语义空间中的中心位置,而高斯分布的协方差则表示该实体或关系的不确定度。图4.3为KG2E模型示例,每个圆圈代表不同实体与关系的表示,它们分别与“比尔·克林顿”构成三元组,其中圆圈大小表示的是不同实体或关系的不确定度,可以看到“国籍”的不确定度远远大于其他关系。& x" w" O4 a/ T5 y
, O# d/ |$ i8 k, W9 _
% b+ X3 Q t+ z4 f5 W0 L
图4.3:KG2E模型 2 ^" M; z0 V6 D; w% ~ KKG2E模型将实体和关系表示为从多变量高斯分布中抽取的随机向量% A6 C* u+ i4 p2 _
h~N(μh,Σh), h\sim N(μ_h,Σ_h),. O! M; a" c' ~4 z
h~N(μ , G* R& w. o7 f3 Z8 g9 Kh: O2 z( a. ]3 B/ }. w. l
! R% E/ A. _' U
,Σ 5 R3 U. z; `* d$ j7 g: nh# \; U8 ^% S8 E+ V& f5 ]; @" G
$ ^7 j3 [- w6 H) t. i1 ~9 h# {1 w
), / `: h; H" @8 s it~N(μt,Σt), t\sim N(μ_t,Σ_t), ) j6 i5 u3 A% e' Yt~N(μ ( l7 N7 W: P: J# T2 A" bt$ [% b, s; ^8 {# E9 w7 V/ U
1 ] v; Q* C* M- P {% J- h4 [3 d- t
,Σ ; g' P2 l; S. t' Z: K3 ?7 x: ot3 \4 f" y/ k/ M, U7 z c
0 B8 [+ W+ D' T/ s( k; l. L* R, R
), ( u" D; u5 r3 or~N(μr,Σr), r\sim N(μ_r,Σ_r), . D* E% O! Y" @5 H9 F- p* T6 sr~N(μ 6 z: `6 y$ o# L f3 v& b# e& I
r' D. Z! J2 ~0 g, Y2 c8 @
4 |# [6 q+ A4 U6 Y1 }* j ,Σ j) E4 u M; R5 vr; |6 T/ H- d$ U1 R
% S9 g5 j7 t0 L+ e4 X
), 7 y: p; B, d4 {; f) H) J+ Z6 ]% I; R, j
KG2E模型通过测量t-h和r这两个随机向量之间的距离来为一个事实评分,即N(μt−μh,Σt+Σh) N(μ_t-μ_h,Σ_t+Σ_h)N(μ Q9 ?: o C+ ]0 bt# H+ G. G/ W% m. @# [' J
! E: E. p# ^' u: j −μ * A: M1 I/ s, t& g% i* V
h* y! Z4 h5 c9 Z3 m% A
^; E+ N- A4 Y- z: J
,Σ - w/ ~7 }' N5 N: V3 Y/ I$ u
t 5 g8 }/ E1 [3 O% i- D! h X ( r2 `& T( i" q% }6 L; J x/ J, J
+Σ ' C M. _6 }- O/ N* c
h: c `. f* |7 a; o2 R& Q0 X! I, p
( }& _5 W5 a1 j7 b2 A )和N(μr,Σr) N(μ_r,Σ_r)N(μ 9 E" X n6 H( {* s$ q( ?
r: H, { F' Y# r) l3 C0 j
' f7 v' L: M# w) Y" r ,Σ 9 f g9 ?' t& W0 u( K+ t$ z- u# @r9 S5 d `& H$ d" c a) @. n v
. C# X" L2 d# p: @- _ )这两个分布。通过2种方法来进行测量。一种是通过KL散度(KL距离)来进行测量即: 8 _) ^' n- r$ Z2 o( y9 E6 zfr(h,t)=−∫(Nx(μt−μh,Σt+Σh)lnNx(μt−μh,Σt+Σh)Nx(μr,Σr)dx f_r (h,t)=-∫(N_x (μ_t-μ_h,Σ_t+Σ_h)ln \frac{N_x (μ_t-μ_h,Σ_t+Σ_h )}{N_x (μ_r,Σ_r )} dx / ~4 ~3 R# j1 Zf - ]' T2 d5 K( p
r / h$ P2 r: X# e( U3 D- \ 9 x/ ?. `! g* Y z* {# y2 ^# { (h,t)=−∫(N $ b B p: q, y" M( i
x @% E% n+ H* S) |' j& a1 j
5 A: M* M5 R: ^. o7 Y9 y$ | (μ ( O! v' |% h. c! C; s, [t ' M4 j$ n }6 S: c' g 2 z' w8 M8 W' O' e8 b2 V! \ −μ 4 I, u5 P9 O9 s g
h 3 Y% D; Q, H+ L/ l" O7 q7 V7 r $ q/ ~# a9 g/ K, b) K9 O6 G ,Σ ; D. _9 F( O) @! i, A) o
t ; G! S, l3 E0 _# ]0 V : t+ q" f, z; h' W +Σ + r1 N& c8 V$ Zh( k! y0 [: S7 U! k' P
. y2 P2 Q" N) i8 i4 k! M' P/ } )ln 3 j) ]+ ^" T* E5 U6 `N , E {" q! R) b6 y: e6 [8 F& |4 ?! X- @
x - ~5 c m G. ]4 M4 K ' |% U0 X1 I& n- ^% V: Q4 k0 X9 x
(μ ?& R# e) [. P8 P& d9 x! v+ I% ^/ ]r / w4 r5 H( M. v) i 0 ~/ b$ A7 C( w) r+ U5 v
,Σ - ]" G: ]. Q- Q( ^
r, c/ a7 o! d1 D
3 i9 A( B" T" _( Y- ~
)- P6 G+ Q$ H' I" ]5 l6 E
N * V4 e) g1 U1 [! \' Y( h2 o0 {( Lx, U. _# s+ w( R! @
& \7 x o' L' t" `' z( b+ j1 p (μ 7 M5 z1 _$ \; O( W it. c+ V2 c; l5 y o1 E( }
5 b5 E' N" I% }" A
−μ 5 w; v! V' K: P6 L; j
h* d1 U0 z1 D9 |1 P% `
2 c$ Z V* x, N' R! M0 _ ,Σ - W: C; h7 c9 I9 V" t2 U% k1 F7 Q: C
t $ \ H, J2 E0 B+ t 3 ^; c$ F% L. S, z, J, o +Σ ! s w( z1 c2 e3 U L7 O5 Vh w8 @6 c4 `0 K. \, M ' }4 I' W u9 b W ) + U1 ^8 i8 n. k: S: m5 Z+ |9 ~9 \ 9 ]2 g$ \) o0 a' b! u
dx + [8 h. Y0 G$ f& R8 b/ e∝−tr(Σ−1r(Σt+Σh))−μTΣ−1rμ−lndet(Σr)det(Σt+Σh) ∝-tr(Σ_r^{-1} (Σ_t+Σ_h ))-μ^T Σ_r^{-1} μ-ln \frac{det(Σ_r)}{det(Σ_t+Σ_h)}( B/ ^0 j( m( y5 F& v, I8 u9 J
∝−tr(Σ * z+ ], L6 J; |# W( nr ; [! x2 A, [4 W6 t; ^1 H−1 % y8 T/ N6 @& Y( q + N5 N) a, q) N/ [9 i$ f# s
(Σ 3 c5 r1 t9 o w N2 W
t 7 `0 b# O1 ]- T ' w9 U# U) ?0 Q +Σ U7 [5 A3 q; }- L; f* m/ B+ l2 y
h0 g# r" w: G4 r# n/ l
% L% J/ z9 S& G6 [' G: b9 M( _ ))−μ - U7 Z6 K" T* x Z O4 A- k1 [# R
T 2 h2 g7 N4 y e2 }5 D$ j Σ u1 k5 j) a9 k& B
r # S: r2 W# G. w7 |8 v; i−13 s1 M4 w( @5 J2 r T1 G
8 | q3 b3 m# B) t2 j Q6 X
μ−ln - U% K" V% m7 e- Jdet(Σ 1 w( E+ Z9 }1 \! ]3 \0 R2 mt " `1 ~1 X& z; O7 b: a ; Y% C! S# P# E% U" c# {- E +Σ ! M% K/ v3 U. l: `
h" g6 {- f8 w5 Z1 u H
9 l( q" v) r5 B- |0 S& u ) 9 |9 g7 A; x5 n9 l0 Udet(Σ 6 n7 i$ F, E8 ]7 nr ]3 P4 U4 D# E; _, o- s# e Y" c* V, h# V- z& F
) $ p$ y5 R I" r! x" \8 f 1 }- P4 j) u' d$ ^: y& c( Z - J9 X. C( T/ ~另一种方法是计算概率的内积,即: 9 ?& H4 Z1 B# O0 C( D/ K6 Z6 Rfr(h,t)=∫(Nx(μt−μh,Σt+Σh)⋅Nx(μr,Σr)dx f_r (h,t)=∫(N_x (μ_t-μ_h,Σ_t+Σ_h )\cdot N_x (μ_r,Σ_r )dx 5 L! q5 `* A1 F9 ~7 P) K% nf ! D7 t& j$ F/ Q) t1 _8 J% ?r3 s) v, z x1 B2 O
5 L6 Z# X3 s$ o( w8 D
(h,t)=∫(N : l% Q: W. }/ ]
x) i0 l& D% c- w& }' J2 F$ V
( w" w. m% G3 W0 N# G; u# ` (μ 9 k% Y$ |" e! J+ |) |. s
t 2 q7 b+ y( |- c: {- F6 v8 n ! @* ?+ q" K5 V6 [) W+ ~. M9 m
−μ 0 {8 ^4 y/ G9 r2 L ^h 0 P2 r/ x: N+ w3 P. a' u- R% B 3 F$ s2 z" a7 h! i8 t. n. } ,Σ + C6 I7 ]; n' ^5 n: Ut8 t1 q9 v3 h, y, ~9 n
3 K1 Z( C1 w+ w. i+ a
+Σ ! B. S4 i0 D% v$ |! A2 h
h 8 D ~5 Y8 f3 A% n- m m- H 7 m. g% j; ]$ ^; ^* J$ R6 d3 | )⋅N ' n- ?& [" H1 ~1 n# ?6 m
x + }9 ^1 N* n7 g* i& R1 e" a $ B/ V+ P G) y, n/ c
(μ ( K" u0 q2 d( H+ C# r
r/ ?) f; x ?/ v0 E% Y' ]- m1 k* s
7 c7 E7 G) D W2 ?
,Σ 6 _- S2 W+ h5 j8 l I
r 2 S4 f8 K/ d! h2 H3 c$ E' N- f 2 P0 Z% }+ b/ C4 N )dx ( A# [) L p4 N6 f% p: Q∝−μTΣ−1rμ−ln(det(Σ)) ∝-μ^T Σ_r^{-1} μ-ln(det(Σ)) P3 m* [/ m9 g1 z9 Q∝−μ 2 G# H; V! l$ P2 \, g
T 7 h" r2 B5 b4 d) ?6 h. p9 x Σ ; Q9 S; g) f$ @1 p6 V5 S4 L" l
r ( D: O& x5 h( M ]−1: B3 S m i, D
3 j& I' H% l; s& q μ−ln(det(Σ)) ! K) Y, Z1 `" {KG2E可以有效地对KGs中实体和关系的不确定性进行建模。+ v! R8 `" v4 T7 w& C/ r0 A6 N
9 n4 j, N9 J. G' x, h/ t, k' k$ l, y
TransG模型:7 e/ @# P) c, _4 ]! g! c- l
TransG提出使用高斯混合模型描述头、尾实体之间的关系.该模型认为,一个关系会对应多种语义,每种语义用一个高斯分布来刻画,即:7 e Y$ ?3 U% ]8 C' A
r=∑iπirμir,μir~N(μt−μh,(σ2h+σ2t)I) r=∑_iπ_r^i μ_r^i , μ_r^i\sim N(μ_t-μ_h,(σ_h^2+σ_t^2)I) 7 f* j6 R9 [' `r= / j9 V* m$ H T8 [: c/ k
i6 B, j7 O* J" ?% T1 r: O* }6 m
∑ 4 O6 O6 y' f, S9 Q, q$ K. Z9 U + e8 f" y$ z2 t: V- I
π ; c- p* w& I/ k: O8 d B+ R: ?5 P
r : |4 M5 {% t ^i 0 h" b9 K# y/ u- Q3 J6 c. g" p8 |: I ( H" n$ O" m, j μ ) y8 ]# O) k* w4 M) Y( Z) ^r 3 Y' a# M8 Q$ \4 I2 ?% h! Ni ' k; e; X8 Z H4 Q) D5 N I( H6 j# F' P% w4 G( Z ,μ : J+ N5 R* R S! [- }+ O- w
r 1 c+ z/ ~9 Z/ q3 ri4 G' Z0 c6 ?$ l/ v: q) ]) o# n0 M
7 j" @. ?$ Z8 p8 R
~N(μ 4 d7 [4 d, f. a+ D
t( I. j. z# h. R! r
* L1 w4 e5 N5 G( N) f −μ ( v9 A. S+ v9 _9 C, H$ R3 v
h# x& I4 s2 j6 {, L1 z. d
" A6 y+ ]) x- l5 y: d ,(σ . O- L+ J% q: A( j" p
h 2 E* Y8 L( h+ c% e( n2 3 ~$ @: D* B5 c! n: O9 u3 U . i& V5 w l, ~% I& l +σ ( ?* A j* L9 R) G5 ~0 l) _
t - w, p0 B$ K+ ?8 s w- n2 7 q( r! `: _+ ?' x " k* R3 Z* w+ N. E+ Q9 l& U+ [; d8 _
)I) 9 |1 ^ a7 M6 @5 z" r评分函数如表1所示。从评分函数公式可以看出,哪一种平移距离的混合是由关系的不同语义引入的,由关系的不同语义引入。这些语义组合可以通过CRP从数据中自动学习。$ n4 \0 Z6 y6 ? ~
9 [3 c6 i' x2 I" M2 [表1:平移距离模型总结 ( P3 [8 o8 X6 P+ }6 V: m. I ; q6 c2 R. _/ Z j& e 9 y/ R/ P2 M2 F3 [! s4.3.2 基于语义的匹配模型:使用基于相似度的评分函数。 8 K% B2 g; D f. e' V A 7 [* z& L4 U" y 它们通过匹配实体的潜在语义和向量空间表示中包含的关系来度量事实的可信性。5 F" ]6 @3 Y9 D
2 B6 L% u/ x: B图4.4:RESCAL、DistMult、HolE的简单图解 : h. L8 Z! n- o$ U! ^ComplEx模型: . k$ g7 o4 y9 W% l' D+ i+ _ ComplEx通过引入复值嵌入来扩展DistMult,以便更好地对非对称关系进行建模。在ComplEx中,实体和关系嵌入h,r, t不再存在于实空间中,而是存在于复空间中。定义事实的评分函数为:% T6 S. ~/ P1 o1 D* b4 P d
fr(h,t)=Re(hTdiag(r)tˉ)=Re(∑d−1i=0[r]i⋅[h]i⋅[tˉ]i) f_r (h,t)=Re(h^Tdiag(r)\bar{t})=Re(\sum_{i=0}^{d-1}[r]_i\cdot [h]i\cdot [\bar{t}]_i)4 g" r" f7 P: P& e0 l0 \( d
f ! S' Z7 J$ Z$ `7 p
r K& C' T, m. e0 M9 G $ L6 l. S( R0 y- f" ^
(h,t)=Re(h % o6 K3 P6 G6 F
T 0 c T. W( c; W6 c diag(r) * _, V# W, C4 Z% c$ Et 0 Z7 B: v9 J) O0 Y* c1 |$ Gˉ 9 L+ M1 N G# U. f5 ?$ P3 C )=Re( 6 Z* p& F( \/ Z! o( x0 d' V& Yi=06 ^0 f* |+ D& Y# V) K
∑ 3 i/ o( m: G R* @0 x; \d−1 ( v; D Z$ j, i* l ! J( X) K3 J+ R9 E2 L
[r] , P( M0 ]3 C/ ^6 di ' }; g* o$ g+ K 7 H8 A5 ~' `7 P) i2 y x ⋅[h]i⋅[ ) Y5 R- a2 V6 r7 s- Z2 O+ S- [t . o: Q M$ `7 ]! ?" z7 Yˉ3 a4 {6 L# k2 `# T: {, i; u, n
] + R4 N' K3 C; |1 z! C7 N& ?1 y
i ' l+ G0 M3 B. `( s * l1 R5 M4 s7 r* e6 w) C) }; [7 J
) 2 l0 n ~, o4 Q+ j+ o 这个评分函数不再是对称的,来自非对称关系的事实可以根据涉及实体的顺序得到不同的分数。最近的研究表明,每个ComplEx都有一个等价的HolE,反之,是在嵌入上施加共轭对称ComplEx包含HolE的特殊情况。$ P6 h+ Q y6 \$ _' Z
, U, P8 p( d7 m( t0 ~
ANALOGY模型: & i/ { u7 R. h ANALOGY 扩展了RESCAL,从而进一步对实体和关系的类比属性进行建模,例如,AlfredHitchcock之于Psycho,正如JamesCameron之于Avatar。它遵循RESCAL并使用双线性评分函数如表2所示。其中,h,t是对于实体的嵌入向量,Mr是一个与关系相关的线性映。为了对类比结构进行建模,它进一步要求关系线性映射是正规的和符合交换律,即:8 r9 q' ?1 k' @5 |2 o7 X
normality:MrMTr=MTrMr,∀r∈IR; normality: M_r M_r^T=M_r^T M_r,∀_r∈IR; * W0 _0 h; o. B3 D' j! lnormality:M 1 o& `4 Q% ]3 ]9 r9 Dr 0 q8 Z0 {; z( R* I" R# s) y " }- h1 t/ |: [5 d; Z | M / g) q' u( S1 T7 g/ {3 Mr# S' l, r. d d, R! Q+ i
T 2 R) o7 q* y& D- U5 l , m- W5 ?7 c8 O
=M . i3 L8 c; q0 J
r/ L, s( e4 R1 ^1 U7 |& d
T 5 j2 [, g( {: h# @ k7 `" `( N ) \" o' y1 O" d' J+ w M . ^' z( p3 Z+ k0 c9 J* X1 @8 d* Mr: ~! u& K$ m; J. s# I) O4 |; Q7 n/ ]
% g* z- ?1 Y) T. A( B. E, ~ ,∀ $ a8 A9 H6 E ~7 e: o+ \( t% k
r# a+ P' E( {0 v7 e5 j V
6 ]' o$ D" }! |3 ]: l0 r6 s
∈IR; / D1 B/ w! B. t% D9 d; \# Q: W' V$ Jcommutaivity:MrMr′=Mr′Mr,∀r,r′∈IR commutaivity:M_r M_{{r}'}=M_{{r}'}M_r,∀_{r,{r}' }∈IR 2 ~, c+ M3 Z' \5 G: J" c, }/ Wcommutaivity:M 9 h1 U9 V. h0 [! cr $ K& x( c8 x. V3 M 2 @# M" f0 H! o! t6 l9 T8 I* C
M 1 \: I; ^$ \' G0 n) P" rr 1 h+ h) J _1 c
′* }* g) a. p) X1 i% k/ g% `
$ W3 X% y& t1 d1 v$ r ]
. t5 Z: ], J5 {8 X# O* i
=M ' l3 X4 y1 M; O2 G) ~r $ K, y/ o8 G( D _# @
′8 h) m: Q7 O2 r9 X2 S5 u8 ^2 ]
G5 N5 A9 d; L% j/ P
Y9 {( m- p, _2 P
M 8 Q$ N. q. y. Z, k3 r1 e
r $ r1 j3 R+ ~- t6 y - }" s# F: g& g& |! h6 [' \ ,∀ ' o, H: ^, q% P, T8 _& [
r,r ( `; T/ z1 v7 S: x/ B, a" D
′5 ?! N6 X( d9 s/ k1 K
$ e" V2 {& F% Y: ^
: F8 A! s( E: e; }- N4 N
∈IR- f1 [7 J6 E- h
尽管ANALOGY表示关系为矩阵,这些矩阵可以同时对角化成一组稀疏的准对角矩阵,由每个只有O(d)自由参数。结果表明,前面介绍的DistMult、HolE、ComplEx等方法都可以归为ANALOGY的特例。 , }9 T5 w/ u* ]* ^# _3 d- D$ ^( x- r2 ^- J( H+ k
基于神经网络匹配 , D7 l0 b# \9 B- m+ d( H , U7 C$ V# D `' W W v6 l语义匹配能量模型(SME): 7 O/ p% E2 E7 a4 P0 F h3 o8 t9 O& i; A! l) T' g) b
SME采用神经网络结构进行语义匹配。给定一个事实三元组(h,r,t),它首先将实体和关系投影到输入层中的嵌入向量。然后,将关系r与头实体h组合得到gu(h,r) g_u(h,r)g + a. \9 _) [; [! `! `/ iu . f! Q( ]. c( V, U 1 ?$ A$ ], R7 c- C: Q7 n; ~, o
(h,r),并与尾实体t组合,得到隐藏层中的gv(t,r) g_v(t,r)g , _& Z0 b# K. hv2 M6 e3 J5 T9 y9 a- t0 M1 p. g9 ~
/ j: V0 F5 u( Y5 w' O
(t,r)。则该事实的分数最终由它们的点积定义为匹配的gu g_ug 2 W5 W; }4 o" X" f2 ~/ d; G4 \+ qu 5 b( {. K* {' u/ Y6 c! R : `, w; b% a% \6 [, ? 和gv g_vg 8 }' L0 C2 [; [8 E; J$ _5 M! Z
v G/ u' `7 x1 N ! l- c5 d6 v; d/ R6 D1 R; c
。即:: r4 e! I9 Y3 b! _2 I
fr(h,t)=gu(h,r)Tgv(t,r) f_r (h,t)=g_u (h,r)^T g_v (t,r) $ \* ?) \4 H/ `7 Z1 S& Rf & ]) U: F! I; V2 R8 L
r # v; E- G: J3 n$ b, g / [& I0 {! N" j8 z# w4 h# h+ ^
(h,t)=g 2 p' e2 [& g% n% J4 O3 [# C
u " @8 \6 \( z( z3 f6 ]2 } # c% Z- Q5 W, ^. B5 i (h,r) ) }& J( G0 d$ a" C8 l3 nT " s; X: G3 S' ~# _3 H g 2 `( V, }/ T* r# z1 |( N6 a! g
v ! M; J$ L( u% ?+ d: H 0 S: h; e2 m+ N0 Z: L) K
(t,r)! ~! B n" g4 k5 \
9 U7 [$ |0 B" J$ R5 a神经张量网络模型(NTN):3 U4 V j9 D% A0 {- k
# y% ?+ \) a% u4 Y4 V NTN是另外一种神经网络结构,给定一个事实,它首先将实体投影到输入层中的嵌入向量。然后,将这两个实体h,t由关系特有的张量Mr(以及其他参数)组合,并映射到一个非线性隐藏层。最后,一个特定于关系的线性输出层给出了评分,即: 7 }2 R' {8 s) K* n) c1 I2 \" Mfr(h,t)=rTtanh(hTMˉˉˉˉrt+M1rh+M2rt+br) f_r (h,t)=r^T tanh(h^T\underline{M}_r t+M_r^1 h+M_r^2 t+b_r) 2 q- _* W5 V$ r# i0 yf 5 k) e4 l6 P& J8 S
r 0 ?- _6 ^% C$ J6 F. B * e7 a( k# {/ ]# c- Y2 J+ _) L, v6 V) P
(h,t)=r 8 Y" N; w7 K/ S* p$ g- i1 `T ; Z' s$ m' p& R/ S; w5 a tanh(h 6 ?; I- S5 h9 v6 T# a7 }
T1 d3 S% ?! e0 F+ Y3 F. h6 R h! R
( G- H/ _8 B$ f% `
M 1 ? t* z+ R0 u: k+ j 0 h& f3 y/ _+ @" I4 |, V 3 w' I' Z( J- e6 f Z7 R% p. T* y* ^r ' f6 p+ z& x) C0 X& A3 l9 x% ] ) O1 ~+ k. i! X6 a M K
t+M 9 T/ y8 X0 V9 p5 {8 ur* @/ h D* u! V/ W7 {
1- {: l7 V5 V* z% m/ ]
5 H5 r; r. E8 f( y& k% e
h+M - D5 P+ m! w) S5 y
r 5 @2 c6 C- j4 u2 7 L4 n6 F S) _( i6 n! B, ]: N" v : i" [3 o- Y" U* V8 a t+b / i6 o" h9 Q5 ^9 Er, q7 t; R( [9 b Z
3 w7 _% B+ M" _$ ~
)" l% |) [' K+ @7 m
通过设置所有Mr=0和br= 0,NTN退化为单层模型(SLM)。尽管NTN是迄今为止最具表达能力的模型,但是,由于它的每个关系的需要O(d2k)个参数,并且不能简单有效地处理大型的KGs。9 [. d3 C A. ^) w9 \* E& x# D
/ N7 Q- c5 T5 B c( l多层感知机(MLP): : n' e/ z, ]% x" n8 h $ Z7 S" Z' e& Z# k: j MLP是一种更简单的方法,在这种方法中,每个关系(以及实体)都是由一个向量组合而成的。如图6(c)所示,给定一个事实(h,r,t)将嵌入向量h、r和t连接在输入层中,并映射到非线性的隐藏层。然后由线性输出层生成分数,即: , c: U* A9 J6 l: i& T( X9 sfr(h,t)=wTtanh(M1h+M2r+M3t) f_r (h,t)=w^T tanh(M^1 h+M^2 r+M^3 t)4 D# e/ i I7 u; T
f ) m* w4 [9 x& mr# d- G: [; T9 A' I/ f
( B- k' k! f$ `: H: ~" [7 |! G( V (h,t)=w 9 d/ A- D4 h3 n; y- m, QT 9 g' g/ T9 j6 x tanh(M 9 j! v) K, z' N1( ] J& {. \8 t! y; ~
h+M ; `0 ? N' N" M23 @& h- G/ s8 F& U% g( ?
r+M + p+ X) X% |3 e3 ?4 Q
3, ]; k- f$ ~2 U
t)/ p+ U- |9 p" v" D) X
7 w/ h; ^1 |' Q* R( ^神经关联模型(NAM): - b7 T! C' x% J3 _9 u$ d) a ; A. Q. N) x! g o NAM使用“深度”架构进行语义匹配,给定一个事实,它首先将头实体的嵌入向量和输入层中的关系连接起来,从而给出z_0=[h,r]。然后输入z_0输入到一个由L个线性隐层组成的深神经网络中,即:8 L6 M1 _. d* d! S' J9 B
a((l))=M(l)z(l−1)+b(l),l=1,…,L, a^((l))=M^{(l)} z^{(l-1)}+b^{(l)},l=1,…,L,( y* F3 z- o# C* x
a \+ J) n+ q9 F* U) ~
(# [6 Q( E, l& Z/ ?! W( p. d
(l))=M 3 Q& w9 q( B) `# E5 f
(l)7 G) G& ~6 D n8 B4 s
z ' G+ x" [8 Z+ E1 o(l−1) 4 Q. o O9 i& }6 i( b8 w +b " `* Y3 C; O5 i/ o0 \. X% M
(l) A- F$ {0 [ {8 x2 J; Y6 J
,l=1,…,L, ! a) W. [6 W$ k$ o3 Kz(l)=ReLU(a(l)),l=1,…,L, z^{(l)}=ReLU(a^{(l)} ), l=1,…,L, 0 j: P/ j2 V: fz . e/ e) V% L. @2 L. G
(l) ) d3 ]' I' j$ e0 K4 D =ReLU(a 8 p5 N; t) S6 n, m
(l) 7 w& u8 S! s! e% \' p' @ ),l=1,…,L,* Y# ]6 d: j! s( \' }: j
在前馈过程之后,通过匹配最后一个隐藏层的输出和尾实体的嵌入向量来给出分数,即:) N# Z- |- y* G. ~/ Y
fr(h,t)=tTz(L) f_r (h,t)=t^T z^{(L)}/ {" _1 R ?% A& M
f 6 }; D' r8 B: S( tr 4 G( X4 f% K: h% n: I7 k 4 N1 b8 j# z/ B+ D. j, k' N (h,t)=t 0 Y {/ M; Y! r( p/ d, HT) ~& f) O" j4 m! y
z # K7 \. Y& d3 h. l(L) 6 F& R" f( ?+ O$ X# t ' Q' D; P0 B* Z e. X5 b) S8 i! _" L; s# u _7 Z: u/ D8 j
图4.5:SME、NTN、MLP和NAM的简单图解 : P2 `/ g+ L, U; x! ]% E- u% a6 B1 F4 q" H7 N3 M$ G! D( p* B
表2 语义匹配模型总结! U( K& Z4 z# O: f3 b# L
. F8 _% y4 E8 h4 {) y& d' N
% r+ e+ P0 k) [, u& O, y* G
5. 结合知识图谱特征学习的推荐系统 0 |& r" J! }) W3 f+ g q- D2 I h# \( ]
知识图谱特征学习与推荐系统相结合,往往有以下几种方式:依次训练、联合训练、交替训练。 0 B' L& {! S' ~8 k/ w% {; _ & t. \ {9 g' T" y # _4 Y8 w9 [ w3 m) b图5.1:知识图谱特征学习 - Q3 ?7 W# x3 ^4 n: V# o4 a7 w b$ _3 C5.1 依次训练& q7 D" ^: }- h! L
T, q6 Q$ k; m; A- Y6 V0 k
论文名称:DKN: Deep Knowledge-Aware Network for News Recommendation & n5 F, X" V) n/ ~ 在线新闻推荐系统旨在解决新闻信息爆炸(文章的数量对用户来说是压倒性的)和为用户制定个性化推荐。新闻推荐是高度浓缩的,充满了知识实体和常识,但是以往的模型却较少考虑新闻包含的外部知识,仅仅从语义层面(semantic level)进行表示学习,没有充分挖掘新闻文本在知识层面(knowledge level)的联系。此外,新闻具有很强的时效性,一个好的新闻推荐算法应该能随用户的兴趣的改变做出相应的变化。为解决上述问题,本文提出了DKN模型。首先使用一种融合了知识的卷积神经网络KCNN(knowledge-aware convolutional neural network),将新闻的语义表示与知识表示融合起来形成新的嵌入表示,再建立从用户的新闻点击历史到候选新闻的注意力机制,选出得分较高的新闻推荐给用户。并且在真实的线上新闻数据集上做了大量的实验,实验结果表示,DKN模型在F1-score,AUC等指标上超过了现有的基线模型。 5 ^9 _6 ]& d! V7 k( V! l DKN解决了新闻推荐中的三大挑战:(1)与协同过滤等基于身份的方法不同,DKN是一种基于内容的点击率预测深度模型,适合于时间敏感度较高的新闻。(2) 为了充分利用新闻内容中的知识实体和常识,我们在DKN中设计了一个KCNN模块,共同学习新闻的语义层和知识层表示。单词和实体的多通道和对齐使得KCNN能够结合来自异构源的信息,并保持每个单词不同嵌入的对应关系。(3) 为了模拟用户不同的历史兴趣对当前候选新闻的不同影响,DKN使用注意模块动态计算用户的聚合历史表示。 . j* i# q- w$ k5 L5 d* G: d1 u% \ / P% y6 N0 k q" L) h6 t* y# F$ y. {4 `+ T3 c
图5.2:DKN框架图 " Q, ` E! a8 V2 N) N6 q5.2 联合训练 ( u3 `6 s, K% X `3 v2 U . a, F& z6 v. J5 j" i4 ^9 \论文名称:RippleNet: Propagating User Preferences on the Knowledge Graph for Recommender Systems8 _; T9 ?4 P% D! K
为了解决协同过滤的稀疏性和冷启动问题,研究者通常利用社会网络或项目属性等辅助信息来提高推荐性能。本文将知识图作为边信息的来源。为了解决现有的基于嵌入和基于路径的知识图感知推荐方法的局限性,我们提出了一种端到端框架,它自然地将知识图结合到推荐系统中。与在水上传播的实际涟漪类似,RippleNet通过沿着知识图中的链接自动迭代地扩展用户的潜在兴趣,来刺激用户偏好在知识实体集上的传播。因此,由用户的历史点击项激活的多个“涟漪”被叠加以形成用户相对于候选项的偏好分布,该偏好分布可用于预测最终点击概率。通过在真实世界数据集上的大量实验,我们证明RippleNet在各种场景(包括电影、书籍和新闻推荐)中都能在多个最先进的基线上获得实质性的收益。8 C7 n/ J7 B2 f8 p" B
本文的贡献:据我们所知,这是将基于嵌入和基于路径的方法结合到KG感知推荐中的第一项工作。我们建议使用的RippleNet,这是一个端到端的框架,利用KG来帮助推荐系统。RippleNet通过在KG中迭代传播用户的偏好,自动发现用户的分层潜在兴趣。我们在三个真实的推荐场景上进行了实验,结果证明了RippleNet在几个最新基线上的有效性。1 u6 q" [; | m8 R+ v2 A2 Z7 P
- g, A- x3 ~- ~* K
& R& W9 Y: J; v: R( f$ J1 [图5.3:RippleNet框架图1 \# K' q; z+ K
5.3 交替训练 8 W+ K. m4 [0 \ P. | 0 h. H1 ~- g' {% B# I- ~9 b3 [9 b 在实际的推荐场景中,协同过滤往往存在稀疏性和冷启动问题,因此,研究者和工程人员通常利用辅助信息来解决这些问题,提高推荐系统的性能。本文将知识图作为辅助信息的来源。提出了一种多任务特征学习的知识图增强推荐方法MKR。MKR是一个利用知识图嵌入任务辅助推荐任务的深度端到端框架。这两个任务通过交叉和压缩单元相关联,自动共享潜在特征,学习推荐系统中项目与知识图中实体之间的高阶交互。我们证明了交叉压缩单元具有足够的多项式逼近能力,并表明MKR是推荐系统和多任务学习的几种典型方法的通用框架。通过对真实世界数据集的大量实验,我们证明MKR在电影、书籍、音乐和新闻推荐方面取得了显著的进步,超过了最新技术的基线。MKR也被证明能够保持良好的性能,即使用户项交互是稀疏的。8 Q# i0 F- D7 S+ h
本文的贡献:本文研究的问题也可以建模为跨域推荐或转移学习,因为我们更关心推荐任务的执行情况。然而,关键的观察是,虽然跨域推荐和转移学习对于目标域只有一个目标,但是它们的损失函数仍然包含测量源域中数据分布或两个域之间相似性的约束项。在我们提出的MKR中,KGE任务明确地作为约束项,为推荐系统提供正则化。我们要强调的是,本文的主要贡献是将问题精确地建模为多任务学习:我们比跨域推荐和转移学习更进一步,理论分析和实验结果表明,发现任务间的相似性不仅有助于推荐系统,而且有助于知识图嵌入。( ?0 a2 p% u; M/ {
" @3 I2 k8 |; n, I, c& L2 P# W6 m6 u/ H8 C+ ^7 E. t# t$ V
图5.4:MKR框架 , |& Q2 I2 r$ L& |6 W6. 结合知识图谱推荐系统的机遇与挑战 ' o+ |- C/ J4 A& N' y2 D # x% K2 J4 t3 R7 H6.1 基于知识图谱推荐的重点和难点 7 `4 G( E3 X j0 Z* y+ _, A' q$ `) N
(1)对用户偏好的精准建模问题。知识图谱可以融合多源异构信息,包括丰富的用户信息及用户与项目的交互信息;如何全面考虑用户与用户、用户与项目之间的联系,进一步提高推荐的 准确度,是未来的研究重点。; h; h4 \" Q2 i+ G: K( [1 B, q7 N
(2)对大数据的高效处理问题。由于数据生成速度快,而且多源数据融合过程中引入了更多的噪声和冗余,使得传统推荐算法中采用的精确计 算方式越来越难以应对,概率模型统计方法将可 能发挥更为重要的作用。 , h8 U" b: |4 F. O8 C (3)推荐系统的效用评价问题。对传统推荐系 统的评价指标主要是准确度和效率,通常采用的 方法有MAE、RMSE、关联度等。这些指标当然也可以用于基于知识图谱的推荐系统,例如文献采用了准确率和召回率来表征推荐系统的准确 度。然而,由于不同领域的推荐系统面临的实际 问题不同,相应地使用了不同的数据集,使得难以形成统一的效用评价标准。 3 l, y/ f0 w' e ` e( s# c. ] (4)如何通过深度挖掘和相关性知识发现提高推荐效果。由于知识图谱本身的特点,相对于因果关系挖掘,其更适合于相关关系挖掘。通过从知识图谱中深度挖掘项目之间、用户之间、以及 项目与用户间的深层次关系,获得更多的相关性 结果,有助于为用户进行个性化推荐,在提高推 荐结果多样性的同时保持较高的推荐准确性。 * r* S& }& I* L( b, G (5)推荐系统的可扩展性。可扩展性一直是推荐系统应用中面临的难点问题。在传统推荐系统中,随着用户与项目数量的增加,会使得计算量显著增大。目前主要的解决方法有聚类、数据集缩减、降维等。在知识图谱中,用户之间、用户 与项目之间随时随地的信息互动会产生大规模的 数据集;将这些数据集融入知识图谱后会急剧增加计算复杂度。如何将用户之间产生的数据动态、快速地融入知识图谱并提高推荐系统的可扩 展性,是未来需要解决的难点问题。3 D, T$ s' w2 |( d1 ?9 _/ d! X
(6)社交网络信息的充分利用问题。传统的推荐系统假设用户之间是独立同分布的,忽略了 用户之间的社会交互及联系。知识图谱中用户与户、用户与项目、项目与项目之间都存在一定的 联系,用户不再是单一的用户需要进一步挖掘彼 此之间的联系以发现更多的隐含信息。因此结合社交网络关系也是今后的一个研究重点。 5 J. ~% n5 B% n- \4 j# R! O* Q ' Y0 O0 ?/ B" R# ^6.2 知识图谱现有研究的局限性 ' U' l+ K/ C0 o8 @ C7 P ~* Y0 d" f* r- W5 d( F+ I9 r/ Y+ X, \
将推荐算法与知识图谱的图计算方法相结合已逐渐成为学术热点,前景广阔。然而现有方法仍有一定局限,有充分的研究空间。/ j7 L* H8 x5 Q; |- [
(1)现有模型都属于统计学习模型,即挖掘网络中的统计学信息并以此进行推断。一个困难但更有研究前景的方向是在网络中进行推理,将图推理与推荐系统相结合。 # H! y6 |: z8 q; f (2)如何设计出性能优秀且运行效率高的算法,也是潜在的研究方向。现有模型并不涉及计算引擎层面、系统层面甚至硬件层面的考量,如何将上层算法和底层架构进行联合设计和优化,是实际应用中一个亟待研究的问题。% h) E/ n1 u9 s) g6 _, h% j
(3)现有的模型网络结构都是静态的,而在真实场景中,知识图谱具有一定的时效。如何刻画这种时间演变的网络,并在推荐时充分考虑时序信息,也值得我们未来研究。1 l+ i4 ]3 N- f! x! B, L9 ~) k1 X( Z
. ~! X! S: S' D0 P. {参考文献:$ Z" ^/ o n) }! i% a0 G- b7 z
. }7 o3 }. u$ U J o% ^: m* B- \: J! A
Quan Wang, Zhendong Mao, Bin Wang, and Li Guo, 2017. Knowledge Graph Embedding: A Survey of Approaches and Applications. IEEE0 S, d' a; d1 l* g/ B
Hongwei Wang, Fuzheng Zhang, Xing Xie, andMinyiGuo. 2018. DKN: Deep Knowledge-Aware Network for News Recommendation. In Proceedings of the 2018 World Wide Web Conference on World Wide Web. International World Wide Web Conferences Steering Committee, 1835–1844. & q8 f* h! b) ~6 k6 _Hongwei Wang, Fuzheng Zhang, Jialin Wang, Miao Zhao, Wenjie Li, Xing Xie, and MinyiGuo. 2018. RippleNet: Propagating User Preferences on the Knowledge Graph for Recommender Systems. In Proceedings of the 27th ACM International Conference on Information and Knowledge Management. ACM. $ o! `& E' d. r5 }9 m1 d5 ~Hongwei Wang, Fuzheng Zhang, MiaoZ hao, Wenjie Li, XingXie, and MinyiGuo. 2019. Multi-Task Feature Learning for Knowledge Graph Enhanced Recommendation. WWW 2019, May 13–17.1 J! }& |- K% T5 m- s
CHANG Liang, ZHANG Weitao, GU Tianlong, et al. Review of recommendation systems based on knowledge graph[J]. CAAI transactions on intelligent systems, 2019, 14(2): 207–216. & J6 n! D7 Y2 b8 P* Q2 W/ Whttps://cloud.tencent.com/developer/article/1370084.& G; o# ?" t: h9 [2 G
———————————————— " t, V1 [3 E5 O4 V, E/ T版权声明:本文为CSDN博主「lisa丶」的原创文章,遵循CC 4.0 BY-SA版权协议,转载请附上原文出处链接及本声明。 . i( e* g0 ^- _4 _ I) q原文链接:https://blog.csdn.net/weixin_42341986/article/details/1057733760 P" \/ m4 G8 _( k