标题: 【文本匹配】交互型模型 [打印本页] 作者: 杨利霞 时间: 2023-4-13 21:16 标题: 【文本匹配】交互型模型 【文本匹配】交互型模型( @3 p' x- p- ?/ G( C. X1 f
& N5 ^* J+ x' g; M/ t表示型的文本匹配模型存在两大问题:(1)对各文本抽取的仅仅是最后的语义向量,其中的信息损失难以衡量;(2)缺乏对文本pair间词法、句法信息的比较$ H# ]4 ]1 Y. F y0 c% C
# e7 i* D! G* A/ t
而交互型的文本匹配模型通过尽早在文本pair间进行信息交互,能够改善上述问题。 \7 m3 }, N# k z. J" e8 ]" _! W7 O
基于交互的匹配模型的基本结构包括:: T" z. P2 a# R' `% l2 f
s& |5 Y7 P5 {7 d(1)嵌入层,即文本细粒度的嵌入表示;! |9 {5 d* A" b- r& r6 y
! q7 `" Z j& s* K5 j
(2)编码层,在嵌入表示的基础上进一步编码;& Y9 s3 o2 O1 N7 Q- v
% s+ m1 m# ]$ ~& N5 P' B
(3)匹配层:将文本对的编码层输出进行交互、对比,得到各文本强化后的向量表征,或者直接得到统一的向量表征; 5 A+ Z& K: ?5 N. E3 w* q1 e! V: p5 C8 L: g
(4)融合层:对匹配层输出向量进一步压缩、融合; 7 H' t: `" o6 `5 R( n/ @/ [$ B) W6 }1 t+ W* X# N5 R- T. g- t
(5)预测层:基于文本对融合后的向量进行文本关系的预测。7 r2 L; `$ [; n) u$ H
+ V$ c- h s* U5 M
9 Y- q0 G& ]7 J. F& j/ d% T ! h! l- Z4 T" Y7 Y9 a/ [0 E+ U5 Y1. ARC-II ; V. w. F4 R0 t6 f( h% rARC-II模型是和表示型模型ARC-I模型在同一篇论文中提出的姊妹模型,采用pair-wise ranking loss的目标函数。" ~9 S% q0 m# l
1 V* C& V7 {7 ^4 m# @
其核心结构为匹配层的设计: ) k. S$ @; T% O) j4 ? 8 @" S1 A4 w, ~3 ?& q/ ?2 n/ m(1)对文本pair的n-gram Embedding结果进行拼接,然后利用1-D CNN得到文本S_X中任一token i和文本S_Y中任一token j的交互张量元素M_{ij}。该操作既然考虑了n-gram滑动窗口对于local信息的捕捉,也通过拼接实现了文本pair间低层级的交互。 ( T4 }. o% [& Z- Q: j4 H: i. g. F3 M
(2)对交互张量进行堆叠的global max-pooling和2D-CNN操作,从而扩大感受野。 f% b+ o: ? G3 f, F( m, N
( J( b1 U# n% t, |3 N D(1)编码层采用BiLSTM得到每个token隐层的向量表示; ! T2 S& }1 Z6 m# C; Z3 X - z. o |/ u* S9 x) `! s* N(2)匹配层遵循 m k = c o s i n e ( W k ∗ v 1 , W k ∗ v 2 ) m_k=cosine(W_k*v_1,W_k*v_2) m / ^3 @' {- |* n2 n) j; @
k 2 G) c4 o9 V6 H1 ? 6 J* W4 R- ~9 P* ]
=cosine(W a3 c8 ^1 G+ E: b F3 ^5 I7 {
k; N- u8 a4 i& A5 S6 y& L6 v
& r4 t" y" Y9 p, x4 G X
∗v - \" _+ c, v) i: C) A# f# W
1 5 }$ R5 O" i% A9 I6 s6 @9 v( h 9 g0 S7 R R; I' M0 x9 ?) A
,W ) y# o. c6 h3 l; x. [1 q6 `9 L
k ! o! b6 o/ r3 V$ z) q o: M: ~" i# Y0 Z1 X Q ∗v 0 {( ?+ O) Z" s7 g' o2 : f$ ]! n5 f" b , Y6 h( v1 X' ]" c3 j6 L/ ] )的方式可以得到两个文本的任意token pair之间在第k个view下的匹配关系,至于 v 1 v_1 v * Q2 x( e( i0 R
1 % J: Y' M; B+ O! h$ U) X5 a & f5 Q% Y0 _( q- f, ^+ v 和 v 2 v_2 v 2 R1 A: Q8 L4 {4 [% \
2 3 Z* E- `% M0 b9 L# \" D' I, Y ) @% \. S0 X* {1 ?, @# X1 K. V; k' k
如何取,文章提供了4种策略: ( v9 s2 P- a9 i. U1 x6 }; r8 D6 @- v/ R+ S! s2 a
策略一:其中一个句子取各token隐层的向量表示,另一个句子采用隐层最后时间步处的输出; $ j7 @) E; p' k% i$ l# q9 s策略二:其中一个句子取各token隐层的向量表示,另一个句子采用隐层各时间步输出与之匹配后取再取Max-Pooling值; % Q% ]( M8 } Y% J策略三:其中一个句子取各token隐层的向量表示,另一个句子采用cross-attentive后得到的加权句子向量;; ?! R9 ?/ ? m/ }( J- }
策略四:其中一个句子取各token隐层的向量表示,另一个句子采用cross-attentive后attention score最高处token的向量作为句子向量。 : U8 ~- s# t& y这四种策略的区别在于对句子向量的计算不同。/ `* y; X5 C" j8 p5 T
0 J, Z- H* u9 _+ {; r, q8 T* k5 r
: `7 u- |1 M" G; y4 W" }(3)聚合层,首先对上面各种策略得到的输出层再通过一层BiLSTM层,然后将各策略下最后时间步的输出进行拼接,得到最后的聚合向量;, U9 ]+ J/ C# [0 q2 L; S! V8 Y0 h
. O Q+ L& P2 e( d8 M* W9 P( }: t
(4)预测层:两层MPL+softmax! Y2 G/ L" q* ~" O0 \; k
! ^6 n- P3 [$ T# E" T6 O
9. HCAN z$ ~8 r4 `% G' F$ c+ b* YHCAN是除Bert类模型外在文本匹配领域表现最为优异的深度模型之一,其采用了较为复杂的模型结构。 & P3 p3 j0 T) i1 x! ~ m7 E o2 V3 W
针对于信息抽取问题,文章首先分析了相关性匹配和语义匹配的差异:& x1 V1 _8 }1 [2 C. k4 P
: {( K1 E- w% p9 r
(1)相关性匹配主要关注于关键词的对比,因此更关注低层级词法、语法结构层面的匹配性; % [# b5 s) w& a7 M1 p2 y$ ~ 5 x; \5 y& Q, U) j* b, V% z; r(2)语义匹配代表着文本的平均意义,因此其关注更高、更丑想的语义层面的匹配性。) |6 p% v1 n# B2 C4 U" I
+ Y, W' ~& ~, T" X该模型首先采用三类混合的编码器对query和context进行编码: 9 O3 Y, |& M, _2 x6 K" |; ^2 K" _/ J* l, g. g [
(1)深层相同卷积核大小的CNN编码器;' E5 U Z( m( A* K3 _: v, y
4 x% ~4 u" X$ {(2)不同卷积核大小的CNN编码器的并行编码; ; ?* T0 N4 _# b* C7 R3 t' _; I+ P6 X) ?+ d) p8 m) g
(3)沿着时序方向的stacked BiLSTM编码; 0 f# ]- ^: ]+ v : S; {1 K! n, D! u0 [) j. `2 |对于前两者,通过控制卷积核的大小可以更好的捕捉词法和句法特征,即符合相关性匹配的目的;而对于后者,其能表征更长距离的文本意义,满足语义匹配的目的。" q- Y: r! a% q6 L) J' [3 p: q3 T
( H; Y! L" S% n6 p
在这三类编码器的编码结果基础上,模型分别进行了相关性匹配和语义匹配操作。其中相关性匹配主要采用各phrase间内积+max pooling/mean pooling的方式获取相关性特征,并通过IDF指进行各phrase的权重调整。而在语义匹配中,模型采用了精心设计的co-attention机制,并最终通过BiLSTM层输出结果。 * h' `) `0 X* U. ]) g# V8 L5 |* h& S! g% N Y' b/ N& X; [
最后的预测层仍采用MPL+softmax进行预测。 6 Y. }6 N6 `% r; w. V4 h7 W! N- q! W% V2 N% U j% e
10. 小结2 j6 }6 R2 b5 D+ Y5 R: _+ h
交互型语言匹配模型由于引入各种花式attention,其模型的精细度和复杂度普遍强于表示型语言模型。交互型语言匹配模型通过尽早让文本进行交互(可以发生在Embedding和/或Encoding之后)实现了词法、句法层面信息的匹配,因此其效果也普遍较表示型语言模型更好。 @- C! o H; ~& \7 W% c
, i X) m' o& a【Reference】 6 M+ v1 |' G& B# O7 W! v+ _" a A# N 8 x- m0 F) ]& \( {. sARC-II: Convolutional Neural Network Architectures for Matching Natural Language Sentences8 W& @1 s6 I# Z
' m9 i* R) R; N0 p$ j& ZPairCNN: Learning to Rank Short Text Pairs with Convolutional Deep Neural Networks ( m. S% j) m8 B6 R& R. x $ p6 W) h. A+ x( FMatchPyramid: Text Matching as Image Recognition4 W- S1 L7 [7 |) V+ E5 Z
J: l4 [8 u D
DecAtt: A Decomposable Attention Model for Natural Language Inference% @) B$ b4 c( b2 m% _" [" M
% w4 v; W2 b7 j- x+ tCompAgg: A Compare-Aggregate Model for Matching Text Sequences ) |) Q# b& I7 A3 z5 [. a8 G/ v5 W) j1 X6 h
ABCNN: ABCNN: Attention-Based Convolutional Neural Network 2 z D* L5 S: r cfor Modeling Sentence Pairs, {% t% [- K* [% T$ G
4 J; |+ |% v" j$ b3 e. SESIM: Enhanced LSTM for Natural Language Inference ! Z' M4 H5 _7 X! X3 F1 g& Q$ c, V. _
Bimpm: Bilateral Multi-Perspective Matching for Natural Language Sentences 4 w6 \+ t S* P & f( [9 `3 n% r8 DHCAN: Bridging the Gap Between Relevance Matching and Semantic Matching 4 W/ X) p. y0 Wfor Short Text Similarity Modeling% S L* J* o3 K$ }4 f6 X8 K& g