6 i& A4 Q4 U+ U w8 J) i7. ESIM2 R" H) |+ E5 f' a1 i3 c
ESIM模型基于NLI任务给出了一种强有力的交互型匹配方法。其采用了BiLSTM和Tree-LSTM分别对文本序列和文本解析树进行编码,其亮点在于: 8 I5 y+ H1 W$ l# D4 V % z3 ^ L1 D: _, F, a(1)匹配层定义了cross-attention得到各token的向量表示与原token向量间的详细交互关系,即采用 [ a ˉ , a ^ , a ˉ − a ^ , a ˉ ∗ a ^ ] [\bar a, \hat a,\bar a-\hat a,\bar a* \hat a] [ ( j2 J u3 Q* W; s8 M! [0 _5 |
a7 R- `! s' m* V8 l3 f; z# q; D
ˉ ! g2 Y: S3 D# y# a6 w/ R% `! I , $ n- w2 J8 J' J5 l
a- [7 U4 Z' i: A/ I
^ . @# H% |* x* G , & N( v6 ~0 X) p2 h( Z0 k
a 6 [% \4 j' x3 n5 cˉ' ^$ q0 M6 ] g5 q* k
− # H6 Z9 N' z( l2 ?2 Wa " [9 |2 p2 K( A# G5 M^2 |" X4 P& U- m; R- P4 N
, * I3 s" ~) X) |6 E, y/ ua* I1 x4 R/ j" `# Z7 E% G
ˉ ! n7 \' |; {, _$ D& Z ∗ 8 P" R' X: t* S* X$ Q
a$ c6 z4 Q4 y9 K: l# ^- z
^ - q! Y2 r, Q! N0 h( u! B9 b& y ]作为最终文本token的向量表示,这也成为后续文本匹配模型的惯用做法。1 K' M0 q# z4 @( R3 c
* C% `9 p, m5 s0 B1 M8 T* x* a" M
(2)聚合层通过BiLSTM得到各文本token的编码,从而进一步增强了文本序列的信息传递;) ^. S/ o6 ~1 w+ _! v
) g: d8 J* z8 q(3)预测层通过拼接各文本token编码的max-pooling和mean-pooling结果,再经过MPL进行匹配预测。5 E. {8 p8 P/ n( W
) R' |- ~! e: Y
3 T$ d8 G @7 N5 ~3 r & d. g% p: B# x7 U5 y8. Bimpm) X7 l: p; f/ o$ X
Bimpm可视为对之前各类交互型文本匹配模型的一次总结。 n) x7 U" h$ [/ B. }# p) x8 |' q+ q* H: l
该模型在各层的具体做法总结如下: + b' l$ a7 l2 n* C5 ~ % q. u8 d/ F" a) s8 T; z(1)编码层采用BiLSTM得到每个token隐层的向量表示; 9 D# g& K" W$ ]& s) o" a9 _& [% O9 Q5 K! @
(2)匹配层遵循 m k = c o s i n e ( W k ∗ v 1 , W k ∗ v 2 ) m_k=cosine(W_k*v_1,W_k*v_2) m ; k6 D* A, ]. X9 Bk 4 \8 W' v) S3 W+ q' \3 W / A# ]3 E+ S# L0 F' ^) f =cosine(W 5 X* j/ V, A/ t
k: Q0 F& l) ` ]- I
( m' @9 \' |: e# H# d
∗v : r; l" A% P. T6 D1 7 g- Z6 M5 f/ t$ n; D& T6 R3 F * `. w) e: Y D" C) [7 N ,W 3 u0 r% x, J0 A/ V& N; pk % Y% A, I& z. G: V/ G) N* { 9 i4 P, w9 I& Q/ @ z2 y8 v, @. L
∗v % p6 F! ?% m3 R+ A% C: D8 R7 l
2' _4 l- T+ E, Z9 I
# f s) Z8 @. F( ?: I+ ?0 `0 x
)的方式可以得到两个文本的任意token pair之间在第k个view下的匹配关系,至于 v 1 v_1 v 9 P! \$ j$ Q" G+ @
1 & }! L9 M$ a U C/ t. g2 ^; F / h% L2 z: {6 y' n% P
和 v 2 v_2 v 5 v" d3 e8 t$ q$ [5 L Z2: y4 q* T. w, H! }7 V+ v; W v
$ B+ y9 M3 w$ G& Q2 M t& v5 y E 如何取,文章提供了4种策略:, U& i/ w3 P& @2 B& i
$ _- W4 Q0 R p8 g! W, `1 e8 k S
策略一:其中一个句子取各token隐层的向量表示,另一个句子采用隐层最后时间步处的输出; \/ J1 u1 ]& o) s% A8 `0 S
策略二:其中一个句子取各token隐层的向量表示,另一个句子采用隐层各时间步输出与之匹配后取再取Max-Pooling值;- u- Z' V, A9 w( q! C; W
策略三:其中一个句子取各token隐层的向量表示,另一个句子采用cross-attentive后得到的加权句子向量;- g3 d2 e. M$ e8 I
策略四:其中一个句子取各token隐层的向量表示,另一个句子采用cross-attentive后attention score最高处token的向量作为句子向量。% @- d- H+ c/ M) b. q0 Y: _
这四种策略的区别在于对句子向量的计算不同。 . r( E2 T- |- Q/ V9 n/ t9 d3 { $ ~4 h {6 z5 s( H6 e( u4 S p; ~9 Q0 a- O
(3)聚合层,首先对上面各种策略得到的输出层再通过一层BiLSTM层,然后将各策略下最后时间步的输出进行拼接,得到最后的聚合向量;! g" G V- z/ L, {( x
1 [8 {* n( }9 E5 A3 h6 l
(4)预测层:两层MPL+softmax / x; X4 a9 ~. j* |' d 8 @1 D3 e+ U- A7 [- T. b9. HCAN 4 z7 N3 V; i7 P! ^0 w8 X9 pHCAN是除Bert类模型外在文本匹配领域表现最为优异的深度模型之一,其采用了较为复杂的模型结构。9 L; e! F3 Y( ~5 o
5 f7 t% Y- } d: E
针对于信息抽取问题,文章首先分析了相关性匹配和语义匹配的差异:' |6 E$ B. v1 }3 P* P
. P- H% c0 u! Y: |5 P
(1)相关性匹配主要关注于关键词的对比,因此更关注低层级词法、语法结构层面的匹配性; * ~ S2 d! `$ d" S, Q 2 z% g' e F5 N7 o(2)语义匹配代表着文本的平均意义,因此其关注更高、更丑想的语义层面的匹配性。 - F; }& s# h9 L2 }# n2 A 0 W/ f. s8 |- U$ }该模型首先采用三类混合的编码器对query和context进行编码: ( j X+ o9 ?# V% u+ x ' U" U' I( ]2 R1 k& u( K J2 w( e(1)深层相同卷积核大小的CNN编码器;# P ~1 t7 R# M8 D, n8 W3 I$ ?8 e
- R* Z X; o9 t(2)不同卷积核大小的CNN编码器的并行编码; - [1 G! v- |. n. w# ~" X 1 }) D2 { k1 {- i2 r5 r8 O(3)沿着时序方向的stacked BiLSTM编码; ] V& ^; n3 Y9 T8 E2 C8 G; l$ ~. x
) l( t& |" _ Y' B" W v对于前两者,通过控制卷积核的大小可以更好的捕捉词法和句法特征,即符合相关性匹配的目的;而对于后者,其能表征更长距离的文本意义,满足语义匹配的目的。7 a E4 ~) T9 R8 x/ X$ w" {
5 p" j1 }0 K) A# A. D: U
在这三类编码器的编码结果基础上,模型分别进行了相关性匹配和语义匹配操作。其中相关性匹配主要采用各phrase间内积+max pooling/mean pooling的方式获取相关性特征,并通过IDF指进行各phrase的权重调整。而在语义匹配中,模型采用了精心设计的co-attention机制,并最终通过BiLSTM层输出结果。 + b# A/ D% Y6 }1 _9 g, e) L$ s' {' w' s) w& k( ?
最后的预测层仍采用MPL+softmax进行预测。 " F J3 ~! J8 i" z* s* y9 r/ G) ^3 B9 h
10. 小结 - f9 i7 ?5 {6 }7 V交互型语言匹配模型由于引入各种花式attention,其模型的精细度和复杂度普遍强于表示型语言模型。交互型语言匹配模型通过尽早让文本进行交互(可以发生在Embedding和/或Encoding之后)实现了词法、句法层面信息的匹配,因此其效果也普遍较表示型语言模型更好。" I. {$ M, n5 g' u+ w* C- r
7 {+ M" Y; k7 Z/ g
【Reference】! D- M6 \( X/ ^0 n6 b$ r! Q- Q; Y
4 q$ a0 X! u$ B5 a" t/ d6 R
ARC-II: Convolutional Neural Network Architectures for Matching Natural Language Sentences q! e0 @% H' p0 M7 H
& x, k' O+ C& `5 b3 c3 s7 a' Q0 jPairCNN: Learning to Rank Short Text Pairs with Convolutional Deep Neural Networks1 F* T, O6 \1 u, d4 j" Y& |
- g$ v" [4 {6 J; @: f' c" n6 U' Y9 `MatchPyramid: Text Matching as Image Recognition ) t2 `) `! P5 t! R. W" z 3 R+ T' o- T4 ~, G9 F& [; PDecAtt: A Decomposable Attention Model for Natural Language Inference ; G4 v% ]8 u: p$ H 6 r4 B2 ^2 k9 j1 UCompAgg: A Compare-Aggregate Model for Matching Text Sequences # S* `( q9 E) ~% Q" \3 H& U. M4 l& u: P9 }) u6 \( j+ h
ABCNN: ABCNN: Attention-Based Convolutional Neural Network ' y& N- L* W c' B9 afor Modeling Sentence Pairs $ L2 ^+ X" [% } ?4 ^. i: ~; y ?7 |. }9 ^' s
ESIM: Enhanced LSTM for Natural Language Inference; R- m1 p' O4 ?6 `- \
: q8 w7 t1 G4 C; t1 d) v: oBimpm: Bilateral Multi-Perspective Matching for Natural Language Sentences: r j/ x/ I) O; J1 C0 C" a7 k7 o
+ }5 T2 F% ~# k/ H; d2 E ~
HCAN: Bridging the Gap Between Relevance Matching and Semantic Matching 1 D7 Y. X/ h3 T' Zfor Short Text Similarity Modeling4 d9 i. C3 Z( t0 @4 i) K/ U" Q, M
% M4 i _9 I( N) j文本匹配相关方向打卡点总结(数据,场景,论文,开源工具) + C: U% M; O+ T" T/ q, k& [/ A! L$ k( F
谈谈文本匹配和多轮检索0 k C! A9 m0 @! d' x Y- q
: t6 W* v/ T2 c) q+ r+ H
贝壳找房【深度语义匹配模型 】原理篇一:表示型: E+ ^$ ^: Y5 n3 K9 \
———————————————— z2 D+ Z u: j! k! g
版权声明:本文为CSDN博主「guofei_fly」的原创文章,遵循CC 4.0 BY-SA版权协议,转载请附上原文出处链接及本声明。 . e O9 ^: L% G8 b原文链接:https://blog.csdn.net/guofei_fly/article/details/107501276$ Y& S5 v3 T' B8 {+ u! B