这篇文章探讨了半监督学习在分类任务中的应用,特别是通过图表示法来利用标记和未标记数据。传统的机器学习方法通常仅依赖于标记数据来训练分类器,而获取标记实例往往既困难又耗时。相对而言,未标记数据更容易收集,但很少有方法能有效利用这些数据。半监督学习通过结合大量未标记数据和少量标记数据来构建更好的分类器,因此在理论和实践中都备受关注。4 i* B" M) o* R% ]7 O& ~9 T
2 G. Q x0 u9 B H: G. I
文章提出了一系列新颖的半监督学习方法,这些方法基于图的表示,其中标记和未标记实例作为图的顶点,边则编码实例之间的相似性。文章围绕以下几个关键问题展开讨论:$ G1 _3 _% q6 m4 H, ?6 W' a5 v9 f; |7 I/ c
9 H0 G; o9 M( S' H( K1 ~1. **如何使用未标记数据?** 通过标签传播的方法。: A, f' i" G' h" d+ c
2. **如何进行概率解释?** 利用高斯场和谐波函数。1 ^0 f7 c" q5 j/ E: m7 ?7 u
3. **如果可以选择标记数据,应该怎么做?** 采用主动学习的方法。/ [( V5 V3 ^( G( d
4. **如何构建良好的图?** 通过超参数学习。$ Y' n7 M: ^+ F ~; i; i1 a
5. **如何与核机器(如支持向量机)结合?** 使用图核的方法。6 p) t1 ]6 U5 m; t* ^( B
6. **如何处理复杂数据(如序列数据)?** 采用核条件随机场。2 W% U# f% G# b5 \' G
7. **如何处理可扩展性和归纳问题?** 通过谐波混合的方法。2 G. I; f8 G4 s9 x: C* P; U/ u