半监督学习

二十三、半监督 学习

半监督学习(semi-supervised learning,SSL)是模式识别和机器学习领域研究的重点问题,是SL与UL相结合的一种学习方法。SSL方法使用大量未标记数据的同时,辅以少量标记数据,来进行模式识别工作。SSL的优点是在最大限度降低人工需求(主要是数据标记工作)的同时,又能够取得比较高的准确性。因此,SSL方法正越来越受到相关领域专业人员的重视。

SSL的基本思路基于以下三个假设。

(1)平滑假设(smoothness assumption):如果位于密集数据区域的两个距离很近的样本的类别标签相似时,则它们据有相同类别标签的概率非常大;相反,当两个样本被稀疏数据区域分开时,它们的类别标签相同的趋势则不会很大。

(2)聚类假设(cluster assumption):如果反映样本特征的点在同一集簇中,它们很可能属于同一类。事实上,聚类假设属于平滑假设的一种特殊状态,在平滑假设中,样本特征不一定要形成明显的集簇。假如整个样本空间都是密集且均匀的,此时就不存在聚类中所谓集簇的概念,当样本空间中形成明显的集簇时,聚类假设才具有实际意义。

(3)流形假设(manifold assumption):又叫流形学习(manifold learning),是机器学习和模式识别中的一种方法,在样本特征维数降低方面具有广泛的应用。它的主要思想是将高维度的数据映射到低维度,使该低维度的数据能够反映原高维度数据的某些本质结构特征。流形学习的前提是某些高维度数据其实是以一种低维度的流形结构嵌入在高维度空间中。流形学习的目的是将其映射回低维度空间以揭示其本质。

按照统计学习理论方法的不同,SSL通常包括纯SSL、直推学习(transductive learning)和主动学习(active learning)[1]三种模式。SSL的学习器不依赖外界交互、自动地利用未标记样本数据来提升学习性能,当预设的训练数据中的未标记样本并非待测的数据特征样本时,则为纯SSL;假定学习过程中所考虑的未标记样本恰好是待预测数据则为直推学习,其目的就是在这些未标记样本上获得最优泛化性能;主动学习是指未标记样本的数据特征通过人工专家等方法来进行查询与标注,从而使样本数据特征在获得新的标签信息之后的训练模型不断反复迭代升级,最终使得人类的经验知识越来越丰富,模型的泛化性能也越来越好。主动学习通常以问题为导向,通过以某种主动策略构建较小训练集来减少标记成本;并以某种方式对未标记样本的数据特征的重要性进行评估;本质上是一种交互式的半监督标记、训练、评估流程。因此,主动学习通过让病理学家积极参与、通过不断学习而进化的算法,为病理学中有限的数据注释问题提供了一个解决方案。