2.1.2 分类过程
更新于 2026年10月10日
版权声明
2.1.2 分类过程
分类过程主要包括两个步骤:模型构造(学习)和模型使用(分类)。
第一步 模型构造,即学习。
分类模型可以表示为分类规则、决策树、数学公式等,是对已经分类的数据集进行描述。
数据集被划分为训练集和测试集两个独立的数据集合,训练集数据量越大,分类会越准确。如果把数据集划分为k个子集的话,一般而言,对于大规模的数据集,用2/3k个子集作为训练集,1/3k个子集作为测试集;对于中等规模数据集,用k-1个子集作为训练集,另一个子集作为测试集;对于小规模数据集,全部作为训练集。通过训练集数据特点,得出分类规则:职称为教授或者年限大于6年的是终身教授,如图2⁃1所示。

图2⁃1 分类模型构造
第二步 模型使用,即分类。
根据第一步的分类模型,未分类对象Jeff教授应该分类为终身教授,如图2⁃2所示。(https://www.daowen.com)
分类是一种重要的大数据计算分析方法,根据重要数据类的特征向量值及其约束条件,构造分类模型(即分类器),目的是根据数据集的特点把未知类别的样本映射到给定类别中,目前广泛应用于商业大数据计算分析中。由于样本数据的类别标记是已知的,在预先知道目标数据有关类的信息的情况下,从训练样本集中提取分类规则,用于其他标号未知的对象进行类标识,因此,分类又称为有监督的学习。

图2⁃2 分类模型使用
从数学角度来说,分类问题可做如下定义:
已知集合
和
,确定映射规则
,使得任意
有且仅有一个
,使得
成立。
上述
称为类别集合,其中每一个元素就是一个类别,而
称为实例项集合(特征集合),其中每一个元素是一个待分类实例项,
称为分类器。分类算法的任务就是构造分类器
。