2.1.2 分类过程

更新于 2026年10月10日 版权声明
2.1.2 分类过程

分类过程主要包括两个步骤:模型构造(学习)和模型使用(分类)。

第一步 模型构造,即学习。

分类模型可以表示为分类规则、决策树、数学公式等,是对已经分类的数据集进行描述。

数据集被划分为训练集和测试集两个独立的数据集合,训练集数据量越大,分类会越准确。如果把数据集划分为k个子集的话,一般而言,对于大规模的数据集,用2/3k个子集作为训练集,1/3k个子集作为测试集;对于中等规模数据集,用k-1个子集作为训练集,另一个子集作为测试集;对于小规模数据集,全部作为训练集。通过训练集数据特点,得出分类规则:职称为教授或者年限大于6年的是终身教授,如图2⁃1所示。

图示

图2⁃1 分类模型构造

第二步 模型使用,即分类。

根据第一步的分类模型,未分类对象Jeff教授应该分类为终身教授,如图2⁃2所示。(https://www.daowen.com)

分类是一种重要的大数据计算分析方法,根据重要数据类的特征向量值及其约束条件,构造分类模型(即分类器),目的是根据数据集的特点把未知类别的样本映射到给定类别中,目前广泛应用于商业大数据计算分析中。由于样本数据的类别标记是已知的,在预先知道目标数据有关类的信息的情况下,从训练样本集中提取分类规则,用于其他标号未知的对象进行类标识,因此,分类又称为有监督的学习。

图示

图2⁃2 分类模型使用

从数学角度来说,分类问题可做如下定义:

已知集合图示和图示,确定映射规则图示,使得任意图示有且仅有一个图示,使得图示成立。

上述图示称为类别集合,其中每一个元素就是一个类别,而图示称为实例项集合(特征集合),其中每一个元素是一个待分类实例项,图示称为分类器。分类算法的任务就是构造分类器图示。

↑上一章 ↓下一章
关注公众号获取验证码
复制内容需要验证码(7.99元/天)