更新于 2026年7月21日

分类#


术语解释#

在机器学习中,分类(Classification)属于监督学习(Supervised Learning),其核心目标是通过学习已有标签的训练数据,构建模型以预测新数据的类别标签(离散值),例如垃圾邮件识别、疾病诊断或图像分类。

二分类数据集可视化
二分类数据集可视化

模型通过学习输入特征与输出类别之间的映射关系,在特征空间中寻找一个决策边界(Decision Boundary),从而将不同类别的样本分隔开 。

二分类决策边界图
二分类决策边界图

在分类任务中,常见类型有:

  • 二分类(Binary Classification):最简单的形式,判断样本属于两个类别中的哪一个(如:是否为垃圾邮件、是否患病)。

  • 多分类(Multi-class Classification):类别数大于2的情况。常用策略包括 One-vs-all (OvR),即每次将一个类和剩余类看作二分类任务进行训练

    One-vs-all思想
    One-vs-all思想
  • 多标签分类(Multi-label Classification):一个样本可以同时属于多个不同的类别 。


出现动机#

分类算法的出现完全是为了解决一种全新的问题:

  • 解决线性回归的局限性:线性回归预测的是任意实数,无法有效处理离散类别。即使强行使用线性回归,其预测值也无法准确区分决策边界两边的样本。

  • 自动化决策需求:为了处理如图像识别、癌细胞诊断、垃圾邮件过滤等具有明确判定标准但逻辑复杂的现实问题 。


相关术语#

  • 分类

  • 回归

  • 聚类

阅读 --

3.6 Softmax回归简洁实现

在本节内容中,我们首先介绍了什么是随机梯度下降和小批量梯度下降,并顺利的引出了PyTorch框架中DataLoader模块;然后介绍了PyTorch中用于计算分类任务模型损失的nn.CrossEntropyLoss()模块及其使用示例;

3.7 从零实现分类模型

在本节内容中,我们首先通过一个3层的神经网络来回顾和梳理了分类模型前向传播的详细计算过程;然后根据3.3节中介绍的内容导出了模型在反向传播过程中权重参数的梯度计算公式;

3.1 模型的建立与求解

在本节中,我们首先通过一个例子引入了什么是分类,然后介绍了为什么不能用线性回归模型进行建模的原因。其次,通过对线性回归的改进得到逻辑回归模型,并直接地给出了逻辑回归模型的目标函数。最后通过开源的sklearn框架搭建了一个简单的逻辑回归模型 …