· 机器学习 ·阅读时长约 7 分钟

机器学习的分类

机器学习可以从多个维度进行分类。最经典的划分方式是按学习方式分为监督学习、无监督学习、半监督学习和强化学习;此外还可以按任务类型、模型形式、学习策略等进行划分。

监督学习无监督学习半监督学习强化学习

所属专题:机器学习基础 (ml-basics·02)

机器学习的分类

机器学习可以从多个维度进行分类。最经典的划分方式是按学习方式分为监督学习、无监督学习、半监督学习和强化学习;此外还可以按任务类型模型形式学习策略等进行划分。

一、按学习方式分类(最主流)

1. 监督学习(Supervised Learning)

定义:训练数据包含”输入 + 标签”,模型学习从输入到输出的映射 f: X → Y。

数据形式:{(x⁽¹⁾, y⁽¹⁾), (x⁽²⁾, y⁽²⁾), …, (x⁽ᵐ⁾, y⁽ᵐ⁾)}

两大子任务

任务输出类型例子常用算法
分类(Classification)离散标签垃圾邮件识别、图像分类、疾病诊断逻辑回归、SVM、决策树、随机森林、KNN、朴素贝叶斯、神经网络
回归(Regression)连续数值房价预测、销量预测、气温预测线性回归、岭回归、Lasso、回归树、GBDT、神经网络

优点:目标明确、精度高、可解释性相对较好 缺点:需要大量高质量标注数据,人工标注成本高

2. 无监督学习(Unsupervised Learning)

定义:训练数据只有输入 x,没有标签 y,模型自行发现数据中的结构或模式。

主要任务

任务目标例子常用算法
聚类(Clustering)将相似样本分组用户分群、图像分割K-Means、DBSCAN、层次聚类、GMM
降维(Dimensionality Reduction)压缩特征、可视化数据可视化、去噪、特征提取PCA、t-SNE、UMAP、LDA、Autoencoder
密度估计(Density Estimation)学习数据分布异常检测KDE、GMM
关联规则(Association Rule)发现频繁模式购物篮分析(啤酒-尿布)Apriori、FP-Growth

优点:不需要标签,可挖掘未知规律 缺点:效果难以量化评估,结果解释性较弱

3. 半监督学习(Semi-Supervised Learning)

定义:训练数据中少量有标签 + 大量无标签,同时利用两者训练模型。

适用场景:标注成本高但无标签数据丰富的场景(如医学影像)

常用方法

  • 自训练(Self-training)
  • 协同训练(Co-training)
  • 图半监督学习(Label Propagation)
  • 一致性正则化(如 Π-Model, Mean Teacher)
  • 伪标签(Pseudo-labeling)

4. 自监督学习(Self-Supervised Learning)

定义:从无标签数据中自动构造监督信号进行训练,是当前大模型的基石。

核心思想:设计”预训练任务(pretext task)“让模型从数据本身学习表示。

典型例子

  • NLP:BERT 的掩码语言模型(MLM)、GPT 的下一个词预测
  • CV:MAE(掩码图像建模)、SimCLR / MoCo(对比学习)、DINO
  • 多模态:CLIP(图文对比学习)

为什么重要:让大规模无标签数据(互联网文本、图像)成为可用训练资源,催生了 GPT、Claude、BERT 等大模型。

5. 强化学习(Reinforcement Learning, RL)

定义:智能体(Agent)通过与环境(Environment)交互,根据奖励信号(Reward)学习最优策略(Policy)。

核心要素

        动作 action
Agent ────────────→ Environment
   ↑                    │
   │  状态 state       │
   │  奖励 reward      │
   └────────────────────┘
  • 状态 s:环境当前情况
  • 动作 a:智能体的选择
  • 奖励 r:环境的反馈
  • 策略 π:从状态到动作的映射
  • 价值函数 V/Q:评估状态或动作的长期价值

主要方法

类别代表算法
值函数方法Q-Learning、SARSA、DQN
策略梯度方法REINFORCE、A2C、A3C
Actor-CriticDDPG、PPO、SAC
基于模型Dyna-Q、MuZero

应用:AlphaGo、机器人控制、自动驾驶、游戏 AI、RLHF(大模型对齐人类偏好)

二、按任务类型分类

任务输入 → 输出例子
分类x → 离散类别情感分析、图像分类
回归x → 连续值房价、股价预测
聚类X → 分组用户分群
降维x ∈ ℝⁿ → z ∈ ℝᵏ (k≪n)可视化、特征压缩
排序一组候选 → 排序结果搜索、推荐
生成噪声/条件 → 新样本文本生成、图像生成
序列标注序列 → 逐位置标签命名实体识别、词性标注
结构化预测x → 结构化对象句法树、图结构
异常检测x → 正常/异常欺诈检测、故障预警
强化决策状态 → 动作游戏、机器人

三、按模型形式分类

1. 参数模型 vs 非参数模型

  • 参数模型:参数数量固定(线性回归、逻辑回归、神经网络)
  • 非参数模型:参数量随数据规模增长(KNN、核方法、决策树)

2. 生成式 vs 判别式

类型建模对象例子
判别式(Discriminative)P(y|x) 直接建模决策边界逻辑回归、SVM、CRF、大多数神经网络分类器
生成式(Generative)P(x, y) 建模联合分布朴素贝叶斯、HMM、GAN、扩散模型、GPT

3. 线性 vs 非线性

  • 线性模型:线性回归、逻辑回归、线性 SVM
  • 非线性模型:核 SVM、决策树、神经网络、GBDT

4. 浅层 vs 深层

  • 浅层学习:单层或少数几层(SVM、决策树、朴素贝叶斯)
  • 深度学习:多层神经网络(CNN、RNN、Transformer、Diffusion)

四、按学习策略分类

1. 批量学习(Batch Learning)

一次性用全部数据训练,训练完成后模型固定。适合数据稳定的场景。

2. 在线学习(Online Learning)

数据逐条到来,模型持续更新。适合数据流场景(推荐、广告、金融)。

3. 迁移学习(Transfer Learning)

将在 A 任务上学到的知识迁移到 B 任务。例如:ImageNet 预训练模型微调用于医学影像分类。

4. 元学习(Meta-Learning)

“学会学习” —— 从多个任务中学习”如何快速学习新任务”。代表:MAML、Prototypical Networks。

5. 少样本 / 零样本学习

  • Few-shot Learning:每类只有极少样本(1-5 个)
  • Zero-shot Learning:训练时未见过的类别也能识别(CLIP、大语言模型的 zero-shot 能力)

6. 联邦学习(Federated Learning)

数据不出本地,多方协作训练全局模型。用于隐私敏感场景(医疗、金融)。

7. 主动学习(Active Learning)

模型主动选择”最有价值的样本”请求标注,降低标注成本。

五、按模型驱动方式分类

类型特点例子
数据驱动从数据中学习规律主流机器学习
知识驱动依赖专家规则/知识图谱传统专家系统
混合驱动数据 + 知识神经符号系统(Neuro-Symbolic AI)、RAG

六、分类关系总览图

                    机器学习

        ┌──────────────┼──────────────┬──────────────┐
        │              │              │              │
     监督学习       无监督学习     强化学习      混合范式
        │              │              │              │
   ┌────┴────┐    ┌────┴────┐         │       ┌──────┼──────┐
   │         │    │         │         │       │      │      │
  分类     回归   聚类  降维/生成   值函数/     半监督  自监督  迁移
   │         │    │         │      策略/AC       │      │      │
  ...       ...  ...       ...      ...         ...    ...    ...

七、如何选择合适的方法

场景推荐范式
有大量标注数据监督学习
只有少量标注 + 大量无标签半监督 / 自监督 + 微调
完全没有标签,想探索数据结构无监督学习
涉及决策序列、有奖励信号强化学习
目标任务数据少,相关领域数据多迁移学习
数据不能集中(隐私)联邦学习
数据持续到来在线学习
标注成本高主动学习 / 自监督

八、要点小结

  1. 监督 / 无监督 / 强化学习 是最基础的三分法,但现代 AI 中 自监督学习 已成为大模型的核心范式。
  2. 分类维度不是互斥的:一个方法可以同时是”判别式 + 参数化 + 深度 + 监督”的。
  3. 现代大模型(GPT、Claude、BERT)通常是:自监督预训练 → 监督微调(SFT)→ 强化学习对齐(RLHF) 的组合。
  4. 选择方法时,先看数据有无标签、再看任务类型、最后看规模与部署约束

评论