ml-basics · 9·首发 2026-07-10 ·最后更新 2026-07-10

机器学习基础

概念、分类、建模流程、经典算法与训练问题。

机器学习概念介绍

ml-basics·01

机器学习(Machine Learning, ML)是人工智能的一个分支,它使计算机能够从数据中自动学习规律,并利用这些规律对未知数据进行预测或决策,而无需被显式地编程。

入门监督学习无监督学习

机器学习的分类

ml-basics·02

机器学习可以从多个维度进行分类。最经典的划分方式是按学习方式分为监督学习、无监督学习、半监督学习和强化学习;此外还可以按任务类型、模型形式、学习策略等进行划分。

监督学习无监督学习半监督学习

机器学习建模流程

ml-basics·03

一个完整的机器学习项目并不是"选个模型 → 训练 → 完事",而是一条贯穿业务、数据、模型、工程、运营的闭环流水线。工业界普遍遵循的流程可以归纳为下面 10 个阶段。

建模流程数据预处理模型评估

机器学习中的数据集与矩阵表示

ml-basics·04

一个典型的机器学习数据集(Dataset)由若干样本(Sample)组成,每个样本包含若干特征(Feature),在监督学习中还会带有对应的标签(Label)。

数据集特征工程矩阵表示

独立同分布(IID)及其在深度学习中的应用

ml-basics·05

独立同分布(Independent and Identically Distributed,简称 i.i.d. 或 IID)是概率论与统计学中的一个基本假设。当一组随机变量 $

IID独立同分布统计基础

欠拟合与过拟合

ml-basics·06

在机器学习中,模型在训练数据上的表现与在新数据(测试集或真实场景)上的表现之间存在一种权衡关系。理解这一权衡的核心就是欠拟合(Underfitting)与过拟合(Overfitting)

过拟合欠拟合正则化

交叉熵损失(Cross-Entropy Loss)

ml-basics·07

交叉熵源自信息论,衡量两个概率分布之间的差异。给定真实分布 $p$ 和预测分布 $q$,交叉熵定义为:

交叉熵损失函数信息论

KNN 算法原理

ml-basics·08

K 近邻算法(K-Nearest Neighbors, KNN) 是一种最经典、最直观的监督学习算法,既可用于分类,也可用于回归。

KNN分类距离度量

模型蒸馏(Knowledge Distillation)

ml-basics·09

深度学习模型的效果与规模高度相关——参数量越大,通常性能越强。然而大模型在实际部署时面临一系列问题:

模型蒸馏知识蒸馏模型压缩