ml-basics · 9 篇 ·首发 2026-07-10 ·最后更新 2026-07-10
概念、分类、建模流程、经典算法与训练问题。
机器学习(Machine Learning, ML)是人工智能的一个分支,它使计算机能够从数据中自动学习规律,并利用这些规律对未知数据进行预测或决策,而无需被显式地编程。
机器学习可以从多个维度进行分类。最经典的划分方式是按学习方式分为监督学习、无监督学习、半监督学习和强化学习;此外还可以按任务类型、模型形式、学习策略等进行划分。
一个完整的机器学习项目并不是"选个模型 → 训练 → 完事",而是一条贯穿业务、数据、模型、工程、运营的闭环流水线。工业界普遍遵循的流程可以归纳为下面 10 个阶段。
一个典型的机器学习数据集(Dataset)由若干样本(Sample)组成,每个样本包含若干特征(Feature),在监督学习中还会带有对应的标签(Label)。
独立同分布(Independent and Identically Distributed,简称 i.i.d. 或 IID)是概率论与统计学中的一个基本假设。当一组随机变量 $
在机器学习中,模型在训练数据上的表现与在新数据(测试集或真实场景)上的表现之间存在一种权衡关系。理解这一权衡的核心就是欠拟合(Underfitting)与过拟合(Overfitting)
交叉熵源自信息论,衡量两个概率分布之间的差异。给定真实分布 $p$ 和预测分布 $q$,交叉熵定义为:
K 近邻算法(K-Nearest Neighbors, KNN) 是一种最经典、最直观的监督学习算法,既可用于分类,也可用于回归。
深度学习模型的效果与规模高度相关——参数量越大,通常性能越强。然而大模型在实际部署时面临一系列问题: