人工智能专业课 机器学习(1)——导论

本文依照《机器学习从原理到应用》(卿来云、黄庆明编著,2020 年第一版)的目录顺序整理,为期末复习系列的第一篇。相较原提纲版,本文对五个核心考点做了系统扩充:补充对比表格、直觉解释、关键公式与自测题。

〇、本章知识地图

本章回答机器学习学科的五个基础问题:

1. 学习范式如何划分?        → 监督学习 vs 无监督学习
2. 学习在数学上是什么?      → 假设空间中的搜索 + 目标函数的优化
3. 模型好坏如何权衡?        → 模型复杂度与预测误差(欠拟合/过拟合)
4. 选择模型的哲学准则?      → 奥卡姆剃刀原理
5. 如何求解最优参数?        → 常用优化技术(梯度下降家族、牛顿法家族)

五个问题层层递进:先分清"学什么",再理解"怎么表示学习问题",进而讨论"学到什么程度算好",最后落到"怎么算出来"。

一、监督学习与无监督学习的区别

可从定义与核心思想、训练数据、学习目标、常见算法、应用场景五个方面论述。

1.1 定义与核心思想

  • 监督学习(Supervised Learning):利用一组已知类别的样本调整分类器的参数,使其达到所要求性能的过程。核心思想是学习输入与输出之间的映射关系,从而对新的输入预测其对应输出。

  • 无监督学习(Unsupervised Learning):使用未标记的数据进行训练,模型自主地从数据中发现隐藏的结构、关系或规律。核心思想是探索数据的内在结构,不依赖外部标签。

1.2 训练数据的差异

监督学习无监督学习
输入样本
标签/输出值
数据来源要求需要标注,成本较高无需标注,获取容易

监督学习中模型以标签为"标准答案"校正自身;无监督学习中模型只能依靠数据自身的分布特性提取信息。

1.3 学习目标

  • 监督学习:构建一个能对新的未标记数据进行预测或分类的模型;

  • 无监督学习:从数据中推断隐藏的结构、关系或规律

1.4 常见算法

  • 监督学习:决策树、支持向量机(SVM)、朴素贝叶斯、K 最近邻(KNN)、线性回归、逻辑回归(Logistic 回归)、随机森林、梯度提升(GBDT)等;

  • 无监督学习:聚类算法(K 均值聚类、层次聚类、DBSCAN)、主成分分析(PCA)、关联规则挖掘(Apriori、FP-Growth)、异常检测算法等。

1.5 应用场景

  • 监督学习:分类任务(垃圾邮件识别、图像识别)、回归任务(房价预测、股票价格预测)等;

  • 无监督学习:聚类任务(客户细分、市场分割)、降维任务(数据可视化、特征提取)、异常检测(欺诈检测、故障预警)等。

1.6 补充:两种范式之外

考试中若要求"论述机器学习的主要范式",可补充以下两类,体现知识面:

  • 半监督学习:少量标注数据 + 大量未标注数据联合训练,适用于标注成本高的场景(如医学影像);

  • 强化学习:智能体在与环境的交互中通过奖励信号学习策略,没有静态的训练集,典型应用为棋类博弈、机器人控制。

二、假设空间与目标函数

2.1 假设空间(Hypothesis Space)

  • 定义:所有可能假设的集合,这些假设是模型对数据潜在规律的表示。模型本质上是一个从输入空间到输出空间的映射函数,因此假设空间实际上就是模型空间,即函数集合。

  • 特点:假设空间的规模可能非常大甚至无穷大,取决于输入空间与输出空间的维度以及可能的函数形式。监督学习的目标,就是从假设空间中找出一个能最好地拟合训练数据的模型。

直觉理解:假设空间界定了"模型最多能表达什么"。例如用线性模型拟合具有周期性规律的数据,无论如何优化参数都无法成功——因为真实规律根本不在假设空间之内。这解释了为什么"模型选择"先于"参数优化"。

2.2 版本空间(Version Space)

版本空间是假设空间的一个子集,包含所有能够正确分类训练样本的假设。随着训练数据的增加,不满足新样本的假设被逐个排除,版本空间逐渐收缩;但即便如此,其中仍可能包含大量假设。

考试常考点:版本空间中剩余多个假设时,必须引入归纳偏好(Inductive Bias)才能在它们之间做出选择——这是"没有免费的午餐"定理(No Free Lunch Theorem)讨论的内容,其含义是:脱离具体问题,不存在普适最优的学习算法。

2.3 目标函数(Objective Function)

  • 定义:衡量模型好坏的函数,是模型参数的函数。机器学习的目标就是找到一组参数,使目标函数达到最优。

  • 组成:目标函数通常包括两部分:

  • 经验损失(Empirical Loss):衡量模型在训练数据上的表现,如均方误差、交叉熵;

  • 结构损失(Structural Loss,即正则化项):惩罚模型复杂度,防止过拟合,常见形式为 L1 范数(促进稀疏)与 L2 范数(抑制过大的参数值)。

记忆要点:经验损失回答"学得像不像",结构损失回答"复杂不复杂",二者之和回答了"好不好"。

三、模型复杂度与预测误差的关系

3.1 总体规律

模型复杂度由低到高变化时,预测误差呈现先降后升的趋势:

  • 训练误差随复杂度增加单调下降

  • 测试(泛化)误差先降后升,最低点即最优复杂度。

3.2 欠拟合(Underfitting)

  • 定义:模型在训练数据上表现不佳,未能学习训练数据中的内在模式或规律。

  • 原因

    1. 模型复杂性不足,无法捕获数据中的复杂结构或非线性关系;
    2. 特征选择不当,未选到足够有效或相关的特征;
    3. 训练数据量过少,模型无法学习到足够的模式。
  • 解决方法

    1. 增加模型复杂性:使用更多参数、更复杂的模型结构或非线性模型;
    2. 添加更多与预测目标相关的特征;
    3. 收集更多训练数据,或使用数据增强技术。

3.3 过拟合(Overfitting)

  • 定义:模型在训练数据上表现很好,但在测试数据上表现较差。模型过度学习了训练数据的细节与噪声,导致泛化能力下降。

  • 原因

    1. 模型参数过多、结构过于复杂,记住了训练数据的噪声和细节;
    2. 相对于模型复杂性,训练数据量太少;
    3. 训练过程中过度优化。
  • 解决方法

    1. 减少模型参数,使用更简单的模型结构;
    2. 添加正则化项以惩罚模型复杂度(呼应 2.3 节的结构损失);
    3. 收集更多训练数据或使用数据增强。

3.4 补充:偏差—方差权衡(Bias–Variance Tradeoff)

泛化误差可分解为三部分,这是理解欠拟合与过拟合的统一框架:

  • 偏差(Bias):模型预测的平均值与真实值之间的差距,反映模型的拟合能力。偏差大 → 欠拟合

  • 方差(Variance):训练集变动时模型预测的波动程度,反映模型对数据的敏感程度。方差大 → 过拟合

  • 噪声(Noise):数据本身的不可约误差,任何模型都无法消除。

降低偏差通常需要更复杂的模型,而这又会增大方差,二者不可兼得,故称"权衡"。答题时给出此公式并解释三项含义,属于高分答案。

上图为偏差—方差的经典靶心示意:黑点为靶心(真实值),红点为同一模型在不同抽样数据集上的预测落点。左上的"低偏差、低方差"是理想状态;右上的预测围绕靶心但散布大,对应过拟合;左下的预测集中但整体偏离靶心,对应欠拟合。

3.5 补充:过拟合的常用对策清单

除上述三点外,实际中还有三类常用手段:

  • 交叉验证(Cross-Validation):将数据划分为 k 折轮流训练与验证,更可靠地估计泛化性能;

  • 早停(Early Stopping):监控验证集误差,在其开始上升时终止训练;

  • Dropout(神经网络):训练时随机屏蔽部分神经元,降低节点间的共适应关系。

四、奥卡姆剃刀原理

奥卡姆剃刀原理由 14 世纪逻辑学家奥卡姆的威廉提出,核心思想为"如无必要,勿增实体"(Entities should not be multiplied unnecessarily)。

在机器学习中,它是一条基本准则,可解释为:在实现目标函数最优时,既要要求模型与训练数据拟合得好,又要要求模型尽可能简单

4.1 与其他考点的联系

  • 奥卡姆剃刀是正则化的哲学依据:结构损失项正是"简单性要求"的数学化表达;

  • 它是模型选择的指导原则:两个模型在验证集上性能相当时,选择假设更简单的那个;

  • 需要指出:简单不等于好,奥卡姆剃刀的前提是"同等拟合能力"。答题时加上此前提,表述才严谨。

五、常用的优化技术

确定了目标函数之后,需要数值方法求解最优参数。常用优化技术主要包括以下几类:

5.1 梯度下降法(Gradient Descent)

最早、最简单也最常用的优化方法。基本思想是通过迭代最小化目标函数:每次迭代计算目标函数关于参数的梯度,并沿负梯度方向更新参数。

参数更新公式:

其中 $\eta$ 为学习率,控制每步的更新幅度:过大会震荡甚至发散,过小则收敛缓慢。

扩展:梯度下降的三个变体(了解即可,常作为加分点):

变体每次更新所用数据特点
批量梯度下降(BGD)全部训练样本方向准确,但大数据下计算昂贵
随机梯度下降(SGD)单个样本快但有噪声,更新轨迹震荡
小批量梯度下降(Mini-batch)一小批样本二者的折中,实践中的默认选择

5.2 牛顿法(Newton's Method)

利用目标函数的一阶导数和二阶导数信息求解最优解。每一步迭代在当前点构建二次模型(泰勒二阶展开),求解该二次模型的极小点作为新的迭代点。

  • 优点:具有二阶收敛性,收敛速度通常远快于梯度下降;

  • 缺点:需要计算二阶导数 Hessian 矩阵及其逆矩阵,计算量大(参数维度高时不可行),且 Hessian 矩阵可能不可逆或计算不稳定。

5.3 拟牛顿法(Quasi-Newton Methods)

对牛顿法的改进:通过近似 Hessian 矩阵或其逆矩阵来简化计算,仅需一阶导数信息即可实现超线性收敛,计算量相对较小,因此实际应用比牛顿法更广泛。

  • 代表算法:BFGSL-BFGS(BFGS 的限量存储版本,适用于大规模问题)。sklearn 中逻辑回归的默认求解器 lbfgs 即来源于此——这是一个可以在答题时引用的实例。

5.4 共轭梯度法(Conjugate Gradient)

适用于求解大规模线性方程组和某些非线性优化问题的迭代方法。通过构建一系列共轭方向搜索最优解,各搜索方向互不干扰,从而更快收敛。对二次函数优化问题特别有效,计算量相对较小。

5.5 四类方法对比(建议记表)

方法所需信息收敛速度单次迭代成本适用场景
梯度下降一阶导数线性收敛通用,大规模问题首选
牛顿法一阶 + 二阶导数二阶收敛高(Hessian 求逆)小规模、强凸问题
拟牛顿法一阶导数(近似二阶)超线性中等规模问题
共轭梯度一阶导数超线性(二次问题)大规模二次问题

附:代码实践(动手 10 分钟)

用多项式回归直观验证第 3.1 节的复杂度—误差曲线:同一批数据上分别拟合 1 阶、3 阶、15 阶多项式,观察训练集与测试集得分的分化。

import numpy as np
from sklearn.pipeline import make_pipeline
from sklearn.preprocessing import PolynomialFeatures
from sklearn.linear_model import LinearRegression
from sklearn.model_selection import train_test_split

rng = np.random.RandomState(0)
X = np.sort(rng.rand(60, 1) * 5, axis=0)
y = np.sin(X).ravel() + rng.normal(0, 0.2, 60)   # 正弦规律 + 噪声

X_train, X_test, y_train, y_test = train_test_split(X, y, random_state=0)

for degree in [1, 3, 15]:
    model = make_pipeline(PolynomialFeatures(degree), LinearRegression())
    model.fit(X_train, y_train)
    print(f"degree={degree:>2}  训练R2={model.score(X_train, y_train):.3f}  "
          f"测试R2={model.score(X_test, y_test):.3f}")

预期现象(与 3.1 节曲线一一对应):

  • degree=1:训练、测试得分都低 → 欠拟合(偏差大);
  • degree=3:测试得分最高 → 接近最优复杂度
  • degree=15:训练得分接近 1,测试得分骤降 → 过拟合(方差大)。

六、本章自测题

  1. 从五个方面论述监督学习与无监督学习的区别。(答案见第一节)
  2. 什么是假设空间?什么是版本空间?二者有何关系?
  3. 目标函数由哪两部分组成?各自的作用是什么?
  4. 画图说明模型复杂度与训练误差、测试误差的关系,并标注欠拟合区与过拟合区。
  5. 用偏差—方差分解解释欠拟合与过拟合。
  6. 奥卡姆剃刀原理在机器学习中的含义是什么?它与正则化有何联系?
  7. 比较梯度下降法与牛顿法的优缺点,说明拟牛顿法的改进思路。
  8. 为什么说"脱离具体问题,不存在普适最优的学习算法"?(提示:NFL 定理与归纳偏好)

七、复习建议

  1. 五个考点中,一、三、五为高频考点,务必达到能默写对比表的程度;二、四以理解为主,答题时重在与正则化、模型选择建立联系;
  2. 涉及"关系""区别"类题目,优先用表格组织答案,条理清晰且不易遗漏采分点;
  3. 公式只需记住两个:目标函数 = 经验损失 + 结构损失;泛化误差 = 偏差² + 方差 + 噪声。理解含义比背推导过程更重要。
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值