机器学习模型评估与分类器评测指南
在机器学习中,对模型进行准确评估以及对分类器进行有效评测是至关重要的环节。下面将详细介绍相关的方法和技术。
1. 模型评估与训练数据比例的关系
在测试误差方面,我们发现使用不同比例的训练数据会对测试性能产生显著影响。具体情况如下:
- 当使用约 30% 的数据进行训练时,测试性能很差,准确率仅略高于 30%。
- 将训练数据比例提高到 40 - 50% 时,测试性能提升至 70%,这是一个显著的进步。
- 当训练数据比例从 70% 增加到 100% 时,测试性能开始趋于平稳,准确率接近 90% 以上。
而在训练性能方面,当训练数据较少时,5 - NN 算法能够捕捉到简单的模式,从而完美拟合训练数据。但当训练数据比例达到约 60% 后,训练性能会略有下降。不过,我们更关注的是测试性能。
此外,我们可以将这些百分比转化为所需的最小训练示例数量。例如,为了获得合理的 5 - CV 测试结果,我们几乎需要 100% 的合并训练折叠,这相当于需要 80% 的完整数据集进行训练。如果训练数据不足,我们可以考虑减少 CV 分割次数,以增加训练数据量。
2. 复杂度曲线
在讨论欠拟合和过拟合时,我们绘制了一个图表,展示了随着模型复杂度的变化,训练和测试性能的变化情况。为了简化这个过程,我们可以使用 tsplot 函数,以下是实现代码:
import numpy as np
import seaborn as sns
from sklearn import neighbors, datase
超级会员免费看
订阅专栏 解锁全文

415

被折叠的 条评论
为什么被折叠?



