前面章节把样本和特征备齐了。这一章是整套课的核心——从数据里挖出能上线的策略规则。
先回答一个问题:凭经验拍脑袋定规则不行吗?行,但有三个短板:不可解释(讲不清为什么)、漏非线性(人脑难发现变量交叉)、难比对(没法科学评估好坏)。决策树正好补这三块。
决策树的原理是递归分裂:从全量样本开始,每次选"最能把好坏分开"的特征和切点,把样本一分为二,再对每边继续分,直到满足停止条件(如最大深度、最小叶子数)。每次分裂都对应一条"如果…则…"的规则,天然可解释。
为什么它适合策略岗?
- 可解释:每一条分裂都能讲给业务听,不像黑箱模型;
- 自动:从数据里找非线性切割点,人不用猜;
- 可比对:挖出来的树规则和专家规则做 Champion/Challenger(冠军挑战者)对比,谁好用谁。
提醒:树只在"被接受且有 Y"的样本上训,拒绝样本没 Y。直接拿来预测会有乐观偏差,务必配合前面讲的拒绝推断。下篇讲怎么把一棵树变成一张准入决策表。

473

被折叠的 条评论
为什么被折叠?



