好的,今天直接进入强化学习(RL)阶段,一次性翻完核心部分,让你看到“思考模型”是怎么练成的。
⚙️ 第三阶段:强化学习(Reinforcement Learning, RL)
目标:让模型自己“练题”,发现人类没写过的推理技巧
✅ 动机:SFT 模型只能“模仿”,不会“超越”
- SFT 的数据是人类手写答案 → 模型只能照抄风格
- 人类答案不一定最适合模型的“脑回路”
- 有些题人类写“跳步” → 模型学不来,容易算错
让模型自己试答案,只要结果对,路径随便它选。
✅ 可验证领域:数学、代码、逻辑题 → 自动判分
流程(一张图就能懂):
Prompt(题) → 模型生成 1000 条解答 → 自动批卷(对/错)
↓
把“对的”留下来 → 继续训练 → 下次更可能出对的路径
- 每道题采样 100–1000 条解答
- 用脚本检查最终答案(提取 <
订阅专栏 解锁全文
&spm=1001.2101.3001.5002&articleId=155789436&d=1&t=3&u=d5249fd5f89b4812b0bde69d66f277ae)
3万+

被折叠的 条评论
为什么被折叠?



