【人工智能】《Deep Dive into LLMs like ChatGPT 》—— Andrej Karpathy 第三阶段:强化学习(Reinforcement Learning, RL)

好的,今天直接进入强化学习(RL)阶段,一次性翻完核心部分,让你看到“思考模型”是怎么练成的。


⚙️ 第三阶段:强化学习(Reinforcement Learning, RL)

目标:让模型自己“练题”,发现人类没写过的推理技巧


✅ 动机:SFT 模型只能“模仿”,不会“超越”
  • SFT 的数据是人类手写答案 → 模型只能照抄风格
  • 人类答案不一定最适合模型的“脑回路”
  • 有些题人类写“跳步” → 模型学不来,容易算错

让模型自己试答案,只要结果对,路径随便它选。


✅ 可验证领域:数学、代码、逻辑题 → 自动判分

流程(一张图就能懂):

Prompt(题) → 模型生成 1000 条解答 → 自动批卷(对/错)
  ↓
把“对的”留下来 → 继续训练 → 下次更可能出对的路径
  • 每道题采样 100–1000 条解答
  • 脚本检查最终答案(提取 <
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

本本本添哥

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值