【人工智能】《Deep Dive into LLMs like ChatGPT 》—— Andrej Karpathy 第二部分:监督微调(SFT)

🔁 第二部分:监督微调(SFT)

目标:把“互联网文本模拟器”变成“能对话的 AI 助手”

✅ 问题:基础模型不会“回答问题”

你问:What is 2+2?
它续写:What is 2+2? The answer is debated among mathematicians...
这不是助手,是“自动补全”

✅ 解决:换数据集,继续训练
  1. 扔掉互联网文档
  2. 换成“对话” → 百万条人工写的 QA 对
    例:
    Human: 2+2 等于多少?
    Assistant: 2+2 等于 4。
    
  3. 格式化成 token 序列
    用特殊 token 区分角色:
<im_start>user\n2+2 等于多少?<im_end>
<im_start>assistant\n2+2 等于 4。<im_end>
  1. 继续“预测下一个 token”
    现在模型学到的统计规律是:“当人类问 X,助手答 Y”
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

本本本添哥

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值