🔁 第二部分:监督微调(SFT)
目标:把“互联网文本模拟器”变成“能对话的 AI 助手”
✅ 问题:基础模型不会“回答问题”
你问:What is 2+2?
它续写:What is 2+2? The answer is debated among mathematicians...
这不是助手,是“自动补全”。
✅ 解决:换数据集,继续训练
- 扔掉互联网文档
- 换成“对话” → 百万条人工写的 QA 对
例:Human: 2+2 等于多少? Assistant: 2+2 等于 4。 - 格式化成 token 序列
用特殊 token 区分角色:
<im_start>user\n2+2 等于多少?<im_end>
<im_start>assistant\n2+2 等于 4。<im_end>
- 继续“预测下一个 token”
现在模型学到的统计规律是:“当人类问 X,助手答 Y”
订阅专栏 解锁全文
&spm=1001.2101.3001.5002&articleId=155789417&d=1&t=3&u=15c985028d094e67b21ca071e8f1ad21)
526

被折叠的 条评论
为什么被折叠?



