第6篇 · S2·上:预训练流程与数据工程(数据混合/质量/去重/稳定性)

一个基座模型是怎么"练"出来的?这一篇过一遍预训练五步全流程、数据混合配比、去重与质量打分、loss spike 与训练稳定性,最后算一笔"为什么单卡训不了"的显存账,为下一篇的分布式解法立靶。 S1(第 3-5 篇)讲了"模型是什么",从本篇起进入"怎么把它训练出来"。预训练是"几十上百卡跑几周"的重型工程,正是你大数据分布式经验的主场。 学完你能看懂预训练技术报告里的数据配比与稳定性章节,会算 16P 显存账,理解"数据质量 > 数据量"的工程共识。每节按 原理 -> 关键结论 -> 后端/大数据映射 走。Chinchilla 之后的共识是:数据清洗与混合策略是各家核心壁垒。


1. 预训练全流程

预训练 = 在海量文本上反复"预测下一个 token"训练模型参数。流程:

  1. 数据准备:爬取/清洗海量文本(网页/书籍/代码),去重、过滤低质、脱敏。数据质量决定模型上限,垃圾进垃圾出。规模通常 T(万亿)token 级。

  2. Tokenizer 训练:在语料上训 BPE 词表(token 详见本专栏第 4 篇)。

  3. 模型初始化:按架构(Decoder-only Transformer)随机初始化参数 P。

  4. 训练循环:每个 step 取一批 token -> 前向算 loss(预测下一个 token 的交叉熵)-> 反向算梯度

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值