一个基座模型是怎么"练"出来的?这一篇过一遍预训练五步全流程、数据混合配比、去重与质量打分、loss spike 与训练稳定性,最后算一笔"为什么单卡训不了"的显存账,为下一篇的分布式解法立靶。 S1(第 3-5 篇)讲了"模型是什么",从本篇起进入"怎么把它训练出来"。预训练是"几十上百卡跑几周"的重型工程,正是你大数据分布式经验的主场。 学完你能看懂预训练技术报告里的数据配比与稳定性章节,会算 16P 显存账,理解"数据质量 > 数据量"的工程共识。每节按 原理 -> 关键结论 -> 后端/大数据映射 走。Chinchilla 之后的共识是:数据清洗与混合策略是各家核心壁垒。
1. 预训练全流程
预训练 = 在海量文本上反复"预测下一个 token"训练模型参数。流程:
-
数据准备:爬取/清洗海量文本(网页/书籍/代码),去重、过滤低质、脱敏。数据质量决定模型上限,垃圾进垃圾出。规模通常 T(万亿)token 级。
-
Tokenizer 训练:在语料上训 BPE 词表(token 详见本专栏第 4 篇)。
-
模型初始化:按架构(Decoder-only Transformer)随机初始化参数 P。
-
训练循环:每个 step 取一批 token -> 前向算 loss(预测下一个 token 的交叉熵)-> 反向算梯度
订阅专栏 解锁全文
&spm=1001.2101.3001.5002&articleId=163821413&d=1&t=3&u=c74960c32088494aa716c03dbced9de1)
1253

被折叠的 条评论
为什么被折叠?



