3.7 改造模型:为GPT添加一个分类头(Classification Head)
引言:给“语言大师”一个“裁判”的哨子
在前面的章节中,我们已经成功地将预训练的GPT-2权重加载到了我们自己构建的模型中,并为接下来的分类任务准备好了高效的数据加载器。
现在,我们面临一个关键的“适配”问题。我们手中的GPT-2模型,本质上是一个语言模型。它的“天职”是预测下一个词,它的最终输出是一个指向整个词汇表的巨大
logits向量。然而,我们现在的任务是分类,我们需要模型输出的是对几个有限类别(在我们的垃圾邮件识别任务中,是“spam”和“ham”这两个类别)的预测概率。这就像我们有一位学识渊博的“语言大师”(预训练的GPT),但我们现在需要他来当一场球赛的“裁判”,只需要他吹出“犯规”或“没犯规”这两种判罚。直接让语言大师去做这件事,他可能会滔滔不绝地为你分析球场上的战术,而不是给出明确的判罚。
因此,我们需要对原始的GPT模型进行一次小小的“外科手术”:在它强大的语言理解躯干之上,嫁接一个专门用于分类的“决策大脑”。这个“决策大脑”,就是我们所说的分类头(Classification Head)。
本章,我们将:
- 分析如何从GPT模型的输出中,选取最合适的特征表示来代表整个输入序列。
- 学习如何定义一个简单的线性分类头。
订阅专栏 解锁全文
3411

被折叠的 条评论
为什么被折叠?



