现代大型语言模型(LLM)的演变进化树,如下图:

https://arxiv.org/pdf/2304.13712.pdf
-
基于 Transformer 模型以非灰色显示:
-
decoder-only 模型在蓝色分支,
-
encoder-only 模型在粉色分支,
-
encoder-decoder 模型在绿色分支。
-
-
模型在时间线上的垂直位置表示它们的发布日期。
-
开源模型由实心方块表示,而闭源模型由空心方块表示。
-
右下角的堆积条形图显示了各公司和机构的模型数量。
从时间轴上,我们可以看到:
2021年前,当 OpenAI 决定在 GPT 系列中采用 Decoder-Only 架构时,他们实际上是在逆流而上。在那个时代,Encoder-Decoder 架构,如在 BART 和 Transformer 模型中见到的,是技术巨头和学术界的宠儿,而 Decoder-Only 架构当时被视为一条不被主流认可的小径。
然而,正是这种冒险的选择催生了一个突破性的产品——ChatGPT。它不仅挑战了当时的技术共识,还引领了一个全新的对话生成和文本续写的潮流。ChatGPT 展现的生成连贯、流畅和相关文本的能力,彻底颠覆了业界对 Decoder-Only 架构的看法,将其从一个被边缘化的选择转变


2685

被折叠的 条评论
为什么被折叠?



