1. 从“讲故事的人”到“翻译家”:三大架构的通俗理解
如果你刚开始接触大语言模型,看到“Decoder-Only”、“Encoder-Only”这些术语,是不是感觉头都大了?别担心,我第一次看到这些词的时候,也是一头雾水。其实,我们可以把它们想象成三种不同职业的“大脑”,它们处理信息的方式完全不同,也因此擅长不同的工作。今天,我就用最接地气的例子,带你把这三种架构彻底搞明白。
咱们先来说说最火的 Decoder-Only 架构,它的代表就是大名鼎鼎的GPT系列。你可以把它想象成一个特别会讲故事的人。你给他一个开头,比如“在一个雨夜,我推开了一扇吱呀作响的木门……”,他就能顺着这个氛围,滔滔不绝地把整个悬疑故事给你编下去,情节、对话、环境描写,样样不缺。这个“讲故事的人”的核心能力是续写和创造。他不太关心你给的这句话背后有什么深意,他的全部注意力都放在“接下来最可能发生什么”上。所以,GPT这类模型天生就适合做聊天、写文章、编代码、头脑风暴这些需要“无中生有”的生成任务。你给它一个提示,它就能源源不断地输出新内容。
然后是 Encoder-Only 架构,它的典型代表是BERT。这个家伙不像讲故事的人,它更像一个严谨的文本分析师或者书评家。你丢给它一整篇冗长的产品评测,它会逐字逐句地仔细阅读、分析和理解,然后告诉你:“这篇文章的情感是积极的,核心观点是夸赞电池续航,同时提到了屏幕亮度不足的问题。” 看到了吗?它不生成任何新句子,它的全部功力都用在“理解”和“提炼”输入的内容上。所以,BERT这类模型是文本分类、情感分析、命名实体识别(比如从新闻里自动提取人名、地名)这些任务的王者。它就像一个超级阅读理解专家,只负责“输入”,不负责“输出”。
最后是 Encoder-Decoder 架构,它的代表有T5、BART。这个架构结合了前两者的特点,你可以把它看作一个专业的同声传译。翻译的过程分两步:第一步,Encoder(编码器) 像分析师一样,全神贯注地听和理解你说的英文句子;第二步,Decoder(解码器) 像讲故事的人一样,根据刚才理解的意思,用中文重新组织并说出来。所以,这个架构天生就是为“转换”任务而生的。它需要先深度理解输入(编码),再基于理解生成全新的、对应的输出(解码)。机器翻译、文本摘要(把长文缩写成短文)、问答(根据问题从文章中找答案并组织成句子)都是它的拿手好戏。
简单总结一下:Encoder-Only 擅长“读”,Decoder-Only 擅长“写”,而 Encoder-Decoder 擅长“先读后写”的转换。理解了这个核心区别,我们就能明白为什么不同的模型会采用不同的架构了——它们从设计之初,就是为了解决不同类型的问题。
2. 技术演进史:一场关于“生成”与“理解”的路线之争
了解了它们是谁,我们再来看看它们是怎么走到今天的。这段历史特别有意思,它不像一条直线,更像一场充满戏剧性的技术路线博弈。我自己回顾这段历程时,感觉就像在看一部科技行业的《权力的游戏》,各方势力在不同时期押注不同的架构,最终,一个看似“非主流”的选择逆袭成了主流。
在2020年之前,学术界和工业界的宠儿其实是 Encoder-Decoder 架构。这很好理解,因为Transformer论文(2017年)本身就是一个Encoder-Decoder框架,它一举解决了机器翻译的难题,光芒万丈。随后出现的模型,比如谷歌的T5(“Text-to-Text Transfer Transfo


1119

被折叠的 条评论
为什么被折叠?



