一、Transformer
目前,Transformer不仅统一了自然语言处理诸多领域,在2020年底出现Vision Transformer(ViT)之后,更被研究人员发现其在图像处理领域的强大能力,卷积神经网络的地位也在被它蚕食。

同时,Transformer可以并行训练,相比于循环神经网络其训练时间更短。近年来,逐渐崭露头角的多模态模型也基本采用了Transformer架构。
这种Transformer从自然语言处理领域开始,逐步统一越来越多领域的趋势,到目前已大获成功,且其向更多领域拓展的势头还会越来越猛。
对于Transfommer,在整个架构中完全没有使用卷积神经网络和循环神经网络,最重要的一点就是自注意力机制(Self-Attention)的使用。

从2017年6月谷歌提出Transformer的论文Attention is All You Need的题目中,也可以看到注意力的重要性。
而自注意力的思想也非常符合人类的直觉,对于一个很长的句子,当我们考虑每一个词时,不仅仅会关注这个词本身,也会考虑这个词和其他词的关系,自注意力机制就是考虑当前词和句子甚至文章中每个词的相关性大小,进而理解这个词的真正含义。
可以这么说,Transformmer的诞生,是利用人工智能技术来生成内睿即AIGC ( Artifcial Intelligence Genrated Content, AIGC )的基石。

如图3-8所示,Transformer大体可以分为左、右两个部分,其中左边类似于编码器,右边类似于解码器。输入数据经过编码器之后被转换成其他形式,再经过解码器之后,输出的就是模型的最终结果。
二、大型语言模型
在回答这个问题之前,首先需要知道什么是语言模型。
简而言之,语言模型就是为了预测一句话整体是否合乎情理,或者预测下一个出现的是什么词语。

例如,当我们已知前文是“今天下雨了,出门前最好带X”的时候,预测下一个词语“X”就会用到语言模型,语言模型会计算每个词放在句子最后的整体概率,从而选出最大概率的一个词(这里概率最大的“X”是“雨伞”),这就是语言模型的机制。
大型语言模型(Large Language Model,LLM)就是从互联网或者其他语料库的海量数据中学习了大量知识,相比早期的模型,在模型的参数量上有了几个数量级的跃迁。
面对如此大规模的参数量,相信很多人会想到一句话,就是“量变引起质变”。的确,大型语言模型因此展现了“突现能力”,所谓突现能力,是指这些能力只存在于大模型当中,而不存在于小模型之中,比如复杂推理、知识推理和分布外鲁棒性、思维链等能力。

通常,模型的输入数据会在处理后变为遵从同一分布,大型语言模型虽然在同分布情况下的效果一般,但在非同分布情况下的泛化性能却好得多。
鲁棒性是指系统或模型在遇到输入错误/故障或者受攻击的情况下,依然能够保持稳定的能力,而分布外鲁棒性即为数据在非同分布的情况下,大型语言模型依然可以保持良好的泛化性和稳健性。
有研究表明,人脑平均包含860亿个神经元,如今大型语言模型的参数量,已经远超人脑包含的神经元数量,像GPT-3的模型参数量就已经高达1750亿,ChatGPT背后使用的GPT-3.5的改进版应该会更多,GPT-4参数量将会达到破天荒的100万亿(如图3-9)

那么,如何系统的去学习大模型LLM?
作为一名从业五年的资深大模型算法工程师,我经常会收到一些评论和私信,我是小白,学习大模型该从哪里入手呢?我自学没有方向怎么办?这个地方我不会啊。如果你也有类似的经历,一定要继续看下去!这些问题啊,也不是三言两语啊就能讲明白的。
所以我综合了大模型的所有知识点,给大家带来一套全网最全最细的大模型零基础教程。在做这套教程之前呢,我就曾放空大脑,以一个大模型小白的角度去重新解析它,采用基础知识和实战项目相结合的教学方式,历时3个月,终于完成了这样的课程,让你真正体会到什么是每一秒都在疯狂输出知识点。
由于篇幅有限,⚡️ 朋友们如果有需要全套 《2025全新制作的大模型全套资料》,扫码获取~

为什么要学习大模型?
我国在A大模型领域面临人才短缺,数量与质量均落后于发达国家。2023年,人才缺口已超百万,凸显培养不足。随着AI技术飞速发展,预计到2025年,这一缺口将急剧扩大至400万,严重制约我国AI产业的创新步伐。加强人才培养,优化教育体系,国际合作并进是破解困局、推动AI发展的关键。


👉大模型学习指南+路线汇总👈
我们这套大模型资料呢,会从基础篇、进阶篇和项目实战篇等三大方面来讲解。


👉①.基础篇👈
基础篇里面包括了Python快速入门、AI开发环境搭建及提示词工程,带你学习大模型核心原理、prompt使用技巧、Transformer架构和预训练、SFT、RLHF等一些基础概念,用最易懂的方式带你入门大模型。

👉②.进阶篇👈
接下来是进阶篇,你将掌握RAG、Agent、Langchain、大模型微调和私有化部署,学习如何构建外挂知识库并和自己的企业相结合,学习如何使用langchain框架提高开发效率和代码质量、学习如何选择合适的基座模型并进行数据集的收集预处理以及具体的模型微调等等。

👉③.实战篇👈
实战篇会手把手带着大家练习企业级的落地项目(已脱敏),比如RAG医疗问答系统、Agent智能电商客服系统、数字人项目实战、教育行业智能助教等等,从而帮助大家更好的应对大模型时代的挑战。

👉④.福利篇👈
最后呢,会给大家一个小福利,课程视频中的所有素材,有搭建AI开发环境资料包,还有学习计划表,几十上百G素材、电子书和课件等等,只要你能想到的素材,我这里几乎都有。我已经全部上传到CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

相信我,这套大模型系统教程将会是全网最齐全 最易懂的小白专用课!!

2889

被折叠的 条评论
为什么被折叠?



