以前没有学习过AI,半路出家从零开始,边学边记边总结。
平常最熟悉的、最常用的就是 “ChatGPT” 或 “文心一言” 这类的AI工具了,先捋一下他们的发展线路,感性了解一下:
- 人工智能,简称 AI (Artificial Intelligence)
- 人工智能实现的重要手段是通过『机器学习』(Machine Learning)
- 机器学习里有一项重要的技术叫『深度学习』(Deep Learning)
- 深度学习里有一种技术叫『神经网络』(Neural Network)
- 神经网络里有一种技术架构叫『Transformer』
- 利用Transformer技术开发出了 GPT 大模型(Generative Pre-trained Transformer,生成式预训练变换器)
- 在 GPT的基础上又开发了 ChatGPT

近几年随着深度学习技术的突破和硬件算力的提高,AI大模型快速兴起。
- 大模型是指具有大规模参数和复杂计算结构的机器学习模型,这些模型通常由深度神经网络构建而成,拥有数十亿甚至数千亿个及以上的参数。
- 一个新的大模型需要先经过“训练”,然后再“使用”。也可以直接使用别人已经“预训练”好的模型,或者在其基础上进行更适合自己的“微调”后再使用。
- 大模型参数表达方式:
- “B” 代表“Billion”,即“十亿”
- GPT3 175B,即该模型有1750亿个参数
从应用领域看主要有这么几种模式:
- NLP:自然语言处理(Natural Language Processing),常采用循环神经网络(RNN)、卷积神经网络(CNN)或 Transformer 等结构来处理文本数据。
- CV:计算机视觉(Computer Vision),常采用卷积神经网络(CNN)、深度残差网络(ResNet)等结构来处理图像数据,更关注图像的视觉特征提取和分析。
- 语音:常采用循环神经网络(RNN)、卷积神经网络(CNN)或长短时记忆网络(LSTM) 等结构结合音频信号处理和自然语言处理技术,实现语音与文本的相互转换和理解。。
- 多模态:能够处理多种不同类型数据的大模型,例如文本、图像、音频等多模态数据。
大模型主要可以分为L0、L1、L2三个层级:
- 通用大模型-L0:拥有相对通用和泛化能力。一般需要大算力和海量的训练数据。
- 行业大模型-L1:针对特定行业或领域,通常使用行业相关的数据进行预训练或微调,以适应其所在行业。
- 垂直大模型-L2:针对特定任务或场景,通常使用任务相关的数据进行预训练或微调,以提高在该任务上的性能和效果。
AI的常见的应用场景:
- TAG:检索增强生成(Retrieval-augmented Generation)。它会先从一个庞大的文档集合中检索出相关的信息,然后利用这些检索到的信息来指导文本的生成,从而提高预测的质量和准确性。
- AI Agent:人工智能体,以大语言模型为驱动的平台,具备自主理解、感知、规划、记忆和使用工具的能力,能够自动化执行完成复杂任务的系统。即不仅是回答问题还能调用工具解决问题。
- AIGC:文生图片、图生视频、文生视频、写文案、写策划等。
- 工业商业:智能排产、次品检测、安全监控、流水生产、智能客服、OCR识别等。
- 其它领域:直播领域中的数字人;个人AI助手;软件开发IDE中的AI编程助手。
耳边常听说的神经网络:
ANN,Artificial Neural Network 人工神经网络,较为基础的神经网络模型,属于一个更广泛的概念,包括:
- CNN: Convolutional Neural Network 卷积神经网络,专注图像处理领域的神经网络模型
- RNN: Recurrent Neural Network 循环神经网络
- Transformer 基于自注意力机制的深度网络神经模型,用于处理序列数据
- BERT 采用了编码部分,理解能力强
- GPT 采用了解码部分,文本输出能力强
深度学习常用的框架和工具:
- 机器学习使用如 sklearn 传统算法工具包
- 深度学习常使用如 Pytorch、TensorFlow 等框架进行大模型的训练
- PyTorch:注重灵活性和易用性,适合快速原型开发和实验。运算模式是“动态框架”。
- TensorFlow:强调稳定性和高效性,适合大规模部署和生产环境。运算模式是“静态框架”。
- 大型语言模型(LLMs)轻量级微调工具:Lora (Low-Rank Adaptation of Large Language Models)

2553

被折叠的 条评论
为什么被折叠?



