不废话,直接开干1/3/2
这次我们来了解下大语言模型(LLM)到RAG再到AI agent的技术演进过程,了解三者之间的关系与作用,以及如何通过引入RAG和工具调用提升模型对外界环境的感知与交互能力。
并通过手动模拟展示了AI agent的运行流程,更深刻的理解其过程。
大语言模型(LLM)的局限性
- 定义与功能
- 大语言模型提供强大的语言理解与生成能力。
- 能根据用户提问生成内容,是构建复杂AI系统的基础。
- 主要缺陷
- 对训练数据中不存在的问题,可能无法回答或一本正经的胡编乱造(幻觉)。
RAG(检索增强生成)
- RAG全称
- 索引增强搜索(Retrieval-Augmented Generation)。
- 解决思路
- 对于未知问题先进行检索(如数据库或联网搜索)。
- 将检索结果与问题一同输入大语言模型。
- 模型结合训练数据与检索内容生成回答。
- 功能特点
- 结合信息检索与生成式模型。
- 提供更准确、信息丰富、专业、更垂直的输出。
RAG的局限与智能体(Agent)
- RAG的不足
- 无法获取知识库中不存在的信息(如实时天气、IP定位等)。
- 知识库的也不是实时的,动态的。需要人去维护的,但是更多情况我们需要外部能力(如第三方SDK、自己系统提供的一些功能)
- 智能体(Agent)的定义
- 能感知环境并做出响应的程序或设备(具有思考、规划、决策、执行的能力)。
- 可以是软件程序或机器人。
- 核心能力
- 基于大语言模型进行自然语言处理。
- 利用RAG技术获取知识。
- 调用工具与外界环境交互(这一点也是与RAG的区别)。
Agent的运行机制与架构

(图片来自网络)
-
基本流程
- 用户输入问题 → 模型判断是否需要调用工具 → 生成工具参数 → 调用工具 → 返回结果 → 模型生成最终回答。
- 上述调用工具 → … →执行工具得到结果,这个过程可能多次反复进行(参考上图)
-
核心组件
- 记忆:可记录短期和长期对话内容。
- 规划:将任务拆解为多个子目标并决定什么时候使用什么工具。
- 工具:与外部环境交互的接口(能力提供)。
-
执行流程
- 若无法直接回答 → 调用工具 → 获取结果 → 再次判断是否可输出答案 → 否则继续调用工具。
-
多Agent协作
- Agent之间也可互相协作,一个Agent可作为另一个Agent的工具。
Agent架构示意图与手动模拟演示
复制一下,再看一遍

(图片来自网络)
- 架构图展示
- 中间为Agent核心,包含大语言模型。
- 周围包括记忆、规划、工具等模块。
- 手动模拟流程(为了梳理流程,仅供参考,可配合上图进行消化)
- 构建提示词(Prompt):
- 定义角色:你是阿里大模型团队开发的聊天机器人。
- 描述可用工具及其参数(如天气查询、IP定位、数学计算)。
- 规定调用工具时的输出格式(JSON格式)。方便进行解析。
- 用户提问:请查询IP地址为
113.116.189.101所在的地区。 - 大语言模型返回调用
get_ip_location函数的JSON格式。 - 手动调用工具,返回结果为“广东省广州市”。
- 将结果附加至提示词中,再次输入大语言模型。
- 最终输出正确回答:“IP地址113.116.189.101所在的地区是广东省广州市。”
- 构建提示词(Prompt):
推开窗,是别人的车马喧嚣;关上门,才是自家的月光皎洁。在属于自己的节奏里泡茶、读书、慢慢行走,力量,自会在不言中生长。 耐得寂寞蓄力气,终有一朝破土鸣。

1047

被折叠的 条评论
为什么被折叠?



