引子
2024 到 2026 年,AI 领域的术语像雨后春笋般涌来。Token、Prompt、RAG、MCP、Agent、Harness、Loop……每一个词单独拿出来都能写十篇文章,但它们真正的力量,在于彼此之间的递进与咬合。
我试图用一条线把它们串起来。这条线的逻辑是:从一粒原子,到一次对话,到一座能自我运转的城市。
一、Token:一切的原子
大语言模型不"认识"文字。它认识的是 Token——一个介于字母与单词之间的奇怪单位。
"你好世界"在中文模型里可能被切成 ["你", "好", "世", "界"],而 “unbelievable” 在英文模型里是 ["un", "believ", "able"]。Token 是模型的最小感知粒度,是概率分布的基本坐标。
理解 Token 意味着理解一个残酷的事实:模型的"思考"本质上是在一个有限词表上做下一个 Token 的概率预测。 没有理解,只有统计。没有灵魂,只有条件概率。
但正是这种"笨拙"的逐 Token 预测,涌现出了令人震惊的语言能力。这是整个大厦的地基。
二、Prompt:人类伸向概率云的那只手
Token 是模型的原子,而 Prompt 是人类与模型交互的唯一界面。
你写下的每一个字、每一段指令、每一个"请你扮演……",都会被切成 Token 序列,喂入模型,成为条件概率的"条件"部分。Prompt 本质上是在说:
“在无穷可能的下一个 Token 分布中,请你把概率质量集中到我想要的方向。”
Prompt Engineering 的全部技巧——角色设定、Few-shot 示例、思维链(Chain-of-Thought)、结构化输出约束——都是在雕刻概率分布的形状。
但 Prompt 有一个根本局限:它只能携带模型训练时已经"见过"的知识,以及你在上下文窗口里塞进去的有限文本。 一旦你问"我们公司上周的销售额是多少",再精妙的 Prompt 也救不了你。
模型需要"外挂"。
三、RAG:给模型装上图书馆
RAG(Retrieval-Augmented Generation) 的核心思想极其朴素:
在生成回答之前,先去外部知识库里检索相关文档片段,把它们塞进 Prompt 的上下文里,再让模型基于这些"临时教材"生成答案。
流程是:用户提问 → Embedding 向量化 → 在向量数据库中做相似度检索 → 取回 Top-K 文档块 → 拼接进 Prompt → 模型生成。
RAG 解决了两个痛点:知识时效性(模型训练有截止日期)和领域专属性(你的私有数据不在训练集里)。
但 RAG 也暴露了新的问题:检索到的只是"文本片段"。如果模型需要的不是"读一段文档",而是"调用一个 API"“查一次数据库”"发一封邮件"呢?
我们需要一个更通用的"连接协议"。
四、MCP:AI 世界的 USB 接口
2024 年底,Anthropic 提出了 MCP(Model Context Protocol)。它的野心很大:
定义一套标准协议,让任何 AI 模型都能以统一方式连接任何外部工具、数据源和服务。
你可以把 MCP 理解为 AI 世界的 USB-C。在 MCP 之前,每个模型要连 GitHub 得写一套适配,连 Slack 又得写一套,连数据库再写一套——M×N 的组合爆炸。MCP 之后,工具方实现一个 MCP Server,模型方实现一个 MCP Client,中间用标准 JSON-RPC 通信,即插即用。
MCP 把 RAG 从"只能检索文本"扩展为"可以调用任意能力"。它让模型从"读书的学者"变成了"能操作电脑的实习生"。
但一个"能操作电脑的实习生"和一个"能独立完成项目的工程师"之间,还差一个关键的东西:自主性。
五、Agent:从"回答"到"做事"
Agent(智能体) 是当前最热的词,也是最容易被滥用的词。
一个真正的 Agent 不只是"能调用工具"。它的核心特征是:
- 目标驱动:给定一个高层目标(“帮我调研竞品并写一份报告”),而非单步指令。
- 自主规划:自己拆解任务、决定先做什么后做什么。
- 工具使用:通过 MCP 或 Function Calling 与外部世界交互。
- 记忆与反思:能记住中间状态,能从失败中调整策略。
如果说 Prompt 是"你问我答",RAG 是"你问我查了再答",MCP 是"你问我用工具查了再答",那么 Agent 是:
“你给我一个目标,我自己决定问谁、查什么、用什么工具、做几步、怎么验证,直到完成。”
Agent 把 AI 从函数(输入→输出)变成了过程(目标→规划→执行→反馈→……→完成)。
但一个 Agent 不能凭空运行。它需要一个"身体"。
六、Harness:Agent 的肉身与操作系统
Harness(直译"挽具/框架")是承载 Agent 运行的基础设施。它回答的问题是:
Agent 的"灵魂"(LLM + 规划逻辑)跑在什么"身体"里?谁管理它的生命周期?谁给它分配工具权限?谁监控它的资源消耗?谁在它失控时拉下紧急制动?
一个典型的 Agent Harness 包括:
- 运行时环境:沙箱、容器、权限隔离
- 工具注册表:Agent 可以调用哪些 MCP Server / API
- 状态管理:对话历史、中间变量、长期记忆
- 安全护栏:最大步数限制、敏感操作确认、输出过滤
- 可观测性:日志、Trace、Token 消耗统计
你可以把 Harness 想象成 Agent 的操作系统 + 身体 + 法律体系。没有 Harness,Agent 只是一个在 Jupyter Notebook 里裸跑的 while 循环,脆弱且危险。
而 Harness 中最核心的运行机制,就是 Loop。
七、Loop:Agent 的心跳
Loop(循环) 是 Agent 的执行引擎。最经典的形态是 ReAct Loop(Reason + Act):
while 目标未完成:
1. Observe → 观察当前状态(用户输入 / 工具返回 / 环境反馈)
2. Think → LLM 推理:下一步该做什么?
3. Act → 调用工具 / 生成回复 / 修改计划
4. Reflect → 结果是否符合预期?是否需要调整?
每一次循环迭代,就是一次"心跳"。Agent 的"智能"不在某一次推理中,而在循环的收敛性中——它能否在有限步数内,从混乱走向目标。
Loop 也解释了为什么 Token 消耗在 Agent 时代会爆炸式增长:每一次循环迭代都要把完整上下文重新喂给模型,10 步循环可能消耗单次对话 10 倍的 Token。这就是为什么 Token 经济学(定价、窗口长度、缓存策略)在 Agent 时代变得如此关键。
八、全景:一粒沙如何建成一座城
让我们退后一步,看完整的图景:
Token ← 原子:模型的最小感知单位
↓ 组成
Prompt ← 界面:人类雕刻概率分布的手段
↓ 增强
RAG ← 知识:让 Prompt 携带外部信息
↓ 泛化
MCP ← 协议:标准化一切外部连接
↓ 驱动
Agent ← 主体:自主规划与执行的智能体
↓ 承载于
Harness ← 基础设施:运行时、权限、安全、可观测
↓ 核心机制
Loop ← 心跳:观察→思考→行动→反思的迭代循环
从 Token 到 Loop,是从静态到动态、从单次到迭代、从被动响应到主动执行的完整跃迁。
尾声:一个隐喻
如果把 AI 系统比作一座城市:
- Token 是砖块。
- Prompt 是市民对城市说的话(“我需要一条路”)。
- RAG 是市政档案馆,提供历史图纸。
- MCP 是统一的市政接口标准(水电煤网都走同一套管道协议)。
- Agent 是城市规划师,接到目标后自主设计、施工、验收。
- Harness 是城市的法律、电网、交通系统——让规划师能工作但不至于拆掉整座城市。
- Loop 是规划师每天的工作节奏:勘察→设计→施工→验收→返工→再验收……直到竣工。
我们正处在从"建几栋房子"(单次对话)到"建一座自运转的城市"(多 Agent 系统)的过渡期。每一个概念都不是孤立的技术时尚,而是这座城市的必要构件。
理解它们的递进关系,比记住任何一个单独的定义,都重要得多。

674

被折叠的 条评论
为什么被折叠?



