从一粒沙到一座城:AI 时代核心概念的底层叙事

引子

2024 到 2026 年,AI 领域的术语像雨后春笋般涌来。Token、Prompt、RAG、MCP、Agent、Harness、Loop……每一个词单独拿出来都能写十篇文章,但它们真正的力量,在于彼此之间的递进与咬合

我试图用一条线把它们串起来。这条线的逻辑是:从一粒原子,到一次对话,到一座能自我运转的城市。


一、Token:一切的原子

大语言模型不"认识"文字。它认识的是 Token——一个介于字母与单词之间的奇怪单位。

"你好世界"在中文模型里可能被切成 ["你", "好", "世", "界"],而 “unbelievable” 在英文模型里是 ["un", "believ", "able"]。Token 是模型的最小感知粒度,是概率分布的基本坐标。

理解 Token 意味着理解一个残酷的事实:模型的"思考"本质上是在一个有限词表上做下一个 Token 的概率预测。 没有理解,只有统计。没有灵魂,只有条件概率。

但正是这种"笨拙"的逐 Token 预测,涌现出了令人震惊的语言能力。这是整个大厦的地基。


二、Prompt:人类伸向概率云的那只手

Token 是模型的原子,而 Prompt 是人类与模型交互的唯一界面。

你写下的每一个字、每一段指令、每一个"请你扮演……",都会被切成 Token 序列,喂入模型,成为条件概率的"条件"部分。Prompt 本质上是在说:

“在无穷可能的下一个 Token 分布中,请你把概率质量集中到我想要的方向。”

Prompt Engineering 的全部技巧——角色设定、Few-shot 示例、思维链(Chain-of-Thought)、结构化输出约束——都是在雕刻概率分布的形状

但 Prompt 有一个根本局限:它只能携带模型训练时已经"见过"的知识,以及你在上下文窗口里塞进去的有限文本。 一旦你问"我们公司上周的销售额是多少",再精妙的 Prompt 也救不了你。

模型需要"外挂"。


三、RAG:给模型装上图书馆

RAG(Retrieval-Augmented Generation) 的核心思想极其朴素:

在生成回答之前,先去外部知识库里检索相关文档片段,把它们塞进 Prompt 的上下文里,再让模型基于这些"临时教材"生成答案。

流程是:用户提问 → Embedding 向量化 → 在向量数据库中做相似度检索 → 取回 Top-K 文档块 → 拼接进 Prompt → 模型生成。

RAG 解决了两个痛点:知识时效性(模型训练有截止日期)和领域专属性(你的私有数据不在训练集里)。

但 RAG 也暴露了新的问题:检索到的只是"文本片段"。如果模型需要的不是"读一段文档",而是"调用一个 API"“查一次数据库”"发一封邮件"呢?

我们需要一个更通用的"连接协议"。


四、MCP:AI 世界的 USB 接口

2024 年底,Anthropic 提出了 MCP(Model Context Protocol)。它的野心很大:

定义一套标准协议,让任何 AI 模型都能以统一方式连接任何外部工具、数据源和服务。

你可以把 MCP 理解为 AI 世界的 USB-C。在 MCP 之前,每个模型要连 GitHub 得写一套适配,连 Slack 又得写一套,连数据库再写一套——M×N 的组合爆炸。MCP 之后,工具方实现一个 MCP Server,模型方实现一个 MCP Client,中间用标准 JSON-RPC 通信,即插即用。

MCP 把 RAG 从"只能检索文本"扩展为"可以调用任意能力"。它让模型从"读书的学者"变成了"能操作电脑的实习生"。

但一个"能操作电脑的实习生"和一个"能独立完成项目的工程师"之间,还差一个关键的东西:自主性


五、Agent:从"回答"到"做事"

Agent(智能体) 是当前最热的词,也是最容易被滥用的词。

一个真正的 Agent 不只是"能调用工具"。它的核心特征是:

  1. 目标驱动:给定一个高层目标(“帮我调研竞品并写一份报告”),而非单步指令。
  2. 自主规划:自己拆解任务、决定先做什么后做什么。
  3. 工具使用:通过 MCP 或 Function Calling 与外部世界交互。
  4. 记忆与反思:能记住中间状态,能从失败中调整策略。

如果说 Prompt 是"你问我答",RAG 是"你问我查了再答",MCP 是"你问我用工具查了再答",那么 Agent 是:

“你给我一个目标,我自己决定问谁、查什么、用什么工具、做几步、怎么验证,直到完成。”

Agent 把 AI 从函数(输入→输出)变成了过程(目标→规划→执行→反馈→……→完成)。

但一个 Agent 不能凭空运行。它需要一个"身体"。


六、Harness:Agent 的肉身与操作系统

Harness(直译"挽具/框架")是承载 Agent 运行的基础设施。它回答的问题是:

Agent 的"灵魂"(LLM + 规划逻辑)跑在什么"身体"里?谁管理它的生命周期?谁给它分配工具权限?谁监控它的资源消耗?谁在它失控时拉下紧急制动?

一个典型的 Agent Harness 包括:

  • 运行时环境:沙箱、容器、权限隔离
  • 工具注册表:Agent 可以调用哪些 MCP Server / API
  • 状态管理:对话历史、中间变量、长期记忆
  • 安全护栏:最大步数限制、敏感操作确认、输出过滤
  • 可观测性:日志、Trace、Token 消耗统计

你可以把 Harness 想象成 Agent 的操作系统 + 身体 + 法律体系。没有 Harness,Agent 只是一个在 Jupyter Notebook 里裸跑的 while 循环,脆弱且危险。

而 Harness 中最核心的运行机制,就是 Loop。


七、Loop:Agent 的心跳

Loop(循环) 是 Agent 的执行引擎。最经典的形态是 ReAct Loop(Reason + Act):

while 目标未完成:
    1. Observe  → 观察当前状态(用户输入 / 工具返回 / 环境反馈)
    2. Think    → LLM 推理:下一步该做什么?
    3. Act      → 调用工具 / 生成回复 / 修改计划
    4. Reflect  → 结果是否符合预期?是否需要调整?

每一次循环迭代,就是一次"心跳"。Agent 的"智能"不在某一次推理中,而在循环的收敛性中——它能否在有限步数内,从混乱走向目标。

Loop 也解释了为什么 Token 消耗在 Agent 时代会爆炸式增长:每一次循环迭代都要把完整上下文重新喂给模型,10 步循环可能消耗单次对话 10 倍的 Token。这就是为什么 Token 经济学(定价、窗口长度、缓存策略)在 Agent 时代变得如此关键。


八、全景:一粒沙如何建成一座城

让我们退后一步,看完整的图景:

Token          ← 原子:模型的最小感知单位
  ↓ 组成
Prompt         ← 界面:人类雕刻概率分布的手段
  ↓ 增强
RAG            ← 知识:让 Prompt 携带外部信息
  ↓ 泛化
MCP            ← 协议:标准化一切外部连接
  ↓ 驱动
Agent          ← 主体:自主规划与执行的智能体
  ↓ 承载于
Harness        ← 基础设施:运行时、权限、安全、可观测
  ↓ 核心机制
Loop           ← 心跳:观察→思考→行动→反思的迭代循环

从 Token 到 Loop,是从静态到动态、从单次到迭代、从被动响应到主动执行的完整跃迁。


尾声:一个隐喻

如果把 AI 系统比作一座城市:

  • Token 是砖块。
  • Prompt 是市民对城市说的话(“我需要一条路”)。
  • RAG 是市政档案馆,提供历史图纸。
  • MCP 是统一的市政接口标准(水电煤网都走同一套管道协议)。
  • Agent 是城市规划师,接到目标后自主设计、施工、验收。
  • Harness 是城市的法律、电网、交通系统——让规划师能工作但不至于拆掉整座城市。
  • Loop 是规划师每天的工作节奏:勘察→设计→施工→验收→返工→再验收……直到竣工。

我们正处在从"建几栋房子"(单次对话)到"建一座自运转的城市"(多 Agent 系统)的过渡期。每一个概念都不是孤立的技术时尚,而是这座城市的必要构件

理解它们的递进关系,比记住任何一个单独的定义,都重要得多。


评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值