《Agent开发工程师成长指南》- 第2章 第8节:大模型为什么会涌现能力?——AI如何突然学会推理、编程与规划?

第一卷:大模型 基础篇

第2章 大模型基础原理

第8节:大模型为什么会涌现能力?——AI如何突然学会推理、编程与规划?

《Agent开发工程师成长指南》系列教程


引言

在上一节我们学习了:

Scaling Law为什么重要?

我们知道:

更多参数
+
更多数据
+
更多算力
        ↓
Scaling Law
        ↓
Loss持续下降
        ↓
模型能力不断提升

但这里又出现了一个非常奇怪的问题。

如果模型能力只是随着规模不断提升:

为什么很多能力看起来像是:

突然出现的?

例如:

一个小模型可能:

不会写复杂代码

模型规模扩大以后:

突然能够完成代码生成

继续扩大:

开始理解数学问题

再扩大:

开始进行多步骤推理

甚至能够:

制定计划
调用工具
分析结果
修改方案

这类现象通常被称为:

Emergent Ability(涌现能力)

也就是:

当模型规模、训练数据和训练能力达到一定程度后,模型表现出训练阶段没有被直接赋予的复杂能力。

这也是理解现代大模型为什么越来越像“智能系统”的关键。


一、什么是涌现能力?

先看一个最简单的例子。

假设我们训练三个模型:

1B
7B
70B

测试一个复杂任务:

请分析:

如果A比B多20%,
B比C少10%,
那么A与C是什么关系?

小模型可能:

无法正确计算

7B模型:

偶尔答对

70B模型:

大多数情况下能够正确完成

于是我们会发现:

模型规模
   ↓
1B ──────→ 7B ──────→ 70B
                         ↓
                   能力明显增强

这种从:

几乎不会

到:

能够完成

的变化。

就被称为:

涌现。


二、涌现并不是“凭空产生”

这里需要特别注意。

很多文章会把涌现描述成:

70B模型突然产生了智能

这其实容易产生误解。

模型并不是:

69B

↓

突然增加1B

↓

产生意识

真正发生的是:

大量参数经过训练以后:

参数之间形成更加复杂的关联

↓

模型能够表示更加复杂的模式

↓

原本分散的能力开始组合

↓

复杂任务成功率快速提升

所以:

涌现更像是复杂能力达到临界条件后的“可观察跃迁”,而不是凭空创造了一种能力。


三、为什么大模型会产生涌现能力?

可以从三个角度理解。


① 参数规模足够大

小模型:

容量有限

能够学习的模式有限。

大模型:

参数更多

可以建立更加复杂的:

语言关系
知识关系
逻辑关系
代码结构
任务模式

例如:

小模型

“苹果” → 水果

大模型可能进一步建立:

苹果
 ↓
水果
 ↓
植物
 ↓
农业
 ↓
供应链
 ↓
价格
 ↓
商业分析

模型内部能够表示的关系越来越复杂。


四、数据规模同样重要

只有参数:

没有数据

模型也不会变聪明。

例如:

一个70B模型:

训练数据很少

可能仍然无法完成复杂任务。

因此:

Model Size
+
Dataset
+
Compute

共同决定模型能力。

这正好对应上一节的:

Scaling Law


五、为什么“规模”会产生新的能力?

这是一个非常重要的问题。

可以把模型想象成一个巨大的:

函数系统

小模型只能学习:

简单关系

例如:

A → B

稍大的模型可以学习:

A → B → C

更大的模型能够学习:

A
↘
 B → C
↘   ↓
 D → E

最终:

知识
+
语言
+
逻辑
+
代码
+
数学

开始互相组合。

于是:

单独看每一个能力都不神奇,但是当大量能力组合起来,就可能形成新的复杂能力。


六、最典型的涌现能力之一:In-Context Learning

这是现代大模型最重要的能力之一。

传统机器学习:

训练
 ↓
模型
 ↓
预测

如果需要完成新任务。

通常需要:

重新训练

但是大模型出现以后:

你可以直接告诉它:

例子1:

苹果 → Apple

香蕉 → Banana

橘子 → ?

模型:

Orange

我们甚至没有修改模型参数。

只是:

改变Context

模型就能够:

理解任务

这种能力叫:

In-Context Learning(上下文学习)

它是:

Prompt Engineering能够成立的重要基础。


七、Few-Shot为什么有效?

例如:

例子:

输入:
北京是中国的城市

输出:
正确

输入:
东京是中国的城市

输出:
错误

输入:
上海是中国的城市

输出:
?

模型能够推断:

任务规则

然后回答:

正确

注意:

我们没有:

重新训练模型

只是:

提供几个例子

这说明:

大模型能够从Context中:

识别模式

然后:

执行模式

这就是:

In-Context Learning。

后面学习Prompt Engineering时会大量使用这一能力。


八、第二种重要涌现:代码能力

大模型早期:

只能生成简单代码

随着模型规模和代码训练数据不断增加:

模型开始能够:

理解函数

生成代码

分析Bug

修改代码

理解项目结构

完成复杂开发任务

于是:

语言模型

逐渐变成:

Code Assistant

甚至进一步:

Coding Agent

九、为什么大模型能够学会编程?

因为代码本身就是一种:

高度结构化的语言。

例如:

def login(username, password):
    ...

模型不仅需要知道:

login是什么意思

还需要理解:

函数结构
参数关系
控制流程
数据结构
调用关系

当模型规模足够大以后:

这些结构能够被统一表示。

于是:

自然语言
+
代码
+
逻辑

可以在同一个模型中建立关联。

这也是:

大模型成为AI编程助手的重要原因。


十、第三种重要能力:数学推理

数学是观察模型能力变化的另一个重要领域。

例如:

2 + 3 = ?

非常简单。

但:

小明有5个苹果。

第一天吃掉2个。

第二天又买了原来的两倍。

现在有多少个?

就需要:

理解问题
+
提取信息
+
建立关系
+
计算

复杂数学问题进一步需要:

分步骤推导

于是:

模型开始出现:

Reasoning

能力。


十一、为什么推理能力会随着模型规模提升?

可以简单理解为:

小模型

↓

模式匹配

而更强模型:

模式匹配
+
关系理解
+
步骤分解
+
中间结果组合

例如:

问题
 ↓
步骤1
 ↓
步骤2
 ↓
步骤3
 ↓
答案

模型越强:

能够处理的:

推理深度

通常越高。

这也为后面的:

Reasoning Model

奠定了基础。


十二、第四种能力:Planning规划

这是Agent开发工程师最需要关注的一种涌现能力。

传统聊天模型:

用户:
帮我订一个旅行计划

可能只会:

给出一段文字建议

更强模型开始能够:

分析需求
 ↓
拆解任务
 ↓
制定计划
 ↓
调用工具
 ↓
检查结果
 ↓
调整计划

这已经非常接近:

Agent。


十三、从模型能力到Agent能力

我们可以把整个过程串起来:

模型规模提升
      ↓
语言理解增强
      ↓
知识关联增强
      ↓
代码能力增强
      ↓
推理能力增强
      ↓
规划能力增强
      ↓
Tool Calling
      ↓
Workflow
      ↓
Agent

所以:

Agent并不是突然出现的一种独立技术。

它实际上建立在:

大模型能力

不断增强的基础之上。


十四、涌现能力与Tool Calling

再看一个Agent非常典型的场景。

用户:

帮我查询北京明天的天气,
如果下雨提醒我带伞。

模型需要:

理解需求

然后:

调用天气Tool

得到:

降雨概率80%

然后:

分析结果

最后:

提醒用户带伞

这里实际上需要:

理解
+
规划
+
工具调用
+
结果分析

这些能力组合起来以后:

才形成真正的:

Agent行为。


十五、涌现能力是否真的“突然出现”?

这里需要进行一个非常重要的科学解释。

早期论文和很多媒体经常描述:

模型规模
        ↓
突然
        ↓
新能力出现

但是后来的研究发现:

有些所谓的“涌现能力”,可能与:

评价指标

有关。

例如:

一个模型:

准确率:

40%

另一个:

60%

如果评价指标要求:

准确率 > 50%

那么:

第一个模型:

不会

第二个模型:

看起来像:

突然涌现

实际上:

能力可能一直在:

连续提升

只是:

当模型跨过某个任务阈值以后,我们才开始明显观察到它。

因此:

现代研究对“涌现”的理解越来越谨慎。


十六、涌现能力可以分成两种

可以简单理解为:

第一类:连续增强

例如:

语言理解

代码生成

知识问答

通常表现为:

能力逐步提升

第二类:阈值型表现

例如:

复杂推理
规划
多步骤任务

可能在某个规模之后:

成功率快速提升

于是:

用户会产生:

“它突然学会了。”

这种现象:

就是我们通常所说的:

Emergent Ability。


十七、为什么这对Agent开发工程师非常重要?

因为:

不是所有Agent问题:

都应该靠Prompt解决。

例如:

Agent无法完成:

复杂数学推理

你可能不断修改:

Prompt

但效果仍然不好。

原因可能是:

模型能力不足

而不是:

Prompt不好

因此:

Agent开发工程师需要判断:

这是Prompt问题?

还是:

模型能力问题?

还是:

RAG问题?

还是:

Tool问题?

还是:

Workflow问题?

这是非常重要的工程能力。


十八、模型越大是不是一定越好?

当然不是。

例如:

一个企业客服Agent:

简单FAQ

可能:

7B
+
RAG

就已经足够。

没有必要:

70B

甚至:

Reasoning Model

因为:

成本↑
延迟↑
资源↑

但能力提升:

可能非常有限。

因此:

真正的工程原则应该是:

选择能够满足业务目标的最小模型。

而不是:

永远选择最大的模型。


十九、Scaling Law → Emergence → Agent

到这里。

我们可以把第2章的知识串起来。


第一阶段:模型规模

更多参数
+
更多数据
+
更多算力

Scaling Law

第二阶段:基础能力提升

语言理解
+
知识表示
+
代码能力
+
数学能力

能力增强

第三阶段:复杂能力出现

推理
+
规划
+
任务分解
+
工具使用

Emergent Ability

第四阶段:Agent

LLM

+

Memory

+

RAG

+

Tools

+

Workflow

↓

Agent

这就是:

现代AI应用的发展路径。


二十、为什么大模型最终会走向Agent?

如果模型只会:

回答问题

它只是:

Chat Model

如果模型能够:

理解任务

制定计划

调用工具

观察结果

调整策略

完成任务

它就开始具备:

Agent

的核心特征。

所以:

Agent并不是简单给大模型加几个Tool。

真正的Agent:

建立在模型已经具备:

理解
推理
规划
决策

等能力的基础之上。


二十一、从GPT到Agent的完整技术演进

我们现在可以把第2章全部串起来:

GPT
 ↓
Transformer
 ↓
Attention
 ↓
Token
 ↓
Embedding
 ↓
Position Encoding
 ↓
Scaling Law
 ↓
Emergent Ability
 ↓
Reasoning
 ↓
Agent

这条路线非常重要。

因为:

Agent不是凭空出现的。

它是过去十多年大模型技术不断积累的结果。


二十二、给Agent开发工程师的一个重要启示

当你开发Agent时。

遇到问题不要第一时间:

修改Prompt

应该先定位:

模型能力?
   ↓
Prompt?
   ↓
Context?
   ↓
RAG?
   ↓
Tool?
   ↓
Workflow?
   ↓
Memory?

例如:

模型无法理解复杂任务:

优先考虑模型能力

模型理解了但知识错误:

检查RAG

模型知道答案但不会执行:

检查Tool Calling

模型每一步都正确但整体流程混乱:

检查Workflow

模型前几轮正确,后面开始忘记:

检查Context / Memory

这就是:

从“调Prompt”升级到“系统诊断”。


面试题

问题1

什么是大模型的涌现能力?

参考答案:

涌现能力是指随着模型规模、训练数据和计算量提升,一些复杂能力的任务成功率出现明显跃迁,例如复杂推理、代码生成、规划和工具使用等。需要注意,所谓“突然出现”有时也与评价指标和任务阈值有关,并不一定意味着能力在模型内部凭空产生。


问题2

为什么大模型会产生涌现能力?

参考答案:

随着参数规模和训练数据增加,模型能够学习更加复杂的语言、知识、逻辑和任务模式。当这些能力达到一定程度并能够组合起来时,就可能表现出复杂的新能力。


问题3

什么是 In-Context Learning?

参考答案:

In-Context Learning 是模型通过当前输入中的上下文、任务描述和示例来理解任务并完成任务,而不需要重新训练或修改模型参数。


问题4

Few-Shot为什么有效?

参考答案:

因为大模型具有较强的In-Context Learning能力。通过提供少量输入输出示例,可以帮助模型识别任务模式、输出格式和解决方法,从而提升任务完成效果。


问题5

涌现能力与Agent有什么关系?

参考答案:

Agent需要模型具备较强的任务理解、推理、规划、决策和工具调用能力。随着大模型能力增强,这些复杂能力逐渐具备,使LLM能够从单纯聊天进一步发展为能够执行任务的Agent。


问题6

为什么Agent出现问题不能只修改Prompt?

参考答案:

因为Agent是一个完整系统。问题可能来自模型能力、Prompt、Context、RAG、Tool Calling、Workflow或者Memory。工程师需要定位问题所在的层,而不是把所有问题都归结为Prompt问题。


问题7

模型越大是不是一定越适合企业Agent?

参考答案:

不是。企业应该根据业务复杂度、准确率要求、延迟、成本、部署资源等因素选择模型。简单客服可能使用小模型加RAG即可,而复杂规划和推理任务可能需要更强的大模型或Reasoning Model。


本章小结

本节我们学习了:

✅ 什么是Emergent Ability(涌现能力)

✅ 为什么模型规模提升会带来复杂能力

✅ In-Context Learning是什么

✅ Few-Shot为什么能够有效

✅ 大模型为什么能够学会编程

✅ 大模型为什么会出现推理和规划能力

✅ 涌现能力与Agent之间的关系

✅ 为什么“涌现”并不一定意味着能力凭空出现

✅ 为什么Agent问题不能全部归结为Prompt问题

最终,我们可以把整个第2章浓缩成一条技术路线:

Transformer
      ↓
Attention
      ↓
Token
      ↓
Embedding
      ↓
Position Encoding
      ↓
Scaling Law
      ↓
Emergent Ability
      ↓
Reasoning
      ↓
Agent

而这一条路线背后真正发生的事情是:

模型规模扩大
      ↓
学习能力增强
      ↓
复杂模式开始形成
      ↓
能力出现跃迁
      ↓
推理与规划能力增强
      ↓
从“生成文本”
走向
“完成任务”

所以:

大模型真正革命性的地方,并不是它能够生成更多文字,而是当模型能力达到一定规模以后,它开始能够理解任务、组合知识、进行推理、制定计划,并最终成为Agent的“大脑”。

至此:

第2章《大模型基础原理》

全部核心知识学习完毕。

下一章将正式从:

模型原理

进入:

模型能力认知

我们将开始回答Agent开发工程师最实际的几个问题:

Context到底是什么?

为什么GPT会遗忘?

为什么大模型会产生幻觉?

普通Chat Model和Reasoning Model有什么区别?

多模态模型到底是怎么理解图片、声音和视频的?

下一篇:

《第3章 第1节:什么是Context Window?——为什么AI能记住这么多内容?》

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值