第一卷:大模型 基础篇
第2章 大模型基础原理
第8节:大模型为什么会涌现能力?——AI如何突然学会推理、编程与规划?
《Agent开发工程师成长指南》系列教程
引言
在上一节我们学习了:
Scaling Law为什么重要?
我们知道:
更多参数
+
更多数据
+
更多算力
↓
Scaling Law
↓
Loss持续下降
↓
模型能力不断提升
但这里又出现了一个非常奇怪的问题。
如果模型能力只是随着规模不断提升:
为什么很多能力看起来像是:
突然出现的?
例如:
一个小模型可能:
不会写复杂代码
模型规模扩大以后:
突然能够完成代码生成
继续扩大:
开始理解数学问题
再扩大:
开始进行多步骤推理
甚至能够:
制定计划
调用工具
分析结果
修改方案
这类现象通常被称为:
Emergent Ability(涌现能力)
也就是:
当模型规模、训练数据和训练能力达到一定程度后,模型表现出训练阶段没有被直接赋予的复杂能力。
这也是理解现代大模型为什么越来越像“智能系统”的关键。
一、什么是涌现能力?


先看一个最简单的例子。
假设我们训练三个模型:
1B
7B
70B
测试一个复杂任务:
请分析:
如果A比B多20%,
B比C少10%,
那么A与C是什么关系?
小模型可能:
无法正确计算
7B模型:
偶尔答对
70B模型:
大多数情况下能够正确完成
于是我们会发现:
模型规模
↓
1B ──────→ 7B ──────→ 70B
↓
能力明显增强
这种从:
几乎不会
到:
能够完成
的变化。
就被称为:
涌现。
二、涌现并不是“凭空产生”

这里需要特别注意。
很多文章会把涌现描述成:
70B模型突然产生了智能
这其实容易产生误解。
模型并不是:
69B
↓
突然增加1B
↓
产生意识
真正发生的是:
大量参数经过训练以后:
参数之间形成更加复杂的关联
↓
模型能够表示更加复杂的模式
↓
原本分散的能力开始组合
↓
复杂任务成功率快速提升
所以:
涌现更像是复杂能力达到临界条件后的“可观察跃迁”,而不是凭空创造了一种能力。
三、为什么大模型会产生涌现能力?

可以从三个角度理解。
① 参数规模足够大
小模型:
容量有限
能够学习的模式有限。
大模型:
参数更多
可以建立更加复杂的:
语言关系
知识关系
逻辑关系
代码结构
任务模式
例如:
小模型
“苹果” → 水果
大模型可能进一步建立:
苹果
↓
水果
↓
植物
↓
农业
↓
供应链
↓
价格
↓
商业分析
模型内部能够表示的关系越来越复杂。
四、数据规模同样重要
只有参数:
没有数据
模型也不会变聪明。
例如:
一个70B模型:
训练数据很少
可能仍然无法完成复杂任务。
因此:
Model Size
+
Dataset
+
Compute
共同决定模型能力。
这正好对应上一节的:
Scaling Law
五、为什么“规模”会产生新的能力?
这是一个非常重要的问题。
可以把模型想象成一个巨大的:
函数系统
小模型只能学习:
简单关系
例如:
A → B
稍大的模型可以学习:
A → B → C
更大的模型能够学习:
A
↘
B → C
↘ ↓
D → E
最终:
知识
+
语言
+
逻辑
+
代码
+
数学
开始互相组合。
于是:
单独看每一个能力都不神奇,但是当大量能力组合起来,就可能形成新的复杂能力。
六、最典型的涌现能力之一:In-Context Learning

这是现代大模型最重要的能力之一。
传统机器学习:
训练
↓
模型
↓
预测
如果需要完成新任务。
通常需要:
重新训练
但是大模型出现以后:
你可以直接告诉它:
例子1:
苹果 → Apple
香蕉 → Banana
橘子 → ?
模型:
Orange
我们甚至没有修改模型参数。
只是:
改变Context
模型就能够:
理解任务
这种能力叫:
In-Context Learning(上下文学习)
它是:
Prompt Engineering能够成立的重要基础。
七、Few-Shot为什么有效?

例如:
例子:
输入:
北京是中国的城市
输出:
正确
输入:
东京是中国的城市
输出:
错误
输入:
上海是中国的城市
输出:
?
模型能够推断:
任务规则
然后回答:
正确
注意:
我们没有:
重新训练模型
只是:
提供几个例子
这说明:
大模型能够从Context中:
识别模式
然后:
执行模式
这就是:
In-Context Learning。
后面学习Prompt Engineering时会大量使用这一能力。
八、第二种重要涌现:代码能力
大模型早期:
只能生成简单代码
随着模型规模和代码训练数据不断增加:
模型开始能够:
理解函数
↓
生成代码
↓
分析Bug
↓
修改代码
↓
理解项目结构
↓
完成复杂开发任务
于是:
语言模型
逐渐变成:
Code Assistant
甚至进一步:
Coding Agent
九、为什么大模型能够学会编程?

因为代码本身就是一种:
高度结构化的语言。
例如:
def login(username, password):
...
模型不仅需要知道:
login是什么意思
还需要理解:
函数结构
参数关系
控制流程
数据结构
调用关系
当模型规模足够大以后:
这些结构能够被统一表示。
于是:
自然语言
+
代码
+
逻辑
可以在同一个模型中建立关联。
这也是:
大模型成为AI编程助手的重要原因。
十、第三种重要能力:数学推理

数学是观察模型能力变化的另一个重要领域。
例如:
2 + 3 = ?
非常简单。
但:
小明有5个苹果。
第一天吃掉2个。
第二天又买了原来的两倍。
现在有多少个?
就需要:
理解问题
+
提取信息
+
建立关系
+
计算
复杂数学问题进一步需要:
分步骤推导
于是:
模型开始出现:
Reasoning
能力。
十一、为什么推理能力会随着模型规模提升?
可以简单理解为:
小模型
↓
模式匹配
而更强模型:
模式匹配
+
关系理解
+
步骤分解
+
中间结果组合
例如:
问题
↓
步骤1
↓
步骤2
↓
步骤3
↓
答案
模型越强:
能够处理的:
推理深度
通常越高。
这也为后面的:
Reasoning Model
奠定了基础。
十二、第四种能力:Planning规划

这是Agent开发工程师最需要关注的一种涌现能力。
传统聊天模型:
用户:
帮我订一个旅行计划
可能只会:
给出一段文字建议
更强模型开始能够:
分析需求
↓
拆解任务
↓
制定计划
↓
调用工具
↓
检查结果
↓
调整计划
这已经非常接近:
Agent。
十三、从模型能力到Agent能力

我们可以把整个过程串起来:
模型规模提升
↓
语言理解增强
↓
知识关联增强
↓
代码能力增强
↓
推理能力增强
↓
规划能力增强
↓
Tool Calling
↓
Workflow
↓
Agent
所以:
Agent并不是突然出现的一种独立技术。
它实际上建立在:
大模型能力
不断增强的基础之上。
十四、涌现能力与Tool Calling
再看一个Agent非常典型的场景。
用户:
帮我查询北京明天的天气,
如果下雨提醒我带伞。
模型需要:
理解需求
然后:
调用天气Tool
得到:
降雨概率80%
然后:
分析结果
最后:
提醒用户带伞
这里实际上需要:
理解
+
规划
+
工具调用
+
结果分析
这些能力组合起来以后:
才形成真正的:
Agent行为。
十五、涌现能力是否真的“突然出现”?
这里需要进行一个非常重要的科学解释。
早期论文和很多媒体经常描述:
模型规模
↓
突然
↓
新能力出现
但是后来的研究发现:
有些所谓的“涌现能力”,可能与:
评价指标
有关。
例如:
一个模型:
准确率:
40%
另一个:
60%
如果评价指标要求:
准确率 > 50%
那么:
第一个模型:
不会
第二个模型:
会
看起来像:
突然涌现
实际上:
能力可能一直在:
连续提升
只是:
当模型跨过某个任务阈值以后,我们才开始明显观察到它。
因此:
现代研究对“涌现”的理解越来越谨慎。
十六、涌现能力可以分成两种
可以简单理解为:
第一类:连续增强
例如:
语言理解
代码生成
知识问答
通常表现为:
能力逐步提升
第二类:阈值型表现
例如:
复杂推理
规划
多步骤任务
可能在某个规模之后:
成功率快速提升
于是:
用户会产生:
“它突然学会了。”
这种现象:
就是我们通常所说的:
Emergent Ability。

十七、为什么这对Agent开发工程师非常重要?
因为:
不是所有Agent问题:
都应该靠Prompt解决。
例如:
Agent无法完成:
复杂数学推理
你可能不断修改:
Prompt
但效果仍然不好。
原因可能是:
模型能力不足
而不是:
Prompt不好
因此:
Agent开发工程师需要判断:
这是Prompt问题?
还是:
模型能力问题?
还是:
RAG问题?
还是:
Tool问题?
还是:
Workflow问题?
这是非常重要的工程能力。
十八、模型越大是不是一定越好?
当然不是。
例如:
一个企业客服Agent:
简单FAQ
可能:
7B
+
RAG
就已经足够。
没有必要:
70B
甚至:
Reasoning Model
因为:
成本↑
延迟↑
资源↑
但能力提升:
可能非常有限。
因此:
真正的工程原则应该是:
选择能够满足业务目标的最小模型。
而不是:
永远选择最大的模型。
十九、Scaling Law → Emergence → Agent
到这里。
我们可以把第2章的知识串起来。

第一阶段:模型规模
更多参数
+
更多数据
+
更多算力
↓
Scaling Law
第二阶段:基础能力提升
语言理解
+
知识表示
+
代码能力
+
数学能力
↓
能力增强
第三阶段:复杂能力出现
推理
+
规划
+
任务分解
+
工具使用
↓
Emergent Ability
第四阶段:Agent
LLM
+
Memory
+
RAG
+
Tools
+
Workflow
↓
Agent
这就是:
现代AI应用的发展路径。
二十、为什么大模型最终会走向Agent?
如果模型只会:
回答问题
它只是:
Chat Model
如果模型能够:
理解任务
↓
制定计划
↓
调用工具
↓
观察结果
↓
调整策略
↓
完成任务
它就开始具备:
Agent
的核心特征。
所以:
Agent并不是简单给大模型加几个Tool。
真正的Agent:
建立在模型已经具备:
理解
推理
规划
决策
等能力的基础之上。
二十一、从GPT到Agent的完整技术演进
我们现在可以把第2章全部串起来:
GPT
↓
Transformer
↓
Attention
↓
Token
↓
Embedding
↓
Position Encoding
↓
Scaling Law
↓
Emergent Ability
↓
Reasoning
↓
Agent
这条路线非常重要。
因为:
Agent不是凭空出现的。
它是过去十多年大模型技术不断积累的结果。
二十二、给Agent开发工程师的一个重要启示
当你开发Agent时。
遇到问题不要第一时间:
修改Prompt
应该先定位:
模型能力?
↓
Prompt?
↓
Context?
↓
RAG?
↓
Tool?
↓
Workflow?
↓
Memory?
例如:
模型无法理解复杂任务:
优先考虑模型能力
模型理解了但知识错误:
检查RAG
模型知道答案但不会执行:
检查Tool Calling
模型每一步都正确但整体流程混乱:
检查Workflow
模型前几轮正确,后面开始忘记:
检查Context / Memory
这就是:
从“调Prompt”升级到“系统诊断”。
面试题
问题1
什么是大模型的涌现能力?
参考答案:
涌现能力是指随着模型规模、训练数据和计算量提升,一些复杂能力的任务成功率出现明显跃迁,例如复杂推理、代码生成、规划和工具使用等。需要注意,所谓“突然出现”有时也与评价指标和任务阈值有关,并不一定意味着能力在模型内部凭空产生。
问题2
为什么大模型会产生涌现能力?
参考答案:
随着参数规模和训练数据增加,模型能够学习更加复杂的语言、知识、逻辑和任务模式。当这些能力达到一定程度并能够组合起来时,就可能表现出复杂的新能力。
问题3
什么是 In-Context Learning?
参考答案:
In-Context Learning 是模型通过当前输入中的上下文、任务描述和示例来理解任务并完成任务,而不需要重新训练或修改模型参数。
问题4
Few-Shot为什么有效?
参考答案:
因为大模型具有较强的In-Context Learning能力。通过提供少量输入输出示例,可以帮助模型识别任务模式、输出格式和解决方法,从而提升任务完成效果。
问题5
涌现能力与Agent有什么关系?
参考答案:
Agent需要模型具备较强的任务理解、推理、规划、决策和工具调用能力。随着大模型能力增强,这些复杂能力逐渐具备,使LLM能够从单纯聊天进一步发展为能够执行任务的Agent。
问题6
为什么Agent出现问题不能只修改Prompt?
参考答案:
因为Agent是一个完整系统。问题可能来自模型能力、Prompt、Context、RAG、Tool Calling、Workflow或者Memory。工程师需要定位问题所在的层,而不是把所有问题都归结为Prompt问题。
问题7
模型越大是不是一定越适合企业Agent?
参考答案:
不是。企业应该根据业务复杂度、准确率要求、延迟、成本、部署资源等因素选择模型。简单客服可能使用小模型加RAG即可,而复杂规划和推理任务可能需要更强的大模型或Reasoning Model。
本章小结
本节我们学习了:
✅ 什么是Emergent Ability(涌现能力)
✅ 为什么模型规模提升会带来复杂能力
✅ In-Context Learning是什么
✅ Few-Shot为什么能够有效
✅ 大模型为什么能够学会编程
✅ 大模型为什么会出现推理和规划能力
✅ 涌现能力与Agent之间的关系
✅ 为什么“涌现”并不一定意味着能力凭空出现
✅ 为什么Agent问题不能全部归结为Prompt问题
最终,我们可以把整个第2章浓缩成一条技术路线:
Transformer
↓
Attention
↓
Token
↓
Embedding
↓
Position Encoding
↓
Scaling Law
↓
Emergent Ability
↓
Reasoning
↓
Agent
而这一条路线背后真正发生的事情是:
模型规模扩大
↓
学习能力增强
↓
复杂模式开始形成
↓
能力出现跃迁
↓
推理与规划能力增强
↓
从“生成文本”
走向
“完成任务”
所以:
大模型真正革命性的地方,并不是它能够生成更多文字,而是当模型能力达到一定规模以后,它开始能够理解任务、组合知识、进行推理、制定计划,并最终成为Agent的“大脑”。
至此:
第2章《大模型基础原理》
全部核心知识学习完毕。
下一章将正式从:
模型原理
进入:
模型能力认知
我们将开始回答Agent开发工程师最实际的几个问题:
Context到底是什么?
为什么GPT会遗忘?
为什么大模型会产生幻觉?
普通Chat Model和Reasoning Model有什么区别?
多模态模型到底是怎么理解图片、声音和视频的?
下一篇:

1768

被折叠的 条评论
为什么被折叠?



