第02章 智能体 (Intelligent Agents)
摘要:本章系统阐述了智能体的核心概念与理论框架。首先定义了理性智能体及其性能度量标准,引入PEAS(性能、环境、执行器、传感器)任务描述框架。随后详细分析了环境的八维分类属性(可观测性、智能体数、确定性、动态性、离散性、已知性等)及其对算法选择的影响。重点梳理了五类智能体结构:从简单的反射式智能体到基于模型、基于目标、基于效用的智能体,最终演进至具备学习能力的智能体。最后探讨了智能体理论与后续章节(搜索、博弈、概率推理、机器学习)的关联,并延伸思考了LLM的智能体定位及效用对齐等前沿问题。
本章要点
- 理性智能体定义:在每一个感知序列下,选择能最大化其性能度量期望值的行动。理性取决于性能度量、先验知识、可执行行动和感知序列,且理性 ≠ 全知。
- PEAS 框架作用:形式化描述任务环境的四元组(性能、环境、执行器、传感器),是分析智能体任务和设计算法的基础工具。
- 五类智能体核心区别:从简单反射式(无状态、条件-动作规则)到基于模型(有内部状态和世界模型)、基于目标(引入目标状态、需搜索规划)、基于效用(引入效用函数、最大化期望效用),最终到学习型智能体(具备批评、学习、性能、问题生成四模块,能自适应改进)。
- 环境属性影响算法选择:环境的八维属性(可观测性、智能体数、确定性、动态性、离散性、已知性等)直接决定适用算法。例如,完全可观测+确定性+离散+已知环境适合经典搜索;部分可观测/随机环境则需要信念状态与概率方法。
- 演进趋势与权衡:智能体结构从简单到复杂演进,抽象能力和处理复杂环境的能力同步提升,但计算代价和实现难度也随之增加。
1. 章节概述
本章将第 1 章提出的智能体范式形式化,定义理性智能体及其评价标准,给出描述任务的 PEAS 框架与环境的分类维度,并系统梳理五类智能体结构。本章是全书算法(搜索、博弈、CSP、学习)统一落脚的"任务环境"基础。
2. 关键概念与定义
- 理性智能体(Rational Agent):在每一个感知序列下,选择能最大化其性能度量(performance measure)期望值的行动。
- 性能度量(Performance Measure):衡量智能体任务完成好坏的客观标准(如能耗、到达时间、胜率)。
- PEAS:任务环境的形式化描述四元组——Performance(性能度量)、Environment(环境)、Actuators(执行器)、Sensors(传感器)。
- 智能体函数(Agent Function):从感知历史到行动的映射;智能体程序(Agent Program)是其在具体计算平台上的实现。
- 完全可观测 / 部分可观测(Fully / Partially Observable):传感器能否获取环境完整状态。
- 单智能体 / 多智能体(Single / Multiagent):环境中是否存在其他智能体。
- 确定性 / 随机性(Deterministic / Stochastic):下一状态是否由当前状态与行动唯一确定。
- 完全对抗 / 合作(Competitive / Cooperative):多智能体目标是否冲突。
- 动态 / 静态(Dynamic / Static):环境是否在智能体"思考"时变化(静态又称"半动态"若性能随时间变)。
- 离散 / 连续(Discrete / Continuous):状态、时间、感知、行动的取值是否有限可数。
- 已知 / 未知(Known / Unknown):环境转移模型是否对智能体可知(与"可观测"正交)。
3. 核心理论与算法
理性准则:理性取决于(1)定义成功标准的性能度量;(2)智能体先验知识;(3)可执行的行动;(4)感知序列。理性 ≠ 全知,也允许为获取信息而"探索"。
PEAS 示例(自动驾驶出租车):
- P:安全、快捷、合规、舒适、盈利;
- E:公路、交通、天气、行人;
- A:方向盘、油门、刹车、信号;
- S:摄像头、雷达、GPS、速度计。
环境类型影响算法选择:例如完全可观测+确定性+离散+已知 → 适合经典搜索(第 3 章);部分可观测/随机 → 需信念状态与概率方法(第 4 章 + 不确定推理)。
五类智能体结构(由简到繁):
-
简单反射式智能体(Simple Reflex Agent)
-
原理:基于当前感知,按"条件–动作"规则直接响应,无内部状态。
-
局限:无法处理需历史信息的部分可观测任务。
function Simple-Reflex-Agent(percept): state = Interpret-Input(percept) rule = Rule-Match(state, rules) action = rule.ACTION return action -
-
基于模型的反射式智能体(Model-Based Reflex Agent)
- 维护内部状态与"世界如何演化"的模型,从部分感知推断完整状态。
class ModelBasedReflexAgent: def __init__(self, model, rules): self.state = None # 内部状态 self.model = model # 世界模型 self.rules = rules # 条件-动作规则 def update_state(self, percept): """根据感知和模型更新内部状态""" # 使用模型从部分感知推断完整状态 self.state = self.model.infer_state(percept, self.state) def select_action(self): """基于当前状态选择动作""" for condition, action in self.rules: if condition(self.state): return action return None # 无匹配规则 def act(self, percept): self.update_state(percept) return self.select_action() -
基于目标的智能体(Goal-Based Agent)
- 引入目标(描述期望状态),需前向搜索/规划来决策(第 3、4、11 章)。
-
基于效用的智能体(Utility-Based Agent)
- 当目标不足以区分优劣(多目标权衡)时,用效用函数量化"幸福度",最大化期望效用。
class UtilityBasedAgent: def __init__(self, utility_function, actions, model=None): self.utility = utility_function # 效用函数 self.actions = actions # 可用行动集合 self.model = model # 可选:环境模型(用于预测结果) def expected_utility(self, action, state): """计算在给定状态下执行行动的期望效用""" if self.model: # 有模型:考虑所有可能结果及其概率 outcomes = self.model.predict_outcomes(state, action) total_utility = 0 for outcome, prob in outcomes: total_utility += prob * self.utility(outcome) return total_utility else: # 无模型:直接评估行动结果的效用 return self.utility(self.simulate(state, action)) def choose_action(self, state): """选择最大化期望效用的行动""" best_action = None best_utility = float('-inf') for action in self.actions: eu = self.expected_utility(action, state) if eu > best_utility: best_utility = eu best_action = action return best_action -
学习型智能体(Learning Agent)
-
含批评模块(critic)、学习模块(learning element)、性能模块(performance element)、问题生成器(problem generator),持续改进。
function Learning-Agent(percept): # critic 评估 performance element 表现 feedback = Critic(percept, performance-standard) Learning-Element.Update(feedback) # 修改自身 action = Performance-Element(percept) # 当前最佳行动 explore = Problem-Generator.Suggest() # 探索性动作 return action -
4. 关键图示/表格说明
环境属性八维分类表(设计智能体时逐维判定):
| 维度 | 取值 A | 取值 B |
|---|---|---|
| 可观测性 | 完全可观测 | 部分可观测 |
| 智能体数 | 单智能体 | 多智能体 |
| 确定性 | 确定性 | 随机性 |
| 动态性 | 静态 | 动态 |
| 离散性 | 离散 | 连续 |
| 已知性 | 已知 | 未知 |
智能体结构演进对比表:
| 智能体类型 | 核心组件 | 优点 | 缺点 | 适用环境 |
|---|---|---|---|---|
| 简单反射式智能体 | 条件-动作规则表 | 响应快、实现简单 | 无内部状态,无法处理部分可观测任务 | 完全可观测、确定性、静态环境 |
| 基于模型的反射式智能体 | 内部状态 + 世界模型 | 能处理部分可观测环境,可推断完整状态 | 需维护状态和模型,计算成本增加 | 部分可观测、确定性/随机性环境 |
| 基于目标的智能体 | 目标状态描述 + 搜索/规划算法 | 能进行目标导向决策,灵活性高 | 搜索/规划计算开销大,可能陷入局部最优 | 多目标、需规划的环境(如路径规划) |
| 基于效用的智能体 | 效用函数 + 期望效用最大化 | 能权衡多目标,量化决策质量 | 效用函数设计困难,计算复杂度高 | 多目标权衡、不确定性决策环境 |
| 学习型智能体 | 批评模块 + 学习模块 + 性能模块 + 问题生成器 | 能自适应改进,处理未知环境 | 训练成本高,需大量数据/交互 | 未知、动态、复杂环境 |
演进趋势:简单反射 →(加状态)基于模型 →(加目标)基于目标 →(加效用)基于效用 →(加学习)学习型,抽象能力与计算代价同步上升。
5. 与其他章节的关联
- PEAS 与理性概念是全书所有算法适用前提的判定工具:环境属性决定该用搜索/博弈/概率/学习。
- 基于目标 / 效用的智能体直接对应第 3–4 章搜索目标与第 5 章博弈效用。
- 学习型智能体为第三部分的监督学习、强化学习(第 18–22 章)埋下伏笔。
- 多智能体、部分可观测、随机环境引出第 4 章信念状态搜索与后续概率图模型。
6. 延伸思考
- LLM 属于哪类智能体? 大语言模型本身更接近"基于统计效用的生成器",缺乏显式世界模型与持久状态。如何用基于模型/基于效用的框架补足其"行动–后果"推理与长期目标一致性?
- 效用对齐难题:基于效用的智能体要求性能度量可被精确指定,但人类真实偏好复杂且易变。当"最大化效用"与"人类真实意图"不一致时(如奖励黑客 reward hacking),如何设计稳健的性能度量与可纠偏的学习机制?
7. 参考资料与扩展阅读
以下是与本章内容(智能体、人工智能基础)相关的经典教材与关键论文,供深入学习和研究参考:
- 《Artificial Intelligence: A Modern Approach (4th Edition)》 by Stuart Russell and Peter Norvig
人工智能领域的经典教材,第2章“Intelligent Agents”系统阐述了智能体的理论基础,包括PEAS框架、环境分类和智能体结构,是理解本章内容的最佳参考。 - 《Reinforcement Learning: An Introduction (2nd Edition)》 by Richard S. Sutton and Andrew G. Barto
强化学习领域的权威著作,其中关于智能体-环境交互框架、马尔可夫决策过程(MDP)和部分可观测马尔可夫决策过程(POMDP)的讨论,为理解基于模型、基于效用和学习型智能体提供了数学基础。 - 《Rationality and Intelligence》 by Stuart Russell
Russell教授关于理性智能体与通用人工智能的哲学与理论探讨,深入分析了理性定义、效用函数设计、价值对齐等核心问题,与本章“延伸思考”中的效用对齐难题直接相关。 - 《The Society of Mind》 by Marvin Minsky
Minsky关于智能体社会与心智架构的经典著作,从多智能体协作与竞争的角度探讨了智能的涌现,为理解多智能体环境与协作/对抗关系提供了独特视角。 - 论文:“Intelligent Agents: Theory and Practice” by Michael Wooldridge and Nicholas R. Jennings
发表于《The Knowledge Engineering Review》的综述论文,系统梳理了智能体理论的发展脉络、形式化模型与实际应用,是了解智能体研究历史与现状的重要文献。
&spm=1001.2101.3001.5002&articleId=163863758&d=1&t=3&u=9cdc358cdbb74d958a93a8b7ebbc0290)
1万+

被折叠的 条评论
为什么被折叠?



