人工智能:现代方法读书笔记(二)

第02章 智能体 (Intelligent Agents)

摘要:本章系统阐述了智能体的核心概念与理论框架。首先定义了理性智能体及其性能度量标准,引入PEAS(性能、环境、执行器、传感器)任务描述框架。随后详细分析了环境的八维分类属性(可观测性、智能体数、确定性、动态性、离散性、已知性等)及其对算法选择的影响。重点梳理了五类智能体结构:从简单的反射式智能体到基于模型、基于目标、基于效用的智能体,最终演进至具备学习能力的智能体。最后探讨了智能体理论与后续章节(搜索、博弈、概率推理、机器学习)的关联,并延伸思考了LLM的智能体定位及效用对齐等前沿问题。

本章要点

  • 理性智能体定义:在每一个感知序列下,选择能最大化其性能度量期望值的行动。理性取决于性能度量、先验知识、可执行行动和感知序列,且理性 ≠ 全知。
  • PEAS 框架作用:形式化描述任务环境的四元组(性能、环境、执行器、传感器),是分析智能体任务和设计算法的基础工具。
  • 五类智能体核心区别:从简单反射式(无状态、条件-动作规则)到基于模型(有内部状态和世界模型)、基于目标(引入目标状态、需搜索规划)、基于效用(引入效用函数、最大化期望效用),最终到学习型智能体(具备批评、学习、性能、问题生成四模块,能自适应改进)。
  • 环境属性影响算法选择:环境的八维属性(可观测性、智能体数、确定性、动态性、离散性、已知性等)直接决定适用算法。例如,完全可观测+确定性+离散+已知环境适合经典搜索;部分可观测/随机环境则需要信念状态与概率方法。
  • 演进趋势与权衡:智能体结构从简单到复杂演进,抽象能力和处理复杂环境的能力同步提升,但计算代价和实现难度也随之增加。

1. 章节概述

本章将第 1 章提出的智能体范式形式化,定义理性智能体及其评价标准,给出描述任务的 PEAS 框架与环境的分类维度,并系统梳理五类智能体结构。本章是全书算法(搜索、博弈、CSP、学习)统一落脚的"任务环境"基础。

2. 关键概念与定义

  • 理性智能体(Rational Agent):在每一个感知序列下,选择能最大化其性能度量(performance measure)期望值的行动。
  • 性能度量(Performance Measure):衡量智能体任务完成好坏的客观标准(如能耗、到达时间、胜率)。
  • PEAS:任务环境的形式化描述四元组——Performance(性能度量)、Environment(环境)、Actuators(执行器)、Sensors(传感器)。
  • 智能体函数(Agent Function):从感知历史到行动的映射;智能体程序(Agent Program)是其在具体计算平台上的实现。
  • 完全可观测 / 部分可观测(Fully / Partially Observable):传感器能否获取环境完整状态。
  • 单智能体 / 多智能体(Single / Multiagent):环境中是否存在其他智能体。
  • 确定性 / 随机性(Deterministic / Stochastic):下一状态是否由当前状态与行动唯一确定。
  • 完全对抗 / 合作(Competitive / Cooperative):多智能体目标是否冲突。
  • 动态 / 静态(Dynamic / Static):环境是否在智能体"思考"时变化(静态又称"半动态"若性能随时间变)。
  • 离散 / 连续(Discrete / Continuous):状态、时间、感知、行动的取值是否有限可数。
  • 已知 / 未知(Known / Unknown):环境转移模型是否对智能体可知(与"可观测"正交)。

3. 核心理论与算法

理性准则:理性取决于(1)定义成功标准的性能度量;(2)智能体先验知识;(3)可执行的行动;(4)感知序列。理性 ≠ 全知,也允许为获取信息而"探索"。

PEAS 示例(自动驾驶出租车)

  • P:安全、快捷、合规、舒适、盈利;
  • E:公路、交通、天气、行人;
  • A:方向盘、油门、刹车、信号;
  • S:摄像头、雷达、GPS、速度计。

环境类型影响算法选择:例如完全可观测+确定性+离散+已知 → 适合经典搜索(第 3 章);部分可观测/随机 → 需信念状态与概率方法(第 4 章 + 不确定推理)。

五类智能体结构(由简到繁)

  1. 简单反射式智能体(Simple Reflex Agent)

    • 原理:基于当前感知,按"条件–动作"规则直接响应,无内部状态。

    • 局限:无法处理需历史信息的部分可观测任务。

    function Simple-Reflex-Agent(percept):
        state = Interpret-Input(percept)
        rule = Rule-Match(state, rules)
        action = rule.ACTION
        return action
  2. 基于模型的反射式智能体(Model-Based Reflex Agent)

    • 维护内部状态与"世界如何演化"的模型,从部分感知推断完整状态。
    class ModelBasedReflexAgent:
        def __init__(self, model, rules):
            self.state = None  # 内部状态
            self.model = model  # 世界模型
            self.rules = rules  # 条件-动作规则
            
        def update_state(self, percept):
            """根据感知和模型更新内部状态"""
            # 使用模型从部分感知推断完整状态
            self.state = self.model.infer_state(percept, self.state)
            
        def select_action(self):
            """基于当前状态选择动作"""
            for condition, action in self.rules:
                if condition(self.state):
                    return action
            return None  # 无匹配规则
            
        def act(self, percept):
            self.update_state(percept)
            return self.select_action()
  3. 基于目标的智能体(Goal-Based Agent)

    • 引入目标(描述期望状态),需前向搜索/规划来决策(第 3、4、11 章)。
  4. 基于效用的智能体(Utility-Based Agent)

    • 当目标不足以区分优劣(多目标权衡)时,用效用函数量化"幸福度",最大化期望效用。
    class UtilityBasedAgent:
        def __init__(self, utility_function, actions, model=None):
            self.utility = utility_function  # 效用函数
            self.actions = actions  # 可用行动集合
            self.model = model  # 可选:环境模型(用于预测结果)
            
        def expected_utility(self, action, state):
            """计算在给定状态下执行行动的期望效用"""
            if self.model:
                # 有模型:考虑所有可能结果及其概率
                outcomes = self.model.predict_outcomes(state, action)
                total_utility = 0
                for outcome, prob in outcomes:
                    total_utility += prob * self.utility(outcome)
                return total_utility
            else:
                # 无模型:直接评估行动结果的效用
                return self.utility(self.simulate(state, action))
                
        def choose_action(self, state):
            """选择最大化期望效用的行动"""
            best_action = None
            best_utility = float('-inf')
            
            for action in self.actions:
                eu = self.expected_utility(action, state)
                if eu > best_utility:
                    best_utility = eu
                    best_action = action
                    
            return best_action
  5. 学习型智能体(Learning Agent)

    • 批评模块(critic)学习模块(learning element)性能模块(performance element)问题生成器(problem generator),持续改进。

    function Learning-Agent(percept):
        # critic 评估 performance element 表现
        feedback = Critic(percept, performance-standard)
        Learning-Element.Update(feedback)  # 修改自身
        action = Performance-Element(percept)  # 当前最佳行动
        explore = Problem-Generator.Suggest()  # 探索性动作
        return action

4. 关键图示/表格说明

环境属性八维分类表(设计智能体时逐维判定):

维度取值 A取值 B
可观测性完全可观测部分可观测
智能体数单智能体多智能体
确定性确定性随机性
动态性静态动态
离散性离散连续
已知性已知未知

智能体结构演进对比表

智能体类型核心组件优点缺点适用环境
简单反射式智能体条件-动作规则表响应快、实现简单无内部状态,无法处理部分可观测任务完全可观测、确定性、静态环境
基于模型的反射式智能体内部状态 + 世界模型能处理部分可观测环境,可推断完整状态需维护状态和模型,计算成本增加部分可观测、确定性/随机性环境
基于目标的智能体目标状态描述 + 搜索/规划算法能进行目标导向决策,灵活性高搜索/规划计算开销大,可能陷入局部最优多目标、需规划的环境(如路径规划)
基于效用的智能体效用函数 + 期望效用最大化能权衡多目标,量化决策质量效用函数设计困难,计算复杂度高多目标权衡、不确定性决策环境
学习型智能体批评模块 + 学习模块 + 性能模块 + 问题生成器能自适应改进,处理未知环境训练成本高,需大量数据/交互未知、动态、复杂环境

演进趋势:简单反射 →(加状态)基于模型 →(加目标)基于目标 →(加效用)基于效用 →(加学习)学习型,抽象能力与计算代价同步上升。

5. 与其他章节的关联

  • PEAS 与理性概念是全书所有算法适用前提的判定工具:环境属性决定该用搜索/博弈/概率/学习。
  • 基于目标 / 效用的智能体直接对应第 3–4 章搜索目标与第 5 章博弈效用。
  • 学习型智能体为第三部分的监督学习、强化学习(第 18–22 章)埋下伏笔。
  • 多智能体、部分可观测、随机环境引出第 4 章信念状态搜索与后续概率图模型。

6. 延伸思考

  • LLM 属于哪类智能体? 大语言模型本身更接近"基于统计效用的生成器",缺乏显式世界模型与持久状态。如何用基于模型/基于效用的框架补足其"行动–后果"推理与长期目标一致性?
  • 效用对齐难题:基于效用的智能体要求性能度量可被精确指定,但人类真实偏好复杂且易变。当"最大化效用"与"人类真实意图"不一致时(如奖励黑客 reward hacking),如何设计稳健的性能度量与可纠偏的学习机制?

7. 参考资料与扩展阅读

以下是与本章内容(智能体、人工智能基础)相关的经典教材与关键论文,供深入学习和研究参考:

  • 《Artificial Intelligence: A Modern Approach (4th Edition)》 by Stuart Russell and Peter Norvig
    人工智能领域的经典教材,第2章“Intelligent Agents”系统阐述了智能体的理论基础,包括PEAS框架、环境分类和智能体结构,是理解本章内容的最佳参考。
  • 《Reinforcement Learning: An Introduction (2nd Edition)》 by Richard S. Sutton and Andrew G. Barto
    强化学习领域的权威著作,其中关于智能体-环境交互框架、马尔可夫决策过程(MDP)和部分可观测马尔可夫决策过程(POMDP)的讨论,为理解基于模型、基于效用和学习型智能体提供了数学基础。
  • 《Rationality and Intelligence》 by Stuart Russell
    Russell教授关于理性智能体与通用人工智能的哲学与理论探讨,深入分析了理性定义、效用函数设计、价值对齐等核心问题,与本章“延伸思考”中的效用对齐难题直接相关。
  • 《The Society of Mind》 by Marvin Minsky
    Minsky关于智能体社会与心智架构的经典著作,从多智能体协作与竞争的角度探讨了智能的涌现,为理解多智能体环境与协作/对抗关系提供了独特视角。
  • 论文:“Intelligent Agents: Theory and Practice” by Michael Wooldridge and Nicholas R. Jennings
    发表于《The Knowledge Engineering Review》的综述论文,系统梳理了智能体理论的发展脉络、形式化模型与实际应用,是了解智能体研究历史与现状的重要文献。
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

我是慎独

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值