Benchmark for Planning and Control with Large Language Model Agents: Blocksworld with Model Conte...

文章总结与翻译

一、主要内容

本文针对大型语言模型(LLM)智能体在规划与控制任务中缺乏标准化评估基准的问题,提出了一个基于经典积木世界(Blocksworld)领域的基准测试框架。该框架包含可执行仿真环境和五个复杂度类别,通过集成模型上下文协议(MCP)作为标准化工具接口,支持不同架构的LLM智能体无需特定修改即可接入评估,同时也能与传统符号规划方法进行直接对比。

核心内容包括:

  1. 基准架构:采用模块化设计,通过REST API暴露仿真功能,MCP服务器将其封装为工具,支持智能体的动态工具发现、调用及实时环境交互。
  2. 积木世界定义:包含四种基本操作(拾取、放置、堆叠、拆堆)和经典约束,新增有限工作台空间约束,提升场景真实性。
  3. 复杂度维度与场景分类:从积木数量、非构造性动作占比、额外约束、不完全信息四个维度划分五类场景,覆盖基础任务、需非构造性动作任务、不可解任务、带额外约束任务及部分可观测任务。
  4. 实验验证:基于LangGraph实现ReAct架构单智能体,采用OpenAI o3模型在50个预定义场景中测试,建立了成功率、执行时间、令牌消耗等量化指标,验证了基准的有效性。

二、创新点

  1. 首个集成MCP的积木世界基准:通过标准化接口解决了不同LLM智能体及传统规划方法的公平对比问题,支持实时执行、重规划及环境动态交互。
  2. 多维度复杂度设计:引入非构造性动作、块大小约束、部分可观测性等维度,弥补了传统静态基准缺乏 realism 和动态适应性的缺陷。
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值