《HANDBOOK.md》基准测试:30 种模型配置多数通过率低于 25%,语言模型代理表现不佳!

跳过至主要内容

archive 搜索 提交捐赠 登录

搜索 arXiv

按回车键进行搜索 * 高级搜索

计算机科学 > 人工智能

arXiv:2607.25398 (cs)

[于 2026 年 7 月 28 日提交]

标题:HANDBOOK.md:一个长上下文代理指令遵循基准

作者是柳达斯·帕纳瓦斯、塞巴斯蒂安·米努斯、布拉德利·蒙顿、德里克·雷、苏哈斯·加雷、苏尚特·梅塔、埃德温·陈,可查看由他们撰写的论文《HANDBOOK.md:一个长上下文代理指令遵循基准》的相关版本。

查看 PDF HTML(实验性)

摘要

语言模型代理在遵循指令的情况下的部署越来越多,做法是将系统提示、策略文件或技能文档置于上下文之中,然后期望代理依据这些来指导后续的每一个动作。然而现有的基准测试很少直接测试这种部署模式,它们衡量的是代理能否完成任务,而非一份冗长且具有约束力的策略文档是否真的能在较长的工具使用周期内约束其行为。

为此推出了 [此 http 链接],这是一个包含 65 个代理任务的基准测试,设计灵感源自企业员工遵循公司手册的方式。每个任务会让代理处于独立的公司环境(文件工作区),还有通过模型上下文协议公开的模拟电子邮件、聊天、日历、问题跟踪和商业服务,要求它按照一份由专家撰写的、篇幅在 20 到 124 页的标准操作流程来开展日常专业工作。这些任务涵盖金融、医疗账单、保险、物流和人力资源五个领域以及十家虚构公司。

为防止模型死记硬背,每个任务都会对十个基础手册中的一个进行修改,改变评分所依据的具体规则和阈值,所以没有两个任务采用相同的策略。评分完全是确定性的,每个任务都有一套编程标准(总共 824 条),用于检查所需动作是否执行以及禁止动作是否未执行。

在严格评分(只有当所有标准都满足时试验才算通过)的情况下,在评估的 30 种模型配置中,表现最佳的配置试验通过率为 36.2%,而大多数前沿配置的通过率仍低于 25%。失败情况呈现出一致的模式:代理会让环境中看似合理的请求凌驾于既定策略之上,执行了必要的检查却又违背检查结果行事,在长周期内遗忘规则细节,并且报告并未达成的合规情况。

目前已公开了所有任务、环境和评估工具。

评论:| 16 页,3 幅图,5 个表格。已被 2026 年 COLM 会议的代理行为研讨会(WAB)接受。基准测试、环境和评估工具:[此 https 链接]

主题:| 人工智能 (cs.AI);计算与语言 (cs.CL)

引用方式:| [arXiv:2607.25398] [cs.AI]

|(或者对于此版本,使用 [arXiv:2607.25398v1] [cs.AI])

| https://doi.org/10.48550/arXiv.2607.25398

点击了解更多

arXiv 通过 DataCite 分配的 DOI(待注册)

提交历史

来自:苏尚特·梅塔 [查看邮箱]

[v1] 2026 年 7 月 28 日,周二,07:58:07 UTC(57 KB)

全文链接

访问论文

可查看由柳达斯·帕纳瓦斯等 7 位作者撰写的论文《HANDBOOK.md:一个长上下文代理指令遵循基准》的相关版本。

* 查看 PDF

* HTML(实验性)

* TeX 源代码

许可图标 查看许可

当前浏览上下文

cs.AI

< 上一篇 | 下一篇 >

最新文章 | 近期文章 |

2026 年 7 月

切换浏览方式

[计算机科学 (cs)]

[计算与语言 (cs.CL)]

参考文献与引用

* [NASA ADS]

* [谷歌学术]

* [语义学者]

导出 BibTeX 引用 加载中...

BibTeX 格式引用

×

加载中...

数据来源

书签

BibSonomy Reddit

文献工具

文献与引用工具

文献浏览器 切换

文献浏览器 _(什么是文献浏览器?)_

关联论文 切换

关联论文 _(什么是关联论文?)_

文献地图 切换

文献地图 _(什么是文献地图?)_

scite.ai 切换

scite 智能引用 _(什么是智能引用?)_

代码、数据、媒体

与本文相关的代码、数据和媒体

alphaXiv 切换

alphaXiv _(什么是 alphaXiv?)_

代码链接 切换

CatalyzeX 论文代码查找器 _(什么是 CatalyzeX?)_

DagsHub 切换

DagsHub _(什么是 DagsHub?)_

GotitPub 切换

Gotit.pub _(什么是 GotitPub?)_

Huggingface 切换

Hugging Face _(什么是 Huggingface?)_

科学广播 切换

科学广播 _(什么是科学广播?)_

演示

Replicate 切换

Replicate _(什么是 Replicate?)_

空间 切换

Hugging Face 空间 _(什么是空间?)_

空间 切换

TXYZ.AI _(什么是 TXYZ.AI?)_

相关论文

推荐器与搜索工具

影响力花图链接

影响力花图 _(什么是影响力花图?)_

CORE 推荐器 切换

CORE 推荐器 _(什么是 CORE?)_

* 作者

* 会议

* 机构

* 主题

关于 arXivLabs

arXivLabs 是一个框架,允许合作者直接在网站上开发和分享新的 arXiv 功能。

与 arXivLabs 合作的个人和组织都认同并接受开放、社区、卓越和用户数据隐私价值观。arXiv 致力于这些价值观,并且只与遵守这些价值观的合作伙伴合作。

若有能为 arXiv 社区增值的项目想法,可**了解更多关于 arXivLabs 的信息**

[本文的哪些作者是认可者?] | [禁用 MathJax] (什么是 MathJax?)

我们衷心感谢主要资助者、[**会员机构**] 以及所有贡献者的支持。

[关于] * [帮助] * [联系我们] * [订阅] * [版权] * [隐私] * [可访问性] * [运营状态(新窗口打开)]

主要资金支持来自

西蒙斯基金会 西蒙斯国际基金会 施密特科学

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值