
跳过至主要内容
搜索 arXiv
按回车键进行搜索 * 高级搜索
计算机科学 > 人工智能
arXiv:2607.25398 (cs)
[于 2026 年 7 月 28 日提交]
标题:HANDBOOK.md:一个长上下文代理指令遵循基准
作者是柳达斯·帕纳瓦斯、塞巴斯蒂安·米努斯、布拉德利·蒙顿、德里克·雷、苏哈斯·加雷、苏尚特·梅塔、埃德温·陈,可查看由他们撰写的论文《HANDBOOK.md:一个长上下文代理指令遵循基准》的相关版本。
摘要
语言模型代理在遵循指令的情况下的部署越来越多,做法是将系统提示、策略文件或技能文档置于上下文之中,然后期望代理依据这些来指导后续的每一个动作。然而现有的基准测试很少直接测试这种部署模式,它们衡量的是代理能否完成任务,而非一份冗长且具有约束力的策略文档是否真的能在较长的工具使用周期内约束其行为。
为此推出了 [此 http 链接],这是一个包含 65 个代理任务的基准测试,设计灵感源自企业员工遵循公司手册的方式。每个任务会让代理处于独立的公司环境(文件工作区),还有通过模型上下文协议公开的模拟电子邮件、聊天、日历、问题跟踪和商业服务,要求它按照一份由专家撰写的、篇幅在 20 到 124 页的标准操作流程来开展日常专业工作。这些任务涵盖金融、医疗账单、保险、物流和人力资源五个领域以及十家虚构公司。
为防止模型死记硬背,每个任务都会对十个基础手册中的一个进行修改,改变评分所依据的具体规则和阈值,所以没有两个任务采用相同的策略。评分完全是确定性的,每个任务都有一套编程标准(总共 824 条),用于检查所需动作是否执行以及禁止动作是否未执行。
在严格评分(只有当所有标准都满足时试验才算通过)的情况下,在评估的 30 种模型配置中,表现最佳的配置试验通过率为 36.2%,而大多数前沿配置的通过率仍低于 25%。失败情况呈现出一致的模式:代理会让环境中看似合理的请求凌驾于既定策略之上,执行了必要的检查却又违背检查结果行事,在长周期内遗忘规则细节,并且报告并未达成的合规情况。
目前已公开了所有任务、环境和评估工具。
评论:| 16 页,3 幅图,5 个表格。已被 2026 年 COLM 会议的代理行为研讨会(WAB)接受。基准测试、环境和评估工具:[此 https 链接]
主题:| 人工智能 (cs.AI);计算与语言 (cs.CL)
引用方式:| [arXiv:2607.25398] [cs.AI]
|(或者对于此版本,使用 [arXiv:2607.25398v1] [cs.AI])
| https://doi.org/10.48550/arXiv.2607.25398
点击了解更多
arXiv 通过 DataCite 分配的 DOI(待注册)
提交历史
来自:苏尚特·梅塔 [查看邮箱]
[v1] 2026 年 7 月 28 日,周二,07:58:07 UTC(57 KB)
全文链接
访问论文
可查看由柳达斯·帕纳瓦斯等 7 位作者撰写的论文《HANDBOOK.md:一个长上下文代理指令遵循基准》的相关版本。
* 查看 PDF
* TeX 源代码
当前浏览上下文
cs.AI
切换浏览方式
参考文献与引用
* [谷歌学术]
* [语义学者]
导出 BibTeX 引用 加载中...
BibTeX 格式引用
×
加载中...
数据来源
书签
文献工具
文献与引用工具
文献浏览器 切换
文献浏览器 _(什么是文献浏览器?)_
关联论文 切换
关联论文 _(什么是关联论文?)_
文献地图 切换
文献地图 _(什么是文献地图?)_
scite.ai 切换
scite 智能引用 _(什么是智能引用?)_
代码、数据、媒体
与本文相关的代码、数据和媒体
alphaXiv 切换
alphaXiv _(什么是 alphaXiv?)_
代码链接 切换
CatalyzeX 论文代码查找器 _(什么是 CatalyzeX?)_
DagsHub 切换
DagsHub _(什么是 DagsHub?)_
GotitPub 切换
Gotit.pub _(什么是 GotitPub?)_
Huggingface 切换
Hugging Face _(什么是 Huggingface?)_
科学广播 切换
科学广播 _(什么是科学广播?)_
演示
Replicate 切换
Replicate _(什么是 Replicate?)_
空间 切换
Hugging Face 空间 _(什么是空间?)_
空间 切换
TXYZ.AI _(什么是 TXYZ.AI?)_
相关论文
推荐器与搜索工具
影响力花图链接
影响力花图 _(什么是影响力花图?)_
CORE 推荐器 切换
CORE 推荐器 _(什么是 CORE?)_
* 作者
* 会议
* 机构
* 主题
关于 arXivLabs
arXivLabs 是一个框架,允许合作者直接在网站上开发和分享新的 arXiv 功能。
与 arXivLabs 合作的个人和组织都认同并接受开放、社区、卓越和用户数据隐私价值观。arXiv 致力于这些价值观,并且只与遵守这些价值观的合作伙伴合作。
若有能为 arXiv 社区增值的项目想法,可**了解更多关于 arXivLabs 的信息**。
[本文的哪些作者是认可者?] | [禁用 MathJax] (什么是 MathJax?)
我们衷心感谢主要资助者、[**会员机构**] 以及所有贡献者的支持。
[关于] * [帮助] * [联系我们] * [订阅] * [版权] * [隐私] * [可访问性] * [运营状态(新窗口打开)]
主要资金支持来自

2332

被折叠的 条评论
为什么被折叠?



