摘要
随着 AI Agent的发展,人们期待其在科学发现中发挥关键作用。本文提出 X-Master,一种工具增强型通用推理Agent(tool-augmented reasoning agent) ,通过将 Python 代码作为与外部环境交互的语言,实现对计算库、网络搜索等工具的调用。为进一步增强推理能力,本文构建了一个分散–堆叠式代理工作流 X-Masters,实现解答过程的多阶段协作与优化。系统在 Humanity’s Last Exam(HLE)上首次突破 30% 得分,超过 OpenAI 与 Google DeepMind 的闭源系统,展示出开源代理系统在科学智能领域的领先潜力。
- 论文标题:SciMaster: Towards General-Purpose Scientific AI Agents, Part I. X-Master as Foundation: Can We Lead on Humanity’s Last Exam?
- 论文链接:https://arxiv.org/abs/2507.05241
1 引言
“人类最后考试(Humanity’s Last Exam, HLE)” 是一个由全球近 1000 位领域专家共同打造的评估基准,涵盖来自超过 500 个机构的多学科知识前沿任务。它被视为 AI 系统在应对科学性、高复杂度、跨领域问题方面的终极挑战,其中的问题都非常复杂,例如下图展示了其中的几个样例:

目前,尽管 OpenAI 和 Google DeepMind 等闭源系统在 HLE 上分别取得一定的成绩,但这类系统的封闭性严重限制了社区理解、复现与创新的能力。
为应对这一挑战,本文提出一个<


613

被折叠的 条评论
为什么被折叠?



