一、文章主要内容总结
该研究聚焦于大型语言模型(LLMs)将前沿机器学习研究成果转化为可执行代码的能力,核心贡献是构建了ResearchCodeBench基准测试套件,并基于此开展了全面评估。
-
基准测试构建
- 数据源:选取20篇2024-2025年顶会(NeurIPS、ICLR、CVPR等)及arXiv的最新ML论文,覆盖生成模型、计算机视觉、强化学习等多个领域。
- 任务设计:针对每篇论文的核心创新贡献,构建212个代码补全任务,同时划分109个高难度子任务(ResearchCodeBench-HARD),任务采用“填空式”设计,配套论文作者或领域专家编写的确定性测试用例。
- 核心特性:保证任务新颖性(多数论文发布于模型预训练截止日期后)、评估客观性(基于代码执行结果而非主观判断)、社区可扩展性(支持研究者提交新论文和任务)。
-
模型评估结果
- 评估范围:32个主流闭源/开源LLM(来自10家公司),采用Pass@1指标(单次贪心解码通过率)。
- 关键发现:
- 高难度任务表现惨淡:即使最优模型(Gemini-2.5-Pro-Preview)在HARD子集的通过率仅33.0%,43个任务所有模型均未完成;
- 闭源模型领先开源模型:Gemini、OpenAI系列模型表现突出,开源模型中部分型号通过率为0%;
订阅专栏 解锁全文

298

被折叠的 条评论
为什么被折叠?



