2025_NIPS_ResearchCodeBench: Benchmarking LLMs on Implementing Novel Machine Learning Research Code

一、文章主要内容总结

该研究聚焦于大型语言模型(LLMs)将前沿机器学习研究成果转化为可执行代码的能力,核心贡献是构建了ResearchCodeBench基准测试套件,并基于此开展了全面评估。

  1. 基准测试构建

    • 数据源:选取20篇2024-2025年顶会(NeurIPS、ICLR、CVPR等)及arXiv的最新ML论文,覆盖生成模型、计算机视觉、强化学习等多个领域。
    • 任务设计:针对每篇论文的核心创新贡献,构建212个代码补全任务,同时划分109个高难度子任务(ResearchCodeBench-HARD),任务采用“填空式”设计,配套论文作者或领域专家编写的确定性测试用例。
    • 核心特性:保证任务新颖性(多数论文发布于模型预训练截止日期后)、评估客观性(基于代码执行结果而非主观判断)、社区可扩展性(支持研究者提交新论文和任务)。
  2. 模型评估结果

    • 评估范围:32个主流闭源/开源LLM(来自10家公司),采用Pass@1指标(单次贪心解码通过率)。
    • 关键发现:
      • 高难度任务表现惨淡:即使最优模型(Gemini-2.5-Pro-Preview)在HARD子集的通过率仅33.0%,43个任务所有模型均未完成;
      • 闭源模型领先开源模型:Gemini、OpenAI系列模型表现突出,开源模型中部分型号通过率为0%;
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

UnknownBody

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值