GPT-4o和Claude 3.5在Humanity’s Last Exam中表现如何?最新AI基准测试深度解析

AI 时代程序员必备技能

Codex、Claude Code、Cursor、Hermes Agent、OpenClaw等工程化实战专栏 ,讲透 AI 如何接管脏活累活

GPT-4o与Claude 3.5 Sonnet:在“人类终极考试”的熔炉中淬炼

最近,一个名为“Humanity’s Last Exam”(人类最后的考试)的新基准测试在AI研究圈内激起了不小的波澜。这并非又一个简单的排行榜,而是一次试图将最前沿的大语言模型置于人类专业知识巅峰进行拷问的严肃实验。对于像我这样长期关注模型能力边界的从业者而言,这份结果既在意料之中,又带来了许多值得玩味的细节。它像一面高分辨率的镜子,清晰地映照出以GPT-4o、Claude 3.5 Sonnet为代表的顶尖模型,在攀登人类知识金字塔顶端时所面临的真实挑战与微妙差异。今天,我们就抛开那些泛泛的性能对比,深入这场“考试”的肌理,看看这些AI巨人在专家级难题面前,究竟展现出了怎样的“思考”与“挣扎”。

1. “人类最后的考试”:一场重新定义边界的基准革命

基准测试在AI发展史上扮演着“标尺”与“灯塔”的双重角色。然而,近年来我们目睹了一个尴尬的现象:模型在众多经典基准(如MMLU、GSM8K)上的得分迅速逼近甚至超越人类平均水平,给人一种“通用人工智能触手可及”的错觉。但当你真正将一个复杂的、需要跨领域深度推理的专业问题抛给模型时,它可能依然会给出令人啼笑皆非的答案。这就是所谓的“基准饱和”困境——旧的标尺已经无法准确丈量模型在能力前沿的真实高度。

“Humanity’s Last Exam”的诞生,正是为了刺破这层饱和的泡沫。它的设计理念极其明确:收集那些位于人类各学科知识最前沿、足以难倒领域内非顶尖专家的问题。这不再是考察模型对常识或本科知识的掌握,而是直接挑战其“专家级”的推理与知识整合能力。其构建过程本身就堪称一项壮举:

  • 全球专家协作网络:来自50个国家、500多个机构的近千名研究者与教授参与出题,确保了问题的广度与深度。
  • 严格的筛选漏斗:从最初收集的超过7万道潜在问题,经过多轮专家评审,最终精炼出3000道构成公开测试集。这种“大海捞针”式的筛选,保证了每道题都具备足够的区分度。
  • 多模态与纯文本并存:问题形式不局限于文本,还包含了需要结合图像、图表进行解析的题目,考验模型的多模态理解与信息提取能力。

一个来自生态学的示例问题足以说明其难度层级:

“雨燕目蜂鸟独有的双侧成对卵形骨,是一块嵌入尾侧部扩张的十字形插入腱膜中的籽骨。这块籽骨支撑着多少对肌腱?请用数字回答。”

这种问题要求模型不仅理解高度专业的解剖学术语,还要在复杂的生物结构描述中进行精确的逻辑定位与计数。对于绝大多数非该领域的博士而言,这都是一道需要查阅文献才能解答的题目。将这样的问题集作为基准,其意图再清晰不过:探测当前AI系统在模仿人类顶级专家思维模式上的极限

2. 模型竞技场:GPT-4o与Claude 3.5 Sonnet的深度剖析

在“Humanity’s Last Exam”的擂台上,主要的参赛者是当前公认的第一梯队模型:OpenA

AI 时代程序员必备技能

Codex、Claude Code、Cursor、Hermes Agent、OpenClaw等工程化实战专栏 ,讲透 AI 如何接管脏活累活

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值