8 月 14 日晚,阿里把 Qwen3.8-27B 的模型权重免费丢到了网上。48 小时后,它冲上知乎热榜第 2,开发者分成了两派:一派喊"Opus 平替,家用电脑跑得动的最强模型",另一派破口大骂——“我让它算道线段距离,它先思考了 30 分钟”。
同一份开源权重,评价怎么会撕裂成这样?今天把这件事讲透。
一、为什么这次动静这么大?
过去两年,开源模型发布了不少,但 Qwen3.8-27B 把三个变量叠到了一起:
参数大小卡在"甜点位"。 27B 小到单张消费级显卡塞得下,大到能力逼近闭源旗舰。量化后约 17GB,24GB 显存就能流畅跑——普通家用电脑真的可以部署,而不是只能看发布会。
能力确实摸到了天花板。 SWE-bench Pro 61.7,反超 Anthropic 旗舰 Claude Opus 4.6 Max 的 53.4;Agent 编程 Terminal-Bench 2.1 从前代 63.4 涨到 73.0;专业任务 JobBench 提升约 50%。海外社区直接喊出"前沿级",Hugging Face 冲上热榜,有人叫它"家用的 Opus"。
它自带战略背景。 阿里累计开源 460 多个模型、全球下载超 30 亿次,稳居开源下载量第一;昇腾平台首日适配,连玄铁 RISC-V 处理器都打通了推理链路——这是一场对标 Meta 的生态战。
二、跑分是真的吗?冷静点,看反面
但"反超 Opus"这个说法,需要打三个折扣。
第一,这是官方自报对官方自报。 知乎有人点破:这些成绩大多是阿里自己测的,第三方复现还在路上。更扎眼的是落后项:科学推理 HLE 30.8 对 40.0、GPQA 89.2 对 91.3。简单说:代码和 Agent 是真的强,科学推理仍然是短板。
第二,海外口碑有"预期差"成分。 17GB 的文件能完成代


447

被折叠的 条评论
为什么被折叠?



