阿里深夜开源“家用最强模型“,开发者却为它吵翻了

8 月 14 日晚,阿里把 Qwen3.8-27B 的模型权重免费丢到了网上。48 小时后,它冲上知乎热榜第 2,开发者分成了两派:一派喊"Opus 平替,家用电脑跑得动的最强模型",另一派破口大骂——“我让它算道线段距离,它先思考了 30 分钟”。

同一份开源权重,评价怎么会撕裂成这样?今天把这件事讲透。

一、为什么这次动静这么大?

过去两年,开源模型发布了不少,但 Qwen3.8-27B 把三个变量叠到了一起:

参数大小卡在"甜点位"。 27B 小到单张消费级显卡塞得下,大到能力逼近闭源旗舰。量化后约 17GB,24GB 显存就能流畅跑——普通家用电脑真的可以部署,而不是只能看发布会。

能力确实摸到了天花板。 SWE-bench Pro 61.7,反超 Anthropic 旗舰 Claude Opus 4.6 Max 的 53.4;Agent 编程 Terminal-Bench 2.1 从前代 63.4 涨到 73.0;专业任务 JobBench 提升约 50%。海外社区直接喊出"前沿级",Hugging Face 冲上热榜,有人叫它"家用的 Opus"。

它自带战略背景。 阿里累计开源 460 多个模型、全球下载超 30 亿次,稳居开源下载量第一;昇腾平台首日适配,连玄铁 RISC-V 处理器都打通了推理链路——这是一场对标 Meta 的生态战。

二、跑分是真的吗?冷静点,看反面

但"反超 Opus"这个说法,需要打三个折扣。

第一,这是官方自报对官方自报。 知乎有人点破:这些成绩大多是阿里自己测的,第三方复现还在路上。更扎眼的是落后项:科学推理 HLE 30.8 对 40.0、GPQA 89.2 对 91.3。简单说:代码和 Agent 是真的强,科学推理仍然是短板。

第二,海外口碑有"预期差"成分。 17GB 的文件能完成代

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

深频率

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值