qwen3.8-max-正式版深度评测

Qwen3.8-Max 正式版深度评测:2.4T 的"国产 Fable 5",16 天自主编程做出开源智能体,国际价只要 Opus 5 的 1/4

一句话结论:这是国产大模型第一次同时完成三件事——能力对标 Fable 5、首次开源 Max 级权重、国际价只要 Opus 5 的 1/4。但"全球第二"要打折听:预览版时代"没数据就喊话"的营销争议还在,综合智能与 Fable 5 仍差一截。它更像个"编程特长生",不是"全能冠军"。


摘要(30 秒版)

8 月 3 日,阿里千问正式发布 Qwen3.8-Max:总参 2.4T、激活 95B,稀疏 MoE + 混合注意力,1M 上下文,原生多模态。今天港股阿里巴巴早盘涨近 6%。

  • 最炸裂的案例:只给一句"创建一个自进化的智能体 Harness",它独立写代码 16 天,从空文件夹做出开源智能体框架 oh-my-cli(截至 8-06 截图:累计 666 commits、59 个未关闭 issue、625 星)。
  • 最硬核的成绩:PaperBench 93.0,超过 Fable 5 的 88.8、GPT-5.6 Sol 的 90.5;OSWorld-Verified 86.1,主流模型第一。
  • 最激进的价格:国际价 $2.0 输入 / $6.0 输出,约为 Opus 5 的 40% 与 24%;国内缓存命中输入只要 1.5 元/百万 tokens
  • 最意外的一步:千问首次开源 Max 级模型,下周权重上线 Hugging Face 与 ModelScope,并同步开源 Qwen3.8-27B。

但注意:官方数据仍是"自报家门";综合智能基准(Agent’s Last Exam 52.4)离 Fable 5 还有距离;独立实测发现它能"一次性生成"、却会"迭代卡壳";预览版时代"没数据就喊全球第二"的黑历史也需要被记住。


目录

  1. 一个"自己写代码 16 天"的模型
  2. 先给结论:为什么这次发布值得 3000 字
  3. 规格:2.4T / 95B 激活,稀疏 MoE 与混合注意力
  4. 官方基准,逐项翻译成人话
  5. 跟谁比:官方口径硬刚 Fable 5、GPT-5.6 Sol
  6. 独立第三方:Arena 三榜 + 英伟达榜单登顶
  7. 价格账本:Opus 5 的 1/4,缓存价 1.5 元
  8. 首次开源 Max:下周权重上线意味着什么
  9. 泼冷水:六个必须正视的限制
  10. 该不该用:一张决策表
  11. FAQ
  12. 结论

1. 一个"自己写代码 16 天"的模型

7 月 30 日晚,开发者老周在 GitHub 上刷到一个奇怪的仓库:qwen-code-dev-bot/oh-my-cli

16 天前,它的创建者只被下达过一句话——“创建一个自进化的智能体 Harness”。此后,没有人类碰过它:它自己把需求拆成 issue,自己派发给自己执行,自己写代码、跑测试、看日志、再改。16 天下来,仓库里躺着一套真实可用的自进化智能体框架,代号 oh-my-cli——级别达到 Hermes Agent,代码完全开源。8 月 6 日截图时,仓库已累计 666 次提交、PR 编号推进到 #701、625 星,最新一次提交就在截图前 15 分钟——它还在自主运行。

创建者,是千问的新旗舰 Qwen3.8-Max

GitHub 仓库页真实截图:qwen-code-dev-bot/oh-my-cli,截图时 666 Commits、625 Stars、59 open Issues、Fork 56,最新提交 Merge PR #701 在 15 分钟前

图 1 | oh-my-cli:一句需求,16 天,一个还在自主运行的开源智能体框架 —— 真实 GitHub 仓库页截图,截图于 2026-08-06,来源:github.com/qwen-code-dev-bot/oh-my-cli

8 月 3 日,阿里千问正式发布 Qwen3.8。没有独立发布会,一份官方博客 + 一张 Arena 榜单 + 一整套 benchmark 数据,砸在当天早上。

这不是一次例行升级。这是国产大模型第一次,把"自主编程 16 天"从 PPT 里的概念,变成 GitHub 上一个能点开的真实仓库。


2. 先给结论:为什么这次发布值得 3000 字

评测之前,先把立场摆清楚:

这不是又一个国产旗舰。这是国产大模型第一次同时完成三件事:能力对标 Fable 5、首次开源 Max 级权重、国际价只有 Opus 5 的 1/4。

支撑这个判断的三条证据:

  1. 能力越级:PaperBench 93.0 反超 Fable 5(88.8)与 GPT-5.6 Sol(90.5),OSWorld-Verified 86.1 主流模型第一。这不是"追上了",是"在长程编程这一项上超过了"。
  2. 开源拐点:千问首次开源 Max 级模型,下周权重上线 Hugging Face 与 ModelScope。开源社区终于能拿到"第一梯队"的满血权重,而不是"低配学生版"。
  3. 价格地震:国际价约为 Opus 5 的 40% 与 24%,国内缓存命中输入 1.5 元/百万 tokens。同一条方块像素 3D 足球动画提示词,Fable 5 烧掉 $1.105,它只要 $0.012。

但别急着下结论。这次发布有一道绕不开的伤疤:两周前,同样的"全球第二"喊话,被整个社区嘲讽为"没数据、没报告、没模型卡"的营销文案。 这一次,他们补上了数据。数据的真假,才是这篇评测真正要回答的问题。

黄金句:开源不等于免费,但开放权重等于把选择权还给了开发者。


3. 规格:2.4T / 95B 激活,稀疏 MoE 与混合注意力

先看这次"换血"换在了哪里:

维度Qwen3.8-Max上一代 Qwen3.7-MaxKimi K3
总参数量2.4T超万亿2.8T
激活参数95B未披露~280B
架构稀疏 MoE + 混合注意力MoE(896 专家 / 16 激活)
上下文1M tokens1M
多模态原生视觉
开源下周开源(首次 Max 级)不开源开放权重(7/27)

三个关键信息:

第一,2.4T 总参、95B 激活。 参数堆到万亿级不是新闻——Kimi K3 已经 2.8T。真正的信号是"激活效率":95B 激活要和 280B 激活的 Kimi K3 打对台,考的是 MoE 的"门控调度"和训练配方,而不是堆料。

第二,稀疏 MoE + 混合注意力联合优化。 官方原话是"首次将总参数量拓展至 2.4T",配合混合注意力机制换取"更高的推理效率、更快的推理速度"。翻译成人话:骨架更大,但每次推理只点亮 95B,显存与延迟都不该线性爆炸。

第三,基于 Qwen 3.5 架构,1M 上下文,原生多模态。 能跨页读 200 页财报,能把 100 小时长视频组织成可检索的 Graph 记忆。多模态不是附赠功能,是旗舰标配。硬件侧同样就位:阿里自研真武 M890 超节点已适配 Qwen3.8,官方称 Agentic 推理场景最多可带来 1.5 倍性能提升——数字待实测,但算力与模型是成套交付的。


4. 官方基准,逐项翻译成人话

官方一口气甩出 9 项以上基准(以下全部为官方数据,口径见官方博客):

数字单独看没感觉,逐个翻译:

PaperBench:93.0,最硬的一分。 这个基准测"科研复现":读论文、搭实验、跑通并改进。93.0 分比上代猛涨 28.2 分,反超 Fable 5(88.8)和 GPT-5.6 Sol(90.5)。官方配套的案例是:无起始代码、连续运行约 125 小时、写约 7600 行代码、执行 1100 多步、完成 33 轮 GPU 训练,复现并改进了论文。这是"AI 科研工程化"从 Demo 走向交付的信号。

IF Bench:82.8,指令遵循。 这里最扎眼:82.8 比 Fable 5 的 63.5 高出近 20 分。指令遵循是"AI 能不能听话干活的底线",预览版独立实测也反馈它"强约束句子生成全对,速度还快"。

OSWorld-Verified:86.1,主流模型第一。 电脑操作 Agent 的硬指标,86.1 超过 Fable 5 的 85.0。注意"主流模型第一"这个定语——"主流"指参数量公开可比的玩家,这个定语本身就是话术。

GPQA Diamond 92.6、WideSearch 81.9、CoWorkBench 74.8。 科学推理、联网搜索、通用协作,和 Fable 5 大体打平(81.9 vs 81.2;74.8 vs 75.9)。视觉推理 BabyVision 82.0(无工具),约为部分主流模型的 2 倍。

官方抛出的 Cowork 案例,具体到吓人。 一支法务助理团队标注数百份法律文档里的上千条条款,要一周;它一小时内做完。一个篮球数据分析团队逐帧标注 160 小时比赛录像,它数十分钟拆解出 8400 多个攻防回合,直接输出战术画像和教练报告。官方叙事里,它甚至能自主调动并行智能体、连续工作数小时,交付一套可盈利的 ETF 轮动策略。但记住:这些是官方"自证"的营销案例,不是第三方复现。

Agent’s Last Exam 52.4、JobBench 53.4。 这两个才是"全能"的照妖镜。通用 Agent 现实任务、AI 岗位能力,都在 50 出头——比 Fable 5 的 JobBench 57.4 低 4 分。长程编程是特长生,综合智能是普通学生。

黄金句:论文里它是 93 分的科研天才;考"全能"时,它回到了 52 分的现实。

顺手做个实验:拿你团队最头疼的一个长程自动化任务,原封不动丢给它,再回来看这篇评测——它能不能复现 oh-my-cli 那种"16 天无人值守",比任何 benchmark 都更能说明问题。


5. 跟谁比:官方口径硬刚 Fable 5、GPT-5.6 Sol

评测的意义在对比。官方这次直接把枪口对准 Anthropic:

七个基准,七三开:PaperBench、IFBench、OSWorld-Verified 三项领先;CoWorkBench、WideSearch 两项打平;JobBench、AndroidWorld 两项落后。官方自己给出的结论是"与 Fable 5 相当,部分超越"。

两个必须说清的严谨性问题:

第一,Fable 5 的数据可能"放水"。 千问团队在 Benchmark 表注释里主动指出:Fable 5 的部分结果可能包含回退(backoff)机制——即测试中途降级成更简单的应对。这是官方自己加的安全阀,说明他们也知道"对标数据"的水有多深。

第二,这是"官方 vs 官方",不是"第三方 vs 第三方"。 两张卷子各自老师批。整体趋势可信,具体分差必须等 Artificial Analysis 这类独立平台复现后再下结论。

但即便打折看,有一件事躲不掉:一个中国团队的模型,敢把 Fable 5 和 GPT-5.6 Sol 拉进同一张表并自称互有胜负——这个姿态本身,放在半年前没人敢想。


6. 独立第三方:Arena 三榜 + 英伟达榜单登顶

官方自报家门要打折,好在这次第三方跟得很快:

Arena.ai 三榜(2026-08 放榜期,以下三张均为 lmarena.ai 排行榜真实截图,截图于 08-06):

lmarena.ai Text 排行榜截图:qwen3.8-max 1496 分,Preliminary 标注,榜单 Top4 均为 Anthropic Claude 系列(claude-fable-5 1509 领跑)

图 2 | Arena Text 榜真实截图:qwen3.8-max 1496 分——官方"全球第二"的口径,实为"仅次于 Claude 系列" —— 来源:lmarena.ai,榜单期 2026-08-01,截图于 2026-08-06

lmarena.ai Code 排行榜截图:qwen3.8-max 1668 分列第 4,排在 claude-opus-5-max(1705)、kimi-k3-max(1676)、claude-opus-5-high(1669)之后

图 3 | Arena Code 榜真实截图:qwen3.8-max 1668 分,全球第 4 —— 来源:lmarena.ai,榜单期 2026-08-02,截图于 2026-08-06

lmarena.ai Vision 排行榜截图:qwen3.8-max 1305 分列第 2,仅次于 claude-fable-5(1318)

图 4 | Arena Vision 榜真实截图:qwen3.8-max 1305 分,全球第 2 —— 来源:lmarena.ai,榜单期 2026-08,截图于 2026-08-06

三榜逐条看:

  • Text Arena:1496 分——总榜第 5:前面是 claude-fable-5(1509)与三个 Claude thinking 变体。官方口径的"全球第二",实为"仅次于 Anthropic Claude 系列"——榜单 Top4 全是 Claude。
  • CodeArena:1668 分——总榜第 4:排在 claude-opus-5-max(1705)、kimi-k3-max(1676)、claude-opus-5-high(1669)之后。
  • VisionArena:1305 分——总榜第 2:仅次于 claude-fable-5(1318)。
  • 综合口径:阿里 Qwen 在 Arena 上整体仅次于 Anthropic Claude 系列,稳居全球第一梯队。

英伟达 SOL-ExecBench:FlashInfer-Bench 子集登顶。 7 月 22 日,预览版就已拿下英伟达 GPU 算子优化榜单第一,超过腾讯混元 Hyra、人类开发者、Cursor。SOL 分数接近 1.0 意味着"生成 CUDA 内核的效率接近硬件理论极限"——这是在 Blackwell GPU 上用真实算力验证出来的工程能力,和聊天得分是两回事。

两套独立数据,同一个结论:长程编程 + 工程能力是真的能打;但 Arena 综合名次仍在 Fable 5 身后,“全球第二"只能算"其中一科第二”。


7. 价格账本:Opus 5 的 1/4,缓存价 1.5 元

官方定价(国内,单位:元 / 百万 tokens):

场景Qwen3.8-Max
输入(隐式缓存命中)1.5
输入(未命中)12
输出36
国际价$2.0 / $6.0 / 缓存 $0.25

阿里云百炼模型广场 Qwen3.8-Max 官方价格页截图:输入 12 元、输入(缓存命中)1.5 元、显式缓存创建 15 元、显式缓存命中 1 元、输出 36 元(每百万 tokens),及工具调用价格

图 5 | 真实官方价格页截图:Qwen3.8-Max 按量价,输入 12 / 输出 36 元/百万 tokens,缓存命中输入 1.5 元 —— 截图于 2026-08-06,来源:阿里云百炼模型广场(bailian.console.aliyun.com)

三个结论:

第一,国际价是对标 Opus 5 打的。 官方口径:$2.0 输入、$6.0 输出,约为 Opus 5 的 40% 与 24%。输出价砍到 1/4,这才是"性价比"三个字的真正含义。

第二,演示级碾压。 网友"Thành"用同一条提示词让 Fable 5 和 Qwen3.8-Max-Preview 各做一个方块像素 3D 足球动画:Fable 5 花了 $1.105,Qwen 只花了 $0.012——相差约 92 倍

第三,缓存价才是杀手锏。 隐式缓存命中输入 1.5 元/百万 tokens,比未命中输入价再打 1/8 折。对话复用、代码补全这类高缓存场景,实际成本还能再压一个量级。

顺带一张真实官方页面截图:怎么接入。 千问 AI 平台今日同步上线 Token Plan 订阅(个人版),Qwen3.8-Max 首发上线、低至 39 元/月,夜间调用另有折扣:

在这里插入图片描述

图 6 | 真实官方页面截图:千问 Token Plan 订阅页,个人版低至 39 元/月 —— 截图于 2026-08-03,来源:platform.qianwenai.com

注意:这是订阅价,和上表 API 按量价是两套计价——按量是 12/36/1.5 元/百万 tokens,订阅是 39 元/月起步的会员方案。轻度试用走订阅划算,重度/生产走 API 按量。

但别急着高兴,两个现实:国内 12/36 元的绝对价格并不低——对比 Grok 4.5 的 14/44 元、Kimi K3 的 22/109 元,它在"便宜"这件事上没有碾压级优势;真正的优势在国际价对标 Opus 5,以及缓存命中后的长上下文场景。要不要切,取决于你的场景在哪个市场。


8. 首次开源 Max:下周权重上线意味着什么

这可能是这次发布对行业最深远的一步:

  • 千问首次开源 Max 级模型。之前开源的是低配版,旗舰一直捂着。
  • 下周权重上线 Hugging Face 与 ModelScope,并同步开源 Qwen3.8-27B
  • 意味着开发者可以拿到 2.4T/95B 激活的满血权重,自己部署、自己微调、自己审计。

为什么说这是拐点? 过去一年,开源模型的处境是:能聊、能写、但干不了重活;顶级的 Agent 能力总在闭源旗舰手里。Qwen3.8-Max 用"16 天自主编程"证明长程 Agent 能力可以被开源拿到——这正是无数中小团队等的那把钥匙。

不过冷静一句:权重开源 ≠ 人人都能跑。2.4T 总参、95B 激活,推理需要的是一个能装下整个模型的集群。开源把选择权还给了开发者,但门槛没有消失,只是从"买 API"变成了"备卡"。


9. 泼冷水:六个必须正视的限制

评测文章不能只吹。以下六盆冷水,一盆都不能少:

  1. "全球第二"是营销话术的余孽。 两周前,千问只靠一条 X 推文宣布"仅次于 Fable 5",没有数据、没有报告、没有模型卡,被社区围攻为"营销文案"。今天正式版补上了数据,但"先喊话、后补证"的发布方式,该被记住。
  2. 综合智能仍差一截。 Agent’s Last Exam 52.4、JobBench 53.4。它是长程编程特长生,不是全能冠军;拿它当通用数字员工,会失望。
  3. 独立实测的"偏科"是实锤。 光子星球和快科技对预览版的实测:LRU、全栈 Todo 一把过,但 3D 浮岛创意题集体翻车——“岛浮起来了,然后就没有然后了”,动效与交互代码全线崩溃。公允地说,AI 产品狙击手的实测里浏览器 OS、3D 赛车游戏又是通过的;"日进化"不是空话,但历史记录里确实有翻车。
  4. 更致命的短板:能生成,但"改不动"。 第四波科技对正式版的实测:对它刚生成的网站提出修改,修改过程直接卡住、不再继续;第二次把万字长文做成 PPT,要改第 14 页,花了近 8 分钟才完成。一次性生成惊艳、迭代修改僵住——这恰好打在官方"端到端交付、值得信赖"的命门上。对真实项目(必然伴随修改迭代),这是比"偏科"更伤的问题。
  5. 对标数据的水深。 Fable 5 数据可能含回退机制(官方自己注释的),且是"官方 vs 官方"。等第三方复现再谈"反超"。
  6. 价格 ≠ 永久。 12/36 元是国内常态价,不代表长期不变;95B 激活的推理成本结构要等权重出来后实测。别按今天的地板价做三年预算。

最诚实的一句话:如果你要的是"长程编程 + Agent 流水线 + 能自己部署",它现在是国产第一梯队里最值得等的开源选项;如果你要的是"综合智能天花板 + 官方数据背书",请等 Artificial Analysis 的独立评测,别被 93.0 冲昏头。


10. 该不该用:一张决策表

现在就试(千问 AI 平台 / 千问办公 / Qoder):

  • 你在做长程编程、Agent 流水线、科研复现、量化策略这类"重活"
  • 你要对标 Fable 5 的 Agent 能力,但预算按 Opus 5 的 1/4 来算
  • 你愿意接受"官方自报 benchmark"为主,自己跑一轮复现

下周再上(权重开源后):

  • 你想自己部署、自己微调,不想被 API 绑住 → 等 Hugging Face 权重
  • 你要微调 Qwen3.8-27B 做垂直场景 → 27B 才是那个"个人能跑"的版本

继续等:

  • 你要的是综合智能天花板(数学、长推理、通用办公)→ 综合基准还差 Fable 5 一截
  • 你对"先喊话后补数据"零容忍 → 等独立评测铺开再迁
  • 你只是聊个天 → App/Web 体验与 Qwen3.7 差别有限,没有迁移理由

11. FAQ

Qwen3.8 和 Qwen3.8-Max 是什么关系?

Qwen3.8 是系列名,Qwen3.8-Max 是其中的旗舰:总参 2.4T、激活 95B、1M 上下文、原生多模态。另有 Qwen3.8-27B 将同步开源。

Qwen3.8-Max 真的超过 Claude Fable 5 了吗?

看科目。官方口径下 PaperBench(93.0 vs 88.8)、IFBench(82.8 vs 63.5)、OSWorld-Verified(86.1 vs 85.0)领先;JobBench、AndroidWorld 落后。综合智能仍差一截,且 Fable 5 数据可能含回退机制,需第三方复现后再下结论。

Qwen3.8-Max 多少钱?

国内:输入 12 元、输出 36 元、隐式缓存命中 1.5 元(每百万 tokens)。国际价 $2.0 / $6.0 / 缓存 $0.25,约为 Opus 5 的 40% 与 24%。同一条 3D 足球动画提示词,Fable 5 花 $1.105,它花 $0.012。

Qwen3.8-Max 会开源吗?什么时候?

会。这是千问首次开源 Max 级模型,权重将于下周在 Hugging Face 和 ModelScope 发布,同时开源 Qwen3.8-27B。

传闻中"自己写代码 16 天"是真的吗?

真的,而且完全可验证。官方技术博客公开了 GitHub 仓库(qwen-code-dev-bot/oh-my-cli):模型被要求"创建自进化智能体 Harness"后,自主运行约 16 天,产出一个 Hermes Agent 级别的自进化智能体框架。8 月 6 日仓库截图时已累计 666 次提交、PR 编号推进到 #701,最新提交仍在持续——它没有停下来。

预览版时代为什么被嘲讽"营销文案"?

7 月 19 日千问只在 X 上发推文预告"2.4T 参数,仅次于 Fable 5",没有 benchmark、没有报告、没有模型卡。直到 8 月 3 日正式版才补齐数据。发布节奏的争议是真实存在的。


12. 结论

回到开头那句:这不是又一个国产旗舰,这是一次把"第一梯队"从口号变成可验证数据 + 可下载权重的发布。

Qwen3.8-Max 最值得记住的一件事,不是 93.0 或 16 天,而是它把三条路同时走到了临界点:长程编程能力对标 Fable 5、Max 级权重首次开源、国际价砍到 Opus 5 的 1/4。2 年前的前沿模型是"程序员的帮手";今天的它,是一个能从空文件夹出发、连续干十几天活、把结果开源回给你的数字工程师。

对开发者:下周权重上线前,先在 Qoder/千问平台跑一轮你的真实任务;跑通了,它是国产 Agent 流水线里最值得接的选项。

对行业:当"开源"两个字终于和"旗舰能力"出现在同一句话里,闭源旗舰的溢价,该开始被重新定价了。

最后一个问题留给你:

下周权重下载链接放出时,你会部署它,还是继续等下一张满分卷? 评论区聊聊你的场景;或者,把这篇转给那个还在 Fable 5 和 Qwen3.8 之间纠结选型的朋友。


数据截至 2026-08-06;正文配图均为真实页面截图:github.com/qwen-code-dev-bot/oh-my-cli、lmarena.ai(2026-08 放榜期)、阿里云百炼模型广场、千问 AI 平台。benchmark 官方数据请以官方披露与独立复现为准。

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值