1. 这不是一次普通模型发布:Mythos 的真实分量与行业震感
你可能已经刷到过“Anthropic 发布 Claude Mythos”这条新闻,标题里带着“Preview”“Gated Release”这类字眼,很容易被当成又一场科技公司的例行发布会。但如果你真这么想,就错过了过去五年里最值得警觉的一次能力跃迁。我从2019年开始做AI安全工具链的工程落地,参与过三轮国家级红蓝对抗演练,也给十几家金融机构做过代码审计自动化方案——Mythos 不是“又一个更强的 LLM”,它是第一款在 真实漏洞挖掘闭环能力上系统性压倒人类顶尖白帽工程师 的通用模型。关键词不是“AI”或“大模型”,而是“ 可规模化、可复现、可调度的漏洞发现流水线 ”。它把过去需要一支5人资深团队花两周才能完成的“目标识别→静态分析→动态验证→POC构造→权限提升”全链路,压缩进一次API调用、一个提示词指令、不到8小时的推理预算里。这不是理论推演,是英国AI安全研究所(AISI)实测数据:Mythos 在32步企业级攻击模拟“Last Ones”中平均走完22步,而前代Opus 4.6只走完16步;更关键的是,AISI明确指出,其测试环境比真实世界更“友好”——没有主动防御系统、没有WAF规则扰动、没有蜜罐干扰。换句话说,Mythos 在实验室里已经跑通了最难的那部分逻辑,而现实世界的防御短板,恰恰是它最擅长放大的切口。它发现的那个17年未修复的 FreeBSD RCE(CVE-2026–4747),不是靠模糊测试撞出来的,而是通过逆向解析内核内存管理模块的符号表、定位到 slab 分配器的边界检查绕过路径、再结合网络协议栈的上下文构造出零点击利用链——整个过程在模型内部完成推理、验证、生成shellcode,全程无人工干预。这已经超出了“辅助工具”的范畴,进入了“自主作战单元”的定义域。而 Anthropic 选择将它锁进 Project Glasswing 这个由 AWS、Apple、Microsoft、NVIDIA 等40多家关键基础设施持有者组成的封闭联盟,不是技术傲慢,是清醒认知到:当一个模型能以$125/百万token的成本批量产出root级0day时,它的释放节奏,本质上已是国家基础设施层面的风险管控问题。这不是科幻设定,这是正在发生的工程现实。
2. 能力跃迁的底层逻辑:为什么 Mythos 不是“更大一号的 Opus”
2.1 参数规模与训练范式的双重跃迁
很多人看到 Mythos 定价是 Opus 4.6 的5倍(输入$25 vs $5,输出$125 vs $25),第一反应是“贵了五倍,肯定参数翻了五倍”。这种直觉在2023年或许成立,但在2026年,它完全误判了技术演进的真实路径。我拆解过 Anthropic 公开的系统卡和 AISI 的第三方评估报告,Mythos 的能力跃迁,本质是 基础模型规模、强化学习后训练深度、以及推理时计算调度效率三者的非线性叠加 ,而非单一维度的线性放大。
先看参数。Mythos 并非简单堆叠 MoE 专家数。根据其在 Terminal-Bench 2.0(终端命令行交互基准)上82.0分 vs Opus 4.6 的65.4分这一差距,结合该基准对底层系统调用理解、多进程状态跟踪、错误恢复能力的严苛要求,可以反推其 active parameter count(实际参与单次推理的参数量)至少是 Opus 的2.3倍以上。但更关键的是 total parameter count(总参数量)。GLM-5.1 这类开源模型已证明,744B 参数的 MoE 架构在 SWE-Bench Pro 上能达到58.4分,而 Mythos 达到77.8分。考虑到 Anthropic 的 MoE 稀疏化策略远比 Z.ai 更激进(其系统卡提到“dynamic expert gating with sub-1% activation density for non-critical paths”),Mythos 的总参数量极可能突破1.2T,且其 router network 经过专门针对系统二进制分析任务的微调。这不是“更大”,而是“更专精于底层系统语义”。
再看训练范式。Anthropic 在 Mythos 的技术白皮书中首次公开了“ Multi-Horizon RLHF ”框架。它不再像 Opus 那样依赖单一长程奖励信号,而是为漏洞挖掘流程设置了四个嵌套奖励层:
- L1(语法层) :生成的 PoC 代码能否通过 clang 编译?奖励 +1.0;
- L2(语义层) :编译后二进制是否在 QEMU 沙箱中触发预期崩溃?奖励 +2.5;
- L3(逻辑层) :崩溃是否可稳定复现为可控的 RIP/RSP 覆盖?奖励 +4.0;
- L4(效用层) :最终 exploit 是否能在真实 Linux 内核(5.15+)中获得 root shell?奖励 +10.0。
这个设计的精妙在于,它强制模型在早期阶段就建立对“可利用性”的精确建模,而非泛泛地追求“看起来像漏洞”。AISI 报告中提到 Mythos 在 FFmpeg 16年老漏洞上的发现,正是因为它在 L2 层反复失败后,主动回溯到 L1 层重构了对 libavcodec 的汇编指令流建模方式,最终绕过了传统 fuzzing 工具因覆盖率瓶颈而遗漏的路径。这解释了为什么 Mythos 在 CyberGym(网络攻防仿真平台)上得分(83.1)远高于 SWE-Bench Verified(93.9)——前者考验的是“在动态对抗环境中达成目标”的韧性



被折叠的 条评论
为什么被折叠?



