DeepSeek V4 Pro 正式版(版本号 0813)这次”转正”,不是给预览版修修补补,而是一次后训练层面的大手术。它最大的变化,是把智能体能力从”能写一段代码”补到了”能像工程师一样把一整件事干完”——自家的 DeepSWE 软件工程基准从 12.8 飙到 62.7,涨了将近 4.9 倍。架构还是那套 1.6 万亿参数、每词元激活 490 亿的混合专家模型,百万词元上下文、三十八万四千词元最大输出都还在,MIT 开源权重也还在。一句话:老三样(开源、便宜、长上下文)没丢,短板也明摆着——纯文本、没多模态、涨价预告和峰谷定价就悬在头顶。
一、架构没变,能力”换了个人”
从 4 月 24 日预览版到 8 月 13 日正式版,整整 111 天。模型卡显示架构完全一致:1.6 万亿总参数、每词元激活 490 亿的混合专家结构,支持百万词元上下文、三十八万四千词元单次输出。变的是后训练。DeepSeek 这轮明显是冲着代码智能体场景去的——先用同样的方法把 V4 Flash 正式版练了一轮,Pro 版补上同一课。
结果很夸张。几项专门考长链路代码修改、环境操作、工具调用的基准全线大涨:DeepSWE 从 12.8 到 62.7,Terminal Bench 从 72.1 到 87.9,Cybergym 网络安全从 52.7 到 83.3,DSBench-Hard 翻了一倍多到 67.2。官方换了个说法很关键:不再强调”更会答题”,而是强调”更会把一件事干完”。
二、它追上了谁,又差在哪儿
横向看,V4 Pro 正式版在九项智能体基准上已经和 Anthropic 的 Fable 5 几乎持平。Terminal Bench 拿到 87.9,只差 Fable 5 的 88 分 0.1 分;在 AutomationBench 自动化任务和 Cybergym 网络安全攻防两项上,反而略超 Fable 5(Cybergym 83.3 对 83.1)。普通问答和知识类基准也不虚:SWE-bench Verified 80.6%(开源权重模型里的最高分,和 Gemini 3.1 Pro 持平),GPQA Diamond 90.1%,MMLU-Pro 87.5%,LiveCodeBench 93.5%(竞赛代码通过率,目前世界第一档),Codeforces 评分 3206(约等于人类前 23 名的水平)。LMArena 在 2026 年 6 月测到 1456 分。
但要讲老实话:个别项目它还是略逊。比如在 Terminal Bench 2.0 上 67.9%,落后 GPT-5.4 的 75.1%;HLE(人类最后考试)37.7% 也低于 Gemini 3.1 Pro 的 44.4%。而且这些数字目前都是厂商自报,第三方独立复现还没跟上。
三、接口对齐主流工具链,落地门槛低了
这次更新不只是模型强,是把”怎么接进去”也铺平了。V4 Pro 同时兼容 OpenAI 和 Anthropic 两套接口格式,原生支持 Responses API,还能直接接 Codex——也就是说 Claude Code 这类智能体框架改个地址就能跑。默认开启思考模式,也能切到非思考模式;思考强度分低、高、最高三档,按任务复杂度自己选。对开发者来说,这意味着不用为了用一个新模型重搭整套工具链。
四、性价比还是它的王牌,但涨价在即
价格上,V4 Pro 目前是 V4 Flash 的三倍左右:每百万词元,缓存命中输入 0.025 元、缓存未命中输入 3 元、输出 6 元。横向比海外顶流,差距是数量级的——Fable 5 输出要 50 美元每百万词元,V4 Pro 才约合 0.87 美元。猎豹创始人傅盛说它是”性能接近顶尖、价格只有 Fable 5 的 57 分之一”,话糙理不糙。
不过得泼盆冷水:DeepSeek 8 月 6 日就挂了调价预告,说”预计涨幅较大”,并且从 8 月 17 日零点起启用峰谷定价——闲时价格为高峰时段的一半,高峰时段是 9:00–12:00、14:00–18:00。按新方案,高峰时段缓存命中输入涨到 0.3 元、缓存未命中输入 9 元、输出 27 元,闲时再砍半。对跑长链路智能体的用户,成本会明显上来。
五、几个绕不开的短板
纯文本:官方模型卡明确 V4 Pro 是文本模型,不支持图像、音频、视频输入。发布日有媒体称”原生支持图像推理”,但官方文档与模型卡均未确认,更像误读。
并发只有 500(Flash 是 2500),定位就是高精度、低并发的复杂推理场景,不适合高并发轻量调用。
基准多为厂商自报,独立复现尚未到位,真实表现要等社区实测。

1100

被折叠的 条评论
为什么被折叠?



