发布日期:2026-08-20 | 适用人群:AI 开发者 / 产品选型团队 / 模型研究者 | 数据来源:各平台官网及官方发布公告(2026-08-20)
2026 年 8 月是国内大模型旗舰竞争最激烈的月份之一。Kimi K3(2026-07-17 发布,2.8 万亿参数)以 BrowseComp 90.4 和 DeepSWE 67.3 宣示长周期编程与知识工作的新基准;GLM-5.3(2026-08-14 发布,7530 亿 MoE 参数)以极致后训练 Scaling 实现能力跃升 50%,在 CyberGym 安全漏洞发现上登顶第一;DeepSeek V4-Pro(2026-08-13 正式版)引入三档推理强度和峰谷定价机制,原生支持 Responses API,正面对标 Agent 生产场景。三款模型均采用 1M token 上下文窗口,均支持 MoE 稀疏架构,但在能力重心、定价策略和场景适配上走向截然不同的三条路。本文基于官方文档和官方发布公告(2026-08-20 实时数据),完整呈现三款模型的核心参数、基准表现、定价对比与选型建议。
三大旗舰模型核心参数一览
| 维度 | Kimi K3 | GLM-5.3 | DeepSeek V4-Pro |
|---|---|---|---|
| 发布时间 | 2026-07-17 | 2026-08-14 | 2026-08-13(正式版) |
| 参数规模 | 2.8 万亿(MoE) | 7530 亿(MoE) | 未披露 |
| 上下文窗口 | 1M tokens | 1M tokens | 1M tokens |
| 最大输出 | 未披露 | 128K tokens | 未披露 |
| 推理强度控制 | low / high / max | low / high / max | low / high / max |
| 多模态 | 文本 + 图片 + 视频 | 仅文本 | 仅文本 |
| 开源状态 | 权重 2026-07-27 开放 | 两周后开放 | 已开源(HuggingFace/ModelScope) |
| API 协议 | OpenAI 兼容 | OpenAI 兼容 | OpenAI 兼容 |
Kimi K3:2.8 万亿参数,长周期工程任务的新标杆
Kimi K3 是月之暗面(Moonshot AI)于 2026 年 7 月 17 日发布的旗舰模型,参数规模 2.8 万亿,采用 896 个专家中激活 16 个的 MoE 稀疏架构,被官方描述为"世界首个开源 3T 级模型"。
架构与技术特点
- Kimi Delta Attention(KDA):新型注意力机制,提升长上下文处理效率
- Attention Residuals(AttnRes):与 KDA 配合,降低长序列推理的注意力衰减
- 1M token 上下文:支持超长文档、代码库、视频内容的统一输入
- 原生视觉能力:原生支持文本、图像、视频多模态输入,无需外挂视觉适配器
- 整体扩展效率提升约 2.5×(相比 Kimi K2,官方数据)
基准测试表现
| 基准 | Kimi K3 表现 |
|---|---|
| DeepSWE(软件工程) | 67.3(mini-SWE-agent harness,官方排行榜) |
| BrowseComp(网页理解) | 90.4(无上下文压缩时) |
| 内核优化任务 | 与 Claude Fable 5 相当,大幅优于 GPT 系列旗舰 |
| 整体综合能力 | 仍落后于 Claude Fable 5 和 GPT 5.6 Sol |
Kimi K3 的差异化优势集中在长周期工程场景:可持续进行长时工程会话、在 GPU 内核优化任务(AttnRes、KDA、MLA)上与顶流比肩、自主构建 MiniTriton 编译器实现 Triton 对等性能、48 小时内完成 4mm² 芯片设计(8,700+ tokens/s)、支持 120+ 轮次递归自我改进的研究报告生成。
API 接入与定价
Base URL:https://api.moonshot.cn/v1
Model:kimi-k3
| 费用类型 | 价格 |
|---|---|
| 输入(缓存未命中) | $3.00 / MTok |
| 输入(缓存命中) | $0.30 / MTok |
| 输出 | $15.00 / MTok |
缓存命中后输入价格降至 $0.30/MTok(降幅 90%),是三款模型中缓存收益最显著的一个。人民币定价参考平台定价页:输入(未命中)20 元/M,输入(命中)2 元/M,输出 100 元/M。
GLM-5.3:后训练 Scaling 的能力跃升,安全漏洞发现登顶
GLM-5.3 是智谱 AI 于 2026 年 8 月 14 日发布的旗舰模型,参数规模 7530 亿(MoE),基座模型与 GLM-5.2 完全相同。能力跃升来源是"极致后训练 Scaling"——官方表述为"数十倍的长程任务环境训练",重心放在编程能力和网络安全漏洞发现两个方向。
架构与技术特点
- 后训练 Scaling 驱动:基座不变,通过后训练实现能力跃升约 50%,路线与加大预训练参数不同
- 强制推理(thinking always on):推理功能无法关闭,支持 low / high / max 三档强度,默认 max
- 1M 上下文 + 128K 最大输出:是三款模型中唯一明确标注最大输出长度的
- 纯文本:当前版本不支持图片/视频输入
基准测试表现
| 基准 | GLM-5.2 | GLM-5.3 | 对比 |
|---|---|---|---|
| Terminal-Bench 3.0 | 4.6 | 28.3 | +515% |
| DeepSWE v1.1 | 46.2% | 66.9% | +44.8% |
| CyberGym(安全漏洞) | 77.2% | 84.5%(第一) | +9.5% |
| ExploitBench(漏洞利用) | 24.4% | 54.4% | +123% |
| Z.ai Code Bench(Max) | 23.4% | 34.5% | +47.4% |
GLM-5.3 在 CyberGym 评测中累计发现 2436 个漏洞,登顶排行榜第一位;Terminal-Bench 3.0 从 4.6 跃至 28.3 是三款模型中涨幅最大的单项基准改善。编程能力被多家媒体测评描述为"追平 Claude Fable 5"。
API 接入
端点:https://open.bigmodel.cn/api/paas/v4
Model:glm-5.3
官方文档暂未公开具体 API 定价,建议访问 bigmodel.cn 定价页确认。功能支持:Function Calling、流式输出、结构化输出、上下文缓存。

DeepSeek V4-Pro:正式版强化 Agent 能力,峰谷定价重塑成本结构
DeepSeek V4-Pro 于 2026 年 8 月 13 日正式发布(预览版为 2026 年 4 月 24 日),正式版相比预览版的最大变化是 Agent 能力的显著增强,以及三档推理强度(low/high/max)和峰谷定价机制的引入。
核心更新(正式版 vs 预览版)
| 维度 | V4 预览版(4月24日) | V4-Pro 正式版(8月13日) |
|---|---|---|
| Agent 能力 | 基础 | 大幅增强,生产环境表现提升显著 |
| 推理档位 | 未提及 | low(简单任务)/ high(日常 Agent)/ max(高复杂) |
| Responses API | 未提及 | 原生支持(适配 Codex) |
| 定价机制 | 旧价格 | 峰谷双轨,空闲为高峰半价 |
定价(元 / 百万 Token,2026-08-17 起生效)
| 类型 | V4-Flash 空闲 | V4-Flash 高峰 | V4-Pro 空闲 | V4-Pro 高峰 |
|---|---|---|---|---|
| 输入(缓存未命中) | 1.5 | 3.0 | 4.5 | 9.0 |
| 输入(缓存命中) | 0.05 | 0.10 | 0.15 | 0.30 |
| 输出 | 4.5 | 9.0 | 13.5 | 27.0 |
高峰时段:北京时间 9:00–12:00 及 14:00–18:00,其余为空闲时段(价格为高峰半价)
V4-Flash 并发上限 2500,V4-Pro 并发上限 500。
竞争定位
DeepSeek V4-Pro 在官方发布时强调针对 Claude Code、OpenCode 等主流 Agent 产品做了专项优化,内部反馈"Agent 任务使用体验优于 Sonnet 4.5"。Responses API 原生支持使其在 Codex 生态中有直接接入优势,无需二次适配。架构层面引入新注意力机制(token 维度压缩 + DSA 稀疏注意力),降低算力与显存需求。
三款模型横向对比:按场景选型
定价对比(人民币,低估场景优先)
| 模型 | 输出定价(正常/缓存命中输入) | 适合场景 |
|---|---|---|
| Kimi K3 | 输出 100 元/M,缓存命中输入 2 元/M | 高缓存命中率的长文档 RAG、知识工作 |
| GLM-5.3 | 待官方公布 | 编程 / 网络安全专项任务 |
| DeepSeek V4-Pro(空闲) | 输出 13.5 元/M,缓存命中输入 0.15 元/M | Agent 任务、避开高峰的批处理 |
| DeepSeek V4-Flash(空闲) | 输出 4.5 元/M,缓存命中输入 0.05 元/M | 大量调用、成本敏感场景 |
按场景快速选型
| 场景 | 推荐模型 | 核心理由 |
|---|---|---|
| GPU 内核 / 编译器开发 | Kimi K3 | 唯一在此类任务与 Fable 5 相当的开源模型 |
| 长周期工程 Agent(>50 步) | Kimi K3 | 120+ 轮递归自改进,长会话上下文稳定 |
| 网络安全漏洞发现 | GLM-5.3 | CyberGym 第一,ExploitBench 54.4% |
| 编程 Agent + 极端速度提升 | GLM-5.3 | Terminal-Bench 3.0 涨幅最大(+515%) |
| 多模型切换 + 成本控制 | DeepSeek V4-Flash | 空闲时段输出 4.5 元/M,并发上限最高 |
| Codex / Responses API 深度集成 | DeepSeek V4-Pro | 原生 Responses API,官方针对 Claude Code 优化 |
| 图像/视频多模态输入 | Kimi K3 | 唯一原生支持视觉输入的旗舰 |
| 超长文档 + 高缓存命中率 | Kimi K3 | 缓存命中输入降 90%,BrowseComp 90.4 |
基准测试横向对比
| 基准 | Kimi K3 | GLM-5.3 | DeepSeek V4-Pro |
|---|---|---|---|
| DeepSWE(软件工程) | 67.3 | 66.9% | 未披露(官方图片形式) |
| CyberGym(安全漏洞) | 未披露 | 84.5%(第一) | 未披露 |
| BrowseComp | 90.4 | 未披露 | 未披露 |
| Terminal-Bench | 未披露 | 28.3(+515% vs 前代) | 未披露 |
| Agent 能力综合 | 领先开源,落后 Fable 5 | 追平 Fable 5(编程专项) | 优于 Sonnet 4.5(官方) |
三款模型各有基准侧重:Kimi K3 在网页理解和长周期任务上有独特优势,GLM-5.3 在安全和编程专项上取得最高分,DeepSeek V4-Pro 的综合基准以图片形式发布,开发者需参考官方原始表格。

FAQ
Q:三款模型都支持"推理强度"控制(low/high/max),有什么区别?
三款模型均引入了相同名称的推理强度参数,但含义略有差异。GLM-5.3 和 Kimi K3 的推理功能强制开启,low 档在简单任务上可大幅降低耗时和 token 消耗;DeepSeek V4-Pro 的 low 档官方建议用于简单问答,high 用于日常 Agent,max 用于高复杂度推理任务。实际成本差距:max 档 token 消耗通常是 low 档的 3-8 倍,按量计费场景选对档位对账单影响显著。
Q:Kimi K3 的 2.8 万亿参数和 GLM-5.3 的 7530 亿参数,哪个"更强"?
参数量不等于能力。Kimi K3 激活参数(每次推理实际使用)约为 2.8T × (16/896) ≈ 500 亿,GLM-5.3 同样是 MoE 稀疏架构,激活参数规模与总量差距很大。从实际基准来看,两者 DeepSWE 分数接近(67.3 vs 66.9%),但擅长方向不同:Kimi K3 长周期、视觉任务更强;GLM-5.3 安全漏洞发现和终端任务跃升更显著。
Q:DeepSeek 的峰谷定价对我的项目影响多大?
取决于任务时段分布。如果任务可以调度到空闲时段(非北京时间 9:00–12:00 及 14:00–18:00),V4-Pro 的实际输出成本为 13.5 元/M,V4-Flash 为 4.5 元/M;若任务主要发生在工作日高峰时段,成本翻倍。对于可预测的批处理任务(如夜间数据处理、周末报告生成),调度到空闲时段是最直接的降本手段。
Q:GLM-5.3 的定价什么时候会公布?
根据目前官方文档,bigmodel.cn 定价页暂未列出 GLM-5.3 价格,建议定期查看 docs.bigmodel.cn 或关注智谱 AI 官方公告。考虑到 GLM-5.2 的现有定价区间,以及市场竞争压力,预计定价不会超过 Kimi K3 的人民币标价。
Q:这三款模型都开源了,可以本地部署吗?
Kimi K3 权重已于 2026-07-27 正式开放;GLM-5.3 的官方公告提到两周后开放权重(即约 2026-08-28 前后);DeepSeek V4 权重已发布至 HuggingFace 和 ModelScope。但 2.8T 和 7530 亿参数级别的模型对显存要求极高,即使量化版本也需要多卡集群,本地部署适合研究机构和有充足 GPU 资源的企业。
结语
2026 年 Q3 的旗舰模型竞争正在从"谁的基准分最高"转向"谁的场景覆盖最精准"。Kimi K3 以 2.8T 参数和原生视觉能力覆盖最宽的输入模态,在长周期工程任务和网页理解上确立了开源阵营的新高度;GLM-5.3 以后训练 Scaling 实现了编程和安全漏洞发现的集中突破,用更小的基座参数换来了更有针对性的能力跃升;DeepSeek V4-Pro 以原生 Responses API 和峰谷定价直接切入 Agent 生产部署场景,空闲时段的价格竞争力在三款中最突出。选型的关键是任务场景的精确匹配:长周期 + 视觉选 Kimi K3,安全/编程专项选 GLM-5.3,Agent 大量调用 + 成本控制选 DeepSeek V4-Flash/Pro。
数据来源(均为官方渠道,2026-08-20):
- Kimi K3 发布公告:kimi.ai/blog/kimi-k3 | 定价:platform.kimi.com/docs/pricing/chat-k3
- GLM-5.3 模型文档:docs.bigmodel.cn/cn/guide/models/text/glm-5.3
- DeepSeek V4-Pro 正式版公告:api-docs.deepseek.com/zh-cn/news/news260813 | 定价:api-docs.deepseek.com/zh-cn/quick_start/pricing
价格随平台政策变化,购买前请以各官网最新定价为准。
延伸阅读
- Kimi K3 官方发布公告:https://www.kimi.ai/blog/kimi-k3
- GLM-5.3 模型文档:https://docs.bigmodel.cn/cn/guide/models/text/glm-5.3
- DeepSeek V4-Pro 正式版公告:https://api-docs.deepseek.com/zh-cn/news/news260813
- DeepSeek 定价页:https://api-docs.deepseek.com/zh-cn/quick_start/pricing
- 七牛云大模型广场(统一 API Key 接入多模型,含 Kimi/DeepSeek/GLM):https://www.qiniu.com/ai/models

952

被折叠的 条评论
为什么被折叠?



