模型选择指南
整理时间:2026-08-13
说明:基准数字来自第三方评测博客,不同来源口径有差异,仅作量级参考;价格随平台路由变化,实际以接入网关计费为准。
结论速览
日常编码用 Opus 5,大批量/简单任务用 Sonnet 5 或 GPT-5.6 Luna,最难的架构和调试用 Fable 5,超长上下文(整仓库、超长日志)用 Kimi K3 / DeepSeek V4 Pro / MiniMax M3,看图生码用 GLM-5v-Turbo。
一、按场景选(决策表)
| 场景 | 首选 | 备选 |
|---|---|---|
| 日常写代码、改 bug、多文件重构 | Opus 5 | Opus 4.8、GLM-5.1 |
| 最难的架构设计、疑难 debug、失败代价高 | Fable 5 | GPT-5.6 Sol、Opus 5 |
| 明确范围的小改动、批量跑测试、代码走查 | Sonnet 5 | Gemini 3.6 Flash、GPT-5.6 Terra |
| 极高并发/成本敏感(日志分类、批量摘要) | GPT-5.6 Luna | Haiku 4.5、DeepSeek-V4-Flash、MiniMax M3 |
| 长时程 agent(跑几十步不跑偏) | GLM-5.2、Kimi K3 | Opus 5、grok-4.5 |
| 整仓库/超长文档一次性喂进去(1M 上下文) | Kimi K3、DeepSeek V4 Pro、MiniMax M3 | Gemini 3.6 Flash |
| 设计稿/截图 → 代码,看图理解 | GLM-5v-Turbo | Kimi K3、MiniMax M3、Gemini 3.6 Flash |
| 深度检索 / 研究型任务 | Kimi K3 | Gemini 3.6 Flash |
| CLI agent 工具调用要稳、要便宜 | GLM-5-Turbo | grok-4.5 |
二、同系列内部的区别
Claude(Anthropic)—— 三档 + 一个"超 Opus"档
- 命名逻辑:Haiku(快/便宜) < Sonnet(均衡) < Opus(强) < Fable(最强,新增在 Opus 之上)
Haiku 4.5:最便宜最快,适合固定套路的小任务。Sonnet 4.6→Sonnet 5:Sonnet 5 是官方说的"最 agentic 的 Sonnet",能力接近 Opus 4.8 但便宜约 40%,是免费档默认模型。有 Sonnet 5 就没必要再用 4.6。Opus 4.6→4.7→4.8→Opus 5:单调递进,Opus 5 在 Opus 4.8 同价位上明显更强,所以 4.6/4.7 基本只在需要复现旧行为时才用。Fable 5:约 $10/$50,是 Opus 之上的新档,FrontierCode 类硬核编码 SOTA。贵 2 倍,只在 Opus 5 反复失败时上。
GPT(OpenAI)—— 5.6 换成了天体命名的三档制
GPT-5.5:上一代旗舰,已被 5.6 全面覆盖。GPT-5.6 Sol= 旗舰(太阳,最强最贵)GPT-5.6 Terra= 均衡生产档(智能基准持平 GPT-5.5 但只要一半价)GPT-5.6 Luna= 最快最便宜(比 Sol 便宜约 80%)- 2026-07-30 OpenAI 又给 Luna 降价 80%、Terra 降价 20%,Luna 现在的性价比非常极端。
- 选法:默认 Terra,量大用 Luna,出错代价高才上 Sol。
Gemini(Google)—— 注意这里"Pro"不等于更强
Gemini 3.1 Pro Preview自 2 月起冻结,虽然挂着 Pro,但在编码/agent 基准上已被Gemini 3.6 Flash全面超过(SWE-Bench Pro 约 58.7 vs 54.2),而 Flash 还快约 2 倍、输出便宜最多 58%。- 结论:这两个里几乎总选 3.6 Flash,除非要复现 3.1 Pro 的特定行为。
GLM(智谱 / z.ai)—— 主线 vs Turbo vs 视觉
- 主线递进:
GLM-5(开源编码/agent SOTA,可用性接近 Claude Opus 4.5 级)→GLM-5.1(面向 agentic engineering,编码大跳跃,SWE-Bench Pro 开源 SOTA)→GLM-5.2(当前旗舰,主打长时程任务,比 5.1 又是一次大跃升,1M 上下文)。 GLM-5-Turbo:不是更强,是同代的降本加速版,专门针对 CLI agent 场景优化,工具调用错误率低,纯智力略低于 GLM-5。适合高频、循环多、预算敏感的 agent 任务。GLM-5v-Turbo:Turbo 的原生多模态版,从预训练阶段就是视觉原生(不是给文本模型外挂视觉),设计稿/截图直出代码是强项。纯文本任务用 GLM-5-Turbo 就够,涉及图像才换它。
DeepSeek V4(2026-04-24,MIT,1M 上下文)
V4 Pro:开源权重榜首,SWE-bench Verified 约 80.6%,比 Kimi K2 高十几个点。要开源里最强推理/编码就选它。V4-Flash:便宜快的路线,能力档次明显低一截。定位相当于 DeepSeek 版的 “Luna”。
Kimi(Moonshot)
Kimi K2.5:老一代,文本为主。Kimi K3(2026-07-16):2.8T MoE,1M 上下文,原生图像/视频理解,在 BrowseComp、DeepSearchQA、FrontierSWE、GPQA、HLE、MMMU-Pro 等 10 项上全面压过 K2.5,K2.5 一项都没赢。有 K3 就不要用 K2.5。K3 在"深度检索 + 长时程 agent"上尤其突出。
其他单点模型
grok-4.5:不是全面最强(第三方 Intelligence Index 排第 4,在 Fable 5、GPT-5.5、Opus 4.8 之后),但性价比和 token 效率非常好,Terminal Bench 约 83%,SWE-bench Pro 约 64.7% 反超 GPT-5.5。和 Cursor 联合训练过,工具调用循环里的可靠性、少幻觉函数调用是卖点。适合放进"编码 agent 候选池"跑实测。MiniMax M3:约 428B 总参 / 23B 激活,Sparse Attention,文本+图像+视频,1M 上下文,价格约 $0.30/$1.20 —— 最便宜的长上下文多模态,1M 上下文下解码比 M2 快约 15 倍。适合海量长文档处理。
三、实用原则
- 不要看名字猜强弱。反例两个:Gemini 3.6 Flash > Gemini 3.1 Pro;GLM-5-Turbo 比 GLM-5 弱(Turbo = 便宜快,不是更强)。
- 两档策略比单档划算:主力用 Opus 5 / GLM-5.2 做规划和难点,把批量、机械的活派给 Sonnet 5 / Luna / Haiku 4.5。
- 1M 上下文别滥用:上下文越长,注意力质量和成本都下降。能靠检索定位就不要整仓库硬塞。
- 本仓库场景(ipcp,Java Maven 多模块):文件长、依赖深,这类任务对"长时程不跑偏"的要求高于对"单点智力"的要求,所以 Opus 5、GLM-5.2、Kimi K3 这类长时程强的模型比纯基准分高的更实用。
参考来源
- Introducing Claude Opus 5 — Anthropic
- Claude Opus 5 vs Fable 5 vs Sonnet 5
- Claude Sonnet 5 vs Opus 4.8
- Best Claude Model for Coding
- GPT-5.6: Frontier intelligence that scales with your ambition — OpenAI
- Advancing the price-performance frontier with GPT-5.6 — OpenAI
- GPT-5.6 Sol vs Terra vs Luna: Which Tier Should You Actually Use?
- Gemini 3.6 Flash vs 3.1 Pro
- Gemini 3.6 Flash Beats Gemini 3.5 Flash, Gemini 3.1 Pro On Most Benchmarks
- Z.AI Developer Document — GLM-5 · GLM-5-Turbo
- GLM-5, GLM-5.1, GLM-5.2 — Hugging Face
- GLM-5-Turbo vs GLM-5V-Turbo
- DeepSeek V4 Pro vs Flash 完整指南
- Kimi K2.5 vs Kimi K3
- MiniMax M3 Developer Guide
- Grok 4.5 benchmarks: What xAI Published · How Good Is Grok 4.5?

1647

被折叠的 条评论
为什么被折叠?



