模型选择指南

AI 时代程序员必备技能

Codex、Claude Code、Cursor、Hermes Agent、OpenClaw等工程化实战专栏 ,讲透 AI 如何接管脏活累活

模型选择指南

整理时间:2026-08-13
说明:基准数字来自第三方评测博客,不同来源口径有差异,仅作量级参考;价格随平台路由变化,实际以接入网关计费为准。

结论速览

日常编码用 Opus 5,大批量/简单任务用 Sonnet 5GPT-5.6 Luna,最难的架构和调试用 Fable 5,超长上下文(整仓库、超长日志)用 Kimi K3 / DeepSeek V4 Pro / MiniMax M3,看图生码用 GLM-5v-Turbo

一、按场景选(决策表)

场景首选备选
日常写代码、改 bug、多文件重构Opus 5Opus 4.8、GLM-5.1
最难的架构设计、疑难 debug、失败代价高Fable 5GPT-5.6 Sol、Opus 5
明确范围的小改动、批量跑测试、代码走查Sonnet 5Gemini 3.6 Flash、GPT-5.6 Terra
极高并发/成本敏感(日志分类、批量摘要)GPT-5.6 LunaHaiku 4.5、DeepSeek-V4-Flash、MiniMax M3
长时程 agent(跑几十步不跑偏)GLM-5.2、Kimi K3Opus 5、grok-4.5
整仓库/超长文档一次性喂进去(1M 上下文)Kimi K3、DeepSeek V4 Pro、MiniMax M3Gemini 3.6 Flash
设计稿/截图 → 代码,看图理解GLM-5v-TurboKimi K3、MiniMax M3、Gemini 3.6 Flash
深度检索 / 研究型任务Kimi K3Gemini 3.6 Flash
CLI agent 工具调用要稳、要便宜GLM-5-Turbogrok-4.5

二、同系列内部的区别

Claude(Anthropic)—— 三档 + 一个"超 Opus"档

  • 命名逻辑:Haiku(快/便宜) < Sonnet(均衡) < Opus(强) < Fable(最强,新增在 Opus 之上)
  • Haiku 4.5:最便宜最快,适合固定套路的小任务。
  • Sonnet 4.6Sonnet 5:Sonnet 5 是官方说的"最 agentic 的 Sonnet",能力接近 Opus 4.8 但便宜约 40%,是免费档默认模型。有 Sonnet 5 就没必要再用 4.6。
  • Opus 4.64.74.8Opus 5:单调递进,Opus 5 在 Opus 4.8 同价位上明显更强,所以 4.6/4.7 基本只在需要复现旧行为时才用。
  • Fable 5:约 $10/$50,是 Opus 之上的新档,FrontierCode 类硬核编码 SOTA。贵 2 倍,只在 Opus 5 反复失败时上。

GPT(OpenAI)—— 5.6 换成了天体命名的三档制

  • GPT-5.5:上一代旗舰,已被 5.6 全面覆盖。
  • GPT-5.6 Sol = 旗舰(太阳,最强最贵)
  • GPT-5.6 Terra = 均衡生产档(智能基准持平 GPT-5.5 但只要一半价)
  • GPT-5.6 Luna = 最快最便宜(比 Sol 便宜约 80%)
  • 2026-07-30 OpenAI 又给 Luna 降价 80%、Terra 降价 20%,Luna 现在的性价比非常极端。
  • 选法:默认 Terra,量大用 Luna,出错代价高才上 Sol。

Gemini(Google)—— 注意这里"Pro"不等于更强

  • Gemini 3.1 Pro Preview 自 2 月起冻结,虽然挂着 Pro,但在编码/agent 基准上已被 Gemini 3.6 Flash 全面超过(SWE-Bench Pro 约 58.7 vs 54.2),而 Flash 还快约 2 倍、输出便宜最多 58%。
  • 结论:这两个里几乎总选 3.6 Flash,除非要复现 3.1 Pro 的特定行为。

GLM(智谱 / z.ai)—— 主线 vs Turbo vs 视觉

  • 主线递进:GLM-5(开源编码/agent SOTA,可用性接近 Claude Opus 4.5 级)→ GLM-5.1(面向 agentic engineering,编码大跳跃,SWE-Bench Pro 开源 SOTA)→ GLM-5.2当前旗舰,主打长时程任务,比 5.1 又是一次大跃升,1M 上下文)。
  • GLM-5-Turbo:不是更强,是同代的降本加速版,专门针对 CLI agent 场景优化,工具调用错误率低,纯智力略低于 GLM-5。适合高频、循环多、预算敏感的 agent 任务。
  • GLM-5v-Turbo:Turbo 的原生多模态版,从预训练阶段就是视觉原生(不是给文本模型外挂视觉),设计稿/截图直出代码是强项。纯文本任务用 GLM-5-Turbo 就够,涉及图像才换它。

DeepSeek V4(2026-04-24,MIT,1M 上下文)

  • V4 Pro:开源权重榜首,SWE-bench Verified 约 80.6%,比 Kimi K2 高十几个点。要开源里最强推理/编码就选它。
  • V4-Flash:便宜快的路线,能力档次明显低一截。定位相当于 DeepSeek 版的 “Luna”。

Kimi(Moonshot)

  • Kimi K2.5:老一代,文本为主。
  • Kimi K3(2026-07-16):2.8T MoE,1M 上下文,原生图像/视频理解,在 BrowseComp、DeepSearchQA、FrontierSWE、GPQA、HLE、MMMU-Pro 等 10 项上全面压过 K2.5,K2.5 一项都没赢。有 K3 就不要用 K2.5。K3 在"深度检索 + 长时程 agent"上尤其突出。

其他单点模型

  • grok-4.5:不是全面最强(第三方 Intelligence Index 排第 4,在 Fable 5、GPT-5.5、Opus 4.8 之后),但性价比和 token 效率非常好,Terminal Bench 约 83%,SWE-bench Pro 约 64.7% 反超 GPT-5.5。和 Cursor 联合训练过,工具调用循环里的可靠性、少幻觉函数调用是卖点。适合放进"编码 agent 候选池"跑实测。
  • MiniMax M3:约 428B 总参 / 23B 激活,Sparse Attention,文本+图像+视频,1M 上下文,价格约 $0.30/$1.20 —— 最便宜的长上下文多模态,1M 上下文下解码比 M2 快约 15 倍。适合海量长文档处理。

三、实用原则

  1. 不要看名字猜强弱。反例两个:Gemini 3.6 Flash > Gemini 3.1 Pro;GLM-5-Turbo 比 GLM-5 弱(Turbo = 便宜快,不是更强)。
  2. 两档策略比单档划算:主力用 Opus 5 / GLM-5.2 做规划和难点,把批量、机械的活派给 Sonnet 5 / Luna / Haiku 4.5。
  3. 1M 上下文别滥用:上下文越长,注意力质量和成本都下降。能靠检索定位就不要整仓库硬塞。
  4. 本仓库场景(ipcp,Java Maven 多模块):文件长、依赖深,这类任务对"长时程不跑偏"的要求高于对"单点智力"的要求,所以 Opus 5、GLM-5.2、Kimi K3 这类长时程强的模型比纯基准分高的更实用。

参考来源

AI 时代程序员必备技能

Codex、Claude Code、Cursor、Hermes Agent、OpenClaw等工程化实战专栏 ,讲透 AI 如何接管脏活累活

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值