大模型价格战全面爆发:DeepSeek V4 Flash、GPT-5.6降价与GLM涨价的三角博弈

AI 时代程序员必备技能

Codex、Claude Code、Cursor、Hermes Agent、OpenClaw等工程化实战专栏 ,讲透 AI 如何接管脏活累活

大模型价格战全面爆发:DeepSeek V4 Flash、GPT-5.6降价与GLM涨价的三角博弈

2026年8月,大模型行业在一周之内经历了三种截然相反的定价策略——OpenAI把GPT-5.6 Luna砍价80%,DeepSeek用V4 Flash正式版把运行成本打到全球最低,智谱GLM却逆势涨价261%。这不是简单的价格调整,而是一场关于大模型商业化路径的根本性博弈。

大模型价格战三角博弈:DeepSeek降价、GPT砍价、GLM涨价


一、一周三声枪响:三种定价策略的同台对决

7月30日到8月3日,大模型API市场在五天之内被三次"重塑"。

第一枪:OpenAI主动降价。 7月30日,OpenAI宣布GPT-5.6 Luna价格下调80%——输入从每百万Token 1美元降至0.2美元,输出从6美元降至1.2美元。Terra也同步下调20%。旗舰模型Sol维持原价,但新增Fast模式(2倍价格换2.5倍速度)。Sam Altman的表述是:"在每一个模型层级,都提供最好的价格与智能比。"

值得注意的是,这次降价的"功劳"部分来自GPT-5.6自己。OpenAI披露,GPT-5.6 Sol在Codex中自主重写了生产环境的GPU Kernel,将端到端服务成本降低了20%,推测解码优化让Token生成效率提升15%以上。模型帮助优化自身推理系统,再将效率收益转化为价格下调——这在AI行业尚属首次。

第二枪:DeepSeek以价制价。 7月31日,DeepSeek V4 Flash正式版API上线公测。没有发布会,没有高调宣传,但数据足以让行业震动:总参数2840亿,激活参数仅130亿(MoE架构),支持100万Token上下文窗口。Agent能力大幅跃升——Terminal Bench 2.1得分82.7,Cybergym得分76.7,在多项Agent基准上全面超越三个月前的V4-Pro预览版。

定价更加激进:每百万输入Token 0.14美元(缓存未命中)或0.0028美元(缓存命中),每百万输出Token 0.28美元。按Artificial Analysis的智能指数任务成本计算,V4 Flash每项任务平均成本仅3美分——而Kimi K3为86美分,GPT-5.6 Sol为1.86美元,Claude Fable 5为3.15美元。V4 Flash的运行成本只有Claude Fable 5的不到百分之一。

第三枪:智谱逆势涨价。 就在DeepSeek和OpenAI争相降价的同时,智谱GLM Coding Plan新版上线,采用积分制——Pro版月费从149元涨到538元,涨幅261%;Max版从469元涨到1078元,涨幅130%。API层面,GLM-5.2的Prompt价格从0.28美元/百万Token涨到1.19美元,Completion从0.89美元涨到3.74美元,涨幅均超过3倍。

三种定价策略背后,是三种完全不同的商业逻辑。问题在于:谁的选择是对的?


二、数据透视:7.22万亿Token背后的格局重构

OpenRouter最新周报(7月27日-8月2日)给出了最直观的答案。

DeepSeek V4 Flash以7.22万亿Token的周调用量位居所有模型第一。 全球调用量排名前五均为中国AI大模型:小米MiMo-V2.5、DeepSeek V4 Flash、腾讯HY3、智谱GLM-5.2、DeepSeek V4 Pro。中国AI大模型已连续14周在全球调用量排名中领跑,整体市场份额约63.5%,美国模型约35.5%。

这个数据需要放在更大的坐标系里理解。Gartner预计,2026年全球AI优化型IaaS终端用户支出将达到375亿美元,同比增长约105%。其中推理支出预计达到206亿美元,首次超过训练支出。到2029年,推理支出占比将超过65%。

推理正在取代训练,成为大模型行业最大的成本中心和收入来源。而DeepSeek以最低的推理成本拿下了最高的调用量——这不是"赔本赚吆喝",而是"用规模换壁垒"的典型互联网打法。

一名港股AI分析师的评价一针见血:"当市场还在争论'参数竞赛'是否可持续时,DeepSeek证明后训练优化足以让轻量级模型释放接近顶级闭源模型的Agent能力。这意味着推理成本曲线可能比我们预期的更陡峭,对整个产业链的估值体系都会产生连锁反应。"

OpenCode CEO透露的数据也印证了这一点:V4 Flash上线首日,其平台调用量提升30%,新注册用户同步增长30%。多名海外AI初创创始人在X平台表示,团队全线迁移至DeepSeek后,月度推理成本下降60%至85%。


三、85倍价差:三家定价策略的成本结构拆解

把三个模型放在同一张价格表上,差距的触目惊心程度远超想象。

模型输入($/百万Token)输出($/百万Token)智能指数(满分100)单任务成本
DeepSeek V4 Flash0.14(命中0.0028)0.2850$0.03
GPT-5.6 Luna(降价后)0.201.2051+$0.05
GPT-5.6 Sol(不变)5.0030.0056$1.86
Claude Fable 5--57$3.15
GLM-5.2(涨价后)1.193.7451-
Kimi K3--55$0.86

API定价与智能指数一览:DeepSeek / GPT-5.6 Luna / GLM-5.2 / GPT-5.6 Sol

单任务成本对比:DeepSeek $0.03 vs Claude $3.15(约105倍)

Claude Opus每百万输出Token定价大约是V4 Flash的85倍,而智能指数仅高出6分。换句话说,多拿6分,调用费高出52倍。

V2EX上一个99回复的热帖标题很直白:"最新的deepseek-v4-flash正式版真的有这么强吗?"另一个56回复的帖子则在讨论智谱涨价:"智普今天这波涨价,有点迷,涨了快3倍。"开发者的选型天平正在快速倾斜。

DeepSeek为什么能这么便宜? 核心在MoE架构——2840亿总参数中每次推理仅激活130亿,这意味着实际计算量远小于参数规模暗示的水平。再加上后训练优化和峰谷定价机制(缓存命中时输入成本降至0.0028美元/百万Token),DeepSeek把"按10个月回本算都这么便宜"变成了现实。

OpenAI为什么选择降价? 效率提升是直接原因,但更深层的原因是竞争压力。Luna降价80%后的月度账单(按5000万输入+500万输出Token/天计算)约为480美元,介于MiniMax M3(630美元)和DeepSeek V4 Flash(252美元)之间。OpenAI试图用降价守住中低端市场——但即便降价80%,DeepSeek的单任务成本仍比Luna低约60%。

智谱为什么逆势涨价? 表面上看,智谱的解释是"需求爆发"——旧版套餐长期限售,每天上午10点限量开放购买。但更深的原因可能是算力成本压力:智谱已落地1GW级国产AI算力数据中心,全部采用国产芯片。国产芯片的推理效率与英伟达GPU仍有差距,这意味着智谱的单位推理成本可能高于使用H100的竞争对手。涨价可能不是"想赚更多",而是"不得不涨"。

一位开发者在V2EX上的吐槽很能代表情绪:"GLM涨价3倍,能力只差1分,凭什么要支付十几倍价格,还承担限流风险?"


四、开发者选型重构:从"信仰"到"账单"

价格战正在从根本上改变开发者的选型逻辑。

一年前,开发者的选型链路是:看跑分 → 看模型能力 → 看生态 → 看价格。价格是最后考虑的因素,因为所有模型都很贵,差异不大。

现在,选型链路变成了:看价格 → 看智能指数差距 → 看Agent能力 → 看稳定性。当一个模型的运行成本只有另一个的百分之一,而智能指数只差6分时,价格成了第一决策因素。

V2EX上的讨论反映了一个关键趋势:开发者的使用方式正在分化。

  • 重度场景(复杂推理、代码生成、长文档分析):仍然使用GPT-5.6 Sol或Claude Fable 5,追求最高质量
  • 日常场景(信息汇总、文件总结、简单编程):全面迁移到DeepSeek V4 Flash,追求极致性价比
  • 中间地带(中等复杂度任务):使用GPT-5.6 Luna(降价后)或Kimi K3,在质量和成本之间找平衡

一位AI开发者张泽给了每经记者一组直观的数据:他把V4 Flash接入Hermes执行了一次本地文件阅读和全网信息检索汇总任务,用量约51万Tokens,消耗0.53元。"最直观的感受就是任务处理速度很快,40秒完成,而GPT-5.6 Sol Codex用了1分47秒。当然Codex输出质量更高一些,不过V4 Flash的交付也达到了可用水平。"

GitHub上的开源生态也在围绕DeepSeek快速构建。antirez/ds4(DeepSeek 4本地推理引擎)获得2万Star,esengine/DeepSeek-Reasonix(DeepSeek原生AI编码Agent)登上Trending。一个完整的DeepSeek工具链正在形成——从云端API到本地推理,从编码Agent到安全工具,开源社区正在用脚投票。


五、开源生态共振:围绕DeepSeek的工具链正在成型

GitHub Trending不仅是一个排行榜,更是开发者注意力的风向标。

在2026年8月初的Trending列表中,与DeepSeek直接相关的项目至少有三个:antirez/ds4(DeepSeek 4本地推理引擎,C语言,2万Star),esengine/DeepSeek-Reasonix(DeepSeek原生AI编码Agent),以及多个基于DeepSeek API的Agent框架。

这不是偶然。当一个模型的API价格低到开发者"不需要犹豫"的程度时,围绕它构建工具链的动力就会指数级增长。就像2010年代围绕AWS构建的云生态一样——低价的基础设施催生了庞大的上层应用。

更值得注意的是,DeepSeek在Harness(包裹在AI模型外的工作条件基础设施)领域的布局。崔添翼在6月21日发文表示DeepSeek Harness组是新成立的部门,目标远大、工作繁重。中信证券认为,Harness的核心价值在于"将模型能力转化为稳定、低成本的端到端交付"——这正是从"能聊天"到"能干活"的关键一跃。

V4 Flash正式版首次披露了DeepSeek Harness的新进展:即将公布。这意味着DeepSeek不仅在卖模型,还在卖一整套让模型"能干活"的基础设施。当模型+Harness形成闭环,竞争壁垒就不再只是价格,而是生态。


六、冷思考:降价能否持续?

价格战的终局在哪里?这需要从三个维度审视。

算力成本拐点何时到来? Dwarkesh Patel在7月29日撰文预测"未来几年算力可能贵十倍以上",理由是AI芯片需求增速远超供给。如果这个判断成立,那么当前的低价策略可能不可持续——DeepSeek的低价建立在MoE架构效率之上,但如果底层算力成本持续攀升,MoE的效率优势会被侵蚀。

但反方观点同样有力:新一代AI芯片(英伟达Blackwell Ultra、国产替代芯片)的推理效率正在快速提升,而推理优化的软件技术(推测解码、KV Cache压缩、连续批处理)也在迭代。OpenAI用GPT-5.6 Sol自主优化推理系统、降低20%服务成本的案例证明,软件层面的效率提升空间还很大。

商业化拐点是否到来? Gartner预测2026年推理支出首次超过训练支出,意味着行业正从"烧钱训练"转向"靠推理赚钱"。但问题是,当DeepSeek把单任务成本压到3美分时,即使调用量达到7.22万亿Token/周,收入能否覆盖算力和研发成本?

参考一个估算:按V4 Flash的输出价格0.28美元/百万Token计算,7.22万亿Token中假设输出占20%(约1.44万亿),收入约403万美元/周,年化约2.1亿美元。这个数字与OpenAI的年化收入(数十亿美元)仍有数量级差距。但DeepSeek的成本结构也远低于OpenAI——MoE架构+国产算力+后训练优化,三重压缩使得盈亏平衡点远低于竞争对手。

行业格局会怎样演化? 最可能的终局是"三层金字塔":

  • 顶层:GPT-5.6 Sol、Claude Fable 5——靠最强能力维持溢价,服务对质量极度敏感的场景
  • 中层:GPT-5.6 Luna(降价后)、Kimi K3、GLM-5.2——在质量和成本之间寻找平衡点,但GLM涨价后竞争力堪忧
  • 底层:DeepSeek V4 Flash、小米MiMo-V2.5——靠极致性价比+开源生态+Harness基础设施,吃下最大量的日常推理需求

智谱的处境最微妙。GLM-5.2智能指数51分,与V4 Flash的50分几乎持平,但价格高出十几倍。涨价可以短期改善收入,但长期会加速开发者流失。除非智谱能在Coding和Agent场景上拉开与DeepSeek的能力差距,否则涨价策略的可持续性存疑。


七、结语:价格战的本质是路线之争

大模型价格战看似是定价策略的博弈,本质上是三条技术路线的较量。

OpenAI的路线:用最强大模型优化自身推理系统→降低服务成本→降价→吸引更多用户→获得更多推理数据→进一步优化模型。这是一个"能力驱动成本下降"的飞轮,但前提是模型能力必须持续领先。

DeepSeek的路线:用MoE架构+后训练优化把推理成本压到极致→低价吸引最大量调用→构建Harness生态和开源工具链→形成基础设施级壁垒。这是"规模驱动生态成型"的飞轮,核心在于能否持续保持成本优势。

智谱的路线:用国产算力+涨价维持收入→在高价值Coding/Agent场景深耕→靠差异化能力建立溢价。这是"价值驱动溢价"的飞轮,但前提是差异化能力足够明显。

三条路线谁能跑通,不取决于今天的定价高低,而取决于明天的技术迭代速度。但有一点是确定的:大模型行业已经从"谁的模型最强"的时代,进入了"谁的模型最值"的时代。而对开发者来说,这可能是最好的时代——当AI从奢侈品变成基础设施,创新的门槛正在被前所未有地降低。


本文基于OpenRouter周报、Artificial Analysis测试数据、OpenAI官方公告、DeepSeek官方更新日志、智谱Coding Plan公告、V2EX社区讨论及多家媒体报道综合撰写。数据截至2026年8月5日。

AI 时代程序员必备技能

Codex、Claude Code、Cursor、Hermes Agent、OpenClaw等工程化实战专栏 ,讲透 AI 如何接管脏活累活

内容概要:本文围绕基于NSGA-2算法的电--气综合需求响应(IDR)在综合能源系统中的多目标优化问题展开研究,提出了一种融合能优化算法能源系统协同调度的解决方案。研究系统性地构建了包含电力、热力天然气多能耦合的综合能源系统模型,设计了以能效提升、运行成本降低和环境效益优化为目标的多目标优化框架,并采用NSGA-2算法求解该复杂非线性优化问题,获得Pareto最优解集。文中详细阐述了IDR机制建模方法、多目标优化问题的数学建模过程以及NSGA-2算法的关键实现步骤,包括编码方式、交叉变异策略非支配排序机制,并通过Matlab代码实现了完整的仿真验证流程,展示了该方法在平衡多个冲突目标方面的优越性能。; 适合人群:具备电力系统、能源系统建模或优化算法基础的研究生、科研人员及工程技术人员,特别适用于从事综合能源系统规划、需求响应策略设计、多目标进化算法应用等相关领域的研究人员; 使用场景及目标:①应用于综合能源系统的运行优化规划决策,支持多能互补场景下的协同调度分析;②为科研工作者提供NSGA-2算法在能源系统中实际应用的完整Matlab代码实现范例,助力学术论文复现、算法改进模型拓展; 阅读建议:建议读者结合文中提供的Matlab代码,按照系统建模、目标函数设计、约束处理到算法实现的研究脉络逐步学习,重点关注Pareto前沿的生成过程、多目标权衡分析及算法参数敏感性,以深入掌握多目标进化算法在复杂能源系统优化中的工程化应用方法。
内容概要:本文基于Matlab/Simulink仿真平台,复现了一种针对四机并联孤岛微电网的综合控制策略,旨在解决在遭受拒绝服务(DoS)攻击等网络安全威胁下系统的稳定运行问题。该方案深度融合了下垂控制、二次控制事件触发式负荷控制,构建了分层协同的控制架构,以实现电压频率的快速恢复以及有功/无功功率的精确共享分配。研究建立了微电网各分布式单元的数学模型,设计了具备弹性的控制机制,在通信链路受到DoS攻击导致信息中断的恶劣条件下,仍能有效维持系统的基本运行性能。通过引入事件触发机制,显著降低了控制器间的通信频率,减轻了通信负担,提升了系统整体的运行效率鲁棒性。仿真结果充分验证了该复合控制策略在多重扰动下对系统动态响应、稳态精度及抗干扰能力的优越表现。; 适合人群:具备电力系统分析、现代控制理论及微电网运行控制等相关专业知识背景,熟悉Matlab/Simulink仿真环境,从事新能源、能电网、分布式能源系统等领域科研、教学或工程技术研发工作的研究人员、高校教师及研究生。; 使用场景及目标:①深入研究孤岛微电网在面临网络安全攻击(如DoS)时的韧性(resilience)稳定性控制机理;②掌握多分布式电源(DG)并联系统中下垂控制二次电压/频率协同控制的设计实现方法;③探究事件触发控制(Event-Triggered Control)在降低通信资源消耗、提升微电网控制效率方面的具体应用优势;④为开发和验证具备抗干扰能力的微电网弹性控制(Resilient Control)策略提供可靠的仿真平台技术参考。; 阅读建议:此资源以Simulink仿真实现为核心,不仅提供了完整的系统模型模块化代码,更深刻体现了控制策略的设计思想系统集成逻辑。建议读者在学习过程中,务必结合理论推导、模型搭建仿真调试,深入理解各控制环节(如下垂控制、二次补偿、事件触发判据)的内在联系参数整定方法。可通过修改DoS攻击的持续时间、发生时序以及事件触发阈值等关键参数,开展对比仿真实验,以全面掌握系统在不同工况下的动态行为特征,从而深化对微电网复杂控制系统的认知分析能力。
内容概要:本文围绕“计及电气热综合需求响应的区域综合能源系统优化调度”展开,基于Matlab代码实现,聚焦于构建电--气耦合的区域综合能源系统多目标优化模型。研究采用NSGA-II等多目标进化算法,在考虑电力、热力天然气等多种能源形式协同运行的基础上,引入综合需求响应机制,实现对用户侧灵活资源的优化调度。重点解决在多重物理约束运行限制下,如何协调经济性、能源利用效率碳排放等多个冲突目标,并通过仿真算例验证所提模型在提升系统整体效益运行灵活性方面的有效性优越性。; 适合人群:具备一定电力系统、能源系统建模或能优化算法基础,从事综合能源系统、低碳调度、需求响应等领域研究的研究生、科研人员及工程技术人员。; 使用场景及目标:①学习并掌握电--气综合能源系统的耦合建模方法;②理解并应用NSGA-II等多目标优化算法进行复杂工程问题求解;③复现高水平学术论文中的优化调度方案,用于科研论文撰写、项目申报或实际工程系统开发。; 阅读建议:此资源以Matlab代码为核心,强调理论建模数值仿真的深度融合,建议读者在学习过程中结合文档中的模型结构、目标函数约束条件,同步运行并调试代码,深入理解算法参数设置系统性能之间的关联,并尝试在不同场景下进行拓展改进。
内容概要:本文围绕基于电压-电流双闭环控制的DCM模式反激式开关电源展开系统性仿真研究,深入探讨了其工作原理、系统建模方法及控制策略的设计实现。研究重点聚焦于断续导通模式(DCM)下的动态特性,构建了完整的电压外环电流内环双闭环控制系统,通过协同调控实现输出电压的高精度稳定。结合Mathcad计算书对关键参数进行理论推导设计,并依托仿真模型对系统在不同输入电压和负载条件下的响应特性、稳定性及控制精度进行全面验证。研究内容涵盖主电路设计、变压器参数计算、控制环路补偿网络设计及系统级性能评估,确保电源在轻载或变载工况下仍具备优异的稳压能力和动态响应性能。; 适合人群:具备电力电子技术、自动控制理论基础知识,从事开关电源、电源管理系统或相关领域研发工作的工程师及高校电气工程、自动化等相关专业的研究生。; 使用场景及目标:①掌握反激式开关电源在DCM模式下的建模动态分析方法;②学习电压-电流双闭环控制结构的设计流程参数整定技巧;③结合Mathcad计算仿真工具(如Simulink)完成从理论设计到系统仿真的全流程验证优化,提升对开关电源控制环路稳定性的理解工程实践能力。; 阅读建议:建议读者结合文中提供的仿真模型Mathcad计算文档,逐步复现设计过程,重点关注控制环路的波特图分析、相位裕度增益裕度的评估,深入理解参数变化对系统稳定性的影响,从而夯实开关电源设计的理论基础仿真验证能力。
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值