你大概也有过这种经历:项目上线时选了 DeepSeek,因为便宜;过了两个月 DeepSeek 涨价了,你想换 Kimi,但接口规范不同,计费方式不同,缓存逻辑也不一样——换一次模型,等于重写一遍调用层。
更糟的是,Agent 场景下这种"换"不是一次性的。一个复杂任务可能先调用大模型做规划,再调小模型做执行,中间还要插入工具调用。哪个模型负责哪一步、什么时候切换、出了故障怎么 fallback——这些决策每天都在发生,但从来没有人替你做。
过去两年,大家以为模型会越来越便宜,调用成本会趋近于零。这周发生的事告诉我们:模型确实在变便宜,但"帮你选模型、管模型、在模型之间调度"这件事,正在变成整个 AI 产业链里最值钱的生意。
70 亿美元买的是什么
8 月 17 日,彭博社报道,支付公司 Stripe 与 OpenRouter 达成收购协议,价格超过 70 亿美元(约 472 亿人民币)。这笔交易有望创下 AI 模型路由平台并购金额纪录。
OpenRouter 是什么?简单说,它是全球最大的大模型 API 聚合平台。开发者只需要接入一个 API,就能调用 400 多个模型——OpenAI、Anthropic、DeepSeek、Qwen、谷歌,应有尽有。它负责模型路由、故障切换、成本和延迟优化。
这家公司今年 5 月刚完成 1.13 亿美元 B 轮融资,估值 13 亿美元。三个月后,Stripe 给出的收购价是估值的 5 倍以上。
钱花得值不值?看几个数字:OpenRouter 注册开发者超过 800 万,每周处理的 Token 从半年前的 5 万亿涨到 25 万亿,预计全年处理量超过 1 千万亿。年化收入从 2025 年 10 月的约 1000 万美元,飙涨到 2026 年 7 月的约 1.4 亿美元——不到一年翻了 14 倍。服务成本仅占收入的 28.5%,毛利率接近 70%,放在软件行业都是头部水平。
Stripe 买的不是模型,也不是技术。它买的是一个"位置"——OpenRouter 坐在 800 万开发者和 400 多个 AI 模型之间。模型越多、越碎片化,这个位置越值钱。OpenRouter 平均每 10 小时上线一个新模型,仅 7 月就加了 70 个。模型厂商之间竞争越激烈,它反而越受益。
中立是 OpenRouter 最值钱的资产。云厂商也有模型市场,但没有一家厂商会真心把流量导给对手的模型。靠着一个"谁都不站队"的身份,OpenRouter 在巨头环伺的市场里拿到了一个稀缺位置:企业在多模型部署中唯一敢托付核心业务流的中立网关。
同一周的另一条线:模型在调价
就在 OpenRouter 被收购的同一天,DeepSeek 的峰谷定价正式生效。
高峰时段(北京时间 9:00-12:00、14:00-18:00),V4 Pro 每百万 Token 缓存未命中输入 9 元、输出 27 元,缓存命中输入 0.3 元。跟 8 月 12 日公布的原价相比,缓存命中输入从 0.025 元涨到 0.3 元,涨幅 1100%。空闲时段价格为高峰的一半,V4 Flash 的输出也从 2 元涨到高峰 9 元,涨幅 350%。
同一周,OpenAI 发布了 GPT-5.6 开发者指南,核心信息是:降本不靠砍功能,靠改工程。官方给了一个直观的对照——同一道搜索评测题 BrowseComp,GPT-5.5 用最高推理档跑出 84.36% 的准确率,花费 33.27 美元;换成 GPT-5.6 Luna,同一档位拿到 84.04%,成本只要 1.33 美元。几乎一样的分数,二十五分之一的成本。Luna 的单任务成本比 Anthropic 旗舰模型 Fable 5 低将近 99%,成绩还反超了。
把两件事放在一起看,你会发现一个有趣的结构:模型厂商在拼命调整定价策略——有的涨价、有的降价、有的搞峰谷分时段——目的是把用户留在自己的生态里。但越复杂的定价,开发者就越需要一个中间层来帮忙做决策。模型厂商自己也在往这个方向走,DeepSeek 推出了 Harness,OpenAI 在 Responses API 里内置了推理保留和智能体编排——本质上都在把竞争从"模型能力"延伸到"任务入口"。
路由层正在变成新的基础设施
8 月 18 日,Snowflake 宣布在 Cortex AI Gateway 中上线动态模型路由功能。企业只需要选"auto",系统会根据任务复杂度自动把请求分配到最合适的模型上。内部测试显示,部分场景的 Token 效率提升高达 3 倍。同一天,Snowflake 还宣布接入 DeepSeek-V4-Flash 和 GLM-5.3 两个中国开源模型。
这已经不是个案。NVIDIA 在 8 月 11 日开源了模型路由工具 NeMo Switchyard;Databricks 的 Unity AI Gateway 也有类似功能;PPIO、硅基流动等国内平台同样在布局智能模型网关。模型路由,从"有点用的省钱技巧"变成了各大数据平台的标准配置。
原因不难理解。Gartner 本周发布报告预测,到 2028 年,Agent 工作流的推理成本将增长 5 倍以上。当 Agent 成为主流调用方式,一个用户请求会触发一连串中间步骤、工具调用和修正,Token 消耗可能达到普通对话的几十倍甚至上百倍。这时候,"每次请求都用最贵的模型"和"每次请求都用最便宜的模型"都不是好策略,只有智能路由才能在质量和成本之间找到平衡点。
独立分析师 Ben Thompson 的判断很到位:Token 并非真正可替换的商品,不同模型为得到同一个正确结果可能消耗完全不同数量的 Token。更接近商品的是最终获得的"有效智能",而模型成本由规模、推理效率、缓存命中率、批处理和 Token 效率共同决定。换句话说,选模型已经不是选品牌,是选"单位有效智能的最低成本"。
对个人开发者和小团队来说,不一定需要搭一个企业级网关。像 EasyAPI 这样的轻量路由工具,已经能帮你解决多模型切换、故障 fallback 和基本的成本优化问题——接入一个接口,背后是多模型调度。当你发现模型调价太频繁、单押一家风险太大的时候,一个能自动帮你选模型、切模型的中间层,就不再是可选项了。

模型在变便宜,路由层在变值钱。这两条线正在交叉,而交叉点就在你每天写的那几行 API 调用代码里。

200


被折叠的 条评论
为什么被折叠?



