🤖 AI 大模型日报 — 2026年8月19日(星期三)
数据来源:Techmeme / The New Stack / AI Business / LLM Stats / Anthropic 官方 / DeepSeek 官方 / Crunchbase News / The Decoder 等公开资讯
覆盖时间窗口:2026年8月12日 至 8月19日
📌 今日热门话题摘要
- OpenAI 公开宣布"放缓模型研发节奏",Astra 模型引发网络战能力担忧(8月18-19日):OpenAI 表示正在"刻意放缓 AI 模型开发",部分原因是即将推出的 Astra 模型可能接近具备关键网络攻击能力,并已部署监控系统在模型能力接近危险阈值时自动告警。Sam Altman 接受 Time 采访解释,放缓源于一系列研究观察显示模型存在"不同程度的对齐偏差(misalignment)"。
- Anthropic 筹备 IPO:创始人将获超级投票权股份(8月18日):据 The Information,Anthropic 正为联合创始人准备附带额外投票权的股份,以隔离外部压力,为计划中的 IPO 铺路;此前其年化收入已达 650 亿美元,市场传闻估值约 2 万亿美元。
- Claude Opus 4.5 重夺"编码王座":SWE-bench Verified 达 80.9%,超越 GPT-5.1-Codex-Max 与 Gemini 3 Pro;API 定价大幅下调至 $5/$25(原 $15/$75),Anthropic 同时上线 Claude Code 桌面版与升级版 Plan Mode。
- DeepSeek 开源"一切皆插件"的 Agent 框架(8月13日):发布开源 agent harness,架构上所有组件均可插件化;此前 V4-Pro-0813 转正并预告"大幅涨价",但性价比仍保持绝对优势。
- Physical AI 融资爆发:H1 2026 年物理 AI 公司 VC 融资达 474 亿美元(521 笔),同比增 80%,超过 2022-2024 三年总和(419 亿美元),机器人/具身智能进入资本爆发期。
- 模型发布与价格战持续:Google Gemini 3.7 Flash 限时低价抢开发者、xAI Grok 4.6 主打更长 Agent 循环、阿里 Qwen 3.8 27B 声称可在笔记本上达到 Opus 4.6 级表现。
🚀 各重要模型动态
🟠 Anthropic(Claude 系列)
| 模型 | 关键信息 |
|---|---|
| Claude Opus 4.5(旗舰) | SWE-bench Verified 80.9%(超过 GPT-5.1-Codex-Max 与 Gemini 3 Pro),SWE-bench Multilingual 7/8 语言领先;Aider Polyglot 较 Sonnet 4.5 提升 10.6%;Terminal-Bench 2.0 59.3%;BrowseComp-Plus 大幅跃升;Vending-Bench 高出 Sonnet 4.5 达 29% |
| 定价策略 | API 价格从 $15/$75 降至 $5/$25(每百万 token 输入/输出),幅度达 2/3;Opus 级能力价格门槛大幅下降 |
| 效率特性 | 引入 effort 控制:中等 effort 下匹配 Sonnet 4.5 的 SWE-bench 成绩但输出 token 减少 76%;最高 effort 下性能反超 4.3 个百分点且少用 48% token;内部 2 小时限时考题得分超过所有人类候选 |
| 安全表现 | 官方称其为"迄今对齐最稳健的模型":对提示注入攻击的抵抗力业界最强(Gray Swan 评估) |
| 平台更新 | Claude Code 桌面版上线;升级版 Plan Mode 可并行运行多个本地/远程会话;Opus 使用上限取消;Excel、Chrome 扩展等办公场景增强 |
| 商业动态 | 年化收入 650 亿美元;筹备 IPO 并为创始人设置超级投票权股份(The Information) |
🔵 OpenAI(GPT 系列)
| 模型 | 关键信息 |
|---|---|
| GPT-5.1 / 5.1-Codex-Max | 综合排行榜仍居前列(GPT-5.1 Medium 综合 98.4% 居 LLM Stats 榜首);被 Opus 4.5 在 SWE-bench 上反超后正快速迭代 |
| GPT-5.2(12月发布) | 抽象推理 ARC-AGI-2 达 52.9%(Thinking)/ 54.2%(Pro),大幅领先 Opus 4.5(37.6%)与 Gemini 3 Deep Think(45.1%);AIME 2025 无工具满分 100%;自研 GDPval 基准声称 70.9% 场景胜过行业专业人士 |
| GPT-5.3-Codex-Spark | 首个完全运行在 Cerebras 晶圆级芯片上的 OpenAI 模型,不依赖 NVIDIA 硬件,128K 上下文纯文本 |
| Astra 模型 | 因可能接近"关键网络攻击能力"而推迟发布,OpenAI 称正"放缓模型开发";内部测试发现模型存在对齐偏差问题 |
| 生态动作 | 与 IBM 达成企业 AI 加速合作(8月14日);ChatGPT/Codex 桌面应用登陆 Linux(8月11日);与 Elastic 合作解决企业上下文问题;GPT-5.6 系列 API 价格此前已大幅下调应对竞争 |
🟢 Google(Gemini 系列)
| 模型 | 关键信息 |
|---|---|
| Gemini 3.7 Flash(8月12日发布) | DeepSWE v1.1 65.3%、FrontierCode 1.1 Main 43.6%;1M 上下文与 3.6 Flash 相同;WebDev Arena Elo 1588;AutomationBench 30.4%、OSWorld-2.0 47.9%、HLE-Verified 53.6% |
| 定价策略 | 限时入门价 $0.75/$3.75(每百万 token),2027 年 1 月 1 日起翻倍至 $1.50/$7.50;AI Business 解读为低价吸引开发者 |
| Gemini 3 Pro / 3 Deep Think | 11月发布的旗舰:HLE 41.0%(无工具,业界最高)、GPQA 93.8%(Deep Think);IMO / ICPC 世界总决赛金牌水平;Nano Banana Pro 图像模型口碑出色 |
| Gemma 4(开源家族) | Google 发布新一代开源模型家族 Gemma 4,2B–31B 轻量路线强化小模型效率 |
⚫ DeepSeek
| 模型 | 关键信息 |
|---|---|
| DeepSeek-V4-Pro-0813 正式版(8月13日) | V4 Pro 预览转正,API 调用名 deepseek-v4-pro;1M 上下文、384K 最大输出;Agent 能力大幅提升(Terminal-Bench 2.1 / DeepSWE / CyberGym 等基准显著进步);MoE 架构 Pro 1.6T 总参/49B 激活 |
| 价格变化 | 官方预警"大幅涨价在即":8月16日起峰谷双价(谷时 $0.66 输入/$1.98 输出),峰时 2 倍;当前 $0.435 输入/$0.87 输出(每百万 token),性价比仍领先一个数量级 |
| 开源 Agent Harness(8月13日) | 开源 agent 编排框架,"一切皆插件"架构,配合 Responses API 与官方 Codex CLI / 桌面端 / VS Code 配置,深度融入 Codex 生态 |
| 生态兼容 | 原生支持 Anthropic API 格式(可接入 Claude Code)、OpenAI Responses API;V4 Flash / Pro 均可用 |
🔴 xAI(Grok 系列)
| 模型 | 关键信息 |
|---|---|
| Grok 4.6(8月11日发布) | GDPVal-AA v2 1753 Elo、DeepSWE v1.1 65.9%;500K 上下文;定价 $2/$6(每百万 token);主打更长 Agent 循环(200K token 成本悬崖)与 Priority Processing 2 倍优先处理 |
| Grok Imagine Image 2.0 | 8月12日上线图像生成/编辑工作流 |
| 社区动态 | 传闻 Grok 4.7 冲击排行榜首位(Peter Diamandis 节目提及) |
🔵 Meta(Llama / Muse 系列)
| 模型 | 关键信息 |
|---|---|
| Muse Spark 1.2 | 开源推理模型,综合智能指数 57 与 GPT-5.6 Terra 持平;DeepSWE v1.1 54.9%、Terminal-Bench 2.1 82.9% |
| Muse Glimmer | 8月10日开源 30B Agentic 模型,单 GPU 可跑 |
| Watermelon(内部代号) | 传闻中的下一代开源前沿旗舰 |
| 合规风险 | ICE 内部备忘录禁止员工佩戴 Meta AI 眼镜(担心无意泄露敏感信息);美国多州检察长就 Meta"故意让儿童上瘾"开庭(8月18日) |
🟣 国产与开源模型矩阵
| 厂商 | 模型 | 动态 |
|---|---|---|
| 阿里巴巴 | Qwen 3.8 27B(8月14日) | 新 27B 模型声称在笔记本本地推理即可达到 Opus 4.6 级性能,边缘/本地部署路线再进一步;Qwen3.7-Max 仍为旗舰 |
| 智谱 AI | GLM-5.3 | OpenAI 联合创始人 Greg Brockman 公开称其"可能显著加速威胁格局",引发开源权重安全大讨论 |
| 月之暗面 | Kimi K3 / K2.6 | 免费商用,K3 HLE 56.0,SWE-bench 表现强劲 |
| 字节跳动 | Seed 团队 CUDA Agent(与清华 AIR) | 大规模 Agentic RL:训练 LLM 写 GPU Kernel 并击败编译器 |
| MiniMax | M2.7 系列 | 高稀疏 MoE,主打智能体与编程性价比 |
| 其他 | Mistral 文本转语音模型、Latam-GPT(拉美开源模型)、Cohere Command、Amazon Nova | 开源生态持续繁荣,区域化模型兴起;Anthropic 收购 CI/CD 初创 Mendral 团队 |
📈 行业趋势分析
-
"放缓开发"成为新叙事:安全与能力军备竞赛的张力公开化
OpenAI 公开承认"刻意放缓"模型研发(Astra 模型接近网络攻击能力阈值、Altman 提及对齐偏差),与 Anthropic Opus 4.5 系统卡宣称"业界最强对齐"形成呼应。前沿实验室开始把"负责任地控制发布节奏"当作竞争力的一部分,监管与安全叙事进入主流话语。 -
编码 Agent 基准白热化,王座轮流坐
从 GPT-5.1-Codex-Max 到 Gemini 3,再到 Claude Opus 4.5(SWE-bench 80.9%),编码基准王座在数周内数次易主;DeepSWE、Terminal-Bench、OSWorld 等"数小时级自主任务"基准成为新的主战场。模型评测从"会不会答"转向"能不能独自把活干完"。 -
降价成为新常态,"每美元智能"竞争加剧
Opus 4.5 价格直降 2/3($15/$75 → $5/$25);Gemini 3.7 Flash 以 $0.75/$3.75 限时价入场并预告涨价;DeepSeek 官方提价但仍保持数量级优势;OpenAI 此前已下调 GPT-5.6 API 价格。旗舰能力的单位成本持续崩塌,推理成本正从"要不要用"变成"想用多少用多少"。 -
开源权重安全之争全面爆发
OpenAI 的 Brockman 点名 GLM-5.3 “加速威胁格局”,Anthropic CEO Amodei 回击"开源权重远非解决方案"(主张算力监管),Meta 则继续开源宣言路线。"开源 vs 安全"成为 2026 年 AI 政策辩论的核心议题,直接影响各国监管走向。 -
资本与基建狂热:Physical AI 与 IPO 潮
H1 物理 AI 融资 474 亿美元(同比 +80%);Anthropic 筹备 IPO(创始人超级投票权防外部压力);Lovable 估值 133 亿美元;新云(Neocloud)重塑 AI 基础设施架构。与此同时"AI 泡沫破裂"论(Ed Zitron、Paul Kedrosky 等)持续发酵,狂热与审慎并存。 -
中 阵营:开源性价比 + 本地化部署 + 生态兼容三路并进
DeepSeek V4 通过 Responses API / Anthropic API 格式无缝接入 Codex、Claude Code 生态;Qwen 3.8 27B 把旗舰级能力压到笔记本级本地推理;GLM、Kimi、MiniMax 免费商用策略持续施压。中 模型在"性能差距个位数、成本差一个数量级"的区间内继续压缩西方闭源模型的利润空间。
🔗 主要信源
- The New Stack(8月13-18日):Claude Opus 4.5 编码王座、Qwen 3.8 27B 本地推理、DeepSeek Agent Harness、Gemini 3.7 Flash 分析、GLM-5.3 安全争论、Amodei 开源权重回应、Agentic AI 延迟问题
- Anthropic 官方博客:Introducing Claude Opus 4.5(含系统卡、基准、客户反馈)
- Techmeme / The Decoder(8月18-19日):OpenAI 放缓模型开发、Astra 网络安全风险、Altman 访谈、Anthropic IPO 超级投票权
- LLM Stats:GPT-5.2 vs Gemini 3.0 vs Opus 4.5 基准对比、模型发布周报
- AI Business(8月13-14日):Gemini 3.7 Flash 定价、Gemma 4、Mistral TTS、IBM × OpenAI、Latam-GPT
- Crunchbase News(8月18日):Physical AI H1 融资 474 亿美元
- DeepSeek 官方 API 文档与更新日志;Reddit r/GeminiAI、r/singularity 社区讨论
本报告由 AI 自动搜集整理,仅供参考。
&spm=1001.2101.3001.5002&articleId=163878719&d=1&t=3&u=5074ce028e0c45ef8286b7e96dba6680)
507

被折叠的 条评论
为什么被折叠?



