AI 大模型日报 — 2026年8月19日(星期三)

🤖 AI 大模型日报 — 2026年8月19日(星期三)

数据来源:Techmeme / The New Stack / AI Business / LLM Stats / Anthropic 官方 / DeepSeek 官方 / Crunchbase News / The Decoder 等公开资讯
覆盖时间窗口:2026年8月12日 至 8月19日


📌 今日热门话题摘要

  1. OpenAI 公开宣布"放缓模型研发节奏",Astra 模型引发网络战能力担忧(8月18-19日):OpenAI 表示正在"刻意放缓 AI 模型开发",部分原因是即将推出的 Astra 模型可能接近具备关键网络攻击能力,并已部署监控系统在模型能力接近危险阈值时自动告警。Sam Altman 接受 Time 采访解释,放缓源于一系列研究观察显示模型存在"不同程度的对齐偏差(misalignment)"。
  2. Anthropic 筹备 IPO:创始人将获超级投票权股份(8月18日):据 The Information,Anthropic 正为联合创始人准备附带额外投票权的股份,以隔离外部压力,为计划中的 IPO 铺路;此前其年化收入已达 650 亿美元,市场传闻估值约 2 万亿美元。
  3. Claude Opus 4.5 重夺"编码王座":SWE-bench Verified 达 80.9%,超越 GPT-5.1-Codex-Max 与 Gemini 3 Pro;API 定价大幅下调至 $5/$25(原 $15/$75),Anthropic 同时上线 Claude Code 桌面版与升级版 Plan Mode。
  4. DeepSeek 开源"一切皆插件"的 Agent 框架(8月13日):发布开源 agent harness,架构上所有组件均可插件化;此前 V4-Pro-0813 转正并预告"大幅涨价",但性价比仍保持绝对优势。
  5. Physical AI 融资爆发:H1 2026 年物理 AI 公司 VC 融资达 474 亿美元(521 笔),同比增 80%,超过 2022-2024 三年总和(419 亿美元),机器人/具身智能进入资本爆发期。
  6. 模型发布与价格战持续:Google Gemini 3.7 Flash 限时低价抢开发者、xAI Grok 4.6 主打更长 Agent 循环、阿里 Qwen 3.8 27B 声称可在笔记本上达到 Opus 4.6 级表现。

🚀 各重要模型动态

🟠 Anthropic(Claude 系列)

模型关键信息
Claude Opus 4.5(旗舰)SWE-bench Verified 80.9%(超过 GPT-5.1-Codex-Max 与 Gemini 3 Pro),SWE-bench Multilingual 7/8 语言领先;Aider Polyglot 较 Sonnet 4.5 提升 10.6%;Terminal-Bench 2.0 59.3%;BrowseComp-Plus 大幅跃升;Vending-Bench 高出 Sonnet 4.5 达 29%
定价策略API 价格从 $15/$75 降至 $5/$25(每百万 token 输入/输出),幅度达 2/3;Opus 级能力价格门槛大幅下降
效率特性引入 effort 控制:中等 effort 下匹配 Sonnet 4.5 的 SWE-bench 成绩但输出 token 减少 76%;最高 effort 下性能反超 4.3 个百分点且少用 48% token;内部 2 小时限时考题得分超过所有人类候选
安全表现官方称其为"迄今对齐最稳健的模型":对提示注入攻击的抵抗力业界最强(Gray Swan 评估)
平台更新Claude Code 桌面版上线;升级版 Plan Mode 可并行运行多个本地/远程会话;Opus 使用上限取消;Excel、Chrome 扩展等办公场景增强
商业动态年化收入 650 亿美元;筹备 IPO 并为创始人设置超级投票权股份(The Information)

🔵 OpenAI(GPT 系列)

模型关键信息
GPT-5.1 / 5.1-Codex-Max综合排行榜仍居前列(GPT-5.1 Medium 综合 98.4% 居 LLM Stats 榜首);被 Opus 4.5 在 SWE-bench 上反超后正快速迭代
GPT-5.2(12月发布)抽象推理 ARC-AGI-2 达 52.9%(Thinking)/ 54.2%(Pro),大幅领先 Opus 4.5(37.6%)与 Gemini 3 Deep Think(45.1%);AIME 2025 无工具满分 100%;自研 GDPval 基准声称 70.9% 场景胜过行业专业人士
GPT-5.3-Codex-Spark首个完全运行在 Cerebras 晶圆级芯片上的 OpenAI 模型,不依赖 NVIDIA 硬件,128K 上下文纯文本
Astra 模型因可能接近"关键网络攻击能力"而推迟发布,OpenAI 称正"放缓模型开发";内部测试发现模型存在对齐偏差问题
生态动作IBM 达成企业 AI 加速合作(8月14日);ChatGPT/Codex 桌面应用登陆 Linux(8月11日);与 Elastic 合作解决企业上下文问题;GPT-5.6 系列 API 价格此前已大幅下调应对竞争

🟢 Google(Gemini 系列)

模型关键信息
Gemini 3.7 Flash(8月12日发布)DeepSWE v1.1 65.3%、FrontierCode 1.1 Main 43.6%;1M 上下文与 3.6 Flash 相同;WebDev Arena Elo 1588;AutomationBench 30.4%、OSWorld-2.0 47.9%、HLE-Verified 53.6%
定价策略限时入门价 $0.75/$3.75(每百万 token),2027 年 1 月 1 日起翻倍至 $1.50/$7.50;AI Business 解读为低价吸引开发者
Gemini 3 Pro / 3 Deep Think11月发布的旗舰:HLE 41.0%(无工具,业界最高)、GPQA 93.8%(Deep Think);IMO / ICPC 世界总决赛金牌水平;Nano Banana Pro 图像模型口碑出色
Gemma 4(开源家族)Google 发布新一代开源模型家族 Gemma 4,2B–31B 轻量路线强化小模型效率

⚫ DeepSeek

模型关键信息
DeepSeek-V4-Pro-0813 正式版(8月13日)V4 Pro 预览转正,API 调用名 deepseek-v4-pro1M 上下文、384K 最大输出;Agent 能力大幅提升(Terminal-Bench 2.1 / DeepSWE / CyberGym 等基准显著进步);MoE 架构 Pro 1.6T 总参/49B 激活
价格变化官方预警"大幅涨价在即":8月16日起峰谷双价(谷时 $0.66 输入/$1.98 输出),峰时 2 倍;当前 $0.435 输入/$0.87 输出(每百万 token),性价比仍领先一个数量级
开源 Agent Harness(8月13日)开源 agent 编排框架,"一切皆插件"架构,配合 Responses API 与官方 Codex CLI / 桌面端 / VS Code 配置,深度融入 Codex 生态
生态兼容原生支持 Anthropic API 格式(可接入 Claude Code)、OpenAI Responses API;V4 Flash / Pro 均可用

🔴 xAI(Grok 系列)

模型关键信息
Grok 4.6(8月11日发布)GDPVal-AA v2 1753 Elo、DeepSWE v1.1 65.9%;500K 上下文;定价 $2/$6(每百万 token);主打更长 Agent 循环(200K token 成本悬崖)与 Priority Processing 2 倍优先处理
Grok Imagine Image 2.08月12日上线图像生成/编辑工作流
社区动态传闻 Grok 4.7 冲击排行榜首位(Peter Diamandis 节目提及)

🔵 Meta(Llama / Muse 系列)

模型关键信息
Muse Spark 1.2开源推理模型,综合智能指数 57 与 GPT-5.6 Terra 持平;DeepSWE v1.1 54.9%、Terminal-Bench 2.1 82.9%
Muse Glimmer8月10日开源 30B Agentic 模型,单 GPU 可跑
Watermelon(内部代号)传闻中的下一代开源前沿旗舰
合规风险ICE 内部备忘录禁止员工佩戴 Meta AI 眼镜(担心无意泄露敏感信息);美国多州检察长就 Meta"故意让儿童上瘾"开庭(8月18日)

🟣 国产与开源模型矩阵

厂商模型动态
阿里巴巴Qwen 3.8 27B(8月14日)新 27B 模型声称在笔记本本地推理即可达到 Opus 4.6 级性能,边缘/本地部署路线再进一步;Qwen3.7-Max 仍为旗舰
智谱 AIGLM-5.3OpenAI 联合创始人 Greg Brockman 公开称其"可能显著加速威胁格局",引发开源权重安全大讨论
月之暗面Kimi K3 / K2.6免费商用,K3 HLE 56.0,SWE-bench 表现强劲
字节跳动Seed 团队 CUDA Agent(与清华 AIR)大规模 Agentic RL:训练 LLM 写 GPU Kernel 并击败编译器
MiniMaxM2.7 系列高稀疏 MoE,主打智能体与编程性价比
其他Mistral 文本转语音模型、Latam-GPT(拉美开源模型)、Cohere Command、Amazon Nova开源生态持续繁荣,区域化模型兴起;Anthropic 收购 CI/CD 初创 Mendral 团队

📈 行业趋势分析

  1. "放缓开发"成为新叙事:安全与能力军备竞赛的张力公开化
    OpenAI 公开承认"刻意放缓"模型研发(Astra 模型接近网络攻击能力阈值、Altman 提及对齐偏差),与 Anthropic Opus 4.5 系统卡宣称"业界最强对齐"形成呼应。前沿实验室开始把"负责任地控制发布节奏"当作竞争力的一部分,监管与安全叙事进入主流话语。

  2. 编码 Agent 基准白热化,王座轮流坐
    从 GPT-5.1-Codex-Max 到 Gemini 3,再到 Claude Opus 4.5(SWE-bench 80.9%),编码基准王座在数周内数次易主;DeepSWE、Terminal-Bench、OSWorld 等"数小时级自主任务"基准成为新的主战场。模型评测从"会不会答"转向"能不能独自把活干完"

  3. 降价成为新常态,"每美元智能"竞争加剧
    Opus 4.5 价格直降 2/3($15/$75 → $5/$25);Gemini 3.7 Flash 以 $0.75/$3.75 限时价入场并预告涨价;DeepSeek 官方提价但仍保持数量级优势;OpenAI 此前已下调 GPT-5.6 API 价格。旗舰能力的单位成本持续崩塌,推理成本正从"要不要用"变成"想用多少用多少"

  4. 开源权重安全之争全面爆发
    OpenAI 的 Brockman 点名 GLM-5.3 “加速威胁格局”,Anthropic CEO Amodei 回击"开源权重远非解决方案"(主张算力监管),Meta 则继续开源宣言路线。"开源 vs 安全"成为 2026 年 AI 政策辩论的核心议题,直接影响各国监管走向。

  5. 资本与基建狂热:Physical AI 与 IPO 潮
    H1 物理 AI 融资 474 亿美元(同比 +80%);Anthropic 筹备 IPO(创始人超级投票权防外部压力);Lovable 估值 133 亿美元;新云(Neocloud)重塑 AI 基础设施架构。与此同时"AI 泡沫破裂"论(Ed Zitron、Paul Kedrosky 等)持续发酵,狂热与审慎并存

  6. 中 阵营:开源性价比 + 本地化部署 + 生态兼容三路并进
    DeepSeek V4 通过 Responses API / Anthropic API 格式无缝接入 Codex、Claude Code 生态;Qwen 3.8 27B 把旗舰级能力压到笔记本级本地推理;GLM、Kimi、MiniMax 免费商用策略持续施压。中 模型在"性能差距个位数、成本差一个数量级"的区间内继续压缩西方闭源模型的利润空间


🔗 主要信源

  • The New Stack(8月13-18日):Claude Opus 4.5 编码王座、Qwen 3.8 27B 本地推理、DeepSeek Agent Harness、Gemini 3.7 Flash 分析、GLM-5.3 安全争论、Amodei 开源权重回应、Agentic AI 延迟问题
  • Anthropic 官方博客:Introducing Claude Opus 4.5(含系统卡、基准、客户反馈)
  • Techmeme / The Decoder(8月18-19日):OpenAI 放缓模型开发、Astra 网络安全风险、Altman 访谈、Anthropic IPO 超级投票权
  • LLM Stats:GPT-5.2 vs Gemini 3.0 vs Opus 4.5 基准对比、模型发布周报
  • AI Business(8月13-14日):Gemini 3.7 Flash 定价、Gemma 4、Mistral TTS、IBM × OpenAI、Latam-GPT
  • Crunchbase News(8月18日):Physical AI H1 融资 474 亿美元
  • DeepSeek 官方 API 文档与更新日志;Reddit r/GeminiAI、r/singularity 社区讨论

本报告由 AI 自动搜集整理,仅供参考。

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值