8 月 19 日,OpenAI 在官方博客发布了一篇标题为 “Codex as a platform” 的文章。两天之内,GitHub 仓库 star 数飙升至 107,443,fork 数达到 16,354。
这不是一次模型发布。OpenAI 把驱动 Codex App、CLI 和 IDE 扩展的同一套底层 Agent 执行框架——Harness——完整开放给了社区。
OpenAI 亲手拆了自己的护城河。

一、Harness 是什么?AI 智能体的“最强外骨骼”
很多人以为,一个强大的 AI 智能体 = 好模型 + 好提示词。这个认知是错的。
一个真正能在业务场景中持续工作的 Agent,远不止是一段提示词加一个模型。它需要:
-
理解任务,持续维护上下文
-
检查相关资料,调用工具
-
展示执行进度,处理工具报错
-
知道什么时候可以自己继续,什么时候必须停下来请求人工批准
围绕模型运行的这一整套执行系统,就是 Harness。
官方给出的定义更加精炼:“Harness 帮助模型收集上下文、推理任务、使用工具、在配置的边界内操作、请求批准,并将工作向前推进。”
用更直白的话说:模型负责“思考”,Harness 负责“让思考变成可执行的行动” 。
Harness 的设计能实质性地改变结果。OpenAI 在 ARC-AGI-3 测试中,仅通过 Harness 层面的两个调整——保留推理状态和压缩上下文——就让 GPT-5.6 Sol 的得分从 **13.3% 飙升至 38.3%**,同时输出 Token 减少了 六分之五。
同一个模型,换一套 Harness,表现判若两“模”。
二、三层架构:Codex Harness 的三种接入方式
OpenAI 这次开放的不是一套“秘密 Harness”,而是把已经逐步开放的 Codex 执行体系,正式收口成一套有明确入口、文档和产品定位的 Agent Platform。
代码并非一夜之间出现——Codex CLI 早在 2025 年 4 月就已开源。真正重要的,是 OpenAI 正式告诉第三方开发者:可以把驱动 Codex 的同一套 Agent 执行框架,嵌入你自己的产品里。
官方给出了三种接入方式,分别对应不同场景:
第一层:codex exec——脚本党专属神器
适合脚本、CI 流程或一次性后台任务。比如自动分析代码仓库、修复一批问题,或在流水线中执行一个边界明确的 Agent 任务。任务跑完返回结构化结果,整个过程不需要一直保持会话。
最轻量的用法:
codex exec --json "分析当前仓库并输出风险清单"
第二层:Codex SDK——自定义编排随便玩
适合在应用代码里启动、恢复和监听 Codex 任务。开发者可以直接通过程序控制任务,接收流式事件,也可以把 Codex 能力包装进自己的业务逻辑中。
安装方式:
npm install @openai/codex-sdk
# 或
pip install openai-codex
第三层:codex app-server——产品级接入首选
适合真正把 Agent 变成产品的一部分。它可以保持长期会话、持续接收事件、中断任务、暴露工具,并处理人工审批请求。
需要说明的是:开源的是 Harness 和集成层,模型访问、账号额度与托管服务仍然是另一层。源码能改、能商用,不代表模型算力从此免费。
三、三层能力叠加:今天的 Codex 已经不只是“代码补全”
要理解这次开源的意义,需要先看清今天的 Codex 到底是什么。
早期的 Codex 主要指擅长代码补全的模型;但今天的 Codex 已经是三层能力叠加后的产物:
-
模型层:负责代码理解、生成、推理与语义搜索。它决定 “该写什么”
-
智能体层:负责任务拆解、规划与决策。它决定 “先做什么、遇到错误怎么办”
-
执行层:提供可运行的云端沙箱环境。它负责 “真正去执行命令、读写文件、安装依赖”
理解这三层非常关键。因为它意味着 Codex 的输出不再是“建议”,而是“可验证的行为” 。它可以在沙箱里真正运行 pytest、查看报错、修改代码、再次运行,直到测试通过。
这与传统代码生成工具存在本质差异:反馈闭环由模型自己完成。
四、行业震动:两天 10 万星,2000 万活跃用户
这次开源引发的反响远超预期。
GitHub 仓库 star 数两天破 10 万。Codex 负责人 Tibo 在 X 上确认,Codex 本周已突破 2000 万活跃用户。
行业为什么如此兴奋?
第一,终结“通用聊天框”时代。
过去使用 AI 的标准流程是:打开一个网页或侧边栏,面对一个单调的聊天输入框,输入背景描述,然后期望 AI 给出完美答案。但真正的业务场景里,安全分析师面对的是告警队列,客服工程师面对的是账户历史,产品经理面对的是需求看板。
他们需要的是业务看板,不是聊天框。Codex Harness 的开源,让开发者可以把 Agent 直接嵌入到围绕实际工作设计的软件中。
第二,Agent 开发的门槛被大幅降低。
以前要做一个能持续工作的 Agent,开发者需要自己解决上下文管理、工具调用、沙箱隔离、人工审批等一系列工程问题。现在,这些能力可以直接复用。
第三,模型竞争进入新阶段。
正如官方所说:“与其要求每个团队把工作迁移到一个通用编码助手,不如把 Agent 带到围绕实际工作设计的软件中。” Codex 不再要求所有工作都搬进它的界面——它开始主动往别人的产品里走了。
五、对开发者和创业者的启示
1. Agent 的“工程外壳”比模型本身更重要
ARC-AGI-3 的案例已经证明:同一个模型,换一套 Harness,得分可以从 13.3% 变成 38.3%。模型决定能力上限,Harness 决定实际下限。在模型能力日益同质化的今天,差异化的竞争力来自模型外面那层“工程外壳”。
2. “Chatbot 套壳”的时代结束了
当 OpenAI 把顶级 Agent 的底层 Harness 开源出来,再做一个“聊天框 + API 调用”的套壳产品已经没有意义。真正的机会在于:把 Agent 能力嵌入到特定的业务场景和行业工作流中。客服系统、安全看板、财务软件、运维平台——这些才是 Agent 真正该去的地方。
3. 开源 Harness 不等于免费模型
官方明确区分:开源的是 Harness 和集成层,模型访问、账号额度与托管服务仍是另一层。源码能改、能商用,不代表模型算力从此免费。创业者在做成本规划时,需要同时考虑 Harness 的部署成本和模型的调用成本。
4. “多模型策略”成为可能
今年 6 月,OpenAI 已经让 Codex 不再只认自家的 GPT,而是面向所有开源模型开放。DeepSeek 已经跑进了 Codex。这意味着开发者可以在 Codex Harness 上自由切换底层模型——既可以用 GPT,也可以用开源模型。这种灵活性大幅降低了对单一模型供应商的依赖。
写在最后
2026 年 8 月 19 日,OpenAI 做了一件看似“自毁长城”的事:把驱动 Codex 的底层 Harness 完整开源了。
但从战略上看,这恰恰是一次聪明的“升维打击”。当模型能力逐渐同质化,真正的竞争已经从“谁有更强的模型”变成了 “谁能构建更好的 Agent 执行环境” 。OpenAI 选择把 Harness 做成一个开放的平台标准——让所有开发者都基于同一套框架来构建 Agent,然后在这个框架之上,提供自己的模型和云服务。
正如 OpenAI 总裁 Greg Brockman 在 X 上所说:“Codex 可以驱动远不止编程工具。”
当顶级 Agent 的“发动机”被免费送到每个人手中时,真正的创新才刚刚开始。
关键词标签: #OpenAI #Codex #Harness #Agent #开源 #AI编程 #大模型 #开发者工具 #AgentLoop #CodexHarness

326

被折叠的 条评论
为什么被折叠?



