DeepSeek Harness 开源调研:不要问是否成熟,梁文锋在下大棋
文档定位:本报告以 DeepSeek AI 开源的
deepseek-harness项目为核心调研对象,从架构原理、核心特性、生态布局、战略意图四个维度展开分析,提出一个核心观点:DeepSeek Harness 的价值不在于当前是否成熟可用,而在于它开源——梁文锋正在下一盘从模型到基础设施的完整大棋。
1. 引子:Agent = Model + Harness
2026 年 AI 工程领域的核心范式跃迁,已经从"如何让模型更聪明"转向"如何让 Agent 更可靠"。这一转变催生了 Harness Engineering 这一新学科:
Agent = Model + Harness
- Model 是 Agent 的灵魂——负责推理、生成、决策
- Harness 是 Agent 的躯体——负责工具注册、上下文管理、状态持久化、验证机制
裸 LLM 像一颗没有主板的 CPU,Harness 就是让它可靠运行的外围基础设施。DeepSeek AI 在 2026 年 8 月开源了 deepseek-harness(简称 dsh),不是作为又一个 Agent 框架,而是作为**"一切皆插件"的 Agent 操作系统**。

2. 项目概览:84.7K Star 的开发者预览版
| 维度 | 详情 |
|---|---|
| 仓库 | deepseek-ai/deepseek-harness |
| Star 数 | 84,689(截至 2026-08-13) |
| Fork 数 | 7,482 |
| 语言 | TypeScript |
| 协议 | MIT(完全开源) |
| 状态 | Developer Preview(开发者预览版) |
| Commit 数 | 12,293 |
| 最近更新 | 2026-08-13(持续高频迭代) |
| 官网 | deepseek.com/harness |
| 口号 | Everything is a Plugin |
几个关键信号值得注意:
- 84.7K Star + 7.5K Fork——这是一个开发者预览版,却已经获得了顶级开源项目的关注度
- 12,293 Commit——团队投入了巨大的工程精力,这不是一个实验性 demo
- MIT 协议——最宽松的开源协议,不设任何商业限制
- TypeScript——选择 JS/TS 生态而非 Python,意味着瞄准的是前端/全栈开发者社区
- 明确声明"开发者预览"——没有过度承诺,反而强调"未来将出现破坏兼容性的变更"
3. 核心架构:一切皆插件(Everything is a Plugin)
3.1 设计哲学
DeepSeek Harness 的核心架构可以用一句话概括:
模型、工具、技能、会话、沙箱、存储、循环、调度、UI 等所有 Agent 能力均由插件组合而成,可以自由替换和灵活重组。
这不是营销话术。从架构文档来看,dsh 真正实现了"无特权核心":
- Agent Loop 本身是插件——默认的
agent-loop可以被替换 - 模型适配器是插件——DeepSeek 不是唯一选项,任何 LLM 都可以接入
- 工具注册表是插件——
ctx.tools可以被任意扩展 - 会话日志是插件——持久化策略可替换
- 沙箱策略是插件——本地、E2B 远程、自定义沙箱均可
3.2 三层结构

Cordis 内核只做三件事:插件的加载、卸载和依赖关系管理。它不承载任何 Agent 的具体能力——连 Agent 循环本身都是插件。
3.3 Profile 与 Bundle 机制
dsh 通过 Profile(配置档) 和 Bundle(能力包) 实现灵活组合:
- Profile 是一个命名的组合,存储在 Harness home 中,列出它堆叠的 bundles
- Bundle 是 Cordis 配置行和对应代码的发行格式
dsh-base是每个 Profile 的第一层:模型适配器、工具、持久化、沙箱、审批策略等dsh-web-app在 base 之上添加浏览器应用dsh-headless添加无服务器的一次性运行器
关键能力:通过 cordis.patch.yml 可以在不改源码的情况下替换任何一层的任何配置行。
4. Cordis 内核:时空可组合性编程范式
Cordis 是 DeepSeek Harness 的底层框架,由同一个组织维护,有自己的学术论文:A Programming Paradigm for Spatiotemporal Composability。
4.1 五大核心理念
| 理念 | 说明 |
|---|---|
| 插件即对象 | 实现 Service 接口的对象,Cordis 将其生命周期挂载到当前上下文 |
| 上下文即服务仓库 | 服务通过稳定的 ctx.<key>(如 ctx.tools、ctx.llm)被发现 |
| 依赖通过 inject 声明 | 插件声明所需服务,加载顺序由服务依赖而非手动编排 |
| 类型化事件通信 | 四种分发模式:emit(观察)、waterfall(瀑布拦截)、parallel(并行)、serial(串行) |
| 注册即可逆 | 所有注册都是 effect,卸载时自动回退 |
4.2 四种事件分发模式
| 模式 | 是否等待 | 执行顺序 | 是否有返回值 |
|---|---|---|---|
emit | 否 | 注册顺序 | 否 |
waterfall | 否 | 注册顺序(中间件链) | 是 |
parallel | 是 | 并行 | 否 |
serial | 是 | 注册顺序 | 是 |
waterfall 是核心设计——它是 around 中间件模式,监听器收到 (...args, next),调用 next() 委托给下一个服务,不调则短路。这使得策略拦截成为一等公民:安全策略插件可以在 agent/pre-step 事件中决定模型是否应该看到某些消息。
4.3 为什么自研框架而非用现有方案
DeepSeek 选择自研 Cordis 而非使用 LangChain、AutoGen 等现有框架,这本身就是战略信号:
- 控制力:完全掌控底层抽象,可以根据 DeepSeek 模型的特性做深度优化
- 差异化:Cordis 的"时空可组合性"范式在学术上有独特贡献
- 无技术债务:不为历史兼容性妥协
- 生态护城河:自有框架意味着自有标准
5. 运行模式:四种 Preset 覆盖全场景
DeepSeek Harness 提供四种预设运行模式(Preset),覆盖从基准确测到创造的完整场景:
| 模式 | 定位 | 工具集 | 适用场景 |
|---|---|---|---|
| 标准模式 | 完整编码 Agent | 文件编辑、Shell、检索、Skills、计划、目标、子代理、工作流 | 日常开发 |
| PTC 模式 | 代码组合多步操作 | 标准模式全部能力 + Code Mode SDK | 复杂编排 |
| 极简模式 | 最小化基准测试 | 仅 bash + str_replace_editor | 模型评测 |
| 创造模式 | 自定义 Preset 创造 | 标准模式全部 + 运行时检查 + 插件实验 | Agent 设计 |

5.1 PTC 模式的创新
PTC(Program-Through-Code)模式是一个值得关注的设计创新:模型生成一段 TypeScript 程序来组合多轮工具调用,而非传统的逐轮 ReAct 循环。这类似于 Claude Code 的"agentic loop"但更加结构化——模型可以编写控制流(条件、循环、错误处理)来编排工具调用,而不是在每一步都经过一轮 LLM 推理。
5.2 创造模式的自我指涉
创造模式允许 Agent 检查自己的运行时、在内存中试验 Cordis 插件,并据此创建新的 Preset。这是一种自我指涉(self-referential) 的设计——Agent 可以修改自己的架构。这在其他 Agent 框架中极为罕见。
6. 会话日志:模型可见即日志
这是 DeepSeek Harness 最具工程美感的设计之一。
6.1 核心原则
Model-visible ⟺ Logged
任何到达模型请求的内容,都必须可以从会话日志中重建。这是一条运行时不变量,代码中有断言来强制执行。
6.2 仅追加日志(Append-Only Log)
会话日志采用仅追加设计,记录:
- 系统提示词
- 思维链
- 工具调用与结果
- 子 Agent 调度
- 每一次上下文注入
6.3 从日志派生一切

这意味着一切状态都从同一个事件流派生,不存在日志之外的隐藏状态。这个设计的优雅程度甚至超过了很多专业可观测性系统。
7. 生态布局:从模型到框架到社区的完整拼图
DeepSeek 的开源不是单点行为,而是一张完整的拼图:
7.1 模型层
| 模型 | 定位 | 时间 |
|---|---|---|
| DeepSeek-V3 | 基础模型 | 2024 |
| DeepSeek-R1 | 推理模型 | 2025 |
| DeepSeek-V4-Pro | 旗舰模型 | 2026 |
| DeepSeek-V4-Flash | 快速模型 | 2026 |
7.2 基础设施层
| 项目 | 说明 | Star |
|---|---|---|
| 3FS | 高性能分布式文件系统 | 10K+ |
| FlashMLA | 高效多头潜在注意力内核 | 12.8K |
| DeepEP | 专家并行通信库 | 10K |
| DeepGEMM | GPU BLAS 内核库 | 7.7K |
| DeepSpec | 推理解码算法全栈 | 7K |
7.3 框架层
| 项目 | 说明 | Star |
|---|---|---|
| deepseek-harness | Agent Harness(本报告主角) | 84.7K |
| Cordis | 底层插件框架 | 3K |
| awesome-deepseek-agent | Agent 集成指南 | 5.5K |
| awesome-deepseek-integration | 通用集成指南 | 38.7K |
7.4 社区层
- 企微群:面向中国开发者的本地化社区
- Discord:面向全球开发者
- dsh-plugin 话题:GitHub 上的插件发现机制
- 双语文档:中英文同步维护(甚至有自动翻译配对合并机制)
7.5 战略全景

这是一个从底层训练基础设施到上层 Agent 框架到社区运营的全栈开源战略。在中国 AI 公司中,没有任何一家做到了这种程度的全栈开源。
8. 竞品对比:vs Claude Code / Cline / Hermes
8.1 架构范式对比
| 维度 | DeepSeek Harness | Claude Code | Cline | Hermes (内部框架) |
|---|---|---|---|---|
| 架构范式 | 插件操作系统 | 一体化 CLI | VS Code 扩展 | Loop Agent |
| 插件模型 | 一切皆插件,Cordis 驱动 | 内置工具,不可替换 | 内置工具 + MCP | 硬编码流程 |
| 模型绑定 | 模型无关(任何 LLM 可接入) | 绑定 Claude | 模型无关 | 可配置 |
| 事件系统 | 四种分发模式(emit/waterfall/parallel/serial) | 无 | 无 | 无 |
| 会话日志 | 仅追加,模型可见即日志 | 有 | 有 | 简单 |
| 可组合性 | Profile/Bundle/patch 分层 | 无 | 无 | 无 |
| 运行模式 | 标准/PTC/极简/创造 | 单一 | 单一 | 单一 |
| 开源协议 | MIT | 闭源 | Apache 2.0 | 内部 |
| 语言 | TypeScript | TypeScript | TypeScript | Python |
8.2 关键差异分析
vs Claude Code:Claude Code 是一个闭源的一体化产品,工具集和 Agent 循环都不可替换。DeepSeek Harness 把这些都变成了插件——你可以用 Claude 模型 + dsh 的 Harness,也可以用 DeepSeek 模型 + 自定义循环。dsh 的开放性是 Claude Code 无法提供的。
vs Cline:Cline 是 VS Code 扩展,虽然开源但受限于编辑器生态。dsh 独立于任何编辑器,支持 Web App、Headless、CLI 多种形态。Cline 没有插件系统,扩展只能通过 MCP Server。dsh 的插件可以直接拦截 Agent 事件流。
vs Hermes/Loop Agent:传统 Loop Agent 是"感知→决策→行动→观察"的硬编码循环。dsh 的 Agent Loop 本身是插件,可以用 PTC 模式替换为代码编排模式,甚至可以让 Agent 自己在创造模式中设计新的循环。
8.3 dsh 的独特优势
- 无特权核心——连 Agent Loop 都可以替换
- 事件驱动架构——waterfall 模式实现策略拦截
- 自我指涉——创造模式让 Agent 修改自身架构
- 模型无关——不绑定 DeepSeek 模型
- 学术深度——Cordis 有配套论文,不是工程拼凑
9. 核心观点:为什么开源比成熟度更重要
这是本报告的核心论点。
9.1 不成熟不是缺陷,而是信号
DeepSeek Harness 明确声明处于 Developer Preview 阶段,文档中反复强调"API 将出现破坏性变更"。很多人会认为这是劣势——但恰恰相反:
一个不成熟但开源的项目,比一个成熟但闭源的项目更有长期价值。
原因很简单:开源意味着你可以参与塑造它。当你使用 Claude Code 遇到限制时,只能等 Anthropic 更新。当你使用 dsh 遇到限制时,你可以写一个插件解决它,甚至替换整个 Agent Loop。
9.2 梁文锋在下什么棋
从 DeepSeek 的开源轨迹可以清晰看到一盘大棋:
第一步:模型开源(2024-2025)
DeepSeek-V3 和 R1 的开源,以极低成本对标 GPT-4 和 o1,震动了整个 AI 行业。这不是慈善——而是通过开源建立模型层的标准制定者地位。当全世界的研究者都在你的模型上做实验时,你的模型就成了事实标准。
第二步:基础设施开源(2025-2026)
3FS(分布式文件系统)、FlashMLA(注意力内核)、DeepEP(专家并行)、DeepGEMM(矩阵运算)、DeepSpec(解码算法)——这些是训练和推理的底层基础设施。开源这些意味着 DeepSeek 在告诉全世界:我们不仅开源模型,还开源让模型高效运行的全部底层技术。
第三步:Agent 框架开源(2026)
deepseek-harness + Cordis 是上层应用框架。开源这一层意味着 DeepSeek 正在定义"如何使用 AI 模型"的标准。当开发者在 dsh 上构建 Agent 应用时,他们自然倾向于使用 DeepSeek 的模型——不是强制绑定,而是生态惯性。
第四步:社区建设(持续)
双语文档、Discord + 企微群、awesome-* 仓库、dsh-plugin 话题标签——这是系统性的社区运营。开源代码只是起点,社区才是护城河。
9.3 这盘棋的终局

梁文锋的终局不是"做出最好的 Agent 工具",而是"定义 AI 应用的技术标准"。
当 OpenAI 试图通过闭源 API 锁定开发者时,DeepSeek 通过全栈开源建立标准。这是一种完全不同的商业哲学——不收过路费,而是收标准制定权。
9.4 历史类比
这让人想起几个历史先例:
- Linux:Linus 不收 Linux 的钱,但 Linux 定义了操作系统的标准
- Android:Google 开源 Android,不是为了卖手机,而是为了定义移动计算的标准
- Kubernetes:Google 开源 K8s,不是为了卖容器服务,而是为了定义云原生编排的标准
DeepSeek 正在 AI 领域做同样的事。Harness 就是 AI 时代的"操作系统内核"。
10. 局限性与风险
公平起见,也需要看到风险和局限:
10.1 技术风险
| 风险 | 说明 |
|---|---|
| API 不稳定 | Developer Preview 阶段,破坏性变更是常态 |
| 文档滞后 | 快速迭代中,文档可能跟不上代码 |
| Cordis 学习曲线 | 自研框架意味着社区资源有限,踩坑无处可查 |
| 类型体操 | TypeScript Host/Client 双聚合架构对普通开发者不友好 |
10.2 生态风险
| 风险 | 说明 |
|---|---|
| 插件生态空窗 | 目前社区插件还很少,需要时间积累 |
| DeepSeek 模型依赖 | 虽然架构是模型无关的,但默认体验绑定 DeepSeek 模型 |
| 竞争激烈 | Claude Code、Cursor、Windsurf 都在快速迭代 |
| 商业化不确定 | MIT 开源,但 DeepSeek 的商业模式尚不清晰 |
10.3 战略风险
开源不等于成功。历史上开源但最终失败的框架比比皆是(OpenStack 的碎片化、Mesos 的衰落)。DeepSeek Harness 能否成为 AI 时代的 Linux,取决于:
- 社区参与度——能否吸引足够的第三方贡献者
- 企业采用度——能否被企业采纳为生产级工具
- 持续投入——DeepSeek 能否在商业化压力下持续投入
- 标准竞争——能否在与 OpenAI、Anthropic 生态的竞争中胜出
11. 总结与判断
11.1 技术判断
DeepSeek Harness 是目前架构最先进的开源 Agent 框架。它的"一切皆插件"设计、Cordis 事件系统、会话日志不变量、四种运行模式,在技术深度上超越了当前所有开源竞品。Cordis 框架的"时空可组合性"范式甚至有学术贡献。
11.2 战略判断
DeepSeek 的全栈开源战略——从模型到基础设施到框架到社区——是中国 AI 公司中最有野心的开源布局。这不是简单的技术分享,而是一场标准制定权的争夺。梁文锋下的不是产品棋,而是生态棋。
11.3 核心结论
不要问 DeepSeek Harness 是否成熟。
要问的是:当 AI 应用的标准正在形成时,你是要站在闭源产品的围墙内,还是站在开源标准的洪流中?
梁文锋在下大棋。这盘棋的赌注不是某个产品的成败,而是 AI 应用层技术标准的归属权。
开源比成熟更重要——因为开源可以变成熟,但闭源永远无法成为标准。

458

被折叠的 条评论
为什么被折叠?



