DeepSeek Harness开源:88页论文背后的Agent野心,中国AI公司正在重新定义“智能体“

AI 时代程序员必备技能

Codex、Claude Code、Cursor、Hermes Agent、OpenClaw等工程化实战专栏 ,讲透 AI 如何接管脏活累活

DeepSeek Harness开源:88页论文背后的Agent野心,中国AI公司正在重新定义"智能体"

8月13日,DeepSeek在发布V4 Pro正式版的同一天,将酝酿已久的Agent框架DeepSeek Harness以MIT协议开源。16小时内GitHub Star突破65K,配套88页论文同步发布。这不是又一款Claude Code的模仿者——"一切皆插件"的架构哲学,正在重新定义AI Agent应该长什么样。


一、破圈:16小时65K Star,一个框架为什么能让全球开发者集体失眠

8月13日,DeepSeek官方在X上发布了两条推文,间隔不到24小时:

第一条:We're launching DeepSeek-V4-Pro today!
第二条:DeepSeek Harness v0.1 is now available in Developer Preview!

第一条是模型,第二条是框架。模型回答"AI有多强",框架回答"强了之后怎么用起来"。

Hacker News上关于Harness的讨论帖直接冲上TOP 1。GitHub仓库deepseek-ai/deepseek-harness的Star数在16小时内从0飙升到65.4K,Fork数突破5.5K。这不仅是2026年GitHub涨星最快的项目之一,也是中国AI公司开源项目中罕见的全球级破圈事件。

更值得关注的是社区反应的"质量"。掘金上有开发者把仓库克隆下来逐行读代码、翻提交记录、查依赖树,写出了近万字的技术拆解;CSDN热榜上"DeepSeek Harness内测开启,AI Agent竞争升级"冲上1.3万热度;V2EX上关于Harness的讨论帖回复数远超日常话题。

一个Agent框架——不是模型——为什么能让开发者如此兴奋?

答案藏在六个字里:一切皆插件。


二、"一切皆插件":Model + Harness = Agent的设计哲学

2.1 从产品到底座的范式转变

要理解DeepSeek Harness(以下简称DSH)的定位,先看一个公式:

Agent = Model + Harness

这是LangChain提出的Agent架构概念:一个完整的AI Agent,必然由Harness(执行框架)和模型搭配构成。Claude Code、Codex、WorkBuddy,本质上都是Harness,只是以"软件产品"的形态封装好交给用户。

区别在于:其他厂商把Harness藏在产品内部,你只能"用",不能"拆"。DeepSeek把Harness整个打开,放在了GitHub上。

用DeepSeek自己的话说:

Everything is a Plugin.

这不是口号。打开仓库的架构文档,你会发现:

  • 模型适配器是插件——DeepSeek官方只是众多提供方之一,任何OpenAI兼容端点都能作为自定义提供方接入
  • 工具注册是插件——文件编辑、Shell执行、网页搜索、代码审查,全部以插件形式注册
  • 会话日志是插件——采用append-only事件日志,Resume/Fork/Replay共享同一事件流
  • 沙箱策略是插件——默认workspace-write,失败关闭(fail-closed)
  • 审批策略是插件——决定哪些操作需要人工确认
  • Agent Loop本身也是插件——可以被整体替换
  • UI也是插件——默认提供Web UI,但你可以换成CLI、TUI或者任何你想要的形态

所有这些组件通过Cordis服务与事件彼此协作,开发者无需改动DSH源码,就能在配置层独立选择、替换或扩展任何一个能力。

2.2 四种工作模式:预设即插件组装

DSH内置了四种预设模式,每种加载不同的插件集合:

模式适用场景插件配置
标准模式日常开发文件编辑、Shell、检索、Skills、计划、目标、子代理、工作流全开
PTC模式复杂多步任务通过Code Mode SDK让模型生成TypeScript代码编排多轮工具调用,中间数据留在运行环境,只有最终结果进入上下文,大幅降低Token消耗
极简模式基准测试仅保留持久bash和str_replace_editor两个工具
创造模式Agent开发在标准能力外加上运行时检查与插件实验,让Agent反过来帮你设计和创建新preset——用Agent造Agent

换模式 = 换一份插件清单。这和Claude Code里改几个配置参数完全是两种思路。

2.3 Cordis微内核:9个文件撑起整个框架

DSH的核心是一个叫Cordis的插件微内核,核心源码只有9个文件。Cordis的作者是Shigma(史一凡)——著名聊天机器人框架Koishi的作者,他的框架生态中已有超过4000个社区插件验证过这套架构。DeepSeek没有自己造插件系统,而是直接"雇佣"了这个领域最合适的人,把Cordis源码内联进了仓库。

本地实例dump出来的配置显示,一个标准部署包含133个插件,每个都能单独启停:

# dsh --profile web --dump-config (节选)
# == @deepseek-ai/dsh-base
- id: llm
  name: '@deepseek-ai/dsh-llm'
- id: session
  name: '@deepseek-ai/dsh-session'
- id: agent
  name: '@deepseek-ai/dsh-agent'
# == @deepseek-ai/dsh-base, patched by @deepseek-ai/dsh-web-app
- id: hmr
  name: '@deepseek-ai/cordis-plugin-hmr'
  disabled: true

连最"核心"的东西都是插件:会话日志是插件,沙箱是插件,Claude Code的hooks.json也能被插件桥直接解析执行。没有"特权内核"。

2.4 兼容性作为武器:连对手都是它的插件

DSH做了一件非常有想象力的事:把兼容性做成了武器

它直接读取Claude Code的hooks.json配置文件,能够把Claude Code、Codex本身当作子代理调用。这意味着——如果你已经在用Claude Code,迁移到DSH的摩擦几乎为零。你的配置、你的工具链、你的工作流,DSH全部能接管。

同时,DSH从架构上就把模型适配器做成了插件。支持谁、路由到谁,只是注册表里的一行。DeepSeek官方模型只是众多选项之一,你完全可以用本地Qwen、Llama、甚至Claude来驱动DSH。

模型中立 + 工具兼容 + 完全开源 = 对现有Coding Agent产品的降维打击。


三、88页论文:用数学证明"插件可以热插拔"

3.1 论文要解决什么问题

与V4 Pro和DSH一同发布的,还有一篇长达88页的技术论文:《A Programming Paradigm for Spatiotemporal Composability》(面向时空可组合性的编程范式),三位作者:Yifan Shi(北京大学 & DeepSeek-AI)、Wei Zhang(北京大学)、Tianyi Cui(DeepSeek-AI),2026年8月13日预印本。

论文标题很学术,但它要解决的问题每个写过插件系统的开发者都遇到过:

你装了一个插件,它注册了事件监听、分配了资源、修改了全局状态。现在你想卸载它——怎么保证干净地恢复原状?进一步:你的插件B依赖插件A提供的服务,A被热卸载了——B怎么办?

现有的工程实践对这两个问题的回答通常是:重启

论文统计了VSCode top 100扩展,87个包含可执行代码,卸载时需要重启整个extension host;只有7个声明了extensionDependencies。换句话说,当前最流行的插件系统在"动态卸载"和"依赖管理"两个方向上基本是放弃状态。

3.2 时间可组合性:可逆副作用

论文将问题拆解为两个正交维度。

时间可组合性(Temporal Composability):插件被移除时,它做过的所有事情——注册的事件、分配的资源、修改的状态——必须被完全回滚。

论文的解法叫**"可逆副作用"(Revertible Effects)**:

  • 每一次上下文变换都附带逆操作
  • 运行时负责持续追踪和恢复
  • 对开发者来说,写插件时只需要声明"我要做什么",框架保证"卸载时怎么撤销"

这类似于C++的RAII或React的useEffect cleanup,但被提升为一个通用的运行时机制,而不是靠开发者手动记得写dispose。

3.3 空间可组合性:响应式协效应

空间可组合性(Spatial Composability):插件之间的依赖关系必须被结构化地声明和动态解析。

论文的解法叫**"响应式协效应"(Reactive Coeffects)**:

  • 一旦上下文发生变更,系统将依据协效应规约通知对应组件
  • 变化被分类为"激活""去激活"或"中性"
  • 开发者不需要轮询依赖是否可用,也不需要处理"依赖突然消失"的边界情况

3.4 统一与证明

论文将效应上下文与协效应上下文统一为单一上下文类型(context type),在此之上定义组件的概念,并给出了形式化证明——五个关键性质:

  1. 保持性(Preservation):插件加载后系统状态的一致性
  2. 时间可组合性(Temporal Composability):插件卸载后副作用的完整回滚
  3. 空间可组合性(Spatial Composability):依赖关系的正确响应式管理
  4. 进展性(Progress):系统不会因插件操作而死锁
  5. 汇合性(Confluence):相同操作的执行顺序不影响最终结果

这些保证从单个插件推广到整个交错运行的插件系统。

3.5 自演化Agent:论文的终极野心

论文结尾明确指出了Cordis范式的下一个验证方向——自演化智能体托管框架(Self-evolving Agent Harness)

在该场景下,AI智能体可持续生成、替换自身托管组件,几乎无需人工介入。在这类场景中部署Cordis,能够验证两项核心性质:组件频繁更替场景下完整状态恢复的时间特性保障,以及依赖拓扑频繁变动时依赖协同的空间特性保障。

这意味着DeepSeek的终极目标不仅是做一个Agent框架,而是做一个能让Agent自己修改自己、替换自己组件的底层操作系统。当一个AI Agent可以动态加载新能力、卸载旧能力、在运行中重组自己的架构——并且保证每一次重组都不会让系统崩溃——这已经触及了"AI自主进化"的工程边界。


四、V4 Pro正式版:逼近全球顶尖,价格只有六十分之一

4.1 核心参数

与Harness同天发布的DeepSeek-V4-Pro正式版(模型版本V4-Pro-0813)核心参数:

参数数值
总参数量1.6T
活跃参数49B
上下文窗口100万Token
最大输出长度38.4万Token
并发限制500(V4-Flash为2500)
思考模式low / high / max 三档

V4 Pro正式版原生支持OpenAI Responses API格式,并针对性适配Codex——开发者可以通过一键配置脚本完成Codex的配置。同时兼容Anthropic API格式、JSON结构化输出、工具调用等原有功能。

4.2 Agent基准测试:与Fable 5几乎持平

官方公布的评测数据显示,在9项智能体基准中,V4 Pro正式版已与Anthropic的Claude Fable 5几乎持平:

评测集V4-Pro-0813Fable 5差距
Terminal Bench 2.187.988.0-0.1
CyberGym83.383.1+0.2
DeepSWE62.770.0-7.3
Toolathlon-Verified74.176.2-2.1
AutomationBench31.827.2+4.6
DSBench-FullStack71.171.6-0.5
DSBench-Hard67.268.3-1.1

在CyberGym和AutomationBench上V4 Pro甚至略超Fable 5。对于一个完全开源的模型来说,这是一个创举。

而价格呢?V4 Pro高峰时段输出价格为27元/百万Token,而Claude Fable 5的输出价格约为其57倍。

性能逼近行业前沿,价格只有六十分之一。这就是DeepSeek给硅谷的压力。

4.3 思考模式三档:按需调节"智力浓度"

V4-Pro和V4-Flash的思考模式现支持low / high / max三档思考强度:

  • low:简单任务,快速响应,省Token
  • high:日常Agent任务,平衡速度与深度
  • max:高度复杂任务场景,最大化推理深度

这个设计的精妙之处在于:开发者不再需要为简单任务"浪费"深度推理的算力,也不必为复杂任务"节省"推理深度。Agent可以根据任务复杂度自动选择,或者在DSH的PTC模式下由代码逻辑动态切换。


五、峰谷定价:算力焦虑逼出的价格信号

5.1 定价方案

8月17日0时起,DeepSeek正式实施峰谷定价:

模型时段输入(缓存命中)输入(缓存未命中)输出
V4-Flash空闲0.05元1.5元4.5元
V4-Flash高峰0.10元3.0元9.0元
V4-Pro空闲0.15元4.5元13.5元
V4-Pro高峰0.30元9.0元27.0元

高峰时段:北京时间9:00-12:00、14:00-18:00(其余为空闲时段)。空闲时段价格为高峰时段的一半。

5.2 涨幅与信号

对比此前价格,V4-Flash空闲时段输入(缓存命中)上涨150%、输入(缓存未命中)上涨50%、输出上涨125%。涨幅不可谓不大。

但高盛在研报中的判断值得注意:

DeepSeek实施高峰时段价格调整,并不意味着需求走弱,反而反映出国内AI模型需求持续旺盛、算力资源趋紧,行业竞争正在从早期激进的价格战,逐步回归更理性的定价框架。

峰谷定价本质上是一个算力调度信号。DeepSeek通过价格杠杆引导用户将非实时任务迁移到空闲时段,从而在无需扩容的情况下提升整体吞吐量。这是一种比单纯涨价更聪明的资源管理策略——它承认了"算力是稀缺的"这个现实,同时给了用户选择权。

5.3 行业定价的连锁反应

DeepSeek的涨价并非孤例。2026年以来,阿里云、腾讯云、百度智能云、智谱AI等国内头部厂商已集体调价。腾讯云连续两次宣布涨价;智谱AI在年内进行了三次API价格上调。

这意味着中国AI行业正在经历一个重要的转折点:从"烧钱换规模"的价格战,转向"按成本定价"的理性阶段。当模型能力逼近行业前沿,继续低价竞争已经没有意义——竞争焦点从"谁更便宜"转向"谁的Agent生态更完善"。

这恰恰是Harness开源的战略意义所在。


六、梁文锋1.8亿打新宇树科技:从屏幕到物理世界

6.1 一笔跨越数字与物理的投资

就在Harness开源前两天(8月11日),宇树科技披露了科创板IPO配售结果:

  • DeepSeek(战略配售):获配93.34万股,金额1.41亿元,锁定期36个月
  • 幻方量化(网下配售):155只产品参与,获配19.5万股,金额2940.77万元
  • 九章资产(网下配售):43只产品参与,获配6.32万股,金额952.97万元
  • 合计:约119.16万股,总投资额近1.8亿元

宇树科技本次发行价150.80元/股,网上中签率0.0181%——创科创板历史新低。作为"A股人形机器人第一股",宇树科技的IPO热度刷新了多项纪录。

6.2 战略合作的三条线索

根据宇树科技董事长王兴兴在路演中的表述,DeepSeek与宇树科技将在三个方向展开合作:

  1. 面向通用人工智能的研发合作
  2. 高性能通用机器人技术联合攻关
  3. AI大模型在机器人领域的深度融合应用

把这条线连起来:

DeepSeek V4 Pro(大脑)→ DeepSeek Harness(神经系统)→ 宇树机器人(身体)

当大多数AI公司还在屏幕里卷的时候,梁文锋已经开始布局从数字世界到物理世界的通道。Harness的"一切皆插件"架构天然适合具身智能——机器人的传感器、执行器、运动控制,都可以作为插件接入Agent框架。

6.3 从Token到机器人的商业闭环

这笔投资揭示了一个更大的商业逻辑:

  • 模型层:V4 Pro提供智能,按Token收费
  • 框架层:Harness开源,降低开发者使用门槛,扩大Token消耗场景
  • 物理层:投资宇树,将AI能力延伸到物理世界,打开全新的应用场景

模型定智能上限,Harness定智能的形态,宇树定智能的物理载体。三者构成闭环,每多一个机器人应用场景,就多一份Token消耗——而Token正是DeepSeek的核心商业模式。


七、行业影响:Agent之争的格局重塑

7.1 对Claude Code和Codex的冲击

目前Agent产品领域有三大玩家,各自的策略截然不同:

维度Claude CodeCodexDeepSeek Harness
开源MIT协议完全开源
模型绑定仅Claude仅GPT支持所有OpenAI兼容端点
架构封闭产品封闭产品插件化元框架
扩展方式hooks配置插件规范一切皆插件,热插拔
定位产品产品底座/基础设施

DSH最致命的竞争策略不是"做得比Claude Code好",而是把"Claude Code"变成自己的一个插件。通过读取Claude Code的hooks.json、支持将Claude Code作为子代理调用,DSH实际上把竞品变成了自己生态的一部分。

当产品功能可以被组装,护城河就会从功能转向模型与数据。DSH把"组装一个Coding Agent"的成本压到史上最低——任何开发者都可以用它拼出自己的Agent产品。

7.2 开源vs闭源:Agent时代的Linux时刻

Hacker News上有开发者做了一个尖锐的判断:

"他们目前占据了整个帕累托前沿——在每一个商业可用的输出质量水平上,都提供成本最低的模型。我们在90年代见过同样的态度,Silicon Graphics、Sun对Linux和Windows的态度,最终导致了那些公司的毁灭。"

这个类比是否恰当见仁见智,但逻辑值得深思:

  • 1991年,Linus Torvalds开源Linux内核,IBM、HP、Sun的闭源Unix最终被边缘化
  • 2026年,DeepSeek开源Harness框架,Claude Code和Codex的封闭架构面临同样的挑战

不同之处在于:Linux花了十年才真正动摇商业Unix的地位,而Harness在16小时内就收获了65K Star。开源社区的力量已经今非昔比。

7.3 模型厂商的"第三条路"

此前模型厂商下场做Agent,形态基本只有两种:Coding Agent(Claude Code、Codex)或"AI同事"式的Cowork产品。

DeepSeek选了第三条路:做产品的底座,而不是做产品本身。

"模型 + Harness"把组装权交给社区:谁都能基于DeepSeek模型搭出自己的Agent产品,而Harness对模型厂商中立,反而让DeepSeek模型成为"默认项"。

商业逻辑非常清晰:

模型定智能上限 → Harness定智能的形态 → 形态越丰富 → Token消耗的场景越多 → 模型收入越多

7.4 AI原生开发的活样本

翻开DSH的仓库,最大的震撼不是代码本身,而是开发过程:

  • .agents/notes/目录里有1372个文件、约450组决策笔记——大部分是AI写的
  • 64天内完成了12,293次提交,核心团队仅约15人
  • 内置了整套给AI用的技能:dsh-code-review、dsh-merging-stacked-prs,甚至dsh-trim-cot-leakage(专门清理AI散落在文档中的思维链痕迹)

人肉根本写不出这个速度。DeepSeek用Agent开发了一个给Agent用的框架,然后开源了它。 连开发过程中的"AI参与证据"都没有刻意隐藏——450组决策记录就是450份AI原生开发的教学案例。


八、争议与隐忧

8.1 插件生态治理

Hacker News上有开发者直接质疑:

"所有依赖'社区插件'来提供功能的产品,头六个月都运行得很好,之后就是不兼容、过时、缺乏一致性和治理的噩梦。"

这是任何插件化系统都面临的长期挑战。DeepSeek的回应是理论层面的:Cordis的形式化保证确保插件可以被安全卸载,依赖关系可以被正确管理。但4000个Koishi插件的实践和一个全球开发者社区的实践,量级完全不同。

开源首日社区插件已超过1000个,质量参差不齐是必然的。npm供应链安全问题同样不容忽视——有开发者直接指出:"pip几乎发明了供应链攻击;npm把它完善了。大概算打平。"

8.2 "一切皆插件"是否过度设计

最损的一条HN评论是:

"一切皆插件——他们是刚刚发现Unix管道吗?"

Cordis的形式化理论——效应、协效应、时空可组合性——对不熟悉OSGi、iPOJO、React useEffect的开发者来说确实有学习曲线。论文本身的学术密度很高,88页的篇幅对于一篇"框架配套论文"来说相当厚重。

但换个角度看:如果DeepSeek的目标真的是"自演化Agent"——让AI自己修改自己的组件——那么这种形式化保证就不是过度设计,而是必需品。一个会自我修改的系统,如果不能用数学证明"每次修改都是安全的",那它就是一颗定时炸弹。

8.3 早期阶段的不完善

DSH团队负责人崔添翼本人也坦承:

"现在的0.1.0版本是一个面向Harness开发者的预览版,还很不完善,恳请大家多提提宝贵意见。"

如果拿当前Coding Agent的产品标准来说,DSH的体验确实不如Claude Code/Codex那么完善,接口一直在变化,插件生态才刚起步。但如果你从开发框架的角度来看,DSH就像一个超级乐高——官方提供的Coding Agent只是一套官方预置,你可以把零件换成任何你喜欢的。


九、崔添翼:从量化交易到Agent框架

DSH项目的负责人Tianyi Cui(崔添翼)的背景值得单独一说:

  • 浙江大学毕业,曾六次斩获ACM国际大学生程序设计竞赛亚洲分区赛金牌
  • 大学期间整理发布《背包问题九讲》,成为算法竞赛与动态规划学习的经典参考资料
  • 华尔街量化巨头Jane Street履职近9年
  • 前量化投资机构TSY Capital联合创始人(2022年成立于香港)
  • 2026年3月加入DeepSeek,组建Agent Harness团队

他的X账号@tianyi关注者已超过2.5万。DeepSeek同事Deli Chen介绍他时说:"the owner of this project is one of our most gifted workmate."

从Jane Street的量化交易系统到DeepSeek的Agent框架,崔添翼的轨迹揭示了一个深层逻辑:Agent框架的核心难题——状态管理、副作用控制、依赖解析——本质上是分布式系统问题,而这正是量化交易系统每天都在解决的问题。

一个前Jane Street量化交易员带队,一个清华AI-Infra方向的新锐工程师紧随其后(排名第二的贡献者LegGasai,GitHub主页显示为清华大学软件工程硕士),三个月内累计超过一万次提交——这个项目的工程密度极高。


十、总结:Agent的"操作系统"时代

DeepSeek在8月13日做的事情,远不止"发了一个模型+一个框架"。

V4 Pro 证明了:开源模型可以在Agent能力上逼近全球最顶尖的闭源模型,价格只有六十分之一。

Harness 证明了:Agent框架可以是完全插件化、完全开源、模型中立的——"产品"可以被降维成"preset + 插件组合"。

88页论文 证明了:这一切不是工程黑客的灵机一动,而是有严格数学基础的系统设计——并且指向了"自演化Agent"这个终极目标。

1.8亿投资宇树 证明了:DeepSeek的野心不限于屏幕——从Token到机器人,从数字世界到物理世界。

当OpenAI的答案是Codex和Responses API,Anthropic的答案是Claude Code和MCP,DeepSeek给出的答案是:一个完全开源、MIT协议、一切皆插件的Agent Harness,背后有严肃的PL论文做理论支撑,配合一个性能逼近全球顶尖、价格只有六十分之一的开源模型。

这不是在追赶硅谷。这是在重新定义赛道。

Agent的"操作系统"时代,可能刚刚开始。


本文数据截至2026年8月15日。DeepSeek Harness仓库地址:https://github.com/deepseek-ai/deepseek-harness ,88页论文地址:https://github.com/cordiverse/paper/blob/main/paper.pdf

作者注:本文基于DeepSeek官方公告、GitHub仓库代码分析、多篇技术媒体报道及Hacker News社区讨论综合撰写。部分基准测试数据来自DeepSeek官方评测,独立验证数据有待后续更新。

AI 时代程序员必备技能

Codex、Claude Code、Cursor、Hermes Agent、OpenClaw等工程化实战专栏 ,讲透 AI 如何接管脏活累活

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值