DeepSeek Harness开源:88页论文背后的Agent野心,中国AI公司正在重新定义"智能体"
8月13日,DeepSeek在发布V4 Pro正式版的同一天,将酝酿已久的Agent框架DeepSeek Harness以MIT协议开源。16小时内GitHub Star突破65K,配套88页论文同步发布。这不是又一款Claude Code的模仿者——"一切皆插件"的架构哲学,正在重新定义AI Agent应该长什么样。
一、破圈:16小时65K Star,一个框架为什么能让全球开发者集体失眠
8月13日,DeepSeek官方在X上发布了两条推文,间隔不到24小时:
第一条:We're launching DeepSeek-V4-Pro today!
第二条:DeepSeek Harness v0.1 is now available in Developer Preview!
第一条是模型,第二条是框架。模型回答"AI有多强",框架回答"强了之后怎么用起来"。
Hacker News上关于Harness的讨论帖直接冲上TOP 1。GitHub仓库deepseek-ai/deepseek-harness的Star数在16小时内从0飙升到65.4K,Fork数突破5.5K。这不仅是2026年GitHub涨星最快的项目之一,也是中国AI公司开源项目中罕见的全球级破圈事件。
更值得关注的是社区反应的"质量"。掘金上有开发者把仓库克隆下来逐行读代码、翻提交记录、查依赖树,写出了近万字的技术拆解;CSDN热榜上"DeepSeek Harness内测开启,AI Agent竞争升级"冲上1.3万热度;V2EX上关于Harness的讨论帖回复数远超日常话题。
一个Agent框架——不是模型——为什么能让开发者如此兴奋?
答案藏在六个字里:一切皆插件。
二、"一切皆插件":Model + Harness = Agent的设计哲学
2.1 从产品到底座的范式转变
要理解DeepSeek Harness(以下简称DSH)的定位,先看一个公式:
Agent = Model + Harness
这是LangChain提出的Agent架构概念:一个完整的AI Agent,必然由Harness(执行框架)和模型搭配构成。Claude Code、Codex、WorkBuddy,本质上都是Harness,只是以"软件产品"的形态封装好交给用户。
区别在于:其他厂商把Harness藏在产品内部,你只能"用",不能"拆"。DeepSeek把Harness整个打开,放在了GitHub上。
用DeepSeek自己的话说:
Everything is a Plugin.
这不是口号。打开仓库的架构文档,你会发现:
- 模型适配器是插件——DeepSeek官方只是众多提供方之一,任何OpenAI兼容端点都能作为自定义提供方接入
- 工具注册是插件——文件编辑、Shell执行、网页搜索、代码审查,全部以插件形式注册
- 会话日志是插件——采用append-only事件日志,Resume/Fork/Replay共享同一事件流
- 沙箱策略是插件——默认workspace-write,失败关闭(fail-closed)
- 审批策略是插件——决定哪些操作需要人工确认
- Agent Loop本身也是插件——可以被整体替换
- UI也是插件——默认提供Web UI,但你可以换成CLI、TUI或者任何你想要的形态
所有这些组件通过Cordis服务与事件彼此协作,开发者无需改动DSH源码,就能在配置层独立选择、替换或扩展任何一个能力。
2.2 四种工作模式:预设即插件组装
DSH内置了四种预设模式,每种加载不同的插件集合:
| 模式 | 适用场景 | 插件配置 |
|---|---|---|
| 标准模式 | 日常开发 | 文件编辑、Shell、检索、Skills、计划、目标、子代理、工作流全开 |
| PTC模式 | 复杂多步任务 | 通过Code Mode SDK让模型生成TypeScript代码编排多轮工具调用,中间数据留在运行环境,只有最终结果进入上下文,大幅降低Token消耗 |
| 极简模式 | 基准测试 | 仅保留持久bash和str_replace_editor两个工具 |
| 创造模式 | Agent开发 | 在标准能力外加上运行时检查与插件实验,让Agent反过来帮你设计和创建新preset——用Agent造Agent |
换模式 = 换一份插件清单。这和Claude Code里改几个配置参数完全是两种思路。
2.3 Cordis微内核:9个文件撑起整个框架
DSH的核心是一个叫Cordis的插件微内核,核心源码只有9个文件。Cordis的作者是Shigma(史一凡)——著名聊天机器人框架Koishi的作者,他的框架生态中已有超过4000个社区插件验证过这套架构。DeepSeek没有自己造插件系统,而是直接"雇佣"了这个领域最合适的人,把Cordis源码内联进了仓库。
本地实例dump出来的配置显示,一个标准部署包含133个插件,每个都能单独启停:
# dsh --profile web --dump-config (节选)
# == @deepseek-ai/dsh-base
- id: llm
name: '@deepseek-ai/dsh-llm'
- id: session
name: '@deepseek-ai/dsh-session'
- id: agent
name: '@deepseek-ai/dsh-agent'
# == @deepseek-ai/dsh-base, patched by @deepseek-ai/dsh-web-app
- id: hmr
name: '@deepseek-ai/cordis-plugin-hmr'
disabled: true
连最"核心"的东西都是插件:会话日志是插件,沙箱是插件,Claude Code的hooks.json也能被插件桥直接解析执行。没有"特权内核"。
2.4 兼容性作为武器:连对手都是它的插件
DSH做了一件非常有想象力的事:把兼容性做成了武器。
它直接读取Claude Code的hooks.json配置文件,能够把Claude Code、Codex本身当作子代理调用。这意味着——如果你已经在用Claude Code,迁移到DSH的摩擦几乎为零。你的配置、你的工具链、你的工作流,DSH全部能接管。
同时,DSH从架构上就把模型适配器做成了插件。支持谁、路由到谁,只是注册表里的一行。DeepSeek官方模型只是众多选项之一,你完全可以用本地Qwen、Llama、甚至Claude来驱动DSH。
模型中立 + 工具兼容 + 完全开源 = 对现有Coding Agent产品的降维打击。
三、88页论文:用数学证明"插件可以热插拔"
3.1 论文要解决什么问题
与V4 Pro和DSH一同发布的,还有一篇长达88页的技术论文:《A Programming Paradigm for Spatiotemporal Composability》(面向时空可组合性的编程范式),三位作者:Yifan Shi(北京大学 & DeepSeek-AI)、Wei Zhang(北京大学)、Tianyi Cui(DeepSeek-AI),2026年8月13日预印本。
论文标题很学术,但它要解决的问题每个写过插件系统的开发者都遇到过:
你装了一个插件,它注册了事件监听、分配了资源、修改了全局状态。现在你想卸载它——怎么保证干净地恢复原状?进一步:你的插件B依赖插件A提供的服务,A被热卸载了——B怎么办?
现有的工程实践对这两个问题的回答通常是:重启。
论文统计了VSCode top 100扩展,87个包含可执行代码,卸载时需要重启整个extension host;只有7个声明了extensionDependencies。换句话说,当前最流行的插件系统在"动态卸载"和"依赖管理"两个方向上基本是放弃状态。
3.2 时间可组合性:可逆副作用
论文将问题拆解为两个正交维度。
时间可组合性(Temporal Composability):插件被移除时,它做过的所有事情——注册的事件、分配的资源、修改的状态——必须被完全回滚。
论文的解法叫**"可逆副作用"(Revertible Effects)**:
- 每一次上下文变换都附带逆操作
- 运行时负责持续追踪和恢复
- 对开发者来说,写插件时只需要声明"我要做什么",框架保证"卸载时怎么撤销"
这类似于C++的RAII或React的useEffect cleanup,但被提升为一个通用的运行时机制,而不是靠开发者手动记得写dispose。
3.3 空间可组合性:响应式协效应
空间可组合性(Spatial Composability):插件之间的依赖关系必须被结构化地声明和动态解析。
论文的解法叫**"响应式协效应"(Reactive Coeffects)**:
- 一旦上下文发生变更,系统将依据协效应规约通知对应组件
- 变化被分类为"激活""去激活"或"中性"
- 开发者不需要轮询依赖是否可用,也不需要处理"依赖突然消失"的边界情况
3.4 统一与证明
论文将效应上下文与协效应上下文统一为单一上下文类型(context type),在此之上定义组件的概念,并给出了形式化证明——五个关键性质:
- 保持性(Preservation):插件加载后系统状态的一致性
- 时间可组合性(Temporal Composability):插件卸载后副作用的完整回滚
- 空间可组合性(Spatial Composability):依赖关系的正确响应式管理
- 进展性(Progress):系统不会因插件操作而死锁
- 汇合性(Confluence):相同操作的执行顺序不影响最终结果
这些保证从单个插件推广到整个交错运行的插件系统。
3.5 自演化Agent:论文的终极野心
论文结尾明确指出了Cordis范式的下一个验证方向——自演化智能体托管框架(Self-evolving Agent Harness):
在该场景下,AI智能体可持续生成、替换自身托管组件,几乎无需人工介入。在这类场景中部署Cordis,能够验证两项核心性质:组件频繁更替场景下完整状态恢复的时间特性保障,以及依赖拓扑频繁变动时依赖协同的空间特性保障。
这意味着DeepSeek的终极目标不仅是做一个Agent框架,而是做一个能让Agent自己修改自己、替换自己组件的底层操作系统。当一个AI Agent可以动态加载新能力、卸载旧能力、在运行中重组自己的架构——并且保证每一次重组都不会让系统崩溃——这已经触及了"AI自主进化"的工程边界。
四、V4 Pro正式版:逼近全球顶尖,价格只有六十分之一
4.1 核心参数
与Harness同天发布的DeepSeek-V4-Pro正式版(模型版本V4-Pro-0813)核心参数:
| 参数 | 数值 |
|---|---|
| 总参数量 | 1.6T |
| 活跃参数 | 49B |
| 上下文窗口 | 100万Token |
| 最大输出长度 | 38.4万Token |
| 并发限制 | 500(V4-Flash为2500) |
| 思考模式 | low / high / max 三档 |
V4 Pro正式版原生支持OpenAI Responses API格式,并针对性适配Codex——开发者可以通过一键配置脚本完成Codex的配置。同时兼容Anthropic API格式、JSON结构化输出、工具调用等原有功能。
4.2 Agent基准测试:与Fable 5几乎持平
官方公布的评测数据显示,在9项智能体基准中,V4 Pro正式版已与Anthropic的Claude Fable 5几乎持平:
| 评测集 | V4-Pro-0813 | Fable 5 | 差距 |
|---|---|---|---|
| Terminal Bench 2.1 | 87.9 | 88.0 | -0.1 |
| CyberGym | 83.3 | 83.1 | +0.2 |
| DeepSWE | 62.7 | 70.0 | -7.3 |
| Toolathlon-Verified | 74.1 | 76.2 | -2.1 |
| AutomationBench | 31.8 | 27.2 | +4.6 |
| DSBench-FullStack | 71.1 | 71.6 | -0.5 |
| DSBench-Hard | 67.2 | 68.3 | -1.1 |
在CyberGym和AutomationBench上V4 Pro甚至略超Fable 5。对于一个完全开源的模型来说,这是一个创举。
而价格呢?V4 Pro高峰时段输出价格为27元/百万Token,而Claude Fable 5的输出价格约为其57倍。
性能逼近行业前沿,价格只有六十分之一。这就是DeepSeek给硅谷的压力。
4.3 思考模式三档:按需调节"智力浓度"
V4-Pro和V4-Flash的思考模式现支持low / high / max三档思考强度:
- low:简单任务,快速响应,省Token
- high:日常Agent任务,平衡速度与深度
- max:高度复杂任务场景,最大化推理深度
这个设计的精妙之处在于:开发者不再需要为简单任务"浪费"深度推理的算力,也不必为复杂任务"节省"推理深度。Agent可以根据任务复杂度自动选择,或者在DSH的PTC模式下由代码逻辑动态切换。
五、峰谷定价:算力焦虑逼出的价格信号
5.1 定价方案
8月17日0时起,DeepSeek正式实施峰谷定价:
| 模型 | 时段 | 输入(缓存命中) | 输入(缓存未命中) | 输出 |
|---|---|---|---|---|
| V4-Flash | 空闲 | 0.05元 | 1.5元 | 4.5元 |
| V4-Flash | 高峰 | 0.10元 | 3.0元 | 9.0元 |
| V4-Pro | 空闲 | 0.15元 | 4.5元 | 13.5元 |
| V4-Pro | 高峰 | 0.30元 | 9.0元 | 27.0元 |
高峰时段:北京时间9:00-12:00、14:00-18:00(其余为空闲时段)。空闲时段价格为高峰时段的一半。
5.2 涨幅与信号
对比此前价格,V4-Flash空闲时段输入(缓存命中)上涨150%、输入(缓存未命中)上涨50%、输出上涨125%。涨幅不可谓不大。
但高盛在研报中的判断值得注意:
DeepSeek实施高峰时段价格调整,并不意味着需求走弱,反而反映出国内AI模型需求持续旺盛、算力资源趋紧,行业竞争正在从早期激进的价格战,逐步回归更理性的定价框架。
峰谷定价本质上是一个算力调度信号。DeepSeek通过价格杠杆引导用户将非实时任务迁移到空闲时段,从而在无需扩容的情况下提升整体吞吐量。这是一种比单纯涨价更聪明的资源管理策略——它承认了"算力是稀缺的"这个现实,同时给了用户选择权。
5.3 行业定价的连锁反应
DeepSeek的涨价并非孤例。2026年以来,阿里云、腾讯云、百度智能云、智谱AI等国内头部厂商已集体调价。腾讯云连续两次宣布涨价;智谱AI在年内进行了三次API价格上调。
这意味着中国AI行业正在经历一个重要的转折点:从"烧钱换规模"的价格战,转向"按成本定价"的理性阶段。当模型能力逼近行业前沿,继续低价竞争已经没有意义——竞争焦点从"谁更便宜"转向"谁的Agent生态更完善"。
这恰恰是Harness开源的战略意义所在。
六、梁文锋1.8亿打新宇树科技:从屏幕到物理世界
6.1 一笔跨越数字与物理的投资
就在Harness开源前两天(8月11日),宇树科技披露了科创板IPO配售结果:
- DeepSeek(战略配售):获配93.34万股,金额1.41亿元,锁定期36个月
- 幻方量化(网下配售):155只产品参与,获配19.5万股,金额2940.77万元
- 九章资产(网下配售):43只产品参与,获配6.32万股,金额952.97万元
- 合计:约119.16万股,总投资额近1.8亿元
宇树科技本次发行价150.80元/股,网上中签率0.0181%——创科创板历史新低。作为"A股人形机器人第一股",宇树科技的IPO热度刷新了多项纪录。
6.2 战略合作的三条线索
根据宇树科技董事长王兴兴在路演中的表述,DeepSeek与宇树科技将在三个方向展开合作:
- 面向通用人工智能的研发合作
- 高性能通用机器人技术联合攻关
- AI大模型在机器人领域的深度融合应用
把这条线连起来:
DeepSeek V4 Pro(大脑)→ DeepSeek Harness(神经系统)→ 宇树机器人(身体)
当大多数AI公司还在屏幕里卷的时候,梁文锋已经开始布局从数字世界到物理世界的通道。Harness的"一切皆插件"架构天然适合具身智能——机器人的传感器、执行器、运动控制,都可以作为插件接入Agent框架。
6.3 从Token到机器人的商业闭环
这笔投资揭示了一个更大的商业逻辑:
- 模型层:V4 Pro提供智能,按Token收费
- 框架层:Harness开源,降低开发者使用门槛,扩大Token消耗场景
- 物理层:投资宇树,将AI能力延伸到物理世界,打开全新的应用场景
模型定智能上限,Harness定智能的形态,宇树定智能的物理载体。三者构成闭环,每多一个机器人应用场景,就多一份Token消耗——而Token正是DeepSeek的核心商业模式。
七、行业影响:Agent之争的格局重塑
7.1 对Claude Code和Codex的冲击
目前Agent产品领域有三大玩家,各自的策略截然不同:
| 维度 | Claude Code | Codex | DeepSeek Harness |
|---|---|---|---|
| 开源 | 否 | 否 | MIT协议完全开源 |
| 模型绑定 | 仅Claude | 仅GPT | 支持所有OpenAI兼容端点 |
| 架构 | 封闭产品 | 封闭产品 | 插件化元框架 |
| 扩展方式 | hooks配置 | 插件规范 | 一切皆插件,热插拔 |
| 定位 | 产品 | 产品 | 底座/基础设施 |
DSH最致命的竞争策略不是"做得比Claude Code好",而是把"Claude Code"变成自己的一个插件。通过读取Claude Code的hooks.json、支持将Claude Code作为子代理调用,DSH实际上把竞品变成了自己生态的一部分。
当产品功能可以被组装,护城河就会从功能转向模型与数据。DSH把"组装一个Coding Agent"的成本压到史上最低——任何开发者都可以用它拼出自己的Agent产品。
7.2 开源vs闭源:Agent时代的Linux时刻
Hacker News上有开发者做了一个尖锐的判断:
"他们目前占据了整个帕累托前沿——在每一个商业可用的输出质量水平上,都提供成本最低的模型。我们在90年代见过同样的态度,Silicon Graphics、Sun对Linux和Windows的态度,最终导致了那些公司的毁灭。"
这个类比是否恰当见仁见智,但逻辑值得深思:
- 1991年,Linus Torvalds开源Linux内核,IBM、HP、Sun的闭源Unix最终被边缘化
- 2026年,DeepSeek开源Harness框架,Claude Code和Codex的封闭架构面临同样的挑战
不同之处在于:Linux花了十年才真正动摇商业Unix的地位,而Harness在16小时内就收获了65K Star。开源社区的力量已经今非昔比。
7.3 模型厂商的"第三条路"
此前模型厂商下场做Agent,形态基本只有两种:Coding Agent(Claude Code、Codex)或"AI同事"式的Cowork产品。
DeepSeek选了第三条路:做产品的底座,而不是做产品本身。
"模型 + Harness"把组装权交给社区:谁都能基于DeepSeek模型搭出自己的Agent产品,而Harness对模型厂商中立,反而让DeepSeek模型成为"默认项"。
商业逻辑非常清晰:
模型定智能上限 → Harness定智能的形态 → 形态越丰富 → Token消耗的场景越多 → 模型收入越多
7.4 AI原生开发的活样本
翻开DSH的仓库,最大的震撼不是代码本身,而是开发过程:
.agents/notes/目录里有1372个文件、约450组决策笔记——大部分是AI写的- 64天内完成了12,293次提交,核心团队仅约15人
- 内置了整套给AI用的技能:dsh-code-review、dsh-merging-stacked-prs,甚至dsh-trim-cot-leakage(专门清理AI散落在文档中的思维链痕迹)
人肉根本写不出这个速度。DeepSeek用Agent开发了一个给Agent用的框架,然后开源了它。 连开发过程中的"AI参与证据"都没有刻意隐藏——450组决策记录就是450份AI原生开发的教学案例。
八、争议与隐忧
8.1 插件生态治理
Hacker News上有开发者直接质疑:
"所有依赖'社区插件'来提供功能的产品,头六个月都运行得很好,之后就是不兼容、过时、缺乏一致性和治理的噩梦。"
这是任何插件化系统都面临的长期挑战。DeepSeek的回应是理论层面的:Cordis的形式化保证确保插件可以被安全卸载,依赖关系可以被正确管理。但4000个Koishi插件的实践和一个全球开发者社区的实践,量级完全不同。
开源首日社区插件已超过1000个,质量参差不齐是必然的。npm供应链安全问题同样不容忽视——有开发者直接指出:"pip几乎发明了供应链攻击;npm把它完善了。大概算打平。"
8.2 "一切皆插件"是否过度设计
最损的一条HN评论是:
"一切皆插件——他们是刚刚发现Unix管道吗?"
Cordis的形式化理论——效应、协效应、时空可组合性——对不熟悉OSGi、iPOJO、React useEffect的开发者来说确实有学习曲线。论文本身的学术密度很高,88页的篇幅对于一篇"框架配套论文"来说相当厚重。
但换个角度看:如果DeepSeek的目标真的是"自演化Agent"——让AI自己修改自己的组件——那么这种形式化保证就不是过度设计,而是必需品。一个会自我修改的系统,如果不能用数学证明"每次修改都是安全的",那它就是一颗定时炸弹。
8.3 早期阶段的不完善
DSH团队负责人崔添翼本人也坦承:
"现在的0.1.0版本是一个面向Harness开发者的预览版,还很不完善,恳请大家多提提宝贵意见。"
如果拿当前Coding Agent的产品标准来说,DSH的体验确实不如Claude Code/Codex那么完善,接口一直在变化,插件生态才刚起步。但如果你从开发框架的角度来看,DSH就像一个超级乐高——官方提供的Coding Agent只是一套官方预置,你可以把零件换成任何你喜欢的。
九、崔添翼:从量化交易到Agent框架
DSH项目的负责人Tianyi Cui(崔添翼)的背景值得单独一说:
- 浙江大学毕业,曾六次斩获ACM国际大学生程序设计竞赛亚洲分区赛金牌
- 大学期间整理发布《背包问题九讲》,成为算法竞赛与动态规划学习的经典参考资料
- 华尔街量化巨头Jane Street履职近9年
- 前量化投资机构TSY Capital联合创始人(2022年成立于香港)
- 2026年3月加入DeepSeek,组建Agent Harness团队
他的X账号@tianyi关注者已超过2.5万。DeepSeek同事Deli Chen介绍他时说:"the owner of this project is one of our most gifted workmate."
从Jane Street的量化交易系统到DeepSeek的Agent框架,崔添翼的轨迹揭示了一个深层逻辑:Agent框架的核心难题——状态管理、副作用控制、依赖解析——本质上是分布式系统问题,而这正是量化交易系统每天都在解决的问题。
一个前Jane Street量化交易员带队,一个清华AI-Infra方向的新锐工程师紧随其后(排名第二的贡献者LegGasai,GitHub主页显示为清华大学软件工程硕士),三个月内累计超过一万次提交——这个项目的工程密度极高。
十、总结:Agent的"操作系统"时代
DeepSeek在8月13日做的事情,远不止"发了一个模型+一个框架"。
V4 Pro 证明了:开源模型可以在Agent能力上逼近全球最顶尖的闭源模型,价格只有六十分之一。
Harness 证明了:Agent框架可以是完全插件化、完全开源、模型中立的——"产品"可以被降维成"preset + 插件组合"。
88页论文 证明了:这一切不是工程黑客的灵机一动,而是有严格数学基础的系统设计——并且指向了"自演化Agent"这个终极目标。
1.8亿投资宇树 证明了:DeepSeek的野心不限于屏幕——从Token到机器人,从数字世界到物理世界。
当OpenAI的答案是Codex和Responses API,Anthropic的答案是Claude Code和MCP,DeepSeek给出的答案是:一个完全开源、MIT协议、一切皆插件的Agent Harness,背后有严肃的PL论文做理论支撑,配合一个性能逼近全球顶尖、价格只有六十分之一的开源模型。
这不是在追赶硅谷。这是在重新定义赛道。
Agent的"操作系统"时代,可能刚刚开始。
本文数据截至2026年8月15日。DeepSeek Harness仓库地址:https://github.com/deepseek-ai/deepseek-harness ,88页论文地址:https://github.com/cordiverse/paper/blob/main/paper.pdf
作者注:本文基于DeepSeek官方公告、GitHub仓库代码分析、多篇技术媒体报道及Hacker News社区讨论综合撰写。部分基准测试数据来自DeepSeek官方评测,独立验证数据有待后续更新。

377

被折叠的 条评论
为什么被折叠?



