8月13日,DeepSeek开源了Harness。MIT协议, v0.1预览版,GitHub仓库在 github.com/deepseek-ai/deepseek-harness 。
这不是又一个编程助手。它是一套底层基建,把大语言模型变成真正能干活的Agent。核心公式只有一句:Agent = Model + Harness。模型决定能力上限,Harness决定落地方式。模型再聪明,没有工具调度、会话管理、沙箱隔离这套底盘,照样跑不出结果。
设计原则也一句话。“Everything is a plugin”——模型、工具、技能、会话、沙箱、存储、循环、调度、UI,全部可插拔。
现有Agent框架有三个老问题。第一个:工具调用死循环——Agent反复调同一个工具,37块钱API费用烧光了还没出结果。第二个:黑盒不可调试——Agent跑偏了你完全不知道是第几步出的错,只能盲猜十几遍,每次改一点试一遍。第三个:插件生态锁死——想加个"搜索内部Wiki"的工具,发现要改框架源码,直接劝退。Harness对应给出三个答案:可插拔架构、Session Log全链路追踪、Cordis微内核插件系统。
核心架构:三层结构 + 微内核
Harness分三层,自上而下。
模型层接入大语言模型,目前主推DeepSeek V4-Pro,接口设计不绑死单一模型,其他兼容模型也能替换接入。Harness层是调度引擎,管三件事:工具编排、会话管理、沙箱隔离。工具层挂载具体能力——文件系统、Shell命令、网页访问、子Agent调度、自定义插件,每项独立,按需加载。
引擎和能力分开,这是关键。
引擎极小,能力全外挂。这就是Cordis微内核的思路。好处很直接:需要什么挂什么,不需要的不占资源。Cordis把所有能力抽象成九类插件:模型、工具、技能、会话、沙箱、存储、循环、调度、UI。
仓库有230多个workspace成员。每个成员对应一项可替换能力。想把文件系统操作从 Node.js换成Rust实现?替换对应成员就行,其他配置不动。想加个"搜Wiki"的能力?写个工具插件注册进去,不碰核心代码。
跟LangChain的"全家桶"截然不同。LangChain打包所有能力,开箱即用但臃肿。Harness像乐高积木,核心只提供插槽和协议,积木块你选。

四种运行模式
四种模式,按场景选。
Standard是全功能模式。工具技能全开,零配置上手。拿到框架不用纠结,直接跑。适合大多数Agent开发,官方推荐新手从这里开始。
PTC用TypeScript编排工具调用。Standard模式下Agent自己决定调用顺序,灵活但不可控。PTC让你显式编排——先调A再调B,B返回特定结果就跳C。适合需要确定性执行路径的复杂工作流。
Minimal只挂Bash和编辑器。极致轻量,启动快。适合轻量任务、资源受限环境,或者快速验证想法。
Creator完全自由配置。自定义Agent预设,精确控制每个参数和插件组合。灵活度最高,门槛也最高,面向有经验的开发者。
场景怎么选,看这张表:
|
场景特征
|
推荐模式
|
理由
|
| — | — | — |
|
第一次用,想快速跑起来
|
Standard
|
全功能默认开启,零配置上手
|
|
需要确定性执行流程
|
PTC
|
显式编排每步调用,结果可控
|
|
资源受限,只想跑个简单任务
|
Minimal
|
只挂Bash和编辑器,极轻量
|
|
有明确Agent设计方案
|
Creator
|
完全自由配置,最大灵活度
|
关键特性深度解析
Session Log:全链路可追溯
Session Log是最值得关注的设计。append-only日志,写入后不可改。
记录什么?调用什么工具、传什么参数、模型返回什么、耗多少Token、花多少钱。按时间排列,形成完整决策链。
怎么查看?Trajectory视图按来源审查。像翻行车记录仪一样逐帧回放:第一步读文件,第二步跑命令,第三步模型做判断,第四步调子Agent。
解决的是"Agent黑盒"问题。过去Agent跑出错误结果,你只能猜:提示词没写好?工具配置有问题?模型能力不够?有了Session Log,精确定位到第几步跑偏,是提示词问题还是工具参数传错了,一查便知。
调试效率提升是量级的。过去调一个Agent反复跑十几遍,每次改一点盲猜一点,一个Bug耗一整天。现在看一遍Trajectory,定位问题,改一处配置,再跑一遍验证,半小时搞定。

五种入口方式
五种入口,覆盖调试到部署。
Web UI是可视化界面。浏览器里跟Agent对话,实时看工具调用过程,适合开发阶段反复调试。TUI是终端版本,功能类似但不依赖浏览器,适合服务器环境。
Headless去掉所有界面。纯API调用,Agent作为后台服务运行,接收请求返回结果。适合接入CI/CD、自动化流程、定时任务。生产环境最常用。
ACP用于多Agent协作。多个Agent通过ACP对话、传任务、共享上下文。搭一个搜索Agent加分析Agent加写作Agent的系统,ACP就是通信总线。
JSON-RPC和Python SDK是编程接入。用Python SDK,10行代码把Agent嵌进你的系统。集成现有工程最直接的路径。
五种入口不互斥。开发用Web UI调试,验证后切Headless部署,同时用SDK把核心能力嵌进业务系统。
上手使用指南
环境准备
环境要求不苛刻。macOS和Linux原生支持,Windows走WSL。 Node.js 18+,Python 3.10+。用Python SDK的话再pip装对应包。
安装不复杂。克隆仓库,装依赖,跑验证命令确认成功。整个流程15分钟,命令在README里写全了,照着敲就行。
配置模型接入
两步搞定。拿API Key,配环境变量。
Key在DeepSeek开放平台注册后获取。拿到填进配置文件。关键参数几个:temperature控制随机性,日常0.7够用;maxtokens限输出长度,按任务设;thinkingmode控推理深度,有low、high、max三档。
注意一个时间节点。DeepSeek峰谷定价8月17日0点生效。高峰时段(9:00-12:00、14:00-18:00)V4-Pro输出27元每百万Token,空闲时段13.5元。不急的任务错峰跑,直接省一半。thinking_mode也分级——简单任务开low,典型Agent任务开high,复杂排错再开max。全开最高档,Token消耗差3到5倍。
运行你的第一个Agent
Standard模式启动最快。写个最简配置文件,指定模型、挂一两个基础工具,就能跑。
跑完打开Session Log看Trajectory。Agent从接收指令开始,每步怎么思考、调什么工具、返回什么结果,一清二楚。第一次跑建议把完整链路看一遍,建立对"Agent到底在干什么"的直觉。
成本控制还有第三招。除了错峰和thinking_mode分级,关注Prompt Cache命中率。缓存命中输入价0.15元每百万Token,未命中4.5元,差30倍。常见提示词固化成模板能有效省钱。
与主流框架对比
放到市场里比一比。
|
对比维度
|
DeepSeek Harness
|
LangChain
|
AutoGPT
|
| — | — | — | — |
|
架构复杂度
|
微内核,核心极小
|
全家桶,功能全打包
|
单体应用,功能耦合
|
|
可调试性
|
Session Log全链路追踪
|
日志能力有限
|
基本黑盒
|
|
插件扩展性
|
九类插件全部可替换
|
扩展需遵循框架约定
|
扩展需改源码
|
|
学习曲线
|
中等,需理解插件机制
|
较陡,概念多
|
低,开箱即用
|
|
适合场景
|
工程化Agent开发
|
快速原型搭建
|
个人自动化实验
|
定位清晰。面向工程化落地的开发者。快速试想法,LangChain或AutoGPT上手更快。搭一个长期维护、需要调试迭代的Agent系统,Harness架构更有优势。
高频问题和解法:
|
问题
|
解法
|
| — | — |
|
Agent调用工具死循环
|
查Trajectory定位循环起点,提示词里加最大调用次数限制
|
|
Token消耗异常偏高
|
查thinking_mode是否开太高,切low或high试试
|
|
自定义插件不生效
|
确认插件是否注册到Cordis,检查配置文件路径
|
|
Session Log体积过大
|
配置日志保留策略,按时间或大小自动清理
|
|
Headless模式无响应
|
检查环境变量是否加载,确认API Key配置无误
|
|
多Agent协作消息丢失
|
检查ACP配置,确认Agent间通信通道正常
|
Harness是 v0.1预览版。功能还在快速迭代,但"可观察加可插拔"这两个设计决策已经确立核心价值。社区插件生态刚起步,现在了解架构、跟踪动态,入场时机合适。

671

被折叠的 条评论
为什么被折叠?



