作者:Cage、Daniel
| / |
01.
Key Takeaways
1. DeepSeek Harness(DSH)发布了一套支持热重载的 harness,其设计初衷是供 coding agent 自我修改与进化。该发布并未直接在白领工作或 coding agent 产品层面与 Claude Code 等竞争,而是延续开源与 Infra 化的战略路径。
• 开源策略:将 harness 各层级拆解开放,允许社区共同优化。
• Infra 化发布:提高使用门槛,避免项目因复杂度膨胀过快而难以维护。
2. DSH 发布可从三个层面理解:
• 应用层:提供带本地 Web UI 的 coding agent,未做桌面端或 TUI,与 DS 模型适配度高,任务执行能力强于裸模型或其他 harness。
• 框架层:采用 everything-is-a-plugin 架构,核心能力(包括 agent loop)均可自定义。
• 底层元框架:Cordis 实现插件的热重载、自由组合及彻底卸载,解决动态依赖与副作用清理问题。
3. Cordis 插件机制不同于 MCP 或 Skills,它统一了 hooks、subagents 及核心 loop,类似早期 Unix 操作系统,具备高扩展潜力。
4. Creator 模式允许开发者指导 agent 试验插件并创作新的 Agent preset,虽非完全自进化系统,但为收集自进化数据及构建插件生态提供了入口。
5. DSH 长期目标是从 To Developer 转向 To Agent,打造支持 long horizon task 中持续替换运行部件的自进化框架,如同“忒修斯之船”。
6. Anthropic Claude Code 与 DeepSeek DSH 代表两种不同研究范式:
• Anthropic 聚焦当前范式下的最优产品,追求有效性与简单性,通过垂直整合增强用户粘性。
• DeepSeek 押注下一范式,将 harness 视为可流动、可内化的对象,重点研究组件的替换、组合与撤销,即 Meta Harness。
7. DSH 目前实现了 agent runtime self-modification 的基础设施,但缺乏完整的学习闭环(Learning Loop 与 Eval),属于 Harness-level RSI 的初级阶段。
02.
DSH 这次发布了什么?
从产品形态看,DSH 是一个带有本地 Web UI 的 Coding Agent,官方预设四种模式并支持开发者贡献更多配置:
• 标准模式:覆盖 80% 任务,能力完整、行为可预测且易于排错。
• PTC / Code 模式:适合工具调用密集场景,通过生成 TypeScript 批量调用工具,在复杂任务中收益显著。
• 极简模式:仅保留 Bash 和编辑器,用于控制变量研究,区分模型自身能力与 harness 辅助效果。
• 创造模式:核心用途为“造 Agent",允许检查 Cordis Runtime、实验新插件并编写新 Preset,适合 harness 开发与隔离实验。
本次发布可拆解为三层架构:
1. Coding Agent
DSH 选择本地 Web UI 而非 TUI 或桌面端,作为开发者 Demo 形态。标准模式涵盖执行命令、文件操作、Skills 调用、计划维护、子代理启动及工作流运行等核心编程能力,并提供上下文压缩、会话持久化、沙箱及权限审批机制。
2. Harness Construction Framework
DSH 允许通过 Cordis Plugin 自定义 Model Adapter、Tool Registry、Sandbox Policy、Subagent Backend 乃至默认 Agent Loop。组件间通过稳定的 Service Key(如 ctx.llm、ctx.tools)协作,开发者可替换特定 Provider 而不影响其他组件。
3. Cordis Meta-Framework
Cordis 解决了组件动态加入、删除与重组时的系统稳定性问题。针对插件堆积导致的“熵增”现象,Cordis 论文提出时空可组合性方案:
• 时间可组合性(Temporal Composability):确保插件卸载时能正确清理其注册的 Tool、Prompt、Event Listener 等副作用,避免“幽灵组件”残留。
• 空间可组合性(Spatial Composability):处理组件依赖关系。组件声明所需 Service,依赖满足时激活,依赖消失时自动撤销并等待重新激活。
总体而言,DSH 更像早期的 Unix,底层开放允许深度修改;而 Claude Code 和 Codex 则类似高度整合的 Windows。DSH 目前生态尚处早期,理解与修改门槛较高,短期内难以直接替代成熟产品。
03.
DSH 与 Anthropic Harness 的哲学差异
Agent 可定义为 Model + Harness,其中 Harness 包含编排、记忆、权限及工具等。Anthropic 与 DeepSeek 的差异在于优化目标不同:
Anthropic Claude Code:实证优化 Agent 行为
Anthropic 的研究基于 SOTA 模型的能力边界与失败模式,通过实证科学方法设计 Harness 机制:
• 利用 initializer agent 与 Artifact Handoff 解决长任务状态丢失;
• 通过 planner、generator 与 evaluator 分工解决规划不足与自我评价偏差;
• 利用 Context Reset 与 Compaction 缓解上下文污染;
• 通过任务分解与 Scalable Evaluator 控制执行范围并自动验收;
• 随着模型能力提升,通过 Ablation 删除冗余 Scaffolding。
Boris Cherny 指出,Opus 5 发布后 Claude Code 删除了超 80% 的 System Prompt。团队以清空 Prompt 为基线,仅在模型反复失败时逐行加回指令,确保持续优化。
DSH:构建万物可插拔的 Meta Harness
DSH 从理论视角出发,致力于解决"Harness 能否被低成本修改”的问题,旨在打造可持续迭代的 Meta Harness:
• 支持替换 harness component 并撤销旧组件副作用;
• 动态解析依赖关系,支持不同 session 使用不同组合;
• 允许 agent 检查并编写新的 preset/plugin。
Anthropic 优化的是当下最佳结果,而 DSH 优化的是未来持续探索不同结果的能力,意在制造一套 Harness Evolution 的操作系统。
04.
DSH 的用户演进:从开发者到 Agent
DSH 当前形态更接近开发者预览版,优先打磨可深度修改的 Runtime,而非面向普通用户的开箱即用体验。对 Agent Developer 而言,DSH 提供了替换 Memory、Tool、Sandbox 乃至 Agent Loop 的自由度,使其成为 Agent 开发底座。
长期来看,DSH 旨在让 Agent 成为 Harness 的使用者与修改者。通过将 Harness 拆解为命名清晰、依赖明确的 Component,Agent 可定位问题并提出局部修改。插件化将高风险的整体重写转化为可测试、可回滚的局部实验。
Creator Mode 作为过渡形态,目前由开发者指导 Agent 创建插件,未来这些过程将转化为训练数据,使模型学会自主设计与改进 Harness。未来人类角色将转向定义安全边界与 Eval 标准,而 Agent 则在边界内自主优化 Harness 以适应任务需求。
05.
插件机制:DSH 的核心驱动力
在 DSH 中,插件是可独立安装、替换和撤销的 Harness 组件,粒度可从主题工具延伸至 Memory、Model Adapter 及 Agent Loop。DSH 插件定义了能力接入方式,既封装 MCP/Skill,也包含完整软件模块。
DSH 通过完全开源拥抱社区,内核维持接口与生命周期,外围由社区创新。截至 8 月 19 日,GitHub dsh-plugin Topic 聚合约 7,700 个仓库,awesome-dsh-plugin 收录约 1,500 个可用插件,获超 9,200 Stars。
当前插件主要集中于两类:一是补充产品体验(Web UI、监控等),二是接入外部 Agent 能力(长期记忆、Browser、Vision 等)。DSH 正成为外部 Agent Infra 接入用户 Runtime 的适配层。围绕插件的分发基础设施(如 dsh-market、dsh-find-plugin)也已初步形成。
DSH 插件生态不仅是应用商店,更是开放的 Harness 搜索空间。长期目标是让 Agent 自主读取、编写、测试并选择插件,通过改变 Harness 改善自身行为。
06.
离真正的 Self-Evolve Harness 还有多远
难点 1:保持系统自身的稳定性
Agent 修改自身配置时面临破坏运行环境的风险。Cordis 通过热重载机制,支持在不重启进程的情况下卸载旧组件、清理状态并加载新实现。插件注册的 Effect 在卸载时会被自动撤销,依赖关系被持续跟踪,避免失效引用。
这种机制将全局修改缩小为有边界的 Component Mutation,类似于数据库的事务性操作,使 Agent 能在不摧毁自身的前提下进行 Harness-level RSI 实验。但目前仍需更完整的状态管理以实现稳定的自我修改。
难点 2:持续可靠的 Eval
Harness 能生成修改不等于自我改进,系统需具备判断修改有效性的能力。DSH 的 Creator Mode 可产生 Harness Patch 与人工反馈数据,为构建 Eval Suite 提供材料。然而,创作轨迹本身并非可靠 Eval,系统仍需通过 Held-out Tasks、回归测试等手段验证改进的泛化能力。
真正的 Self-Evolving Harness 需要完整的 Learning Loop
目前 Cordis 主要解决"Harness 可控调整”问题,尚未完成问题诊断与效果自动化评估。下一步需建立完整的学习闭环,使系统能从实验中持续学习并保留有效修改。
07.
从 DSH 展望未来的 RSI
RSI(Recursive Self-Improvement)指 AI 不断提升自我改进能力。分为两类:Model-level RSI(模型开发迭代)与 Harness-level RSI(Agent 工作中持续变好)。DSH 聚焦于后者。
近期现实路径是先将外部 Harness 变为优化对象,从 Prompt 扩展至 Workflow 与 Harness Code。RSI 要求 Agent 从任务轨迹中发现失败模式,定位问题组件,提出新方案并通过独立 Eval 验证,最终形成“如何获得更好答案的方法”的优化闭环。
DSH 通过插件化与热重载提升 Harness 的可理解性,使 Agent 能查看系统结构并尝试调整。若未来 Agent 能进一步优化选择机制,提升诊断与设计 Eval 的能力,将迈向真正的 Harness-level RSI。

