大数跨境

别只拿 DeepSeek Harness 当 Claude Code 替代品!DeepSeek 这次开源的是 Agent 组装图纸

别只拿 DeepSeek Harness 当 Claude Code 替代品!DeepSeek 这次开源的是 Agent 组装图纸 AI大模型智能体前沿
2026-08-18
3
导读:一切皆插件,连 Agent 自己的循环都能换,这意味着什么

导读8 月 13 日,DeepSeek 在 V4 Pro 发布次日开源 Agent 框架 Harness(MIT、开发者预览版),当天冲上 Hacker News 第一。多数评测在比它能不能替代 Claude Code 或 Codex,这问偏了——Harness 想交的不是更好用的编程助手,而是一张组装 Agent 的图纸。本文讲清三件事:Cordis 内核怎么让组件"装得上也拆得干净",创造模式凭什么让 Agent 在运行时改装自己,以及模型公司为什么要抢模型之外这一层。

多数人在比成品,DeepSeek 在交图纸

先把事情说清楚。2026 年 8 月 12 日深夜 DeepSeek 上线 V4 Pro,十几个小时后的 13 日,Harness 开发者预览版推上 GitHub,MIT 协议。它不是新模型,也不是 API 客户端,而是一套构建、运行和扩展智能体的 SDK 与应用框架:读文件、跑命令、改代码、查网页、派子任务,默认连 DeepSeek 模型,也能自己换。仓库在 https://github.com/deepseek-ai/deepseek-harness 。

然后网上就吵开了。有人拿它写丧尸射击游戏,有人对比 Codex 审美更好,但这些评测问的是同一个问题:它好不好用,能不能换掉我现在的编程助手?

这个问题只看到了默认应用。Harness 仓库有 230 多个 workspace 成员,文件系统、终端、子进程、语言服务器、网页、子智能体、工作流、会话持久化、凭据,每一项都是独立的包。这不是一个产品的体量,是一块地基的体量。普通 Agent 像一台装好的电脑,Harness 更像一块洞洞板,什么都能插上去、拔下来。买装好的电脑你用的是它给的配置;拿到洞洞板,你拿到的是"怎么拼"的方法。

⬆️AI生成

Cordis:一个会自己收拾残局的内核

"一切皆插件"现在每个框架都在喊。Harness 喊得有点过头——连驱动 Agent 运转的主循环本身,都是插件。模型接入、工具注册表、会话日志、审批策略,全是。

靠一个叫 Cordis 的微内核。它不是 Harness 新写的,来自 Koishi 生态——一个跨 QQ、DiscordTelegram 的聊天机器人框架,社区攒了 4000 多个插件,天生就是"几十个插件热插拔、随时改配置"的场景,只是那时候没有大模型。Harness 把整个 Cordis 源码 vendor 进仓库、改 scope 为 @deepseek-ai/cordis,公司写的每个包都设成对它的依赖。不是"用了个库",是整栋楼盖在这块地基上。

Cordis 解决一个词:拆得干净

插件装上容易卸掉难。注册的监听、起的定时器、开的连接,卸载时漏撤销一个就成了孤儿,跑几天系统变垃圾堆。VSCode 是活教材——论文统计安装量前 100 的扩展,87 个含可执行代码,卸载都得重启整个 extension host。Cordis 让每个副作用在发生那一刻就带上自己的逆操作:注册监听时同时交回"注销它"的函数,运行时把逆函数按后进先出摞起来,卸载时整摞执行,上下文回到加载之前。写过 C++/Rust 的人会眼熟——RAII、Drop trait 都是这思路;React 的 useEffect 也返回 cleanup。差别在组合:React 的 hook 只能写在组件顶层,塞不进条件、循环、异步;Cordis 没这些限制,操作能自由组合、能异步,而复合操作的逆自动从子操作派生,拆卸逻辑不用另写一遍。

这有论文背书。DeepSeek 同步发了 80 页论文《A Programming Paradigm for Spatiotemporal Composability》(时空可组合性的一种编程范式),作者是北大的 Yifan Shi(同时属 DeepSeek)、张伟和 DeepSeek 的崔添翼。论文给了动态组合演算和五个定理,最重的叫汇流性:不管系统经历了怎样一串加载卸载,最终静止状态等同于把最终那批组件一次性按依赖顺序装好。推理一个跑了几天、热插拔无数次的系统,可以当它静态装配的来推,不用回放整部历史。

这就给"一切皆插件"兜了底:插件不是不能乱,是乱完能回到一个确定状态。

让 Agent 在高速上给自己换发动机

插件能装能拆,听着是工程便利。Harness 把它推到了让人后背发凉的地方——让 Agent 在运行时改装自己

Web UI 有四种模式。标准模式功能最全;PTC 让模型写一段 TypeScript 编排多步工具调用,减少往返、省 token;极简模式只留一个持久终端和一个文件编辑器,系统提示词只有一句话,V4 Pro 官方公布的 Agent 基准——DeepSWE 62.7、Terminal Bench 2.1 的 87.9——就是在这个模式下跑的。

图片来源:DeepSeek Harness

第四档创造模式是另一回事。选了它,Agent 能检查当前运行时的插件树,临时写个监听器、注册个新工具、挂个新服务,做完再卸掉。相当于车在高速上一边跑一边给自己换发动机。项目没敢默认打开,信任等级标成和 shell 访问同级;临时插件只活在进程内存里,不写文件、不装包、不改配置,重启即消失。

难就难在收拾残局。Agent 自己写的插件要是留个没关的连接、没注销的监听,自我修改几次后系统就成乱麻,甚至可能把"恢复用的那个进程"搞坏。Cordis 的可逆副作用在这里才显出分量——临时插件走和正式插件一模一样的生命周期,注册项有确定回收路径,跑完能干净撤下来。

话不能说满。论文作者自己承认,语言级访问控制在恶意组件面前不成立,真正的沙箱得靠语言之外的执行边界;创造模式默认关着。它更像一个研究方向的产品形态:智能体不只是使用能力,还能在受控边界内重新组合自己的运行时。 离"安全无忧"还远。

模型之外的那一半

模型公司为什么花这么大力气做模型之外的东西?因为模型和它的运行环境根本不是分开的。

一个反直觉的事实:同一个模型,换个 harness,产物会不一样。腾讯技术工程做过对照,固定 Kimi K3、同一套 prompt 和工作区,DSH 和 Kimi Code 同一批题都 15/15 通过,走法却不同——Kimi Code 5 次工具调用搞定,DSH 走了 9 到 11 步;用同一个 V4 Pro 做跳一跳游戏,两边做成两种产品。harness 不是透明管道,它在参与塑造模型怎么思考、怎么调工具。

三家路线也不同。OpenAI 给 Codex 准备了专门的 GPT-5-Codex,官方说是"a version of GPT-5 optimized for agentic coding tasks in Codex",用真实编码任务做过强化学习训练;Anthropic 不另出模型,Claude Code 用标准 Sonnet/Opus,靠系统提示和工具协议驱动,把 agent 能力做进通用模型。DeepSeek 目前能确认的是协同——基准在 Harness 上跑、同天发布、官方公式写着 Model + Harness = Agent,但有没有类似的专门后训练,公开材料没明说,我不替它下结论。

那其他模型能用吗?能用。DSH 挂着两个适配器:dsh-llm-deepseek 直连自家模型,默认 V4 Flash;dsh-llm-pi-ai 包第三方库做多厂商协议转换,官方约 40 家可选模型大多走这条道。有人拿 GLM-5.3 接 DSH 跟 GPT-5.6-Sol 对标做生产级抠图应用,核心功能打平,GLM 在登录限流、安全响应头上还更全。但"能跑通"和"被充分验证"是两回事——原配的系统提示、工具 schema、错误映射、流式中断恢复都一起调过,换模型这些边角行为得自己验。DeepSeek 是一等公民,其他模型架构上平等、工程上需自证。

这就是 Harness 想占的位置。模型决定智能上限,而模型看见什么、能碰什么、做过的事能不能被完整回放审计,是 harness 决定的。它把"模型看见的一切必须能从日志重建"做成硬规矩,工具调用、流式输出、权限切换、取消原因全进追加式 Session Log,界面和持久化从同一个事件源派生;一个任务跑了几步、读了什么、改了什么、花了多少 token,都能在 Trajectory 视图里按时间线回放出来。

安全上默认 workspace-write、失败关闭,被守卫拒绝的操作不能被后续插件偷偷放行。对企业,这些往往比聊天窗口多几个按钮更要命。

图片来源:DeepSeek Harness

它在和谁抢位置

这一层早有人了:OpenAI Agents SDK、Anthropic 的 Claude Agent SDK、侧重持久化执行和人机协同的 LangGraph。Harness 的差异是把这些能力进一步拆成可配置组合的插件——同一份代码,加适配器加 Bash 加 TUI 就是终端助手,换 Web 插件就是浏览器应用,换 Headless 入口就成跑完即退的 CI 任务。谁掌握这一层,谁就更接近真实任务入口。

能不能成是另一回事。它还是开发者预览版,破坏性变更会很频繁;插件生态的老问题——版本兼容、供应链安全、社区插件半年后失修——一个都不会少,Hacker News 上已有人拿"头六个月都很好,之后是噩梦"质疑。带队的是崔添翼,浙大毕业,在 Jane Street 做过,2026 年 3 月加入 DeepSeek,5 月公司内部立了 Harness 专项团队由他负责,设在北京,仓库里他的提交排第一。一个前量化交易员来做 Agent 底盘,气质居然很通——量化系统对"组件出问题不能拖垮全局、状态要可回放"的执念,和 Session Log、失败关闭是一回事。

最后提醒一句:Harness 代码 MIT 免费,但跑 Agent 要配 API Key,模型调用照样花钱。框架开源不等于服务免费。

它今天能不能替代你手头的编程助手?多半还不能,默认体验离 Claude Code、Codex 有距离。但这事本就不该用"能不能替代"衡量。模型把智能拉到同一水平线之后,决定谁能进生产环境的,是模型外面那一半。DeepSeek 把答案整个摊开了,MIT,随便拿。

答案对不对,得有人真在上面跑一年才知道。我先装上了。你慢慢来。

参考资料

  • DeepSeek Harness GitHub 仓库(MIT): https://github.com/deepseek-ai/deepseek-harness
  • Cordis 论文《A Programming Paradigm for Spatiotemporal Composability》: https://github.com/cordiverse/paper
  • Cordis 微内核仓库: https://github.com/cordiverse/cordis
  • DeepSeek-V4-Pro 模型(Hugging Face,权重 MIT): https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro
  • GPT-5-Codex 模型文档: https://developers.openai.com/api/docs/models/gpt-5-codex
  • Claude Code 模型配置说明: https://support.claude.com/en/articles/11940350-claude-code-model-configuration
  • DeepSeek Harness 团队成立报道(科创板日报/新浪财经): https://finance.sina.com.cn/tob/2026-08-12/doc-inimzqcs5391945.shtml

— THE END —

文章仅做学术分享,如有侵权请联系删除,非常感谢!

【声明】内容源于网络
0
0
AI大模型智能体前沿
分享AI大模型智能体前沿知识,探寻多元应用,洞察未来趋势,带你一路 “卷” 赢行业!🔥
内容 1112
粉丝 0
AI大模型智能体前沿 分享AI大模型智能体前沿知识,探寻多元应用,洞察未来趋势,带你一路 “卷” 赢行业!🔥
总阅读17.2k
粉丝0
内容1.1k