Claude Code 要过时了么?
8 月 13 日,DeepSeek 开源了自家的 agent harness,叫 deepseek-harness,命令行简称 dsh。12 小时破 5 万星,4 天 13.5 万,到我写这篇时(8 月 24 日)已经 190,400 星。GitHub 上开发者工具没见过这个涨法。
我一开始的反应不是兴奋,是烦。我每天在 Claude Code 里干活,订阅费真金白银交着,现在冒出来一个免费、开源、号称什么都能换的国产 harness——要不要迁?
说实话,我不知道。所以这周我自己装了一次、接上网关跑了真实任务,又把能找到的实测都翻了:HN 那条 734 分的主帖、掘金开源当天的上手记录、跑了三次任务的独立评测、15 章的中文手册、一个安全研究员的源码审计。写这篇就是把这些摊开给你看,急的话直接拉到结尾,有一张按人群分的建议表。
harness 是个什么东西
OpenAI 的播客里有句话我一直记着:围绕模型的整个支持系统——harness——对模型可用性的影响,几乎和智能本身同等重要。说白了,你买的是模型,但你每天摸到的是 harness。模型再聪明,harness 拉胯,你的体验就是拉胯。
这层以前是厂商焊死的。Claude Code 的模型、工具、执行循环全固定,你能动的只有 MCP 和 Skills 两个口子。大 V elvis 上周还在感叹「真希望 Claude Code 的 harness 是开源的」——结果没等 Anthropic 表态,DeepSeek 把自家那套直接开源了。
我自己装了一遍,先给你省 13 分钟
官方安装一条命令:
npx -y @deepseek-ai/dsh web
看着和装 Claude Code 一样简单,对吧。实际上我 19:14 敲下回车,Web 界面 19:27 才在 3080 端口起来——首跑 13 分钟,中间 npm 一个核跑满、内存峰值 2.9GB,我一度以为它挂了。HN 上「下载 47MB,构建完 1.5GB」的抱怨没夸张。对照一下,Claude Code 装完到能用,一分钟不到。
装完翻了翻,有几个东西挺出乎意料。
跑 dsh --profile web --dump-config,它会把整个运行时的组装清单打出来——默认 web 配置由 142 个插件叠成,连会话标题生成、计时器都是独立插件。「一切皆插件」我本来当营销听的,看到这份清单才意识到是字面意思。这种透明度,用 Claude Code 时我从来没有过。
配置文件倒是极简,~/.dsh/settings.yaml 就 4 行:
agent-default-model: provider: deepseek-official model: deepseek-v4-pro reasoningEffort: high
reasoningEffort 分 low / high / max 三档,中文手册实测:简单任务手动降到 low 是最省时间的提速手段——但默认没人告诉你。还有个细节:版本号是 0.1.1-rc.2,官方明说后面会有破坏性变更。
我没有 DeepSeek 官方 key,手上只有外部网关的。好消息是它真不锁模型,settings 里加一行 baseURL 就能换网关;坏消息是直连报了句语焉不详的 TRANSPORT: request failed,没有更细的日志,兜兜转转在本地起了个转发脚本才通。通了之后用 headless 跑了个正经任务:写埃氏筛函数、配至少 3 个测试、运行测试确保通过。34 秒跑完,4 轮调用,两个文件落盘,测试它自己跑了、报 4 passed——我用 pytest 复跑了一遍,真过了。
这次实测有个发现,后面讲冷水时用得上。
dsh 在赌什么
它赌的是把可替换的边界从「工具层」砸到整个运行时:模型适配器、工具注册表、会话存储、沙箱、UI,连 agent 主循环本身都是可以拔掉换新的插件。工具调用这条链每一环都能插自己的逻辑:
想在审批环节接自家合规系统,写个插件挂上去就行;胆子大点的,整个 agent 循环都能换成自己的多智能体调度。会话日志是 append-only 的,能恢复、分叉、重放——HN 那 309 条评论里被夸最多的就是这个,闭源 harness 给不了。安全层面,研究员 magnus919 审了源码,没发现恶意代码或隐藏外传;这项目还是用它自己开发的,仓库里躺着 1386 条 Agent Notes 决策记录。
拿房子打比方:Claude Code 是精装房,拎包入住但墙不能砸;dsh 给你毛坯,连承重墙的改造权都在你手里。
|
|
|
|
|
|---|---|---|---|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
11 天长出来的生态
主仓星数说明不了太多,点 star 不要钱。我更关心有多少人真在上面盖房子。
社区聚合仓 awesome-deepseek-harness 已收录 500 多个插件,20 多个类别:多智能体编排、记忆知识库、IDE 客户端、安全治理……插件市场 dsh-plugin-hub 也有了。分发走双源:官方 hub 目录 + 社区打 dsh-plugin topic 标签,安装一条命令。
|
|
|
|
|---|---|---|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
计费监控、模型路由这类东西,只有拿它干正事的人才需要——11 天就冒出这一层,说明压真实工作负载的人不少了。当然别被 500 唬住:另一份横评实际装了 101 个插件,81 个还是源码形态得自己构建,3 个直接装不上。收录了不等于能用。
然后实测数据来泼冷水了
掘金那篇拿同一个 DeepSeek 模型在两边跑同一个任务:写带虚拟滚动的 React 表格组件。dsh 读结构、生成代码、写入文件——完事。Claude Code 做完这些还会自动跑 tsc 检查、自动修类型错、起 dev server 验证渲染。
这就是我前面说要修正的地方。我实测里 dsh 是跑了测试的——因为任务里写明了「运行测试确保通过」。所以准确说法不是它不会验证,是你让它验它才验,Claude Code 是你不让验它也验。差别就是你每次下任务都得记着多写一句,忘了,它就把没验过的代码交给你。
更难受的是那篇独立评测:让 dsh 建一个空间站追踪页面,三次运行全报告「完成」,实际一次地图畸形、一次声称修好的 bug 全没修、只有一次真能用——那次还花了 3.5 倍的钱。作者总结:一切都报告成功,但需要手动审核输出。
钱也是问题。Justin 那篇算过,当前版本 token 用量约是极简 harness Pi 的 10 倍。为什么这么烧,下面避坑清单里讲。
工具白送,钱在模型上收
dsh 开源前后,DeepSeek 上调了 V4-Pro 输出价(掘金给的数字是 27 元/百万 token,方向和 InfoQ 周报一致)。harness 白送,模型涨价,这打法眼熟吗——OpenAI 拿 Codex 圈工作流、从订阅收钱,一模一样。工具确实免费,只是账单挪到了模型那头。
梁文锋说得更直接:dsh 的头号目标「不是大家用得好用,而是我们自己用得好用」。所以它某些地方糙,可能不是没做完,是本来就不是先做给你的。
如果你要试:六条避坑
前五条是别人交的学费,第六条是我交的。
两行 YAML 保命。模型条目只写 id 会继承错误默认值,上下文窗口被砍四分之三——那个「3.5 倍成本」就是这么来的。修复:
compat: thinkingFormat: deepseek maxTokens: 131072
简单任务降档。reasoningEffort 切 low,手册实测性价比最高的提速开关。
缓存调对能救回大半账。会话缓存命中率实测可到 97%,配合 Flash 档 98% 缓存折扣,长会话省 65-96% token。前面说的「烧」是裸配置。
锁依赖版本。rc 阶段出过依赖直接断裂,固定版本线再干活。
Web 版默认关着 Skills。要用得写 patch 文件加 --patch 启动;3080 端口先查占用。
接外部网关,报错不给原因。失败只有一句 TRANSPORT: request failed。还有,任务提示词里记得写清「运行测试确保通过」——它是让验才验的。
那到底迁不迁:分七类人说
我的答案:日常主力不迁,留个窗口。按你的情况对号入座:
|
|
|
|
|---|---|---|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
留窗口的意思是:3-6 个月后回来看两个信号——rc 转正式了没有、插件成品率上来没有。都是,就值得认真评估;不是,继续观望,损失为零。
短期 Claude Code 还是最优解,这和我装完的体感一致。但往一两年看我不敢下注:Claude Code 的护城河是工程打磨,不是架构;dsh 已经站在更开放的位置,142 个插件拼出运行时的透明度、11 天 500 插件的生态速度都是实打实的,愿意填坑的人也不缺。
资源速查
|
|
|
|---|---|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
一年多前,没人觉得一个国产模型能把推理价格打下来。现在同一家公司在 harness 层复制这个剧本,工具糙归糙,剧本本身我不敢小看。
毛坯房住着不舒服。但看房的人这么多,装修队已经在路上了。

