大数跨境

Claude Code 要过时了么?

Claude Code 要过时了么? AI安全工坊
2026-08-24
6
导读:11 天 19 万星的 DeepSeek Harness,我在自己电脑上装了一遍、跑了真实任务,又扒完了社区实测和 500 插件生态。短期结论、长期变数、六条避坑、七类人对号入座,这一篇说清。

Claude Code 要过时了么?

8 月 13 日,DeepSeek 开源了自家的 agent harness,叫 deepseek-harness,命令行简称 dsh。12 小时破 5 万星,4 天 13.5 万,到我写这篇时(8 月 24 日)已经 190,400 星。GitHub 上开发者工具没见过这个涨法。

我一开始的反应不是兴奋,是烦。我每天在 Claude Code 里干活,订阅费真金白银交着,现在冒出来一个免费、开源、号称什么都能换的国产 harness——要不要迁?

说实话,我不知道。所以这周我自己装了一次、接上网关跑了真实任务,又把能找到的实测都翻了:HN 那条 734 分的主帖、掘金开源当天的上手记录、跑了三次任务的独立评测、15 章的中文手册、一个安全研究员的源码审计。写这篇就是把这些摊开给你看,急的话直接拉到结尾,有一张按人群分的建议表。

harness 是个什么东西

OpenAI 的播客里有句话我一直记着:围绕模型的整个支持系统——harness——对模型可用性的影响,几乎和智能本身同等重要。说白了,你买的是模型,但你每天摸到的是 harness。模型再聪明,harness 拉胯,你的体验就是拉胯。

这层以前是厂商焊死的。Claude Code 的模型、工具、执行循环全固定,你能动的只有 MCP 和 Skills 两个口子。大 V elvis 上周还在感叹「真希望 Claude Code 的 harness 是开源的」——结果没等 Anthropic 表态,DeepSeek 把自家那套直接开源了。

我自己装了一遍,先给你省 13 分钟

官方安装一条命令:

npx -y @deepseek-ai/dsh web 

看着和装 Claude Code 一样简单,对吧。实际上我 19:14 敲下回车,Web 界面 19:27 才在 3080 端口起来——首跑 13 分钟,中间 npm 一个核跑满、内存峰值 2.9GB,我一度以为它挂了。HN 上「下载 47MB,构建完 1.5GB」的抱怨没夸张。对照一下,Claude Code 装完到能用,一分钟不到。

装完翻了翻,有几个东西挺出乎意料。

跑 dsh --profile web --dump-config,它会把整个运行时的组装清单打出来——默认 web 配置由 142 个插件叠成,连会话标题生成、计时器都是独立插件。「一切皆插件」我本来当营销听的,看到这份清单才意识到是字面意思。这种透明度,用 Claude Code 时我从来没有过。

配置文件倒是极简,~/.dsh/settings.yaml 就 4 行:

agent-default-model:   provider: deepseek-official   model: deepseek-v4-pro   reasoningEffort: high 

reasoningEffort 分 low / high / max 三档,中文手册实测:简单任务手动降到 low 是最省时间的提速手段——但默认没人告诉你。还有个细节:版本号是 0.1.1-rc.2,官方明说后面会有破坏性变更。

我没有 DeepSeek 官方 key,手上只有外部网关的。好消息是它真不锁模型,settings 里加一行 baseURL 就能换网关;坏消息是直连报了句语焉不详的 TRANSPORT: request failed,没有更细的日志,兜兜转转在本地起了个转发脚本才通。通了之后用 headless 跑了个正经任务:写埃氏筛函数、配至少 3 个测试、运行测试确保通过。34 秒跑完,4 轮调用,两个文件落盘,测试它自己跑了、报 4 passed——我用 pytest 复跑了一遍,真过了。

这次实测有个发现,后面讲冷水时用得上。

dsh 在赌什么

它赌的是把可替换的边界从「工具层」砸到整个运行时:模型适配器、工具注册表、会话存储、沙箱、UI,连 agent 主循环本身都是可以拔掉换新的插件。工具调用这条链每一环都能插自己的逻辑:



dsh 工具调用流水线
dsh 工具调用流水线



想在审批环节接自家合规系统,写个插件挂上去就行;胆子大点的,整个 agent 循环都能换成自己的多智能体调度。会话日志是 append-only 的,能恢复、分叉、重放——HN 那 309 条评论里被夸最多的就是这个,闭源 harness 给不了。安全层面,研究员 magnus919 审了源码,没发现恶意代码或隐藏外传;这项目还是用它自己开发的,仓库里躺着 1386 条 Agent Notes 决策记录。

拿房子打比方:Claude Code 是精装房,拎包入住但墙不能砸;dsh 给你毛坯,连承重墙的改造权都在你手里。


Claude Code
Codex
dsh
可替换范围
工具层(MCP/Skills)
插件层
整个运行时,含主循环和 UI
模型
锁定 Claude
OpenAI 系为主
40+ 家可切换
执行日志
不可导出重放
部分
append-only,可恢复、分叉、重放
成熟度
生产级
生产级
v0.1.1-rc.2,预告破坏性变更
许可
闭源
部分开源
MIT 全开源

11 天长出来的生态

主仓星数说明不了太多,点 star 不要钱。我更关心有多少人真在上面盖房子。

社区聚合仓 awesome-deepseek-harness 已收录 500 多个插件,20 多个类别:多智能体编排、记忆知识库、IDE 客户端、安全治理……插件市场 dsh-plugin-hub 也有了。分发走双源:官方 hub 目录 + 社区打 dsh-plugin topic 标签,安装一条命令。

项目
星数(08-24)
定位
dsh-TUI
2417
终端党补位:Claude Code 风 TUI,npm 一键装
open-design
90908
把 coding agent 变成设计引擎,开源版 Claude Design
dsh-handbook
649
15 章中文手册:安装/插件开发/调优/踩坑
awesome-dsh
871
生态聚合入口
dsh-token-viewer / dsh-budget
计费监控:用量日志、预算上限
dsh-model-router
模型路由:故障切换、多供应商 fallback

计费监控、模型路由这类东西,只有拿它干正事的人才需要——11 天就冒出这一层,说明压真实工作负载的人不少了。当然别被 500 唬住:另一份横评实际装了 101 个插件,81 个还是源码形态得自己构建,3 个直接装不上。收录了不等于能用。

然后实测数据来泼冷水了

掘金那篇拿同一个 DeepSeek 模型在两边跑同一个任务:写带虚拟滚动的 React 表格组件。dsh 读结构、生成代码、写入文件——完事。Claude Code 做完这些还会自动跑 tsc 检查、自动修类型错、起 dev server 验证渲染。

这就是我前面说要修正的地方。我实测里 dsh 是跑了测试的——因为任务里写明了「运行测试确保通过」。所以准确说法不是它不会验证,是你让它验它才验,Claude Code 是你不让验它也验。差别就是你每次下任务都得记着多写一句,忘了,它就把没验过的代码交给你。

更难受的是那篇独立评测:让 dsh 建一个空间站追踪页面,三次运行全报告「完成」,实际一次地图畸形、一次声称修好的 bug 全没修、只有一次真能用——那次还花了 3.5 倍的钱。作者总结:一切都报告成功,但需要手动审核输出。

钱也是问题。Justin 那篇算过,当前版本 token 用量约是极简 harness Pi 的 10 倍。为什么这么烧,下面避坑清单里讲。

工具白送,钱在模型上收

dsh 开源前后,DeepSeek 上调了 V4-Pro 输出价(掘金给的数字是 27 元/百万 token,方向和 InfoQ 周报一致)。harness 白送,模型涨价,这打法眼熟吗——OpenAI 拿 Codex 圈工作流、从订阅收钱,一模一样。工具确实免费,只是账单挪到了模型那头。

梁文锋说得更直接:dsh 的头号目标「不是大家用得好用,而是我们自己用得好用」。所以它某些地方糙,可能不是没做完,是本来就不是先做给你的。

如果你要试:六条避坑

前五条是别人交的学费,第六条是我交的。

两行 YAML 保命。模型条目只写 id 会继承错误默认值,上下文窗口被砍四分之三——那个「3.5 倍成本」就是这么来的。修复:

compat:   thinkingFormat: deepseek maxTokens: 131072 

简单任务降档。reasoningEffort 切 low,手册实测性价比最高的提速开关。

缓存调对能救回大半账。会话缓存命中率实测可到 97%,配合 Flash 档 98% 缓存折扣,长会话省 65-96% token。前面说的「烧」是裸配置。

锁依赖版本。rc 阶段出过依赖直接断裂,固定版本线再干活。

Web 版默认关着 Skills。要用得写 patch 文件加 --patch 启动;3080 端口先查占用。

接外部网关,报错不给原因。失败只有一句 TRANSPORT: request failed。还有,任务提示词里记得写清「运行测试确保通过」——它是让验才验的。

那到底迁不迁:分七类人说

我的答案:日常主力不迁,留个窗口。按你的情况对号入座:

你是谁
建议
依据
日常写码求稳定出活
留在 Claude Code / Codex
默认自我纠错没有平替
终端党,眼馋想试
装 dsh-TUI 插件试水
不用碰 Web UI
要审计每步执行
试点 dsh
append-only 日志独一份
多智能体 / 自定义循环研究
直接上
别家给不了承重墙改造权
基建团队统一管 agent
小流量试点
流水线可插桩 + 监控层已起步
主要想省钱
看 Pi / CodeWhale 极简系
dsh 裸配置贵 10 倍
企业生产环境
再等等
rc + 预告破坏性变更

留窗口的意思是:3-6 个月后回来看两个信号——rc 转正式了没有、插件成品率上来没有。都是,就值得认真评估;不是,继续观望,损失为零。

短期 Claude Code 还是最优解,这和我装完的体感一致。但往一两年看我不敢下注:Claude Code 的护城河是工程打磨,不是架构;dsh 已经站在更开放的位置,142 个插件拼出运行时的透明度、11 天 500 插件的生态速度都是实打实的,愿意填坑的人也不缺。

资源速查

资源
地址
主仓 deepseek-harness
github.com/deepseek-ai/deepseek-harness
中文手册(15 章)
github.com/Electricitysheep/dsh-handbook
生态聚合 awesome-dsh
github.com/0xsline/awesome-deepseek-harness
终端插件 dsh-TUI
github.com/ccch1mneyyy/dsh-TUI
深度评测(架构向)
justin3go.com,标题含 Over-Engineering
独立实测(翻车向)
atlascloud.ai 博客,标题含 3 Runs Said Done

一年多前,没人觉得一个国产模型能把推理价格打下来。现在同一家公司在 harness 层复制这个剧本,工具糙归糙,剧本本身我不敢小看。

毛坯房住着不舒服。但看房的人这么多,装修队已经在路上了。

【声明】内容源于网络
0
0
AI安全工坊
专注 AI 安全技术研究与实践,分享前沿资讯、实战案例、工具资源,打造专业、开放的 AI 安全技术交流工坊。
内容 85
粉丝 0
AI安全工坊 专注 AI 安全技术研究与实践,分享前沿资讯、实战案例、工具资源,打造专业、开放的 AI 安全技术交流工坊。
总阅读5.5k
粉丝0
内容85