DeepSeek Harness 发布了。
梁文峰,梁圣,号召力就是大,项目 star 数两天破十万。Deepseek harness 插件商店一天插件数破两千。
https://dsh.wink.run
追星之外,这玩意到底有什么魔力,群里讨论了不少。
先说魔力不在插件本身,插件早不是新鲜事了。魔力在一切皆插件这件事本身,以及背后撑住它的一整套构建和保护模式。
DeepSeek 官方后来也回复确认了这套说法。DeepSeek Harness v0.1 开发者预览版推出,以 MIT 许可开源,由 Cordis 元框架驱动,核心理念是一切皆插件,模型、工具、技能、会话、沙箱、文件系统,都可以是插件。
以前 skill、MCP、agent loop 这些东西,哪些能动哪些不能动,是分层的。skill 最外层,随便换,记忆系统也是。MCP 往里一层,协议层面能扩展,但调用它的那套循环逻辑还是宿主定死的。到 agent loop 这一层,就是硬边界了,主循环焊死,能动的只有外面塞进去的东西。这就是给自行车加电机,动力换了,车架没换。
dsh 把这层分层拍平了。
skill、MCP、loop、调度,现在是同一个抽象层级,全都是插件,全都能动。四种运行模式,同一个内核,插件组合不同而已。agent 怎么调用工具、怎么重试、怎么调度子任务,这套此前焊死在宿主进程里的东西,现在跟一个普通工具插件一样,能被装载,能被卸载,能被换成另一种形状。skill 不是过时了,是 skill 层面的进化不再是天花板,以前挡在循环那道墙没了,战场挪到了换笼子本身。
但这套结构有个特点,得说清楚。
过去笔者也尝试在TokenBank,Pings里构建自迭代的应用,模式是内部外部各套一层 agent,内部改组件,外部动应用,相当于在外面搭一层固定脚手架,核心是外挂看护,不是系统自己从内部长出来的进化。这条路径的问题是,看护者自己的能力,决定了能撑多高,看护者见顶,系统也就跟着见顶。

造楼机不是这个逻辑。它自己就是承重结构的一部分,用刚浇筑好的楼层当下一层的支撑面,楼往上长,脚手架跟着往上长,没有一个外部固定的高度天花板。dsh 能做到这一点,靠的正是 Cordis 那套自嵌套的组件模型,父子关系一旦建立,子组件的生命周期就跟着父组件一起走,不需要另外配一个独立在外面的看护者。这有点像那种顶升式造楼机,自己在自己身上搭脚手架。
不是取舍,是进化,两种方案说到底都是奔着自进化去的,只是路径不同。外挂看护这条路径一定程度解决了应用框架本身没法进化的问题,但难以突破,能看护到多高,取决于外层这个看护者自己能力的上限。造楼机走的是内生进化,自己就是承重结构的一部分,不需要另请一个外部看护者,不受制于应用框架本身设的那道天花板,想怎么长就怎么长,,灵活度完全是另一个量级。
这个思路一旦成立,会带来一个明显的趋势。harness 这层会开始出现和操作系统类似的分工。今天大家比的是谁的 agent 好用,接下来比的可能是谁的内核能让别人放心地把自己的循环、调度、评分机制插上去跑。谁先把这套底座立住,谁就有机会变成后面一批 agent 产品共用的地基,而不是又一个孤立的应用。dsh 抢的不是某个具体场景的份额,抢的是这层地基的定义权。
这里也值得说说梁文峰为什么下这步棋。DeepSeek 手里已经有 V4 这条足够能打的模型线,这时候食言下场做 Harness,如果只是奔着再造一个 Claude Code 去的,性价比其实很低,这条赛道已经挤满了人,同质化竞争没有意义。更合理的解释是,他判断 AGI 这条路走下去,agent 迟早要能安全地改造自己的运行方式,不能一直在固定循环里堆外挂。想做到这一点,前提是先有一套能把循环本身当组件来装卸的底座,而且这套底座还得扛得住不断往上盖而不塌。这不是又做了一个客户端,是在给自己判断的 AGI 方向提前铺轨。这步棋押的是方向,不是份额,和其他各种商业产品不再一个层面。
说句题外话,他不做这事,还真找不出第二个。梁圣除了高的开源号召力,更是一个商业天才,这次模型API夸张涨价,可能就是在为DeepSeek Harness铺路,凭借超高的cache命中率把开发者和用户向dsh上推。

这套底座说到底,要回答的是两个问题:敢不敢改、改坏了怎么办,以及朝什么方向改、改的到底对不对。RSI 真正要交的答卷,是这两个问题一起解决,少一个都不算数。
先说第一个问题。随着插件越垒越多,风险也就越来越大,这套底座真正防的,是一次改坏了直接把自己改死,副作用留一地、依赖链断掉、连恢复机制自己都被搭进去,最后只能整个进程重启这种连锁事故。从这个角度看,dsh已经不是一个应用框架,而是一个进化的Agent OS(或者是世界编辑器),就如下图,插件越来越多,互相产生关联,如何安全卸载演进就是个大问题。
Cordis 那篇论文里专门拿这个风险开刀,证明了它们方法的可行性(DeepSeek Harness 框架开源,一切皆插件,还附了一篇硬核论文),agent 自我改进最怕的不是改不动,是改到一半把自己运行的地基搞崩。往这个角度看,RSI 卡的瓶颈从模型能不能写出更好的代码,挪到了 agent 敢不敢安全地动自己脚下这层底座,dsh 考虑到了这一层,是梁圣在这份答卷上填掉的前半张。
但第二个问题,这层底座回答不了。架构解决的是敢不敢改、改错了能不能撤回来,没解决往哪改。模型和 harness 现在能互相成就,是因为撤销成本低了,模型可以放心做更大胆的结构性尝试,但胆子大不等于方向对。真正要走通自进化(RSI),还得有一套评估和反馈机制卡在中间,替每一次自我修改打分,把好方向留下,把坏方向及时掐掉。这套评估机制怎么建,谁来当裁判,评估者和被评估者会不会共享同一套认知盲区从而自我强化出错误方向,目前谁都没有很好的答案,反而是接下来最值得盯的一块拼图。这块蛋糕早被ilya看中,据说很快要祭出大招,我们拭目以待。

草履虫的构造还是草履虫的构造,这次真正变的,是它第一次能够以负担得起的代价,去改造自己移动的方式本身,而不只是往身上挂更多的外挂。
但光有 harness 不够,就算草履虫真能进化出一副人的身形,脑子没跟着进化,照样是白搭。
这条路能不能真的走到人,答案不在架构这一层,得看两件事跟不跟得上:模型自己的脑容量,和评估反馈这套东西能不能立起来。
关注公众号回复“进群”入群讨论

