这是我的第499篇Ai笔记,本篇2446、累计笔记8489135
彩蛋:文末给大家准备了《DeepSeek Harness桌面端实战手册》,从安装、配置到真实场景使用,一套跑通。
刚刚,DeepSeek Harness 又冒出了一个挺有意思的新东西:官方仓库里出现了桌面端的开发者预览版本。
先别急着满世界找安装包。目前这东西还比较早,没有正式打包,需要从源码编译。打开之后,左边工作区、右边对话框,再加上设置页面,整体体验基本延续了原来的 Web UI。
单看这里,其实没什么特别炸裂的。
真正让我觉得有意思的,是另外一件事。
DeepSeek 最近发布 V4.1 Flash 时,专门把同一个模型放进不同 Agent Harness 里跑了一轮。
结果在 DeepSWE v1.1 上,成绩从 65.5一路跑到74.2。
模型没换。
只换了“底盘”,前后差了 8.7分。
这事可比多一个桌面客户端重要多了。
以前大家聊大模型,注意力基本都在模型本身:参数、跑分、上下文、推理能力。
但到了 Agent 时代,情况正在发生变化。
如果把模型比作发动机,那么 Harness 更像是一整套底盘和控制系统:系统提示词怎么组织、上下文什么时候塞进去、给模型什么工具、失败之后怎么重试、文件怎么修改、任务怎么继续执行……
这些东西都会直接影响最后能不能把活干成。
所以 DeepSeek 这次真正值得关注的,不只是把 Harness 搬进桌面。
它正在把一套开发者基础设施,慢慢往真正的 Agent 工作台推进。
以后判断一个 Agent 强不强,可能真不能只问:
“你用的什么模型?”
还得继续问一句:
“你给它配的什么 Harness?”
01|桌面化:Agent开始有点“工作台”的样子了
目前 DeepSeek Harness 本身已经有 Web UI,但对普通用户来说,终端启动、本地端口、浏览器标签页,这套体验多少还是有点开发者味儿。
桌面端做的第一件事情其实很简单:
把工具变成应用。
点开以后就是工作区,可以直接围绕项目和 Agent 持续干活。虽然现阶段 UI 和 Web 端差别不大,但产品形态已经开始往 Claude Code、Codex 这类长期工作台靠了。
02|“轨迹”页面,比这个桌面壳更值得看
桌面端里有一个我很喜欢的设计:对话 / 轨迹切换。
系统提示词、上下文注入、工具调用、工具结果,都可以展开查看;它为什么改这个文件、失败后又重试了什么,也都有记录。
这个功能对 Agent 很重要。
聊天机器人说错一句话,大不了重新问;Agent 一次可能改几十个文件、连续调用十几个工具,真翻车的时候,你最需要知道的是:
它到底从哪一步开始跑偏的。
这套轨迹,本质上就是 Agent 的“行车记录仪”。
03|同一个模型差8.7分,Harness的重要性终于摆上台面
这次最值得聊的,还是 V4.1 Flash 的多 Harness 对比。
DeepSeek 把同一个模型放进 Claude Code、Codex、OpenCode、Pi、mini-SWE 以及自己的 Harness 中测试。
在 DeepSWE v1.1 上:
mini-SWE:74.2
DeepSeek Harness Minimal:72.6
Claude Code:69.8
Pi:66.2
Codex:65.6
OpenCode:65.5
而到了 Terminal-Bench 2.1,DeepSeek Harness Minimal 又拿到了 90.6。
所以这张表真正证明的,不是谁“天下第一”。
而是:
Agent最后的能力,是模型和Harness共同作用的结果。
同一个模型,工具怎么给、上下文怎么组织、Agent Loop 怎么跑,都可能把最终效果拉开一大截。
这才是 DeepSeek Harness 真正值得研究的地方。
04|一切皆插件,这东西明显不只想做Coding Agent
DeepSeek Harness 还有一个很有意思的设计:
Everything is a Plugin,一切皆插件。
模型、工具、技能、会话、沙箱、存储、调度,甚至 UI,都可以通过插件组合,底层由 Cordis 管理插件加载和依赖。
这意味着今天它可以是 Coding Agent,换掉工具和 Skill,理论上就可以继续往研究、数据分析、企业内部工作台上扩。
对于普通用户来说,这套东西现在可能还有点远。
但对于喜欢自己折腾 Agent 的开发者,这种架构就很香了。
夸完了,该泼的冷水还是得泼。
第一,现在还不是普通用户闭眼安装的时候。
目前依然是开发者预览版,桌面端也没有成熟的一键安装包,需要源码编译。
想尝鲜没问题,真拿来当主力工具,建议再等等。
第二,桌面端现在还不够“桌面”。
目前最大的变化还是运行载体,核心体验和 Web UI 很接近。
真正值得等的是后续文件拖拽、后台任务、本地应用联动这些系统能力。
第三,别急着把Harness跑分封神。
8.7分差距很亮眼,但换一个任务、换一套工具,排名完全可能变化。
所以跑分只能说明:Harness很重要,不能说明某一个Harness永远最好。
最后,老规矩,用三句话总结一下:
1. DeepSeek Harness桌面端最大的变化,不是多了一个窗口,而是DeepSeek开始把Agent基础设施往真正的长期工作台推进。
2. V4.1 Flash在不同Harness下最高能拉开8.7分,已经证明Agent时代不能只看模型,模型周围那套运行系统同样重要。
3. 开发者现在值得狠狠干一轮,普通用户不用急着折腾源码;等安装、插件和权限体系再成熟一点,这东西才可能真正走向大众。
DeepSeek Harness 现在更新很快,第一次接触的人最容易卡在三个地方:怎么装、装完怎么配置,以及到底什么场景值得用它。
所以这次我重新整理了一份 《DeepSeek Harness桌面端实战手册》。
从源码安装、基础配置,到模型接入、轨迹查看、插件使用,再到 Coding、项目修改和 Agent 工作流的实际场景,我都按照“装完就能用”的思路重新整理了一遍。
不研究概念,直接照着跑。
扫码回复关键词【HARN】,自动获取。

