大数跨境

DeepSeek官方仓库冒出Harness桌面端!同一个模型换套“底盘”差8.7分,这事比客户端本身更重要(附实战手册)

DeepSeek官方仓库冒出Harness桌面端!同一个模型换套“底盘”差8.7分,这事比客户端本身更重要(附实战手册) 我的Ai笔记
2026-09-14
5
导读:DeepSeek Harness桌面端来了,同一模型换套Harness,效果竟能差8.7分。
点击蓝字,关注我们


banner

这是我的第499篇Ai笔记,本篇2446、累计笔记8489135

彩蛋:文末给大家准备了《DeepSeek Harness桌面端实战手册》,从安装、配置到真实场景使用,一套跑通。

icon
引言.

刚刚,DeepSeek Harness 又冒出了一个挺有意思的新东西:官方仓库里出现了桌面端的开发者预览版本。

先别急着满世界找安装包。目前这东西还比较早,没有正式打包,需要从源码编译。打开之后,左边工作区、右边对话框,再加上设置页面,整体体验基本延续了原来的 Web UI。

单看这里,其实没什么特别炸裂的。

插图

真正让我觉得有意思的,是另外一件事。

DeepSeek 最近发布 V4.1 Flash 时,专门把同一个模型放进不同 Agent Harness 里跑了一轮。

结果在 DeepSWE v1.1 上,成绩从 65.5一路跑到74.2。

模型没换。

只换了“底盘”,前后差了 8.7分。

这事可比多一个桌面客户端重要多了。

icon
思考.

以前大家聊大模型,注意力基本都在模型本身:参数、跑分、上下文、推理能力。

但到了 Agent 时代,情况正在发生变化。

如果把模型比作发动机,那么 Harness 更像是一整套底盘和控制系统:系统提示词怎么组织、上下文什么时候塞进去、给模型什么工具、失败之后怎么重试、文件怎么修改、任务怎么继续执行……

插图

这些东西都会直接影响最后能不能把活干成。

所以 DeepSeek 这次真正值得关注的,不只是把 Harness 搬进桌面。

它正在把一套开发者基础设施,慢慢往真正的 Agent 工作台推进。

以后判断一个 Agent 强不强,可能真不能只问:

“你用的什么模型?”

还得继续问一句:

“你给它配的什么 Harness?”

icon
AI+.

01|桌面化:Agent开始有点“工作台”的样子了

目前 DeepSeek Harness 本身已经有 Web UI,但对普通用户来说,终端启动、本地端口、浏览器标签页,这套体验多少还是有点开发者味儿。

插图

桌面端做的第一件事情其实很简单:

把工具变成应用。

点开以后就是工作区,可以直接围绕项目和 Agent 持续干活。虽然现阶段 UI 和 Web 端差别不大,但产品形态已经开始往 Claude Code、Codex 这类长期工作台靠了。

02|“轨迹”页面,比这个桌面壳更值得看

桌面端里有一个我很喜欢的设计:对话 / 轨迹切换。

系统提示词、上下文注入、工具调用、工具结果,都可以展开查看;它为什么改这个文件、失败后又重试了什么,也都有记录。

插图

这个功能对 Agent 很重要。

聊天机器人说错一句话,大不了重新问;Agent 一次可能改几十个文件、连续调用十几个工具,真翻车的时候,你最需要知道的是:

它到底从哪一步开始跑偏的。

这套轨迹,本质上就是 Agent 的“行车记录仪”。

03|同一个模型差8.7分,Harness的重要性终于摆上台面

这次最值得聊的,还是 V4.1 Flash 的多 Harness 对比。

DeepSeek 把同一个模型放进 Claude Code、Codex、OpenCode、Pi、mini-SWE 以及自己的 Harness 中测试。

插图

在 DeepSWE v1.1 上:

mini-SWE:74.2

DeepSeek Harness Minimal:72.6

Claude Code:69.8

Pi:66.2

Codex:65.6

OpenCode:65.5

而到了 Terminal-Bench 2.1,DeepSeek Harness Minimal 又拿到了 90.6。

所以这张表真正证明的,不是谁“天下第一”。

而是:

Agent最后的能力,是模型和Harness共同作用的结果。

同一个模型,工具怎么给、上下文怎么组织、Agent Loop 怎么跑,都可能把最终效果拉开一大截。

这才是 DeepSeek Harness 真正值得研究的地方。

04|一切皆插件,这东西明显不只想做Coding Agent

DeepSeek Harness 还有一个很有意思的设计:

Everything is a Plugin,一切皆插件。

插图

模型、工具、技能、会话、沙箱、存储、调度,甚至 UI,都可以通过插件组合,底层由 Cordis 管理插件加载和依赖。

这意味着今天它可以是 Coding Agent,换掉工具和 Skill,理论上就可以继续往研究、数据分析、企业内部工作台上扩。

对于普通用户来说,这套东西现在可能还有点远。

但对于喜欢自己折腾 Agent 的开发者,这种架构就很香了。

icon
祛魅与吐槽.

夸完了,该泼的冷水还是得泼。

插图

第一,现在还不是普通用户闭眼安装的时候。

目前依然是开发者预览版,桌面端也没有成熟的一键安装包,需要源码编译。

想尝鲜没问题,真拿来当主力工具,建议再等等。

第二,桌面端现在还不够“桌面”。

目前最大的变化还是运行载体,核心体验和 Web UI 很接近。

真正值得等的是后续文件拖拽、后台任务、本地应用联动这些系统能力。

第三,别急着把Harness跑分封神。

8.7分差距很亮眼,但换一个任务、换一套工具,排名完全可能变化。

所以跑分只能说明:Harness很重要,不能说明某一个Harness永远最好。

icon
三句话.

最后,老规矩,用三句话总结一下:

1. DeepSeek Harness桌面端最大的变化,不是多了一个窗口,而是DeepSeek开始把Agent基础设施往真正的长期工作台推进。

2. V4.1 Flash在不同Harness下最高能拉开8.7分,已经证明Agent时代不能只看模型,模型周围那套运行系统同样重要。

3. 开发者现在值得狠狠干一轮,普通用户不用急着折腾源码;等安装、插件和权限体系再成熟一点,这东西才可能真正走向大众。

icon
🎁彩蛋福利🎁

DeepSeek Harness 现在更新很快,第一次接触的人最容易卡在三个地方:怎么装、装完怎么配置,以及到底什么场景值得用它。

所以这次我重新整理了一份 《DeepSeek Harness桌面端实战手册》。

插图

从源码安装、基础配置,到模型接入、轨迹查看、插件使用,再到 Coding、项目修改和 Agent 工作流的实际场景,我都按照“装完就能用”的思路重新整理了一遍。

不研究概念,直接照着跑。

扫码回复关键词【HARN】,自动获取。

【声明】内容源于网络
0
0
我的Ai笔记
很干货、有深度、真免费,关注“我的Ai笔记”,每天学Ai技巧! 赋能客户、助力普通人在Ai时代抢占先机。
内容 446
粉丝 1
我的Ai笔记 很干货、有深度、真免费,关注“我的Ai笔记”,每天学Ai技巧! 赋能客户、助力普通人在Ai时代抢占先机。
总阅读26.2k
粉丝1
内容446