大数跨境

DeepSeek Harness,“杀死”Agent黑箱

DeepSeek Harness,“杀死”Agent黑箱 光子星球
2026-08-14
113
导读:Model+Harness=Agent


撰文 | 郝鑫 高晓阳

编辑 | 王潘

近期,DeepSeek 持续上演反转剧情。


8 月 12 日深夜,DeepSeek 在无发布会、无预告的情况下,静默上线编号"0813"的 DeepSeek-V4-Pro 正式版模型。然而,现实体验与官方跑分的落差,以及上线即预告涨价的质疑,引发了广泛关注。


8 月 13 日,发布不到 24 小时,官网横幅与公告突然撤下,官方保持沉默。开发者发现其 Hugging Face 代码仓库正在紧急抢修,疑似因前后端配置错位导致体验“翻车”。当晚,DeepSeek 重新确认 V4 Pro 上线,并同步开源 DeepSeek Harness 开发者预览版,局势重回正轨。



DeepSeek 提出公式:Model+Harness=Agent。模型是负责思考推理的“大脑”,但纯语言模型无法直接操作外部世界;Harness 则是“身体”与“神经系统”,提供工具调用、文件读写、沙箱环境及任务编排等能力。没有 Harness,模型仅是引擎;有了它,才能成为真正干活的 Agent。


实测显示,在 DeepSeek Harness 加持下,V4 Pro 正式版响应速度显著提升,接入缓存命中率较 Claude Code 提升 1%。

祛魅和争夺范式


“一切皆插件”是 DeepSeek Harness 的核心理念。该设计由北大与 DeepSeek 联合提出的“时空可组合性”范式支撑,将 Agent 组件拆解为时间与空间两个维度:


时间可组合性通过“可逆效应”机制,自动记录并撤销组件卸载后的副作用,确保系统长期稳定;空间可组合性通过“响应式共效应”实现声明式依赖管理,组件只需声明需求,运行时即可自动协调依赖变化。


两者融合于统一的上下文与生命周期中,使 Harness 实现“无特权核心”,所有组件包括 Agent 主循环均可替换。这一理念为构建灵活的 Agent 基础设施指明了方向。


OpenAI、Anthropic 等巨头定义自有 Harness 时,DeepSeek 选择了差异化路径:前者采取“向下整合”策略,深度绑定自家模型以巩固应用层优势;DeepSeek 则致力于“横向铺开”,试图通过开源模型中立、高度模块化的 Agent 底层标准,成为下一代 AI 应用的基础设施。



网传 DeepSeek Harness 内测项目高度集中在 MCP 插件、代码智能体、运行时、编排框架等基础设施领域,直指 Agent 落地核心难题。DeepSeek 此举实为一场“祛魅”运动:将构建强大 Agent 的方法论与源代码公之于众,拆解了以往被视为“黑箱”的特权。


当 Harness 被透明化、标准化后,价值链上唯一不可被替代的便是底层的“模型”本身。DeepSeek 的策略清晰可见:先通过开源 Harness 建立生态与标准,吸引车流;再凭借最强的模型性能,完成商业价值的最终变现。

砍掉 prompt,场景一次跑通


此前测评 DeepSeek-V4-Pro-0813 时,因提示词限制导致《指环王》场景生成不完整。此次借助 DeepSeek Harness 进行完整测试,验证自家工具与模型的协同效果。


安装过程推荐直接使用 npm 包管理器运行npx @deepseek-ai/dsh web启动。若遇卡顿,可先全局安装对应包后再执行启动命令。




本次基准测试要求模型“读懂文学→理解世界→程序化搭建”,难度极高。我们将原著第一章前段完整文字(1817 词)作为输入,进行了两轮对比测试。


第一轮测试采用详尽提示词,包含场景要素、运镜、灯光等五条硬性要求。结果不尽人意:生成的场景粗糙,叙事破碎,穿模严重。复盘发现,过长的提示词反而限制了模型发挥。


第二轮测试将提示词精简为目标导向:“读懂原文,用 Three.js 搭出霍比屯生日派对 3D 世界,运镜按原文节奏,保存为 HTML"。删除所有细节约束后,效果发生反转。


场景一次跑通,洞屋、角色、长桌及人群议论等要素齐全,运镜叙事流畅。同一模型,繁复提示词导致翻车,直白目标却换来及格以上结果。这表明顶级模型无需“小作文”式提示词,提示词的作用正从“写剧本”转向“定目标”。

DeepSeek Harness 到底行不行?


回归正题,DeepSeek Harness 搭配 V4 Pro 表现优异:


响应更快。同等测试条件下,Harness 内的响应速度优于前一天在 Claude Code 中的表现。


缓存命中率提升。从 Claude Code 的 98% 提升至 Harness 的 99%。在长上下文任务中,这 1% 的提升直接关系到成本与生成效率。



作为开发者预览版,Harness 展现出极高的稳定性,全程无报错或上下文丢失。更值得称道的是其创新性:显式呈现运行过程中的每一步,让模型工作机制透明可见。



短期内,普通用户可能难以像使用 WorkBuddy 那样直接提效;但长期来看,DeepSeek Harness 与系列模型形成了难以割裂的增强闭环。



Harness 作为开源框架定义了底层标准,吸引海量开发者与真实任务涌入。这些执行轨迹通过内置可观测体系回流,为模型迭代提供数据养料;而模型能力的跃升,又第一时间通过适配器释放到插件生态中。


这套飞轮一旦转动,开发者将获得一个始终与最强模型同步进化、开箱即用的系统。这正是 DeepSeek 定义的"Agent=Model+Harness"终极形态:一个彼此增强、不可分割的完整个体。

【声明】内容源于网络
0
0
光子星球
细微之处,看见未来
内容 1148
粉丝 0
光子星球 细微之处,看见未来
总阅读83.9k
粉丝0
内容1.1k