
Claude Code、Codex 子代理体系扩容。
智东西 8 月 20 日报道,昨夜,DeepSeek Harness 迎来公测后的首次重要更新。DeepSeek Harness v0.1.0-rc.8 版本正式上线,多模态能力成为此次迭代的核心亮点。
本次更新涵盖 14 项调整,涉及多模态输入、子代理协作、终端体验、工具调用及开发者支持等维度。不仅补齐了 Agent 处理图片等多模态任务的能力,还进一步优化了子代理协作机制与终端交互体验。
新版支持原生图片请求和图文混合输入,/goal、/plan 等指令可直接接收图片;Claude Code、Codex 进一步接入其子代理体系;同时修复了 Windows 终端体验、图片请求异常、流式生成中断及自定义网关兼容性等一批问题。
DeepSeek Harness 于 8 月 13 日正式开启 v0.1 版本公测并同步开源。公测当晚,智东西曾第一时间拉取源码进行实测,完成 88 页论文翻译、贪吃蛇游戏开发等任务。
不到一周时间,这套 Agent Harness 迅速补全多模态能力,引发社区热烈讨论。
有国内开发者感叹:"DSH 支持多模态了,奔走相告!”
海外开发者同样关注这两项核心能力。网友评价称,DeepSeek Harness 正变得“越来越有意思”,多模态支持和更完善的子代理集成标志着显著进步。
更有开发者深入剖析了 DeepSeek Harness 的“看图”机制:面对本身不支持图像输入的模型,它能调用 OCR、颜色统计、像素扫描等工具,将图片拆解为结构化信息后交由文本模型推理,相当于为纯文本模型构建了一套工具层的“视觉”系统。
https://github.com/deepseek-ai/deepseek-harness/releases/tag/dsh-v0.1.0-rc.8
01. 多模态正式补齐,直接“看图”
rc.8 版本最显著的变化在于 DeepSeek Harness 全面补齐了多模态输入能力。
根据官方更新日志,DeepSeek 模型适配器现可通过配置启用原生图片请求。对于具备视觉能力的模型,Harness 可直接处理图片输入;/goal、/plan 等指令也已支持图文混合输入。
同时,输入框中的@菜单新增文件和会话引用功能,用户可直接将本地文件、已有会话等内容引入当前任务。
这意味着,过去主要围绕文本、代码和工具调用的 Agent 工作流,如今可将截图、图片等视觉信息纳入任务上下文。
子代理体系也持续扩充。新版支持将 Claude Code 和 Codex 作为 Profile Bundle 按需安装。其中,Codex 支持非交互权限模式及多个命名实例,便于在同一任务中配置不同子代理。
Windows 用户体验得到重点优化。DeepSeek Harness 的 PTY 终端加入持久 PowerShell 会话,并在极简模式预设中默认开启,有效减少命令执行过程中频繁重建终端环境的问题。
此外,本次更新集中修复了一批公测后暴露的问题。例如,针对单张图片尺寸过大或历史会话累积图片过多导致模型请求失败的情况,新版进行了专项处理。
取消流式生成后,已显示的回复前缀此前可能无法带入下一轮提问或分叉会话,该问题现已修正。对于使用自定义 OpenAI 兼容网关的开发者,新版还修复了部分网关因请求格式差异无法调用及推理内容回传缺失的问题。
02. 纯文本模型也能“看图”
OCR 和像素分析拼出工具层视觉
除了补全原生图片请求,开发者还发现了一个有趣细节。
网友 Yinsen 测试发现,当调用的模型本身未声明图像输入能力时,直接调用 read_image 会首先失败。
但任务并未终止。从执行轨迹看,Harness 随后会退化至另一套工具链:先进行 OCR 文字识别,再统计图片颜色比例、扫描部分像素行,同时读取图片尺寸、色彩模式等元信息。
例如,一张包含文字和简单图形的图片,可被拆解为“文字内容及坐标”、“背景颜色比例”、“特定区域像素变化”、“图片尺寸”等多组结构化信息。
最终,这些结构化结果会被重新交给文本大模型,让模型根据 OCR 文本、颜色占比、像素位置等证据“脑补”出整张图的大致内容。
这种能力与视觉大模型直接理解图片仍有明显区别。对于 PPT 截图、流程图、界面截图等结构相对明确的图片,它可借助 OCR 和像素特征获取大量有效信息;但面对真实照片、复杂空间关系等内容,其恢复信息的能力则受到限制。
但从 Agent Harness 的角度看,这一设计颇具创新性:视觉能力并不完全依赖底座模型,工具也可承担部分感知工作。
事实上,在官方加强多模态支持之前,DeepSeek Harness 社区已围绕视觉能力涌现出一批插件,包括 dsh-vision、dsh-vision-toolkit、modlens、dsh-auto-vision、dsh-subagent-vision 以及通过 pi2dsh 桥接的 pi-vision 等。
部分方案通过 OCR、像素分析、结构化证据或独立视觉子代理,让纯文本模型间接处理图片;也有开发者通过自定义路由,为支持视觉的模型配置 input: [text, image],实现直接接收图片。
rc.8 上线后,原生多模态模型与这类工具层视觉方案可进一步配合使用。
03. 上线不到一周加速迭代
盯上了多模态和子代理
8 月 13 日公测时,DeepSeek Harness 团队便强调其核心设计思路是“一切皆插件”:模型、工具、技能、会话、沙箱、存储、循环、调度和 UI 等 Agent 能力,均可由不同插件组合替换。随着工具和子代理日益丰富,原本依赖单个模型能力的任务,可通过工具编排被重新拆解实现。
此次 rc.8 继续强化插件化思路:视觉模型可原生接收图片,纯文本模型也能借助视觉工具获得部分图像信息;Claude Code 和 Codex 则可作为子代理按需装入同一套 Harness 中。
除核心变化外,rc.8 还加入了 web_search 并发查询、子代理 reportDelivery 及时唤醒父任务、本地运行 dsh web 自动打开浏览器等优化,并提升了大型历史会话分叉及 SQLite 后端的读写性能。
04. 结语:一切皆插件
把模型能力“拆开重组”
从 8 月 14 日开放公测,到如今集成多模态和更多子代理能力,DeepSeek Harness 仍处于快速迭代阶段。
未来值得期待的是,这套插件化 Harness 能否继续整合更多模型、工具和 Agent,构建出更复杂、更稳定的任务流程。
9 月 20-21 日,智东西主办的 2026 全球 AI 芯片峰会将在上海举行,设有开幕式,大模型 AI 芯片、Agent 推理芯片、具身智能芯片 3 场高峰论坛,以及 Token 工厂异构混训混推、超节点、AI 芯片架构创新、新型存储器、大模型 KV Cache 5 场技术研讨会。