"能跑"不等于"敢交付"。当 Agent 系统从演示走向生产,从单个模型走向多智能体团队,从黑盒执行走向可审计可控,我们需要的不是更强的模型,而是一个真正的 Agent 操作系统。
1. 行业的痛点已经暴露
-
40% 的 agentic AI 项目:在 2027 年底前面临被取消或下线的风险,主因不是模型能力不足,而是治理缺口 -
多数项目不是死在 PoC,而是停在规模化之前 -
上下文漂移:已被确认为所有前沿模型上的工程风险
2. 技术对标从"模型能力"转向"执行可靠性"
-
Claude Code 和 Codex 的会话是黑盒私有的,无法外部审计 -
DeepSeek Harness 把会话变成类型化事件日志,支持 keyless 重放、快照回归、全文检索
3. 开源 = 快速验证 + 生态共建 + 技术标准化
-
闭环加速:在社区中暴露缺口,迭代速度远快于单独商业化 -
降低采用门槛:企业更愿意集成开源基础设施而非被技术锁定 -
争夺标准:如同 Linux 之于操作系统,DeepSeek Harness 想成为 Agent 系统的"事实标准"
创新 1:会"改写自己"的运行时(Self-modifying Runtime)
-
检视自己的运行时结构(有哪些工具、插件、能力) -
动态生成新插件并在node:vm 沙箱中执行 -
挂载/卸载新能力,而不需要重启系统
-
dsh-tool-cordis:模型可见的运行时检视工具 -
cordis-host-runner:node:vm 隔离 + 请求-运行往返 -
风险受控:生命周期守卫 + 权限隔离,"可改写"不等于"失控改写"
创新 2:事件溯源 + 可重放会话
-
会话 =类型化、版本化的事件日志(SessionEventMap) -
系统状态来自日志的折叠和投影(类似数据库的事务日志) -
支持JSONL/zstd + SQLite 双持久后端,效率与可靠性兼顾
-
Keyless重放:无需原始API Key,从日志重放任何历史会话 -
快照回归测试:可以对不同版本的Agent逻辑做对比测试 -
全文检索 + 血缘追踪:SQLite FTS5+关系查询,快速定位某个错误决策是在第几步做的
-
可审计:所有 Agent 行为都有完整的审计链 -
可复现:Bug 复现不再靠"描述",而是靠"重放" -
可学习:失败案例成为训练数据,可驱动自进化
创新 3:异构子Agent协议
-
五种sub-agent后端:in-process spawn、in-process fork、ACP、Claude Code、Codex -
三类工具支持:委派、控制、报告 -
父子协作形成闭环
创新 4:可移植沙箱+"fail-closed"设计
-
Linux:Landlock(内核能力隔离)+ bwrap(namespace) -
macOS:Seatbelt(App Sandbox) -
Windows:受限令牌 + ACL
-
原生 C11 实现:native/landlock-run,自限制后 exec(不依赖外部工具) -
Fail-closed exit 125:当内核无法强制隔离时,直接失败而非偷偷放开 -
双重机制:沙箱隔离 + 权限策略(sandbox-policy)分级控制
-
跨平台一致:同一份策略,Windows/macOS/Linux 行为一致 -
"安全失败"是第一原则:宁可功能受限,也不偷偷放开权限 -
原生底层:C11 Landlock 实现意味着零依赖、最小化攻击面
创新 5:把"可靠性"当作工程纪律
-
100% 代码覆盖率(coverage) -
自动化快照回归测试(snapshot tests) -
死代码检测(knip)、复制代码检测(jscpd) -
导出一致性检查(publint) -
运行时不变量校验(invariants
-
Agent Notes: ~680 条决策记录(为什么这样设计、为什么放弃另一个方案) - Postmortem:事故复盘(发生了什么、为什么发生、怎么防止再发生)
- 这些知识可以被持续迭代利用
-
config-catalog:自动生成所有配置选项的文档 -
tool-catalog:所有模型工具的 schema 自动列举 -
persistence-catalog:所有持久化事件类型的目录 -
双语文档体系:.md + .zh.md + .i18n.yaml 三元组,词条一致性强制
三、与 Claude Code/Codex的对比
四、Harness Engineering最新趋势
1. 从"框架能力"走向"可治理运行时"
2. 从"日志"走向"事件-可重放-可审计"
3. 从"调参/自评"走向"工程纪律与自动化守门"
五、给企业的启示
结语
从"能跑"到"敢交付",不是模型更强就能做到的。需要的是一个真正的操作系统——把编排、验证、记忆、治理统一成闭环,让 Agent 进入生产流程且可控、可追溯、可持续。
-
框架足够灵活(能改写自己) -
行为足够透明(事件可重放) -
协作足够开放(子代理协议) -
安全足够可信(沙箱 + 治理) -
质量足够有保障(工程纪律)

