“若无法在数小时内重建 Cursor,面试将异常艰难——那不过是 300 行代码的 while 循环。”Ralph Loop 创造者 Geoffrey Huntley 将软件工程师的底线划在 300 行。看似夸张,却渐成共识。
过去一年,Claude Code、Codex、Antigravity 等大厂产品底层路径趋同:Agent Loop 读写上下文、调用工具、反复执行,以测试和权限兜底。上下文、工具、Loop、记忆及多 Agent 已成为公开的标准配置。
大厂之外,个人 Harness 项目亦呈爆发之势。Pi 由奥地利工程师 Mario Zechner 独立开发,Aider 源于加拿大工程师 Paul Gauthier 一人之手,面向 DeepSeek 优化的 Reasonix 则由游戏引擎开发者 YHH 发起并迅速成长为数万 Star 的社区项目。
DeepSeek 宣布招募 Harness 内测后,评论区演变为“个人 Harness 展销会”,数百个开源仓库覆盖 Coding Agent、记忆、Skills、评测和安全等方向。行业差异已从"AI 提升生产力倍数”转变为“能否自建一套 Harness"。
当模型可替换、Harness 可复刻、组件趋同时,Coding Agent 如何构建壁垒?为此,我们采访了 TiDB 唐刘、腾讯研究院茹炳晟、Floatboat Harness 架构师 Remy 及字节 Trae 天猪。
追模型不如搭 Harness?
今年,多位知名 Coding 工具创始人达成共识:在日常编程任务上,模型性能已难分伯仲。
Amp 联合创始人 Thorsten Ball 直言“模型已死”,认为微调单个模型行为的回报递减,未来模型终将达到“按下按钮即得顶尖代码”的水平。OpenCode 联合创始人 Dax Raad 也指出,新一代模型在可用性上已进入完美区间,彼此差异微乎其微。
Pi 创始人 Mario Zechner 认为模型能力已达顶峰,甚至可能出现倒退。因真实世界用例繁杂,评测难以全覆盖,厂商倾向于推自家 Harness 以锁定变化。此前国内专家曾言“模型不行靠工具补”,如今模型已能应付大多数日常复杂度,竞争焦点正式转向 Harness 层。
Harness 也在趋同,但趋同不是终点
Harness 并非新概念。早在 2022 年,为应对有限的上下文窗口,开发者便利用工具调用、MCP、RAG 管理上下文,催生了 Cursor、Windsurf 等产品。随着任务变长,Sub-agent、Agent Swarm 等机制涌现,本质均为给底层模型搭建更优运行环境。2026 年初"Harness"概念流行,半年内发展方向已高度一致。
最内层的 Agent Loop 负责模型循环、文件读写及安全控制,代码量可精简至约 200 行。Amp 联合创始人 Thorsten Ball 曾用 315 行 Go 代码从零写出具备终端读写能力的 Coding Agent。
尽管核心代码寥寥,完整 Harness 仍需叠加 Planner、Coder、Reviewer、Search、Edit、Shell、Sub-agent、MCP 等众多组件。TiDB 团队唐刘比喻道,如同 MySQL、TiDB、PostgreSQL 均含 SQL 与存储引擎,但真正的差距在于组件如何组合成解决问题的系统。
TiDB 团队在新产品 TiDB Cloud Filesystem 中践行了独特思路:边推进边迭代,在与 AI 协作中打磨出一套早于 Claude Code 动态 Workflow 发布的 Harness。其设计哲学为“薄 Agent Loop,厚 Control Plane"。
团队未重写易同质化的 Agent Loop,而是基于开源项目 Pi,专注于任务编排、权限、持久状态、Sandbox 及失败恢复。这延续了数据库团队二十年的核心命题:状态持久化、权限收口、副作用控制及审计复盘。
该架构优势在于模型无关性:无论上层 Agent 如何更换,下层 Sandbox、权限与控制面无需重写。模型越强,Sandbox 探索空间可适度放宽,但生产系统的副作用边界必须稳定。如同数据库事务与权限不因优化器变强而消失,Agent Framework 可变,但状态与权限边界须稳。
这套 Harness 支撑 TiDB Cloud Filesystem 在三个月内上线,跨 Session、Sandbox 和 Executor 的持久 Workspace,以及版本、分支、Checkpoint、Rollback、权限与多租户隔离全由 Agent 完成,人类未写一行代码。上线后已承载超数百万个 Agent Workspace。
差距藏在这些看不见的地方
LangChain 联合创始人 Harrison Chase 观察到,通用 Harness 虽能胜任基础任务,但非常规任务需定制 Harness。金融等行业宁愿牺牲部分智能以换取可控性。定制认知架构即将领域知识、专业工具和专家流程植入 Harness,这在垂直领域尤为关键。
腾讯研究院茹炳晟指出,知识工程决定 Coding Agent 能力高低。绝大多数 AI 编程是在现有代码上增修,核心在于理解现有系统并按软件工程方法闭环验证。他将优秀 Harness 拆解为三层:
第一层:理解存量系统。需结合原始需求、系统设计与代码,通过 Code Graph 机制进行顶层建模,定位相关模块及细粒度代码片段。
第二层:项目约束与推理。Harness 需让模型可见项目规则,并具备检查与反思机制,通过多轮迭代确保生成结果符合约束。
第三层:确定性验证。代码生成仅是起点,Harness 需打通持续集成体系,具备单元测试、容器化环境、编译运行及结果分析能力,用外部不变量证明代码正确性。
多 Agent 编排:听着高大上,实际是“分布式内耗”
2026 年被称为"Agent 编排之年”。Boris Cherny 推崇数千 Agent 并发,Claude Code 推出 Dynamic Workflows 自动调度子 Agent。然而,TiDB 唐刘提出反潮流观点:Agent 编排的未来可能是越来越少的编排。
随着模型增强,显式编排正转向声明式目标。唐刘强调"Communication is complexity",频繁通信的系统难调试且性能低。TiDB 遵循 Unix 哲学:一个 Agent 做好一件事,通过清晰 Input/Output 解耦,减少高频交互,保持拓扑简单。
茹炳晟同样认为多 Agent 非默认选项,而是单 Agent 受限时的补充。他提出智能体设计模式二维矩阵:认知能力(感知、记忆、推理等)与执行拓扑(链式、路由、并行等)。基础拓扑有限,但具体模式无穷,且部分模式单 Agent 即可完成。
复杂度不会消失只会转移。引入多 Agent 需付出协作、状态同步及治理成本。目前明确值得付出的场景主要有二:一是缓解上下文压力,将子任务拆分;二是交叉验证与发散探索,通过多模型对话产生新想法。
长程是分水岭
架构趋同后,长程稳定性成为下一代 Agent 产品的核心分水岭。真正难度取决于依赖链深度、状态跨越时间、工具数量及错误反馈延迟。小错误若未及时拦截,将在长链条中被放大。
解法在于“快速失败”(Fail Fast)。唐刘指出,重试往往危险,应将问题暴露点提前,并配合限制错误传播与从可信状态恢复的能力。这需要借鉴数据库的 Checkpoint、持久状态及 Rollback 机制,确保系统失败后仍能保持正确。
Pi 的 Harness v2 正将执行状态持久化,操作意图、步骤及 Tool 状态全部落盘,进程崩溃后可依据日志安全恢复。Floatboat 团队则选择全栈自研 Runtime、Agent Loop 及 Infra,以实现对系统内部的全方位掌控,确保长程收敛。
Remy 表示,模型决定判断上限,Harness 决定长路径上的结果积累。实测显示,在长程任务中 Harness 可贡献 23% 的性能提升。此外,自进化必须在受控闭环中进行:发现问题、生成改动、隔离评测、灰度发布并保留回滚,始终维持 Human-Centric 治理。
编程之战结束了吗
编程是 Harness 最早跑通的场景,而非终点。2026 年初起,国内大厂 AI 资源向办公场景倾斜,字节、阿里、腾讯相继整合算力与人才押注 AI 办公。CodeBuddy 演化为 WorkBuddy,Trae IDE 延伸至 Trae Work,底层 Harness 完全共享。
行业共识在于 IDE 与办公场景均经历“能力原子化”,界面功能被拆解为 Agent 可调用的 Tool。两类产品共享 Harness 核心,区别仅在于调用工具:前者操作代码仓库,后者处理文档、网盘与邮箱。
然而,“相同”不意味着“等价”。Coding 场景交付标准明确(编译、测试),属技术复杂性管理;通用任务涉及情境、审美与判断,属社会复杂性管理。关键分界线在于交付标准能否在任务开始时被充分形式化。编程 Agent 积累的上下文管理、任务规划及错误恢复能力,正从垂直场景演变为通用的工作基础设施,推动 Harness 走向更广阔的市场。
声明:本文为 InfoQ 原创,不代表平台观点,也不构成投资建议,未经许可禁止转载。



