https://xiaoyuzhoufm.com/podcast/689c6fb36f495c4caccf91d1
同一个模型,换掉外面那层代码,成本能差三成甚至七成,准确率却基本不变。TrueFoundry 联合创始人 Nikunj Bajaj 的意思是:模型只是发动机,真正决定 AI 产品好不好用的,是发动机之外那辆车。而过去两年最热的两波技术潮,恰好都发生在这辆车上。
嘉宾是谁
Nikunj Bajaj 是企业 AI 公司 TrueFoundry 的联合创始人兼 CEO,公司法律实体叫 Ensemble Labs,在旧金山。他本科读的是机器学习方向,自述大一那年在 FPGA(现场可编程门阵列,一种可以自己重新「接线」的芯片)上实现过矩阵分解算法——必须把算法拆到最基本的运算单元才能跑得动,这让他第一次摸清了底层到底发生了什么。
毕业后他在几家创业公司做过机器学习模型和 ML 基础设施的交叉方向,之后进了 Meta,做到 Lead ML Engineer,带过其中一支会话式 AI 团队。本期节目发布时,他刚把公司做的 agent harness 以 MIT 协议开源,取名 TrueForge。
主持人 Tobias Macey 运营 AI Engineering Podcast(前身是 The Machine Learning Podcast),本职是 MIT Open Learning 数据与基础设施平台工程团队负责人。他在这期节目里的角色是追问「这东西到底能不能部署、能不能观测」,视角偏运维工程师。
一、模型是发动机,但能上路的车是另一回事
Bajaj 在节目开场用「车与发动机」的比喻解释 harness 的边界。
Nikunj Bajaj 有个贯穿全场的比喻:如果把做 AI 智能体比作造一辆车,模型是发动机,「但发动机之外围绕模型的一切,本质上就是智能体运行框架」。你怎么转向,怎么刹车,怎么有一个仪表盘看到正在发生什么,全在这一层里。
先把词说清楚。agent harness,中文常译作「驾驭层」或「运行框架」,指的是一个 AI 智能体里除去模型本身之外的全部代码、配置和执行逻辑。模型只会读入文字、吐出文字;能记住上一轮说了什么、能真的去跑代码、能连上公司内部系统,全靠这层。Bajaj 的划分是:上下文与记忆管理、工具与 MCP(Model Context Protocol,模型上下文协议,2024 年 11 月由 Anthropic 开源,让 AI 用一套统一接口连各种数据和工具)集成、代码沙箱、权限、可观测性、护栏。他还特别提到两件容易被忽略的事:durable execution(任务中途断了能接着跑)和 human-in-the-loop(关键动作要等人点头才继续)。
这个词让人头晕,是因为它已经被混用。软件工程里 harness 早就是「测试脚手架」的意思;而现在它同时指模型厂商内置的 harness(Claude Code、Codex 这类编程智能体本身就是 harness),和企业自己在外层搭的 harness。另外还有一层同名干扰:Harness.io 是一家做软件交付(CI/CD)的公司,跟这里说的 harness 毫无关系。主持人 Tobias Macey 在节目里直接点出混用这一点:大部分人一说 harness 想到的是 Claude Code、Codex、Pi 这些给写代码用的,但还有一类 harness 服务的是已经上线的生产智能体,「你会希望这些 harness 比你本地的终端智能体受更多约束」。
为什么这层突然重要了?主持人给了时间线:大约一年前火的是 AI 网关,几乎每隔一天就冒出一个新网关,有的被并购、有的倒闭;最近六到八个月,注意力转向了 harness 工程。公开材料能对上这条线:2025 年 11 月 Anthropic 先写了长任务 harness 的设计,2026 年 2 月 Mitchell Hashimoto 在自己那篇讲怎么用 AI 的文章里把这套做法命名为 harness engineering,同月 OpenAI 也发了同名文章,3 月 LangChain 给出了「Agent = Model + Harness」的定义式。
Bajaj 的论证里最硬的一块是成本。他说,如果一上来就想在一个 harness 里解决所有问题,系统提示词(system prompt,每次请求都要发给模型的最高优先级指令,定义角色、语气、工具用法)必然会变得极其庞大,「而这段系统提示词,每一轮对话都要带上,你躲不掉。一旦这样,你就开始为它交税了」。
这笔税是真实存在的。下面这层机制是作者补充的厂商文档说明,不是节目里的原话:主流大模型 API 是无状态的,每次调用都要把系统提示词和全部历史消息重新完整发一遍,按 token 计费。Anthropic 文档写明「请求里的一切都计入上下文窗口:system prompt、messages 里的每条消息、以及工具定义」(platform.claude.com/docs/en/build-with-claude/context-windows);OpenAI 也明确「即使使用 previous_response_id,链上所有先前的输入 token 都按输入 token 计费」。唯一减税手段是 prompt caching,把不变的前缀缓存起来,命中后按输入价约 0.1 倍计费,但缓存会过期,前缀一改就全部失效。
他把这套逻辑落到了数字上,而这些数字需要交代边界:它们出自 TrueFoundry 自己发布的公开基准(DevRev Enterprise-Bench,14 个任务,对照的是 Anthropic 的 Claude Managed Agents,模型统一用 Opus 4.8,盲评打分),属于厂商自测,不是第三方评测。按这个基准,同一模型下大约省三成;换成开源模型,省得更多,嘉宾在节目里口述为「百分之七十」,官方基准里这个数字写的是约 75%——口径不同,方向一致。他另外给了 token 消耗的例子:「有些任务,别的 harness 要花超过七万五千个 token 才能完成,而我们的 harness 大概两万三千个词元就能搞定。」
节目里还提到沙箱这个容易被轻视的环节。沙箱是用操作系统级隔离,把 AI 写出来、要真正运行的代码关进一个有明确边界的房间:能读写哪些目录、能连哪些服务器。为什么必须较真?智能体要读网页、工单、邮件这些不可信内容,一旦里面藏了指令,它就会动用自己本来就有权限的 shell 和网络去执行。2025 年这类事故很密集:7 月 Replit 的智能体在明示「冻结期」的情况下删掉了 SaaStr 的生产数据库;8 月 Nx 供应链攻击里的恶意包会调用开发者本机的 AI 命令行工具,加上跳过确认的参数,搜刮密钥再外传。Bajaj 说的正是这件事:「最近出了这么多事,你怎么确认智能体真的被关在沙箱里,跑不出去?」
对普通人来说,这意味着「用了哪个模型」远不是判断 AI 产品好坏的充分条件。同一个模型换个外壳,体验和账单都可能差一大截。至于这层门槛是不是真有那么高,得留个心眼:基准是厂商自测的。可以确认的是方向一致——LangChain 公开说过,他们只改 harness,就把自家编程智能体在 Terminal Bench 2.0 上的排名从 30 名外提到前 5。
二、自建 AI 网关,是一条自建、撞墙、采购的死路
Bajaj 描述企业平台团队追不上协议变化的处境。
第二个判断更实用,直接回答企业最现实的那个问题:AI 网关这种东西到底自己搭还是买。Bajaj 的答案是别搭。
先解释什么是 AI 网关。它是在应用和各家大模型之间加的一层中间件,把 OpenAI、Anthropic、Google、亚马逊等上百家厂商各不相同的接口收敛成一套统一调用格式,顺手做路由、密钥管理、预算、限流、日志和护栏。开源代表是 LiteLLM,官方称一套接口可调用 100 多家厂商、1800 多个模型;商业代表是 Portkey,官方称支持 250 多个模型,2026 年 5 月被 Palo Alto Networks 收购——这本身就说明,网关已经被当成关键基础设施来看。
没有这层网关的年代,麻烦是实打实的:每家一套 SDK、一套鉴权、一套请求响应字段、一套流式格式和错误码,业务代码里塞满厂商专有分支;API key 散落各处没配额;缺跨厂商重试和降级、缺成本核算和集中日志;换模型等于改代码。
Bajaj 讲的是一个企业的处境演变。一开始有公司专门成立平台工程团队建这层网关,先搭一个薄薄的代理层,觉得搞定了;没多久模型 API 签名开始变;再过几个月 MCP 发布,得把它塞进同一个代理层,还要处理认证授权;然后 A2A(Agent2Agent,Google 2025 年 4 月发布的开放协议,管的是智能体和智能体之间怎么互相发现、派活、协作)出来了,又得把 agent 到 agent 的通信打通;接着多个团队的智能体上了生产,要保可用性、可靠性和延迟;再然后智能体身份变成真问题。
他的结论是:这个平台要处理的复杂度和需求每天都在变,「那对于成千上万个团队来说,他们的主要工作又不是做和维护这样一个平台,这问题就完全无解了」。他给这个模式起了个名字,叫先自建、发现不行、再去买。
这里有个容易被误解的点。很多人担心,用了统一接口就会丢掉某个模型厂商独有的能力。主持人在节目里也这么问。Bajaj 回答分两层:大多数情况下他们把分化的签名统一起来,但不丢能力;做不到的时候提供「自定义端点」,你带自己的签名进来,能拿到网关的多数好处,代价是失去一部分开箱即用的能力。
他还补了一句更值得记住的话,也是这期的收束:「真正的问题不出在这些单点方案内部,而是出在这些点解决方案的接口之间。」点解决方案是软件行的老词,指只解决某一个具体环节的专门工具,比如只做可观测性的、只做护栏的、只做评测的。它们单点都能做得不错,但各自带一套身份、权限、日志和接口,工具越多,缝隙越多,跨工具的连贯治理反而没人负责。这解释了他为什么主张把所有 token 流量收到一处——只有汇聚到一处,才能同时做可观测性、可靠性、成本优化、安全和身份这五件事。
对企业的现实含义是:要追的不是一个功能,而是一个每天都在变的协议生态,把这种事当成主业之外的副业来做,性价比很低。对创业者和投资人来说,信号是相反的——正因为难,这块才持续有新公司冒出来。
但反过来看,被锁在别人的控制面里,本身就是另一种代价。厂商锁定指的是客户因为转换成本太高而被单个供应商绑住,换一家要付出重大代价。企业 AI 的锁定点至少有四层:围着某家模型调优的提示词、评测集和微调;写死在某个厂商 SDK 里的工具和连接;沉淀在厂商平台上的数据、身份、权限和审计日志;以及 token 定价和承诺折扣。Bajaj 自己的说法是,用闭源专有平台「你根本没有控制权,那你就管不了自己做的 agent」,所以他们要做厂商中立的框架,模型、MCP 服务器、智能体都可以自带。
最后要说明的是立场:他不只是一个提建议的人,也是卖这个控制平面的人。「该买不该搭」的答案,跟他公司的商业模式方向一致。至于他说的趋势本身,在协议演进的公开记录上站得住。
三、「换个模型结果天差地别」,这句话过期了
Bajaj 回答主持人关于「换模型是否还天差地别」的提问。
这期最有信息量、也最容易被误读的,是第三个判断:过去两年 AI 圈的一条常识,「同一个提示词换个模型,结果可能天差地别」,Bajaj 说已经不成立了,「而且说实话,也就是最近几个月的事」。
他的佐证有两个。一是「幻觉」这个词的讨论热度。幻觉指模型把编造或错误的内容当作事实讲出来,比如虚构论文引用。它曾是衡量模型好坏的头号指标:2021 年发布的 TruthfulQA 是一套专门考模型会不会把编造内容当事实讲的测试题,结论是当时最大的模型反而最不诚实;Vectara 是一家检索技术公司,它发布的幻觉排行榜把各家模型的幻觉率排成公开名次。Bajaj 说,要是能画一张热力图看看这个词出现的频率,「过去这几个月,这张图已经凉得差不多了」——注意这是他打的一个比方,并没有这样一张真实的图。
这个体感有旁证。Vectara 的排行榜只衡量摘要类任务上的幻觉率,不是通用能力指标:2024 年 7 月版本里最好的模型约 2.5%、尾部模型高达 16%–22%;到 2026 年 9 月版本,榜首已到 1.8%。这些数字由 Vectara 发布,嘉宾在节目里并没有引用过。
二是 prompt 的敏感度。他说早些年真得给每个模型单独调 prompt,现在「你不太需要为了适配不同模型去过度抠 prompt 了」。
不过这里有个必须讲明的例外,也是他自己补的:「从前沿模型换到一个非常专用的模型,尤其你做过微调的那些……那种模型会期待 prompt 以某种特定方式进来。」微调就是在通用大模型之上,用自己准备的示例数据继续训练、更新权重,让它在某个任务或领域上更稳。副作用是模型会把训练样本里的措辞、字段顺序和输出格式一并学进权重,所以 OpenAI 的微调指南明确要求训练样本的格式必须和推理时一致,还建议把微调前效果最好的那段指令原样放进每一条样本。换句话说,微调模型是一份带格式契约的资产,前面磨好的 prompt 到它这儿往往会失灵。
他也给了门槛的说法:只要模型超过某个参数量档位,现在不用为了切换模型改 prompt,也能拿到差不多的输出。主持人接着追问了一个更具体的门槛:模型小到什么程度就没法有效驱动 harness 了?Bajaj 的回答值得原样读:「大家并不是在纠结,我该用一个三十亿参数的开源模型跑整套 harness,还是该用 Fable 5。大家一般不会走到这种极端。大家想的是,我这次用 Fable 还是 GLM,我要不要上 Haiku。」他给的实际区间是:选到 Haiku 及以上这一档,harness 就能跑起来;特别复杂的任务再上 GLM、Opus、Fable 那一档。
参数量就是模型权重的个数,3B 约等于 30 亿个,它只粗略对应「能不能塞进手机、跑起来多便宜」,不等于能力——训练数据、后训练、上下文长度同样关键。而 Anthropic 从没公布过 Haiku 的实际参数量,所以「某个门槛」到底在哪,读者不必当成精确刻度。有意思的是,Anthropic 自己的选型指南就写着「效率优先,先用 Haiku 4.5 起步,只有在出现具体能力缺口时才升级」,这独立印证了「Haiku 及以上够用」不是 Bajaj 一家之言。
还有一个议题顺带被回答了:模型路由该放在哪。先说清楚路由有两类:一类决定「这次用哪个模型」,一类决定「这个请求交给哪台机器跑」。主持人最熟悉的是 vLLM 生产栈里的路由器——vLLM 是一个开源的大模型推理框架,用来把模型高效地跑在服务器上,它生态里的路由就同时包括按意图挑模型的「语义路由」和按实例分发请求的「副本路由」。Bajaj 说,这两边都得有路由能力,而且目的不同:harness 里的路由是任务级的,它知道「我现在调用的是哪个智能体、哪个模型、哪个工具」,也知道某些模型擅长写代码、某些模型上下文窗口特别大;网关里的路由是交付级的,它实时知道哪家厂商延迟高、预算和速率限制用了多少。他自己也留了余地——「按现在行业的发展方向,这两个地方都得有路由能力,至少目前是这样」。
如果这个判断成立,推论是:模型正在变成可替换的商品,值钱的东西上移到 harness 和网关。这既改变企业怎么买 AI,也影响普通人怎么看「哪家模型更强」这类日常讨论。但要提醒的是,「幻觉这个词讨论变凉」是嘉宾的口头观察,没有公开的量化证据;而 OpenAI 2025 年 9 月那篇《Why Language Models Hallucinate》甚至认为幻觉是统计上的必然,需要改评测计分方式才能解决。更稳妥的读法是:讨论降温说明模型确实强了一截,但敏感度的差别是变小了,不是消失了。
写在最后
把三个判断连起来看,是同一件事的三个侧面。模型这一层正在趋于同质,按 Bajaj 的说法,超过某个门槛之后彼此的差异对多数任务已经不再致命;于是价值往上走,走到那层决定上下文怎么管、工具怎么调、代码在哪跑、钱花多少的代码里。而企业真正的麻烦不在任何一层内部,在各层之间的接口上——协议天天变,身份和权限得跨智能体链一路传下去,这些活干不完。
对读者来说,比较实际的收获也许是换一个提问方式。下次看到一款 AI 产品,除了问它用了什么模型,还可以问一句:外面那层是谁写的,能不能换模型,账单是谁在管。
不过想留一个问题给你:如果模型真的变成了像电一样的通用商品,那么眼下这些做 harness 和网关的公司,凭什么保证自己不被下一个半年淘汰?Bajaj 自己的答案是每半年重新找一次产品市场契合——这句话听起来像是解法,也像是承认这场仗没有终点。
收听本期:小宇宙搜索「闪电译制厂」,收听《EP13|面向可靠、可治理 AI Agent 的 Harness 工程》。 https://www.xiaoyuzhoufm.com/episode/6abd971d195d838e2aec34a2
原节目:AI Engineering Podcast《》 https://www.aiengineeringpodcast.com/trueforge-ai-agent-harness-engineering-episode-79

