大数跨境

市面上的 agent 框架都不能用,我自己开源了一个

市面上的 agent 框架都不能用,我自己开源了一个 象信AI
2026-10-04
14
导读:TrueFoundry 联合创始人 Nikunj Bajaj 讲他为什么自研开源 agent harness:造的过程中推翻沙箱与 runtime 两个假设,同模型下成本降三成,并点出企业 AI 控制

智能体上不了生产,大家先怪模型不够聪明。TrueFoundry 的 Nikunj Bajaj 说,问题都出在模型之外那一层。

近日,在《AI Engineering Podcast》中,主持人 Tobias Macey 与 TrueFoundry 联合创始人兼 CEO Nikunj Bajaj 聊了一场。Bajaj 曾在 Meta 带过一个会话式 AI 团队,他做的是企业 AI 控制平面 TrueFoundry,团队今年 8 月开源了厂商中立的 agent harness(智能体运行框架)TrueForge,这期聊的工程细节就来自这条产品线。他把智能体比作一辆车:模型是发动机,发动机之外的一切——转向、刹车、仪表盘——才是 harness。

他讲了自己动手的原因:想给自家的 AI Gateway 内建一个一等公民的 agent,试遍市面上的工具都不行,索性自己写了一个开源的。造的过程中他推翻了自己两个架构假设。

同模型下成本降三成,让 harness 自己挑模型能降七成。而节目最后他抛出一个更大的判断:企业 AI 控制平面真正断掉的地方,不在单点方案内部。

01

造到一半,我把沙箱设计反了过来

造到一半,我把沙箱设计反了过来


Bajaj 说,第一关是把智能体的准确率做到跟开箱即用的托管 harness 一样的水准,“harness 不是说你随便写一个就马上到那个水平了”。他举了一个权限上的困境:代表用户的智能体去发一条 Slack 消息,收件人怎么知道这条消息到底是本人发的,还是智能体发的?

真正让架构翻个面的是两件事。一是他原以为把智能体搭起来最难,结果发现“真正难的是让它在我们在意的时机和环境里跑起来”,harness 因此从“追求中立的框架”演进了整套运行时。

二是沙箱。大多数 harness 把整个智能体跑在沙箱里,他反过来:“现在我们是在服务器里跑智能体的循环,只有当智能体真的要执行代码的时候,才去临时开一个沙箱。”好处有三:一台服务器能同时跑很多个智能体;不需要写代码的那些轮次成本低得多;密钥永远不会离开 harness 碰不到的那一层。

聊到 harness 这个词,Tobias 说它已经被混着用:大多数人想到的是 Claude Code、Codex 这类编程 harness,而生产环境的智能体需要更受约束、可分层的 harness。Bajaj 承认市场噪音很大,并给出一条反直觉的经验:不要做全能 harness。“如果你一上来就想在一个 harness 里解决所有问题,那你的系统提示词必然会变得极其庞大”,而这段提示词每轮对话都要带上,“一旦这样,你就开始为它交税了”。

02

同模型下成本降三成,自己挑模型降七成

同模型下成本降三成,自己挑模型降七成


聚焦带来的收益直接体现在账上。Bajaj 说,拿自己的 harness 跟外面那些工具跑基准测试,“在用的是同一个模型的情况下,我们做到了保持准确率的同时成本降低超过百分之三十。如果让 harness 自己选模型,成本降幅能到百分之七十”。

省下来的钱主要来自三个地方。系统提示词: 越精简越省钱,这也是他不做全能 harness 的原因。harness 效率: 发起多少次工具调用、按什么顺序发、工具的延迟加载,以及哪些问题直接用 token 解、哪些该写成代码去执行。“我们见过有些任务,别的 harness 要花超过七万五千个 token 才能完成,而我们的 harness 大概两万三千个词元就能搞定”,同类任务上他见过 50%、甚至 70%、75% 的词元削减。模型本身的基准表现: “很多时候同一个任务,不同模型的成本能差一个数量级,甚至两个数量级,但那个点上它们的表现可能差不多。”

Tobias 追问了一个过去两年被反复验证的经验:同样输入只换个模型,结果可能天差地别,现在还成立吗?Bajaj 说这个假设已经破裂了,“也就是最近几个月的事”。现在只要模型规模超过某个门槛,换模型不用改 prompt 也能拿到差不多的输出,例外是从前沿模型换到微调过的专用模型。Tobias 想要一个具体的门槛数值,Bajaj 没给,只说用户实际活动的区间就是 Haiku、GLM、Opus 这一档,“大概 Haiku 以上这个档,harness 就能跑得起来”。

03

企业为什么绕不开自建这条路

企业为什么绕不开自建这条路


聊到企业这一侧的处境,Bajaj 说创业圈现在有个新说法:以前只要找一次 PMF(产品市场契合),“而现在你基本上每半年就得重新找一次”。

他把这个节奏摊开讲了一遍。一家公司搭了集中式平台团队做 AI 网关,一开始搭个薄薄的代理层,觉得搞定了。先是模型的 API 签名全变了。几个月后 MCP 发布,认证、授权也得塞进同一个代理层。然后是 agent 到 agent 的通信协议(A2A),要把它通过平台打通。接着多个 agent 上生产,可用性、可靠性、延迟都成了他的事。再然后,智能体身份成了真问题。“这个平台要处理的复杂度和需求每一天都在变”,而对成千上万个团队来说,主业又不是做和维护这样一个平台。于是就有了先自建、发现不行、再去买的循环。

Tobias 补了行业的节奏:agent gateway 大约一年前爆发,几乎隔一天冒出一个新网关;过去六到八个月,注意力大量转向 harness engineering。

04

真正的问题出在单点方案的接口之间

真正的问题出在单点方案的接口之间


节目最后,Bajaj 抛出了自己最大的一个判断。大家一直想用更小、更聚焦的单点方案去解决企业 AI 控制平面——自己做模型路由层、自己做 MCP 注册中心、自己搭 A2A 层。“但真正的问题不出在这些单点方案内部,而是出在这些单点方案的接口之间。”要真正解决,就得把这些组件放到一起,并且“用非常 AI 原生的方式来做”。

被问到最大的缺口在哪里,两人都没把答案落在工具上。Bajaj 说,教你怎么用最新那个工具、某个框架,这种战术层面的答案回答不了真正的问题,“唯一有意义的解法”是想清楚哪些底层的事该由人来创造价值、哪些该由 AI 来辅助,并把它更根本地植入教育体系。Tobias 说自己团队也没法对 agent 交付的每一样东西做人工审核,“否则它根本进不了生产环境”。

那么,你手上那套智能体方案,是已经把所有 token 汇到了一处,还是仍散在几个各管一段的单点工具里?

原节目:AI Engineering Podcast《Harness Engineering for Reliable, Governed AI Agents》

【声明】内容源于网络
0
0
象信AI
让人放心把真实工作交给AI
内容 131
粉丝 0
象信AI 让人放心把真实工作交给AI
总阅读1.9k
粉丝0
内容131