-
把 Harness 的实现想象成开一家旋转寿司店,围绕大模型搭好 loop 旋转轨道是最简单的一步,店能不能开下去要看你做的寿司能不能抓住你顾客的胃 -
分享一个评价 Harness 的四级成熟度模型,Harness 本身的定义就有点耍无赖:「除了基模之外的所有,都叫 Harness」,解决了定义问题你就可以拿我们这套四级成熟度模型去重新审视一下你熟悉的、感兴趣的 Harness 们了。
-
第一层, Harness 就是一个 loop 上套个壳子,比如网页、Desktop 加个 chat,大部分是 vibe 来的,看起来也像模像样的回答问题,但仅此而已。 -
第二层是链接实际业务工具,让 Agent 做到「见你所见」,把你的 repo、docs、工具、权限,共同链接上去,就像腾讯对人做的一样,做一个「腾讯链接器」把你的 Agent 跟你看到的东西连接起来。 -
第三层叫「干你所干的工作流」,大部分的 Agent 无论聪明的还是笨的,初次使用都需要手忙脚乱的把你之前走过的坑都趟一遍,比如 skills 里面明明说某网站可用但实际连的时候要翻墙,比如你的集群里面明明写着所有设备都 available ,但真用到跟前了才发现有个细节文档中没讲,又要从头来过。从头来过,不仅费 token,更重要的是费时间,把这些 fixed workflow 写出来,直接告诉大模型,其实就是告诉 ta 你当前做的事,让 ta 代替你趟坑、总结、形成 fixed workflow。此为「干你所干」。 -
第四层叫塑造审美,cultivate taste,你写文章选哪个词、系统设计选哪个方案、今天出门穿哪件衣服化哪个妆,你生活的品味,你工作的品味,真正能拉开人跟人、人跟机器区别的,就是这个审美的品味,而真正 Harness 的终极挑战,也正是这个 cultivate taste,人的品味可以塑造,Agent 的如何 cultivate? 不同的 Harness 有不同的品味,量化不易,但上手用一下,两相对比立刻就能判断出来一个好一个孬,这里面判断的部分,就是评判一个 Harness 是否能最终在第四层胜出的,Agent 的品味。要达到大模型跟人一样有 taste,有 sense,工业界的做法是简单粗暴的重新祭出 RSI 大法(Recursive Self-Improving),递归自进化并不是新鲜的概念,最近的有 Karpathy 提的 auto-research,再往前一点点有 Google 的 AutoML,再再往前还有 Facebook 的 Hydra 超参数搜索框架,等等数不胜数,但这一波确实有所不同,RSI 本质上想实现两个目标:一个是流程自动化,一个是自己改自己,机器制造机器的工业母机,过去的重点包括 ML 领域也一直是集中在前者,后一波里面基本没什么突破直到现在,没突破的主要原因个人认为主要是这 50 年来,IT 领域的架构说到底就是冯诺依曼架构,冯诺依曼架构做的事首先区分一个问题是可被计算的还是不可被计算,比如统计一篇文章里面出现「微笑」两个字的频率是可被计算的,量化这篇文章的情绪是不可被计算的。过去 40 年我们在可计算领域获得了长足的进步,但不可被计算领域其实一直没什么大的发展 -- 直到最近几年,最明显的例子就是满大街跑的自动驾驶快递车。说回来让机器自己改自己这件事,这明显是一个不可被计算的问题,受益于这一波神经网络派的强势发展,递归自进化里面的递归,自己改自己,真的有可能被解决。这个问题解了我们距离实现硅基的 taste 也就不远了。这块啰嗦太多就此打住,有兴趣的可以去从 Claude 的这篇 《When AI builds itself》开始看(https://www.anthropic.com/institute/recursive-self-improvement),同时关注类似 recursive.com 、coreauto.com、mirendil.com 等 startups。最后啰嗦一句,Agent 从 human-in-the-loop 到 human-on-the-loop 最终一定会到只剩 the-loop,整个递归的过程如果去掉了「人」这个慢节奏的点,AI 的进化加速度天知道还能受到什么因素的制约!(附一张某综述里的图,不想看就略过没关系:)

