QUOTE
「AI 会干活了」——这句话说错了一半。它没有变聪明, 它换了一台机器 。
本文看点
01
它换了一台机器,从“续写”到“决策”
02
可靠性是乘法:单步 90%,十步只剩 35%
03
成熟,是失败变得可预测
2026年8月13日,DeepSeek发布了一个叫 Harness 的东西。
通稿里只有一行字: 模型加上Harness,等于智能体 。
第二天,媒体把它概括成一句: AI会干活了 。
这句话,说错了一半。
错的那一半,藏在“聪明”两个字里。人们默认,机器会干活,是因为它又 变聪明了一点 。
不是。
它换了一台机器。
先看它以前的样子。
在很长一段时间里,AI什么都能说, 什么都干不了 。
你问它怎么写一封邮件,它写得漂亮。你问它怎么整理一百张表格,它讲得头头是道。
然后你让它“真的去整理一下”,它停住了。
它不知道从哪下手。
为什么?
这件事,得从它的构造说起。
大模型从头到尾,只干一件事: 预测下一个词 。
你给它“今天天气”,它接着补“不错”;你给它半道题,它接着写下一行。它不是在“想”,它是在 “续写” 。
这是它“会说话不会干活”的根本原因——不是它笨,是它的构造里, 压根没有“手” 。
它说得出“我来帮你订一张票”,但它没法真的打开网页、比对价格、点下付款。
它说得出每一个字,却碰不到任何一个键。
它不是不理解你的问题,也不是不想帮你做。是它从头到尾,就没被设计成一个能动手的东西。它是一台 续写机器 ,你给它开头,它还你下文。仅此而已。
那后来,它怎么突然有了手?
不是谁发明了一个更聪明的算法。
是三件很平庸的东西,慢慢凑齐了。
第一件,是手。
要让机器干活,得先给它接上工具:让它能去查、去搜、去调用一个软件、去执行一段代码。这一步,技术里叫 “函数调用” 。
第二件,是记性。
早期的模型,上下文只有 32k ,大约两万个汉字。
听着不少。但一次真正的任务,要同时装下三样东西:你的目标,工具一次次返回来的结果,还有它自己中间的推理过程。
三样一挤,就溢出来了。
它干到一半,忘了自己刚查到什么,忘了自己为什么要调这个工具,最后连“我正在干什么”都忘了。
你让它查一个数据,它查回来了;你让它用这个数据做下一步,它已经把数据忘了,又去查了一遍,或者干脆用一个错的数往下算。
看起来像在干活,其实在 原地打转 。
所以它缺的,不是“读得更长”,是 “记得住自己正在干什么” 。
长上下文,是给AI的 短期记忆 。记忆不够,手再多,也是白搭。
第三件,是能量。
这个最后再说。先看最要命的那一个。
最要命的,不是手,不是记性,是“稳”。
工具调用这件事, 可靠性是乘法,不是加法 。
ACL 2025有一个叫CONFETTI的基准,专门测模型调工具的准确率。结果很冷:最强的模型之一,Amazon Nova Pro,在复杂对话里,函数调用的准确率,只有 40.91% 。
不到一半。
而这还只是单步。换成链式调用——连续调三步以上——成功率,几乎归零。
另一个基准叫Lacuna,把任务的依赖深度,从1加到4。成功率,直接掉到 30%以下 。
GPT-5做5步的任务,有72.5%的成功率;可一旦要连续做20次函数调用,成功率骤降到 15% 。
为什么会这样?论文里写得很清楚:失败的原因里,超过66%,是 “状态追踪错误” 。
翻译过来,就一句——它记错了上一步的中间结果。
把这几个数字,换成一个普通人能懂的算术。
假设一个模型,单步的正确率是90%。听着不低。
可它要连续干10步,总成功率是多少?
0.9的10次方。
约等于 35% 。
每一步都有九成把握,十步走下来,也只剩三成半的概率能顺利走完。
这才是“会干活”真正的门槛:不是“更聪明”,是 “把单步的错误率,压到连做很多步,还能用” 。
以前,这道门槛,把所有人都拦在了外面。
因为单步90%,多步就是一场灾难。一个订票的任务,中间查错了时间、记岔了价格、漏了一步确认,整件事就废了。
机器不是不想干。是干着干着,就崩了。
你不敢把票交给它。不是因为它笨,是因为你永远不知道, 它会在第几步,悄悄错掉 。
于是,第三件东西,出场了:能量。
要压住错误率,有一个很笨、但管用的办法—— 多想想 。
想一步,干一步,回头检查一步。想错了,就重来。
多想想,是把一次性的答案,变成一段反复的、会回头的路程。每回一次头,都是一次新的调用,都要再付一次钱。
所以,“多想想”是要花钱的。
一次Agent任务,要反复调用模型很多次,token的消耗,是普通问答的几十倍。
于是早年有一个被忽略的事实:不是机器不会干,是 “会干,但用不起” 。
2025年初,DeepSeek R1把这个“多想想”的能力,压到了一个低一个数量级的价钱。原来只有大厂用得起的“推理”,开始 人人用得起 。
记忆变长了,手变稳了,能量变便宜了。
三个平庸的量,叠加在一起,堆出了一个质变:会干活。
现在,可以回答开头那句“错了一半”了。
Harness的意义,不是一个更强的模型。
是它第一次,把“手、记性、能量”这三件东西,装进了同一个壳里,让它们能稳定地、连续地工作。
而这件事真正要紧的地方,不在“它更聪明了”,在 “它的失败,变得可以预测了” 。
一个会订票的AI,可怕吗?不可怕。
可怕的,是你把票交给它,却不知道它会在哪一步崩。
可一旦你知道:它十步里,有几步会错,错在哪一步,你能不能提前拦住——那它就从“一个偶尔翻车的聪明玩具”,变成了 “一个可以托付的工具” 。
成熟的标准,从来不是“永远不犯错”。
是 “错,是可预期的” 。
写到这儿,我回到那个傍晚。
2026年8月13日,世界没有为这件事停一下。
有人照常下班,有人照常加班,有人在回家的路上刷到这条新闻,然后划了过去。
他们不会知道,从这一天起,一件从前只有少数人敢交给机器的事,开始变得, 谁都能试一试 。
而当“干活”第一次变得稳定、便宜、人人可用,它就不再只是一个技术话题。
它会落到每一个人的工位上,落到每一个普通人的月薪上。
这些,是后面要讲的事。
而这件事的分量,不在机器那一端。
在人这一端。
END
我是【AI高效进化论】,与你一起进步。
如果你觉得今天这篇有收获,欢迎 点赞、在看、转发 三连,我们下篇见。

