大数跨境

3个关于「AI让你更轻松」的最大谎言

3个关于「AI让你更轻松」的最大谎言 AI高效进化论
2026-08-18
5
导读:AI 会干活了」——这句话说错了一半。
AI向上 · 科技平权 第 1 期 · 认知篇

QUOTE

「AI 会干活了」——这句话说错了一半。它没有变聪明, 它换了一台机器 

本文看点

01

它换了一台机器,从“续写”到“决策”

02

可靠性是乘法:单步 90%,十步只剩 35%

03

成熟,是失败变得可预测

2026年8月13日,DeepSeek发布了一个叫 Harness 的东西。

通稿里只有一行字: 模型加上Harness,等于智能体 

第二天,媒体把它概括成一句: AI会干活了 

这句话,说错了一半。

错的那一半,藏在“聪明”两个字里。人们默认,机器会干活,是因为它又 变聪明了一点 

不是。

它换了一台机器。


先看它以前的样子。

在很长一段时间里,AI什么都能说, 什么都干不了 

你问它怎么写一封邮件,它写得漂亮。你问它怎么整理一百张表格,它讲得头头是道。

然后你让它“真的去整理一下”,它停住了。

它不知道从哪下手。


为什么?

这件事,得从它的构造说起。

大模型从头到尾,只干一件事: 预测下一个词 

你给它“今天天气”,它接着补“不错”;你给它半道题,它接着写下一行。它不是在“想”,它是在 “续写” 

这是它“会说话不会干活”的根本原因——不是它笨,是它的构造里, 压根没有“手” 

它说得出“我来帮你订一张票”,但它没法真的打开网页、比对价格、点下付款。

它说得出每一个字,却碰不到任何一个键。

它不是不理解你的问题,也不是不想帮你做。是它从头到尾,就没被设计成一个能动手的东西。它是一台 续写机器 ,你给它开头,它还你下文。仅此而已。


那后来,它怎么突然有了手?

不是谁发明了一个更聪明的算法。

是三件很平庸的东西,慢慢凑齐了。


第一件,是手。

要让机器干活,得先给它接上工具:让它能去查、去搜、去调用一个软件、去执行一段代码。这一步,技术里叫 “函数调用” 

第二件,是记性。

早期的模型,上下文只有 32k ,大约两万个汉字。

听着不少。但一次真正的任务,要同时装下三样东西:你的目标,工具一次次返回来的结果,还有它自己中间的推理过程。

三样一挤,就溢出来了。

它干到一半,忘了自己刚查到什么,忘了自己为什么要调这个工具,最后连“我正在干什么”都忘了。

你让它查一个数据,它查回来了;你让它用这个数据做下一步,它已经把数据忘了,又去查了一遍,或者干脆用一个错的数往下算。

看起来像在干活,其实在 原地打转 

所以它缺的,不是“读得更长”,是 “记得住自己正在干什么” 

长上下文,是给AI的 短期记忆 。记忆不够,手再多,也是白搭。


第三件,是能量

这个最后再说。先看最要命的那一个。


最要命的,不是手,不是记性,是“稳”。

工具调用这件事, 可靠性是乘法,不是加法 

ACL 2025有一个叫CONFETTI的基准,专门测模型调工具的准确率。结果很冷:最强的模型之一,Amazon Nova Pro,在复杂对话里,函数调用的准确率,只有 40.91% 

不到一半。

而这还只是单步。换成链式调用——连续调三步以上——成功率,几乎归零。

另一个基准叫Lacuna,把任务的依赖深度,从1加到4。成功率,直接掉到 30%以下 

GPT-5做5步的任务,有72.5%的成功率;可一旦要连续做20次函数调用,成功率骤降到 15% 

为什么会这样?论文里写得很清楚:失败的原因里,超过66%,是 “状态追踪错误” 

翻译过来,就一句——它记错了上一步的中间结果。


把这几个数字,换成一个普通人能懂的算术。

假设一个模型,单步的正确率是90%。听着不低。

可它要连续干10步,总成功率是多少?

0.9的10次方。

约等于 35% 

每一步都有九成把握,十步走下来,也只剩三成半的概率能顺利走完。

这才是“会干活”真正的门槛:不是“更聪明”,是 “把单步的错误率,压到连做很多步,还能用” 


以前,这道门槛,把所有人都拦在了外面。

因为单步90%,多步就是一场灾难。一个订票的任务,中间查错了时间、记岔了价格、漏了一步确认,整件事就废了。

机器不是不想干。是干着干着,就崩了。

你不敢把票交给它。不是因为它笨,是因为你永远不知道, 它会在第几步,悄悄错掉 


于是,第三件东西,出场了:能量。

要压住错误率,有一个很笨、但管用的办法—— 多想想 

想一步,干一步,回头检查一步。想错了,就重来。

多想想,是把一次性的答案,变成一段反复的、会回头的路程。每回一次头,都是一次新的调用,都要再付一次钱。

所以,“多想想”是要花钱的。

一次Agent任务,要反复调用模型很多次,token的消耗,是普通问答的几十倍。

于是早年有一个被忽略的事实:不是机器不会干,是 “会干,但用不起” 

2025年初,DeepSeek R1把这个“多想想”的能力,压到了一个低一个数量级的价钱。原来只有大厂用得起的“推理”,开始 人人用得起 

记忆变长了,手变稳了,能量变便宜了。

三个平庸的量,叠加在一起,堆出了一个质变:会干活。


现在,可以回答开头那句“错了一半”了。

Harness的意义,不是一个更强的模型。

是它第一次,把“手、记性、能量”这三件东西,装进了同一个壳里,让它们能稳定地、连续地工作。

而这件事真正要紧的地方,不在“它更聪明了”,在 “它的失败,变得可以预测了” 


一个会订票的AI,可怕吗?不可怕。

可怕的,是你把票交给它,却不知道它会在哪一步崩。

可一旦你知道:它十步里,有几步会错,错在哪一步,你能不能提前拦住——那它就从“一个偶尔翻车的聪明玩具”,变成了 “一个可以托付的工具” 

成熟的标准,从来不是“永远不犯错”。

 “错,是可预期的” 


写到这儿,我回到那个傍晚。

2026年8月13日,世界没有为这件事停一下。

有人照常下班,有人照常加班,有人在回家的路上刷到这条新闻,然后划了过去。

他们不会知道,从这一天起,一件从前只有少数人敢交给机器的事,开始变得, 谁都能试一试 

而当“干活”第一次变得稳定、便宜、人人可用,它就不再只是一个技术话题。

它会落到每一个人的工位上,落到每一个普通人的月薪上。

这些,是后面要讲的事。

而这件事的分量,不在机器那一端。

在人这一端。


END

我是【AI高效进化论】,与你一起进步。

如果你觉得今天这篇有收获,欢迎 点赞、在看、转发 三连,我们下篇见。


【声明】内容源于网络
0
0
AI高效进化论
1234
内容 121
粉丝 0
AI高效进化论 1234
总阅读4
粉丝0
内容121