大数跨境

真正理解 AI 之后,我反而不再要求它永远正确——从一次“平台是不是降智了”的追问,重新理解 AI、研究、判断与不确定性

真正理解 AI 之后,我反而不再要求它永远正确——从一次“平台是不是降智了”的追问,重新理解 AI、研究、判断与不确定性 建设产业互联网
2026-10-07
9
导读:人机认知分工问题


接受 AI 的优势,也接受平台的不足。

真正成熟的人机关系,不是相信 AI 永远正确,也不是因为它犯错就否定它。

更重要的是,在一次次与 AI 共同研究、质疑、推翻和重建的过程中,我们有没有变成一个比过去更好的思考者。


写在前面:我为什么突然开始怀疑这个平台


最近一段时间,我一直在做跨行业、跨学科、长周期的深度研究。

研究范围越来越广,研究链条越来越长。

有些问题从城市更新进入组织能力,从组织能力进入产业工人,再进入企业边界、交易成本、人力资本、组织学习;有些问题从建筑生命周期进入数据、Authority、Evidence、治理,再进入商业模式。


AI 在其中承担了非常多的工作:

检索资料、阅读论文、寻找案例、构造假设、比较理论、形成框架、寻找反证、不断迭代。

很多时候,它的能力是惊人的。

如果把这些工作完全交给一个人,甚至交给一个传统研究团队,其中相当一部分研究密度,在过去可能需要数月甚至更长时间才能达到。

但研究时间一长,一个问题开始越来越明显。

有些分课题,明明已经跑了几天,甚至经历了很多轮研究,看起来每天都有新的资料、新的分类、新的概念和新的结论,可重新回到最初的问题时,却突然发现:

好像还在那里。

知识越来越多。

结构越来越复杂。

研究编号越来越长。

但母问题并没有真正前进多少。

于是那天早上,我问了 AI 一个非常直接的问题:

“我长时间在做跨行业深度研究,发现最近的几个分课题,研究方法都有瑕疵,跑多少天还是在那里转圈,是平台的能力底线还是降智?”

这是一个带有情绪的问题。

但它后来引出了一个比“平台有没有降智”重要得多的问题:

我们究竟应该怎样认识 AI?

怎样认识平台能力?

怎样认识研究?

又怎样认识一个人在与 AI 长期协作以后真正得到的东西?

今天再回过头看,我越来越觉得:

这是一个值得记录的认知转折。



一、先承认一个事实:AI 很强,而且这种强已经不需要再证明


如果今天仍然只是把 AI 理解成“一个更好的搜索引擎”,其实已经严重低估了它。

它可以在极短时间进入一个陌生专业。

它能够连续查找几十个来源,阅读论文、政策、案例和技术资料;能够进行多跳检索;能够比较不同解释;能够发现前后矛盾;能够提出假设,再主动寻找反证。

更重要的是,它正在从:

\[ \text{Answering} \]

走向:

\[ \text{Acting} \]

也就是所谓 Agentic AI。

AI 不再只是回答一次问题。

它开始能够自己拆任务、调用工具、访问资料、调整搜索路径、修改文件、执行程序、持续观察结果,并在比较长的时间跨度内完成一个目标。

METR 从另一个角度测量了这种进步。

他们不是问模型能答多少道题,而是问:

一个任务如果交给一个熟练的人类,需要多长时间完成,那么 AI 能够以 50% 成功率独立完成多长时间跨度的任务?

研究显示,从 2019 年以来,前沿 AI Agent 的这一“任务时间跨度”大约每 7 个月翻一倍。这意味着 AI 能独立完成的任务,正在从秒、分钟不断向小时、甚至更长时间延伸。METR 同时强调,这种指标并不能自动等价为真实工作场景中的全面可靠性。

到了 2026 年,微软甚至已经推出 SentinelBench,开始专门研究一种过去几乎没有必要研究的问题:

如果 Agent 不是运行几分钟,而是运行几小时甚至更久,它怎样监控一个会不断变化的外部环境?

微软在介绍这一基准时引用 METR 的趋势指出,Agent 的 50% 任务时间跨度已经从 2019 年的大约几秒发展到 2026 年的十几个小时级别。

所以,如果有人今天仍然说:

AI 只是一个会说话的搜索框。

这个判断显然已经落后于现实。

AI 能力的大幅进步是真实的。

而且这种进步还远没有结束。



二、但真正困难的问题,恰恰出现在 AI 已经“很聪明”以后


这听起来有一点矛盾。

AI 越强,为什么我们反而越来越容易遇到它的不足?

原因可能很简单:

因为只有 AI 足够强以后,我们才开始把真正困难的问题交给它。

过去,我们让 AI 写一封邮件。

现在,我们让它研究一个行业。

过去,我们问一个事实。

现在,我们让它运行三天,比较几条理论路线,寻找一个可能根本不存在唯一答案的问题。

任务发生了变化。

因此暴露出来的能力边界也发生了变化。

2026 年发布的 DeepResearch Bench II 非常值得看。

这个 Benchmark 不再只看模型有没有找到一个答案,而是选取了 132 个跨 22 个领域的专业研究任务,再从专家撰写的研究报告中拆出 9430 个细粒度评价标准,分别检查:

信息召回、分析和表达。

结果是:

即便当时最强的 Deep Research 系统,能够满足的专家级评价标准仍然不到一半。

这个结果非常有启发性。

它并不是证明 AI “不行”。

恰恰相反。

它证明的是:

当评价标准从“有没有回答”提高到“有没有覆盖真正重要的证据、有没有做出足够好的分析、有没有形成专家级研究报告”以后,当前系统仍然存在明显能力空间。

所以那天我最后越来越确定的一点是:

\[ \boxed{\text{CAPABILITY FLOOR = REAL}} \]

能力边界是真实存在的。

承认这一点,并不是否定 AI。

就像承认一个极其优秀的人类研究者仍然有认知边界,并不是否认他的能力一样。

成熟的使用方式,从来不是假装边界不存在。

而是首先知道:

边界在哪里。



三、为什么我的研究甚至比 BrowseComp(浏览综合能力基准) 还难


这里还有一个很容易被忽略的问题。

我们经常会看到各种 Benchmark,说某个模型已经达到了多少分。

但 Benchmark 到底在测什么,非常重要。

OpenAI 的 BrowseComp 是一个非常难的网页研究基准。

它有 1266 个问题,很多问题需要在几十、甚至上百个网页中进行复杂搜索,拼接极其隐蔽的信息。

Deep Research 在这个测试上明显优于普通浏览模型。

但是 OpenAI 自己同时非常明确地指出一个重要限制:

BrowseComp 为了方便验证,刻意选择的是:

原则上存在一个唯一、稳定、简短正确答案的问题。

而现实用户的问题通常是开放式的。

OpenAI 因此也明确说,BrowseComp 上的表现与真实开放任务之间究竟能够多大程度相关,并不确定。

这句话对我非常重要。

因为我突然意识到:

我的很多研究任务,比 BrowseComp 更难的地方,并不是资料更难找。

而是:

根本没有一个预先存在的标准答案等着被找到。

我不是在问:

“这个答案藏在哪个网页?”

我实际上在不断问:

“这个问题到底应该怎么定义?”

“原来的研究对象是不是定义错了?”

“哪些证据是真的 Material Evidence,哪些只是信息更多?”

“现在形成的概念是真机制,还是我们为了理解现实而制造出来的概念?”

“成熟理论已经解释得很好,为什么还要创造新理论?”

“昨天的母命题是不是应该被推翻?”

“一个看来非常漂亮的框架,是不是实际上没有现实解释力?”

“这里究竟应该继续寻找证据,还是应该承认 UNKNOWN?”

甚至还要进一步问:

“是不是连问题本身都问错了?”

这时,研究已经不是:

\[ \text{Search}\rightarrow\text{Answer} \]

而变成:

\[ \text{Question Formation} \rightarrow \text{Evidence} \rightarrow \text{Interpretation} \rightarrow \text{Hypothesis} \rightarrow \text{Counterfactual} \rightarrow \text{Kill} \rightarrow \text{Reframe} \rightarrow \text{Question Formation Again} \]

也就是说:

形成研究问题、判断证据强弱、改变研究对象、改变理论结构,本身就是研究的一部分。

这类任务,对今天任何 AI 平台而言都更难。



四、More Agentic,不等于 Fully Reliable


这也是我对 AI 平台认知真正发生变化的地方。

AI Agent 越来越能够“自己做事情”。

但:\[ \boxed{ \text{More Agentic} \neq \text{Fully Reliable} } \]

自主性提高,并不自动意味着长期可靠性同步提高。

这两者不能混为一谈。

微软 2026 年对长周期委托任务的一项研究特别值得注意。

研究人员让模型对同一个信息对象进行连续多轮处理,结果发现,前沿模型可能产生稀疏但后果明显的错误,而且这些错误会随着连续迭代逐渐积累。

在他们设计的特定压力测试中,20 次委托迭代后,一些模型的信息保真度出现了明显下降。

但微软同时非常谨慎地指出:

这不是说 AI 没有实际价值。

实验是专门设计的长程压力测试;真实生产系统通常还会加入专用工具、验证机制、检索、记忆系统、编排以及人工监督,这些都会改变实际可靠性。

这正是我越来越认可的一种技术态度:

不要神化。

也不要因为发现局限就走向另一个极端。

Stanford 2026 AI Index 呈现的是同样复杂的画面。

一方面,Agent 能力在快速提升。

例如 OSWorld 这类真实计算机任务上的表现,在很短时间里出现了非常显著的跃升。

但另一方面,即使在结构相对明确的 Agent Benchmark 中,当前系统仍会出现大量失败;AI Index 同时提醒,很多传统 Benchmark 本身也越来越面临饱和、错误和评价失真的问题。


更进一步,2026 年的 OSWorld 2.0 开始把测试拉到真正的长周期现实工作流:108 个端到端任务,人类完成这些任务的中位时间约为 1.6 小时,有些 Agent 轨迹需要数百次工具调用。

即使最强系统,在严格的完整完成标准下仍然距离专业级可靠性很远。

研究者发现,失败已经不主要是最初那种“不会点按钮”,而越来越表现为:

忘记约束、遗漏中途到达的信息、没有恢复隐藏状态、猜测而不是询问、跳过验证。

这和长期研究中的体验何其相似。



五、长上下文,不等于长期记忆;信息都在,也不等于都被真正使用


这是另一个非常重要的认识。

现在很多模型支持极长上下文。

几十万 Token。

甚至更多。

于是我们很容易产生一种直觉:

既然所有历史都放进去了,模型就应该都记得。

但这两者并不是一回事。


早在 2023 年,《Lost in the Middle》就已经发现:

即使相关信息明确存在于长上下文中,模型能否正确利用它,也会受到这段信息所处位置的明显影响。

很多模型对上下文开头和结尾的信息利用得更好,而当关键信息埋在中间位置时,表现会明显下降。

RULER 又进一步扩大了问题。

它不再只做最简单的“针尖藏在草堆里”式检索,而是增加多信息、多跳追踪和聚合。

结果发现:

即使一些模型在简单 Needle-in-a-Haystack 测试上接近满分,随着上下文变长、任务复杂度增加,性能仍然可以大幅下降。

LongBench v2 则进一步把长上下文问题放入真实任务:

长文档、

多文档、

长对话历史、

代码仓库、

结构化数据。

它说明了同一件事情:

能够“放进去”,与能够“真正理解、推理并持续利用”之间,还有距离。

到了 2026 年,甚至已经出现了专门研究长期搜索中 Context Rot 的工作:上下文越来越多以后,即使资料没有消失,早先的目标、约束、证据和状态也可能逐渐丧失在后续搜索轨迹中的实际影响力。

所以:

\[ \text{Context Window} \neq \text{Working Memory} \]

进一步说:

\[ \text{Information Present} \neq \text{Information Effectively Used} \]

这对长期研究尤其重要。



六、这也解释了一个非常危险的研究幻觉:每一步都对,但最后走错了


长期研究最危险的地方,往往不是突然出现一个非常荒谬的错误。

那种错误反而容易发现。

真正危险的是:

每一步看起来都相当合理。

今天找到三篇论文。

合理。

明天根据论文增加两个变量。

合理。

后天发现一个案例,再建立一个子分类。

合理。

然后为了验证子分类,再增加一条研究支线。

也合理。

每一轮都有引用。

每一步都有解释。

每一次继续,都能说出理由。

于是研究不断产生:

新材料、

新概念、

新矩阵、

新编号、

新方法、

新 Evidence Gap。

整个过程看起来异常繁荣。

但很长时间以后突然回到母问题:

它到底解决了什么?

这时可能发现一个令人不舒服的事实:

\[ \text{Local Progress} \uparrow \]

并不意味着:

\[ \text{Global Progress} \uparrow \]

局部进展越来越多,

整体进展却可能越来越慢。

AI 并不需要犯一个“大错”,也可能产生这种结果。

只要每一轮相对于上一轮发生一点点目标漂移、问题漂移、概念扩张和证据重心偏移,长时间累积以后,就足以让整个研究偏离原始方向。

因此,AI 的能力边界很多时候并不是一道突然出现的墙。

它更像长期航行中的:

微小航向误差。

十公里看不出来。

一千公里以后,已经不在同一个地方。

这也是为什么我后来越来越强调:

回到母命题。

不是因为子问题不重要。

而是因为必须不断重新问:

这条研究支线还在为母问题服务吗?



七、但真正让我重新认识 AI 的,并不是它的不足


如果文章写到这里,很容易得到一个非常普通的结论:

AI 很强,但也会犯错,所以人要监督 AI。

这当然没错。

但我认为这远远不是这段经历真正有价值的地方。

真正让我重新认识 AI 的,是另外一件事:

AI 可以不断参与对它自己此前结论的拆解。

昨天,它和我一起建立了一个理论。

今天,我可以问:

这个理论真的有必要存在吗?

有没有成熟理论已经解释了?

是不是只不过重新命名?

有没有证据支持?

有没有反例?

它能够提出什么可证伪预测?

如果把这个理论整个删掉,现实解释力是否下降?

如果没有下降:

删掉。

一个研究框架花了几天才建立起来。

依然可以 Kill。

一个判断昨天还被认为非常重要。

找到更强证据以后:

可以降级。

一个曾经写得非常漂亮的概念:

可以直接退出研究主线。

我要特别强调:

这并不等于 AI 拥有和人一样的自我反思。

AI 没有人类意义上的“自我”。

更准确的说法是:

AI 让我们第一次拥有了一种成本极低、调用频率极高的 外部认知镜像。

它能够把已经形成的思考重新变成研究对象。

拿出来。

拆开。

攻击。

寻找反例。

重新搜索。

重新组合。

再判断。

这件事情对人的价值,可能比我们想象的大得多。



八、人其实非常难这样持续解剖自己


人会反思。

但真正持续、系统、高频率地反思自己的核心判断,并没有想象中那么容易。

因为人的思想从来不只是思想。

它同时和很多东西绑定:

专业经验。

身份。

地位。

自尊。

过去的成功。

过去公开发表过的观点。

投入过的时间。

团队关系。

组织利益。

甚至与“我是谁”绑定。

如果一个人研究了半年,建立了一套自己非常满意的理论。

现在有人告诉他:

也许它没有必要存在。

这不是简单的信息更新。

它意味着:

半年投入怎么办?

过去说过的话怎么办?

已经写完的文章怎么办?

自己的判断是不是错了?

因此:

沉没成本会进入认知。

身份会进入认知。

利益会进入认知。

情绪也会进入认知。

所以人经常并不是在纯粹判断一个命题是否正确。

而是在不知不觉中维护:

“过去的我为什么是正确的。”

AI 在这里提供了一种非常特殊的价值。

它可以一次又一次,不厌其烦地问:

为什么?

证据是什么?

还有其他解释吗?

你是在证明这个命题,还是在保护这个命题?

如果完全反过来,会怎样?

如果不允许使用你已经形成的理论名称,现实还能不能解释?

如果把这个概念删除,损失什么?

它不一定每次都问得对。

但这种不断外部化的认知压力,本身就很珍贵。

我越来越觉得:

AI 对知识工作的重大贡献之一,可能并不是答案生产。

而是:

\[ \boxed{ \text{Low-cost Cognitive Opposition} } \]

一种低成本、可持续的认知对抗能力。



九、接受平台不足,并不是降低标准


这是我这次认知变化中非常重要的一点。

过去很容易落入两个极端。

第一个极端:

AI 已经这么强,所以它应该最终替我找到正确答案。

第二个极端:

AI 会循环、会遗忘、会漂移,所以这个平台不可靠。

现在我越来越认为:

这两个判断都过于简单。

成熟的 AI 使用者最终必须接受一个表面矛盾、其实完全可以同时成立的事实:

AI 可以极其强大。

AI 又可以并不完全可靠。

两件事情完全不矛盾。

一个顶级研究者也会犯错。

一个世界一流工程师也不能保证每一次工程决策正确。

复杂系统本来就不存在:

\[ 100\% \text{ Capability} = 100\% \text{ Reliability} \]

所以真正值得研究的问题已经不再是:

“AI 靠不靠谱?”

这个问题太粗糙。

应该变成:

在哪种任务上可靠?

在多长时间范围内可靠?

在什么证据结构下可靠?

什么层级的判断可以交给 AI?

什么责任不能外包?

什么结果必须重新验证?

什么任务必须定期回到原始目标重新对齐?

这其实已经从:

模型能力问题

变成了:

人机认知分工问题。

NIST 的 AI Risk Management Framework 其实也是类似思想。

它没有假定一个 AI 系统通过一次测试就永久“可信”。

它把 AI 风险管理设计成持续过程:

\[ \text{Govern} \rightarrow \text{Map} \rightarrow \text{Measure} \rightarrow \text{Manage} \]

而且明确强调,测量和风险管理需要随着知识、方法、风险以及使用环境的变化不断更新。

这可能也是我们理解 AI 平台最成熟的方式:

可靠性不是一个标签。

可靠性是一种持续治理状态。



十、我开始重新理解“研究成果”到底是什么


这次反思最后慢慢超出了 AI。

它开始让我重新理解:

研究到底是在生产什么?

传统意义上,我们非常容易把研究成果理解成:

一篇论文。

一份报告。

一个理论。

一个框架。

一个结论。

一个模型。

当然,这些都很重要。

对于工程、商业和现实决策而言:

结果尤其重要。

一个系统是不是能运行,

一个商业模式是不是赚钱,

一个政策是不是改善现实,

一个机制是不是产生真实效果,

最终都必须由结果验证。

所以,我绝不是想说:

过程比结果重要,因此结果可以不重要。

恰恰相反。

现实世界仍然必须:

\[ \text{Outcome Verified} \]

但是对于一个长期研究者而言,还有另外一层东西经常被低估。

今天认为正确的一个理论,

三个月以后可能被反证。

今天非常满意的一张框架图,

两年以后可能只剩一条关系还成立。

今天找到的一个最佳实践,

环境变化以后可能立刻失效。

今天所谓“正确答案”,

很可能只是当时证据条件下最合理的判断。

如果一个研究者的全部价值都来自这些静态结果,那么研究资产的折旧速度可能比想象中更快。

但在研究过程中,还有另外一种东西在不断积累。



十一、真正复利的,是判断能力


长期研究留下来的东西包括:

什么问题值得问。

什么问题看似重要,其实是假问题。

什么证据足以改变结论。

什么只是信息更多,却没有提高判断质量。

什么时候应该继续搜索。

什么时候继续搜索只是逃避判断。

什么时候应该建立理论。

什么时候应该优先使用成熟理论。

什么时候应该继续验证。

什么时候必须 Kill。

什么时候 Evidence Gap 是真正重要的缺口。

什么时候缺一份数据根本不会改变判断。

什么时候应该明确写:

UNKNOWN。

什么时候应该写:

NO JUDGMENT。

什么时候应该承认:

现在不能得出结论。

什么时候应该:

回到母命题。

这些东西不会因为某一个结论被推翻就消失。

恰恰相反。

每一次真正发生过的:

错误、

失败、

反证、

推翻、

路径修正,

都会进入下一次判断。

于是我开始越来越愿意把研究写成:

\[ \boxed{ \text{Research} = \text{Knowledge Production} + \text{Judgment Formation} } \]

前者在生产知识。

后者在生产:

研究者。

长期看,第二项甚至可能更加重要。

因为:

一篇研究报告只能解决一个时期的一个问题。

而一个真正形成了判断力的人:

可以解决未来很多还没有出现的问题。

所以我越来越认可一句话:

研究最大的产品,不一定是研究成果。

研究也在生产研究者本人。


十二、AI 时代,这一点会变得更加重要


因为未来一个趋势已经越来越清楚:

“得到答案”的成本,会越来越低。

过去花一天搜资料。

未来可能一分钟。

过去花一个星期做行业梳理。

未来可能几个小时。

过去一个研究团队才能完成的初步 Evidence Map,

未来一个人加 AI 就可以完成。

于是,当“答案生产”的边际成本不断下降以后,

真正稀缺的东西就会发生变化。

未来更加重要的问题可能不是:

“你知不知道?”

而是:

“你为什么相信?”

不是:

“AI 给了什么答案?”

而是:

“你有没有能力判断这个答案是否值得相信?”

不是:

“你搜到了多少信息?”

而是:

“什么信息足以改变你的决策?”

不是:

“你是否形成了一套完整理论?”

而是:

“如果出现反证,你敢不敢把它推翻?”

知识生产能力越来越廉价。

于是:

\[ \boxed{ \text{Judgment} } \]

反而越来越稀缺。



十三、不确定性,也必须重新理解


这又带出了另外一个非常重要的问题。

过去,我们通常天然把“不确定”理解成负面状态。

不知道。

没结论。

证据不足。

所以自然产生一种心理冲动:

赶紧把 UNKNOWN 消灭。

AI 又特别容易强化这种冲动。

因为:

只要继续问,

它通常还能继续回答。

继续生成原因。

继续提出假设。

继续增加机制。

继续找到论文。

继续找到案例。

继续制造一个看起来越来越完整的解释。

于是一个极其危险的现象出现了:

语言仍然可以继续,但证据已经停止。

模型还在回答。

不等于知识仍在增加。

报告还在变长。

不等于判断仍在变好。

研究还在继续。

不等于问题仍值得继续。

所以我越来越认为:

真正成熟的研究能力之一,就是保护 UNKNOWN。

UNKNOWN 不应该被当作研究失败。

它可以是一个极其严肃的研究结果。

有些时候:

\[ \boxed{ \text{No Judgment} } \]

本身就是最正确的判断。

因为没有足够证据的时候,

不判断,比制造一个判断更高级。



十四、但更重要的是:不确定性并不只代表风险


这里还有一个更深的认知变化。

我们习惯把不确定性和风险放在一起。

确实如此。

UNKNOWN 可能意味着:

原来的判断错了。

商业模式跑不通。

机制不存在。

理论会被证伪。

新的证据会推翻当前结论。

这是:

\[ \text{Downside Uncertainty} \]

但另外一面经常被忽略。

UNKNOWN 还可能意味着:

我们还没有找到真正决定结果的变量。

原来的问题定义错了。

三个看起来毫不相关的现象,其实来自同一个更底层机制。

原本很小的市场背后,其实存在一个更大的需求结构。

原本认为只是例外的现象,可能代表一个正在出现的新规律。

原本失败的路径,可能暴露了一个过去没有人真正解决的现实问题。

这是:

\[ \text{Upside Uncertainty} \]

所以:

\[ \boxed{ \text{Uncertainty} \neq \text{Negative} } \]

不确定性更准确的定义可能是:

尚未展开的可能世界。

其中一些世界是坏的。

一些是好的。

一些意味着我们错了。

一些意味着机会比我们原先想象得更大。

真正优秀的研究,并不是尽快把这些可能性压缩成一个让自己安心的答案。

而是:

不断排除不成立的世界,同时保留那些仍然值得继续探索的可能世界。

这是一种完全不同的研究心态。



十五、于是我开始重新理解 AI 平台


回到最初那个问题:

“是不是平台降智了?”

今天我不会再轻易这样问。

不是因为平台没有问题。

而是因为这个问题已经不够精确。

更准确的问题应该是:

这是模型本身的能力边界?

是长上下文利用问题?

是长期 Agent 轨迹漂移?

是检索过程中证据权重失衡?

是研究方法本身造成了循环?

还是我自己没有及时停止一个已经没有信息增益的研究方向?

甚至还可能是:

这几种因素同时存在。

这与人的工作其实一样。

一个项目失败,我们也不能简单归因:

“这个人能力不行。”

真正的分析必须拆开:

任务难度,

目标定义,

能力,

流程,

组织,

信息,

激励,

工具,

环境,

监督,

反馈。

AI 也一样。

平台不是一个神秘的整体。

它同样是一个复杂系统。



十六、真正成熟的平台认知,是既不神化,也不失望


所以现在,如果再让我评价 AI,我越来越不会问:

AI 到底行不行?

这个问题已经过于粗糙。

我更愿意连续问:

它在哪里明显比我强?

在哪里我必须怀疑它?

什么工作最适合被它放大?

什么判断不能外包?

什么结果必须真实验证?

什么长期任务必须设置重新归位机制?

怎么让它不断挑战我的思考,而不是不断确认我的思考?

怎样让 AI 帮我看到自己的盲点,而不是替我制造更高级的确定性幻觉?

这时,AI 的定位也开始发生变化。

它不再只是:

工具。

它也不是:

权威。

甚至不完全只是:

助手。

我现在更愿意把它理解成:

一种能够持续扩大观察范围、搜索空间、假设空间、反证能力和认知迭代速度的外部认知系统。

它会犯错。

会遗忘。

会漂移。

会循环。

会非常认真地研究一个实际上并不重要的问题。

也会在某一刻提出一个让我重新思考几个月研究的问题。

这些情况都真实存在。

不需要为了认可它的优势而否认缺点。

也不需要因为看到它的缺点,就否认那些巨大优势。

成熟本身可能就意味着:

同时容纳这两个事实。



十七、AI 真正改变的,也许不是答案,而是人与知识的关系


这是我最后觉得最值得记录的一层。

最初使用 AI 时,我希望:

更快得到答案。

后来,我希望:

得到更好的答案。

再后来,我开始希望:

获得过去我一个人很难拥有的研究能力。

但现在,我越来越觉得:

AI 对我最大的改变,也许不是它让我拥有了多少答案。

而是:

它让我越来越难轻易相信一个答案。

包括它给我的答案。

也包括:

我自己的答案。


这是非常重要的变化。

因为人最危险的状态,并不是不知道。

而是:

非常确定地知道一个错误的东西。


真正的研究成熟,也许并不是知道得越来越多。

而是在知道越来越多以后,仍然能够保持:

可修正性。

我可以今天认为 A。

明天出现更强证据以后认为 B。

而不需要花大量精力证明:

“其实昨天的 A 也没有错。”

这种能力极其珍贵。



十八、一个人很难每天几十次推翻自己,但 AI 让这件事第一次变得可规模化


这也许是 AI 最容易被忽略的一种生产力。

以前所谓“反思”,通常是一种低频活动。

一个项目结束以后反思。

一个阶段结束以后总结。

一年以后复盘。

但在 AI 辅助研究中,

理论上我们可以把反思变成:

实时过程。

提出命题以后马上攻击。

形成框架以后马上找反例。

形成判断以后马上做反事实。

找到支持证据以后主动找反证。

每完成一个研究支线以后重新问:

它有没有改变母命题?

如果没有:

为什么继续?

这种认知迭代速度,是过去非常难实现的。

所以 AI 也许不仅提高了:

\[ \text{Knowledge Productivity} \]

它还可能提高:

\[ \boxed{ \text{Self-Correction Productivity} } \]

自我修正的生产率。

如果这是成立的,那么它的意义可能比单纯节省多少小时更加深远。



十九、所以,我现在更看重研究中的“成长资产”


今天再重新评价这些长期研究,我越来越不会只问:

最终发表了多少文章?

形成了多少理论?

完成了多少报告?

这些当然重要。

但我也会问:

经过这几个月以后,

我判断 Evidence 的能力是不是提高了?

是不是比以前更敢于 Kill 一个自己投入很多的方向?

是不是更能区分 FACT、INFERENCE、HYPOTHESIS 和 UNKNOWN?

是不是更少被漂亮概念吸引?

是不是更快发现研究开始进入循环?

是不是更愿意返回现实问题?

是不是越来越能区分“信息很多”和“证据足够”?

是不是越来越能够接受“不知道”?

如果这些能力提高了,

那么即使某一个最终结论后来被推翻,

研究仍然没有白做。

因为研究过程中形成了一种可以进入下一轮问题的能力。

这就是:

\[ \boxed{ \text{Growth Asset} } \]

它不像一篇报告那么容易展示。

却可能拥有更长的半衰期。



二十、结果仍然重要,但结果与成长不是二选一


所以我要特别把这件事情讲清楚。

说“研究过程中的成长很重要”,绝不意味着:

研究结果不重要。


这不是一句“过程比结果重要”的安慰话。

如果是现实项目:

钱有没有赚到,

项目有没有成功,

系统有没有运行,

政策有没有产生效果,

工程有没有真正解决问题,

这些都必须看结果。

不能因为过程很努力,就宣布成功。

但是长期研究存在另外一个时间尺度。

单次研究看:

\[ \text{Outcome} \]

非常重要。

长期看:

\[ \text{Outcome} + \text{Capability Growth} \]

可能才是完整收益。

因此,更准确的表达不是:

“过程比结果重要。”

而是:

“结果决定这一次研究解决了什么;成长决定未来还有多少问题你有能力解决。”

这两者不是冲突关系。


而是不同时间尺度上的价值。



二十一、这可能也是 AI 时代人真正应该守住的位置


随着 AI 越来越强,一个很自然的问题会出现:

如果 AI 能搜索、

能推理、

能写作、

能编码、

能研究,

人还剩下什么?

我现在越来越不愿意把答案写成某一个固定能力。

因为技术还会继续发展。

今天认为人独有的某一种技能,明天 AI 可能又取得明显进步。

更稳健的答案可能是:

人必须越来越承担对整个认知过程的最终责任。

不是每个答案都亲自生产。

而是决定:

什么问题值得解决。

什么证据可以进入判断。

什么风险能够接受。

什么时候应该继续。

什么时候应该停止。

什么时候应该让 AI 做。

什么时候必须由人接管。

什么结果可以影响真实世界。

什么结果现在只能继续保持为假设。

这是一种:

\[ \boxed{ \text{Epistemic Responsibility} } \]

认知责任。

AI 可以极大放大认知能力。

但放大能力之后,

最终仍然需要有人承担:

判断的责任。



结语:最后真正被改变的,是研究者自己


所以,当我今天再回头看那句:

“是不是平台的能力底线还是降智?”

我觉得真正有价值的已经不是答案。

答案当然重要。

平台确实存在能力边界。

长上下文确实不等于稳定利用全部历史。

长周期 Agent 也确实存在可靠性和轨迹漂移问题。

Benchmark 与真实开放研究之间同样存在距离。

这些都是真实问题。

也必须继续被技术解决。

但比这些更加重要的是:

我对 AI 的期待发生了变化。

一开始,我希望 AI 帮我更快找到答案。

后来,我希望它帮我找到更好的答案。

再后来,我开始意识到:

也许它最大的价值之一,是让我越来越难轻易相信自己的答案。

这不是退步。

恰恰相反。

一个人开始真正能够说:

“我不知道。”

“这里没有足够证据。”

“昨天的判断可能错了。”

“这个理论没有必要存在。”

“这条研究支线应该结束。”

“这个问题可能本身就问错了。”

同时又不会因此失去行动能力,

我认为,这才是研究真正成熟的开始。


AI 给我们的,可能是一种前所未有的知识生产能力。

但它也迫使我们学习另外一门以前没有如此重要的能力:

如何与一个极其聪明、极其高效,却又并不永远可靠的认知系统长期相处。

不神化。

不轻视。

不盲从。

也不因为一次失败就否定它。

知道它强在哪里。

知道它弱在哪里。

让它做它擅长的事情。

同时守住最终判断。

接受它的局限,

也接受自己的局限。

然后利用两者之间不断产生的摩擦,

逼迫自己的认识继续前进。


也许 AI 最深刻的意义,从来就不是替人类消灭不确定性。

恰恰相反。

它可能让我们第一次能够以如此低的成本,

持续面对自己的不确定性。

而不确定性并不只意味着危险。

它意味着错误的可能。

也意味着新的可能。

意味着旧理论可能倒下。

也意味着新的世界可能打开。

真正成熟的研究者,并不是拥有越来越多永远正确的答案。

而是拥有越来越强的能力:

面对复杂世界,仍然保持判断;

面对新的证据,仍然能够修改自己;

面对未知,既不急于制造答案,也不因此停止行动;

面对 AI,既充分使用它的力量,也不把自己的判断交出去。

最终,一次研究最重要的成果,也许是一份报告。

也许是一个新的理论。

也许是一项现实决策。

但如果把时间拉得足够长,

我越来越相信,

还有一种成果更加持久:

研究本身改变了研究者。

AI 最后真正帮助生产的,

也许不仅是更多内容、更多报告、更多答案。

而是:

\[ \boxed{\text{A Better Thinker}} \]

一个比昨天更好的思考者。



后记:我现在怎样重新理解“AI 平台”


今天,我已经很难再用“好不好用”“聪不聪明”“有没有降智”这样的单一尺度评价一个 AI 平台。

我更愿意把平台能力拆成几个不同的问题。

它能够看多远?

能够连续工作多久?

能够记住多少?

能够真正使用多少已经存在的信息?

能够多稳定地保持一个目标?

能够在什么情况下知道自己不知道?

能够接受多少来自人的纠正?

能不能真正回到此前的错误并重新审查?

面对一个没有唯一答案的问题,它是在继续制造答案,还是能够帮助我们维持必要的不确定性?

这些问题没有一个能够只靠一个 Benchmark 回答。

而且答案还会随着模型、工具、上下文架构、Agent 编排以及使用方式不断改变。

所以,对 AI 平台真正成熟的认知,也许本来就不应该是一个固定结论。

它也应该是一种:

\[ \boxed{ \text{Continuous Evaluation} } \]

持续评价。

就像研究本身。



写给自己的最后一句话

认可 AI 的优势,并不要求我否认它的不足。

接受平台的不足,也并不意味着降低对结果的要求。

真正值得争取的,不是一个永远不会犯错的 AI。

至少在今天,更现实也更重要的是:

人与 AI 在不断发现错误、纠正错误、形成新判断的过程中,能不能共同构成一个比单独的人、也比单独的 AI 更强的认知系统。

如果答案是可以,

那么我们今天面对的,

可能就不只是一次工具升级。

而是一种新的学习方式、

新的研究方式,

以及最终——

一种新的成长方式。



资料说明

本文关于当前 AI 能力与边界的事实判断,主要交叉参考了 DeepResearch Bench II、OpenAI BrowseComp、METR Time Horizon、Microsoft SentinelBench 与长周期委托可靠性研究、Lost in the Middle、RULER、LongBench v2、OSWorld/OSWorld 2.0、Stanford AI Index 2026 与 NIST AI RMF 等公开研究。它们共同支持的并不是“AI 不可靠”这样一个简单结论,而是更细致的判断:能力快速增长是真实的;不同任务上的可靠性差异也是真实的;长上下文、长轨迹、开放式研究以及现实执行仍然是重要的前沿难题。


【声明】内容源于网络
0
0
建设产业互联网
建设 行业数字化(城市IP研究与转化);文创及文旅新生活方式;一人公司(AI)装配式装修家具化
内容 846
粉丝 0
建设产业互联网 建设 行业数字化(城市IP研究与转化);文创及文旅新生活方式;一人公司(AI)装配式装修家具化
总阅读7.5k
粉丝0
内容846