接受 AI 的优势,也接受平台的不足。
真正成熟的人机关系,不是相信 AI 永远正确,也不是因为它犯错就否定它。
更重要的是,在一次次与 AI 共同研究、质疑、推翻和重建的过程中,我们有没有变成一个比过去更好的思考者。
写在前面:我为什么突然开始怀疑这个平台
最近一段时间,我一直在做跨行业、跨学科、长周期的深度研究。
研究范围越来越广,研究链条越来越长。
有些问题从城市更新进入组织能力,从组织能力进入产业工人,再进入企业边界、交易成本、人力资本、组织学习;有些问题从建筑生命周期进入数据、Authority、Evidence、治理,再进入商业模式。
AI 在其中承担了非常多的工作:
检索资料、阅读论文、寻找案例、构造假设、比较理论、形成框架、寻找反证、不断迭代。
很多时候,它的能力是惊人的。
如果把这些工作完全交给一个人,甚至交给一个传统研究团队,其中相当一部分研究密度,在过去可能需要数月甚至更长时间才能达到。
但研究时间一长,一个问题开始越来越明显。
有些分课题,明明已经跑了几天,甚至经历了很多轮研究,看起来每天都有新的资料、新的分类、新的概念和新的结论,可重新回到最初的问题时,却突然发现:
好像还在那里。
知识越来越多。
结构越来越复杂。
研究编号越来越长。
但母问题并没有真正前进多少。
于是那天早上,我问了 AI 一个非常直接的问题:
“我长时间在做跨行业深度研究,发现最近的几个分课题,研究方法都有瑕疵,跑多少天还是在那里转圈,是平台的能力底线还是降智?”
这是一个带有情绪的问题。
但它后来引出了一个比“平台有没有降智”重要得多的问题:
我们究竟应该怎样认识 AI?
怎样认识平台能力?
怎样认识研究?
又怎样认识一个人在与 AI 长期协作以后真正得到的东西?
今天再回过头看,我越来越觉得:
这是一个值得记录的认知转折。
一、先承认一个事实:AI 很强,而且这种强已经不需要再证明
如果今天仍然只是把 AI 理解成“一个更好的搜索引擎”,其实已经严重低估了它。
它可以在极短时间进入一个陌生专业。
它能够连续查找几十个来源,阅读论文、政策、案例和技术资料;能够进行多跳检索;能够比较不同解释;能够发现前后矛盾;能够提出假设,再主动寻找反证。
更重要的是,它正在从:
走向:
也就是所谓 Agentic AI。
AI 不再只是回答一次问题。
它开始能够自己拆任务、调用工具、访问资料、调整搜索路径、修改文件、执行程序、持续观察结果,并在比较长的时间跨度内完成一个目标。
METR 从另一个角度测量了这种进步。
他们不是问模型能答多少道题,而是问:
一个任务如果交给一个熟练的人类,需要多长时间完成,那么 AI 能够以 50% 成功率独立完成多长时间跨度的任务?
研究显示,从 2019 年以来,前沿 AI Agent 的这一“任务时间跨度”大约每 7 个月翻一倍。这意味着 AI 能独立完成的任务,正在从秒、分钟不断向小时、甚至更长时间延伸。METR 同时强调,这种指标并不能自动等价为真实工作场景中的全面可靠性。
到了 2026 年,微软甚至已经推出 SentinelBench,开始专门研究一种过去几乎没有必要研究的问题:
如果 Agent 不是运行几分钟,而是运行几小时甚至更久,它怎样监控一个会不断变化的外部环境?
微软在介绍这一基准时引用 METR 的趋势指出,Agent 的 50% 任务时间跨度已经从 2019 年的大约几秒发展到 2026 年的十几个小时级别。
所以,如果有人今天仍然说:
AI 只是一个会说话的搜索框。
这个判断显然已经落后于现实。
AI 能力的大幅进步是真实的。
而且这种进步还远没有结束。
二、但真正困难的问题,恰恰出现在 AI 已经“很聪明”以后
这听起来有一点矛盾。
AI 越强,为什么我们反而越来越容易遇到它的不足?
原因可能很简单:
因为只有 AI 足够强以后,我们才开始把真正困难的问题交给它。
过去,我们让 AI 写一封邮件。
现在,我们让它研究一个行业。
过去,我们问一个事实。
现在,我们让它运行三天,比较几条理论路线,寻找一个可能根本不存在唯一答案的问题。
任务发生了变化。
因此暴露出来的能力边界也发生了变化。
2026 年发布的 DeepResearch Bench II 非常值得看。
这个 Benchmark 不再只看模型有没有找到一个答案,而是选取了 132 个跨 22 个领域的专业研究任务,再从专家撰写的研究报告中拆出 9430 个细粒度评价标准,分别检查:
信息召回、分析和表达。
结果是:
即便当时最强的 Deep Research 系统,能够满足的专家级评价标准仍然不到一半。
这个结果非常有启发性。
它并不是证明 AI “不行”。
恰恰相反。
它证明的是:
当评价标准从“有没有回答”提高到“有没有覆盖真正重要的证据、有没有做出足够好的分析、有没有形成专家级研究报告”以后,当前系统仍然存在明显能力空间。
所以那天我最后越来越确定的一点是:
能力边界是真实存在的。
承认这一点,并不是否定 AI。
就像承认一个极其优秀的人类研究者仍然有认知边界,并不是否认他的能力一样。
成熟的使用方式,从来不是假装边界不存在。
而是首先知道:
边界在哪里。
三、为什么我的研究甚至比 BrowseComp(浏览综合能力基准) 还难
这里还有一个很容易被忽略的问题。
我们经常会看到各种 Benchmark,说某个模型已经达到了多少分。
但 Benchmark 到底在测什么,非常重要。
OpenAI 的 BrowseComp 是一个非常难的网页研究基准。
它有 1266 个问题,很多问题需要在几十、甚至上百个网页中进行复杂搜索,拼接极其隐蔽的信息。
Deep Research 在这个测试上明显优于普通浏览模型。
但是 OpenAI 自己同时非常明确地指出一个重要限制:
BrowseComp 为了方便验证,刻意选择的是:
原则上存在一个唯一、稳定、简短正确答案的问题。
而现实用户的问题通常是开放式的。
OpenAI 因此也明确说,BrowseComp 上的表现与真实开放任务之间究竟能够多大程度相关,并不确定。
这句话对我非常重要。
因为我突然意识到:
我的很多研究任务,比 BrowseComp 更难的地方,并不是资料更难找。
而是:
根本没有一个预先存在的标准答案等着被找到。
我不是在问:
“这个答案藏在哪个网页?”
我实际上在不断问:
“这个问题到底应该怎么定义?”
“原来的研究对象是不是定义错了?”
“哪些证据是真的 Material Evidence,哪些只是信息更多?”
“现在形成的概念是真机制,还是我们为了理解现实而制造出来的概念?”
“成熟理论已经解释得很好,为什么还要创造新理论?”
“昨天的母命题是不是应该被推翻?”
“一个看来非常漂亮的框架,是不是实际上没有现实解释力?”
“这里究竟应该继续寻找证据,还是应该承认 UNKNOWN?”
甚至还要进一步问:
“是不是连问题本身都问错了?”
这时,研究已经不是:
而变成:
也就是说:
形成研究问题、判断证据强弱、改变研究对象、改变理论结构,本身就是研究的一部分。
这类任务,对今天任何 AI 平台而言都更难。
四、More Agentic,不等于 Fully Reliable
这也是我对 AI 平台认知真正发生变化的地方。
AI Agent 越来越能够“自己做事情”。
但:\[ \boxed{ \text{More Agentic} \neq \text{Fully Reliable} } \]
自主性提高,并不自动意味着长期可靠性同步提高。
这两者不能混为一谈。
微软 2026 年对长周期委托任务的一项研究特别值得注意。
研究人员让模型对同一个信息对象进行连续多轮处理,结果发现,前沿模型可能产生稀疏但后果明显的错误,而且这些错误会随着连续迭代逐渐积累。
在他们设计的特定压力测试中,20 次委托迭代后,一些模型的信息保真度出现了明显下降。
但微软同时非常谨慎地指出:
这不是说 AI 没有实际价值。
实验是专门设计的长程压力测试;真实生产系统通常还会加入专用工具、验证机制、检索、记忆系统、编排以及人工监督,这些都会改变实际可靠性。
这正是我越来越认可的一种技术态度:
不要神化。
也不要因为发现局限就走向另一个极端。
Stanford 2026 AI Index 呈现的是同样复杂的画面。
一方面,Agent 能力在快速提升。
例如 OSWorld 这类真实计算机任务上的表现,在很短时间里出现了非常显著的跃升。
但另一方面,即使在结构相对明确的 Agent Benchmark 中,当前系统仍会出现大量失败;AI Index 同时提醒,很多传统 Benchmark 本身也越来越面临饱和、错误和评价失真的问题。
更进一步,2026 年的 OSWorld 2.0 开始把测试拉到真正的长周期现实工作流:108 个端到端任务,人类完成这些任务的中位时间约为 1.6 小时,有些 Agent 轨迹需要数百次工具调用。
即使最强系统,在严格的完整完成标准下仍然距离专业级可靠性很远。
研究者发现,失败已经不主要是最初那种“不会点按钮”,而越来越表现为:
忘记约束、遗漏中途到达的信息、没有恢复隐藏状态、猜测而不是询问、跳过验证。
这和长期研究中的体验何其相似。
五、长上下文,不等于长期记忆;信息都在,也不等于都被真正使用
这是另一个非常重要的认识。
现在很多模型支持极长上下文。
几十万 Token。
甚至更多。
于是我们很容易产生一种直觉:
既然所有历史都放进去了,模型就应该都记得。
但这两者并不是一回事。
早在 2023 年,《Lost in the Middle》就已经发现:
即使相关信息明确存在于长上下文中,模型能否正确利用它,也会受到这段信息所处位置的明显影响。
很多模型对上下文开头和结尾的信息利用得更好,而当关键信息埋在中间位置时,表现会明显下降。
RULER 又进一步扩大了问题。
它不再只做最简单的“针尖藏在草堆里”式检索,而是增加多信息、多跳追踪和聚合。
结果发现:
即使一些模型在简单 Needle-in-a-Haystack 测试上接近满分,随着上下文变长、任务复杂度增加,性能仍然可以大幅下降。
LongBench v2 则进一步把长上下文问题放入真实任务:
长文档、
多文档、
长对话历史、
代码仓库、
结构化数据。
它说明了同一件事情:
能够“放进去”,与能够“真正理解、推理并持续利用”之间,还有距离。
到了 2026 年,甚至已经出现了专门研究长期搜索中 Context Rot 的工作:上下文越来越多以后,即使资料没有消失,早先的目标、约束、证据和状态也可能逐渐丧失在后续搜索轨迹中的实际影响力。
所以:
进一步说:
这对长期研究尤其重要。
六、这也解释了一个非常危险的研究幻觉:每一步都对,但最后走错了
长期研究最危险的地方,往往不是突然出现一个非常荒谬的错误。
那种错误反而容易发现。
真正危险的是:
每一步看起来都相当合理。
今天找到三篇论文。
合理。
明天根据论文增加两个变量。
合理。
后天发现一个案例,再建立一个子分类。
合理。
然后为了验证子分类,再增加一条研究支线。
也合理。
每一轮都有引用。
每一步都有解释。
每一次继续,都能说出理由。
于是研究不断产生:
新材料、
新概念、
新矩阵、
新编号、
新方法、
新 Evidence Gap。
整个过程看起来异常繁荣。
但很长时间以后突然回到母问题:
它到底解决了什么?
这时可能发现一个令人不舒服的事实:
并不意味着:
局部进展越来越多,
整体进展却可能越来越慢。
AI 并不需要犯一个“大错”,也可能产生这种结果。
只要每一轮相对于上一轮发生一点点目标漂移、问题漂移、概念扩张和证据重心偏移,长时间累积以后,就足以让整个研究偏离原始方向。
因此,AI 的能力边界很多时候并不是一道突然出现的墙。
它更像长期航行中的:
微小航向误差。
十公里看不出来。
一千公里以后,已经不在同一个地方。
这也是为什么我后来越来越强调:
回到母命题。
不是因为子问题不重要。
而是因为必须不断重新问:
这条研究支线还在为母问题服务吗?
七、但真正让我重新认识 AI 的,并不是它的不足
如果文章写到这里,很容易得到一个非常普通的结论:
AI 很强,但也会犯错,所以人要监督 AI。
这当然没错。
但我认为这远远不是这段经历真正有价值的地方。
真正让我重新认识 AI 的,是另外一件事:
AI 可以不断参与对它自己此前结论的拆解。
昨天,它和我一起建立了一个理论。
今天,我可以问:
这个理论真的有必要存在吗?
有没有成熟理论已经解释了?
是不是只不过重新命名?
有没有证据支持?
有没有反例?
它能够提出什么可证伪预测?
如果把这个理论整个删掉,现实解释力是否下降?
如果没有下降:
删掉。
一个研究框架花了几天才建立起来。
依然可以 Kill。
一个判断昨天还被认为非常重要。
找到更强证据以后:
可以降级。
一个曾经写得非常漂亮的概念:
可以直接退出研究主线。
我要特别强调:
这并不等于 AI 拥有和人一样的自我反思。
AI 没有人类意义上的“自我”。
更准确的说法是:
AI 让我们第一次拥有了一种成本极低、调用频率极高的 外部认知镜像。
它能够把已经形成的思考重新变成研究对象。
拿出来。
拆开。
攻击。
寻找反例。
重新搜索。
重新组合。
再判断。
这件事情对人的价值,可能比我们想象的大得多。
八、人其实非常难这样持续解剖自己
人会反思。
但真正持续、系统、高频率地反思自己的核心判断,并没有想象中那么容易。
因为人的思想从来不只是思想。
它同时和很多东西绑定:
专业经验。
身份。
地位。
自尊。
过去的成功。
过去公开发表过的观点。
投入过的时间。
团队关系。
组织利益。
甚至与“我是谁”绑定。
如果一个人研究了半年,建立了一套自己非常满意的理论。
现在有人告诉他:
也许它没有必要存在。
这不是简单的信息更新。
它意味着:
半年投入怎么办?
过去说过的话怎么办?
已经写完的文章怎么办?
自己的判断是不是错了?
因此:
沉没成本会进入认知。
身份会进入认知。
利益会进入认知。
情绪也会进入认知。
所以人经常并不是在纯粹判断一个命题是否正确。
而是在不知不觉中维护:
“过去的我为什么是正确的。”
AI 在这里提供了一种非常特殊的价值。
它可以一次又一次,不厌其烦地问:
为什么?
证据是什么?
还有其他解释吗?
你是在证明这个命题,还是在保护这个命题?
如果完全反过来,会怎样?
如果不允许使用你已经形成的理论名称,现实还能不能解释?
如果把这个概念删除,损失什么?
它不一定每次都问得对。
但这种不断外部化的认知压力,本身就很珍贵。
我越来越觉得:
AI 对知识工作的重大贡献之一,可能并不是答案生产。
而是:
一种低成本、可持续的认知对抗能力。
九、接受平台不足,并不是降低标准
这是我这次认知变化中非常重要的一点。
过去很容易落入两个极端。
第一个极端:
AI 已经这么强,所以它应该最终替我找到正确答案。
第二个极端:
AI 会循环、会遗忘、会漂移,所以这个平台不可靠。
现在我越来越认为:
这两个判断都过于简单。
成熟的 AI 使用者最终必须接受一个表面矛盾、其实完全可以同时成立的事实:
AI 可以极其强大。
AI 又可以并不完全可靠。
两件事情完全不矛盾。
一个顶级研究者也会犯错。
一个世界一流工程师也不能保证每一次工程决策正确。
复杂系统本来就不存在:
所以真正值得研究的问题已经不再是:
“AI 靠不靠谱?”
这个问题太粗糙。
应该变成:
在哪种任务上可靠?
在多长时间范围内可靠?
在什么证据结构下可靠?
什么层级的判断可以交给 AI?
什么责任不能外包?
什么结果必须重新验证?
什么任务必须定期回到原始目标重新对齐?
这其实已经从:
模型能力问题
变成了:
人机认知分工问题。
NIST 的 AI Risk Management Framework 其实也是类似思想。
它没有假定一个 AI 系统通过一次测试就永久“可信”。
它把 AI 风险管理设计成持续过程:
而且明确强调,测量和风险管理需要随着知识、方法、风险以及使用环境的变化不断更新。
这可能也是我们理解 AI 平台最成熟的方式:
可靠性不是一个标签。
可靠性是一种持续治理状态。
十、我开始重新理解“研究成果”到底是什么
这次反思最后慢慢超出了 AI。
它开始让我重新理解:
研究到底是在生产什么?
传统意义上,我们非常容易把研究成果理解成:
一篇论文。
一份报告。
一个理论。
一个框架。
一个结论。
一个模型。
当然,这些都很重要。
对于工程、商业和现实决策而言:
结果尤其重要。
一个系统是不是能运行,
一个商业模式是不是赚钱,
一个政策是不是改善现实,
一个机制是不是产生真实效果,
最终都必须由结果验证。
所以,我绝不是想说:
过程比结果重要,因此结果可以不重要。
恰恰相反。
现实世界仍然必须:
但是对于一个长期研究者而言,还有另外一层东西经常被低估。
今天认为正确的一个理论,
三个月以后可能被反证。
今天非常满意的一张框架图,
两年以后可能只剩一条关系还成立。
今天找到的一个最佳实践,
环境变化以后可能立刻失效。
今天所谓“正确答案”,
很可能只是当时证据条件下最合理的判断。
如果一个研究者的全部价值都来自这些静态结果,那么研究资产的折旧速度可能比想象中更快。
但在研究过程中,还有另外一种东西在不断积累。
十一、真正复利的,是判断能力
长期研究留下来的东西包括:
什么问题值得问。
什么问题看似重要,其实是假问题。
什么证据足以改变结论。
什么只是信息更多,却没有提高判断质量。
什么时候应该继续搜索。
什么时候继续搜索只是逃避判断。
什么时候应该建立理论。
什么时候应该优先使用成熟理论。
什么时候应该继续验证。
什么时候必须 Kill。
什么时候 Evidence Gap 是真正重要的缺口。
什么时候缺一份数据根本不会改变判断。
什么时候应该明确写:
UNKNOWN。
什么时候应该写:
NO JUDGMENT。
什么时候应该承认:
现在不能得出结论。
什么时候应该:
回到母命题。
这些东西不会因为某一个结论被推翻就消失。
恰恰相反。
每一次真正发生过的:
错误、
失败、
反证、
推翻、
路径修正,
都会进入下一次判断。
于是我开始越来越愿意把研究写成:
前者在生产知识。
后者在生产:
研究者。
长期看,第二项甚至可能更加重要。
因为:
一篇研究报告只能解决一个时期的一个问题。
而一个真正形成了判断力的人:
可以解决未来很多还没有出现的问题。
所以我越来越认可一句话:
研究最大的产品,不一定是研究成果。
研究也在生产研究者本人。
十二、AI 时代,这一点会变得更加重要
因为未来一个趋势已经越来越清楚:
“得到答案”的成本,会越来越低。
过去花一天搜资料。
未来可能一分钟。
过去花一个星期做行业梳理。
未来可能几个小时。
过去一个研究团队才能完成的初步 Evidence Map,
未来一个人加 AI 就可以完成。
于是,当“答案生产”的边际成本不断下降以后,
真正稀缺的东西就会发生变化。
未来更加重要的问题可能不是:
“你知不知道?”
而是:
“你为什么相信?”
不是:
“AI 给了什么答案?”
而是:
“你有没有能力判断这个答案是否值得相信?”
不是:
“你搜到了多少信息?”
而是:
“什么信息足以改变你的决策?”
不是:
“你是否形成了一套完整理论?”
而是:
“如果出现反证,你敢不敢把它推翻?”
知识生产能力越来越廉价。
于是:
反而越来越稀缺。
十三、不确定性,也必须重新理解
这又带出了另外一个非常重要的问题。
过去,我们通常天然把“不确定”理解成负面状态。
不知道。
没结论。
证据不足。
所以自然产生一种心理冲动:
赶紧把 UNKNOWN 消灭。
AI 又特别容易强化这种冲动。
因为:
只要继续问,
它通常还能继续回答。
继续生成原因。
继续提出假设。
继续增加机制。
继续找到论文。
继续找到案例。
继续制造一个看起来越来越完整的解释。
于是一个极其危险的现象出现了:
语言仍然可以继续,但证据已经停止。
模型还在回答。
不等于知识仍在增加。
报告还在变长。
不等于判断仍在变好。
研究还在继续。
不等于问题仍值得继续。
所以我越来越认为:
真正成熟的研究能力之一,就是保护 UNKNOWN。
UNKNOWN 不应该被当作研究失败。
它可以是一个极其严肃的研究结果。
有些时候:
本身就是最正确的判断。
因为没有足够证据的时候,
不判断,比制造一个判断更高级。
十四、但更重要的是:不确定性并不只代表风险
这里还有一个更深的认知变化。
我们习惯把不确定性和风险放在一起。
确实如此。
UNKNOWN 可能意味着:
原来的判断错了。
商业模式跑不通。
机制不存在。
理论会被证伪。
新的证据会推翻当前结论。
这是:
但另外一面经常被忽略。
UNKNOWN 还可能意味着:
我们还没有找到真正决定结果的变量。
原来的问题定义错了。
三个看起来毫不相关的现象,其实来自同一个更底层机制。
原本很小的市场背后,其实存在一个更大的需求结构。
原本认为只是例外的现象,可能代表一个正在出现的新规律。
原本失败的路径,可能暴露了一个过去没有人真正解决的现实问题。
这是:
所以:
不确定性更准确的定义可能是:
尚未展开的可能世界。
其中一些世界是坏的。
一些是好的。
一些意味着我们错了。
一些意味着机会比我们原先想象得更大。
真正优秀的研究,并不是尽快把这些可能性压缩成一个让自己安心的答案。
而是:
不断排除不成立的世界,同时保留那些仍然值得继续探索的可能世界。
这是一种完全不同的研究心态。
十五、于是我开始重新理解 AI 平台
回到最初那个问题:
“是不是平台降智了?”
今天我不会再轻易这样问。
不是因为平台没有问题。
而是因为这个问题已经不够精确。
更准确的问题应该是:
这是模型本身的能力边界?
是长上下文利用问题?
是长期 Agent 轨迹漂移?
是检索过程中证据权重失衡?
是研究方法本身造成了循环?
还是我自己没有及时停止一个已经没有信息增益的研究方向?
甚至还可能是:
这几种因素同时存在。
这与人的工作其实一样。
一个项目失败,我们也不能简单归因:
“这个人能力不行。”
真正的分析必须拆开:
任务难度,
目标定义,
能力,
流程,
组织,
信息,
激励,
工具,
环境,
监督,
反馈。
AI 也一样。
平台不是一个神秘的整体。
它同样是一个复杂系统。
十六、真正成熟的平台认知,是既不神化,也不失望
所以现在,如果再让我评价 AI,我越来越不会问:
AI 到底行不行?
这个问题已经过于粗糙。
我更愿意连续问:
它在哪里明显比我强?
在哪里我必须怀疑它?
什么工作最适合被它放大?
什么判断不能外包?
什么结果必须真实验证?
什么长期任务必须设置重新归位机制?
怎么让它不断挑战我的思考,而不是不断确认我的思考?
怎样让 AI 帮我看到自己的盲点,而不是替我制造更高级的确定性幻觉?
这时,AI 的定位也开始发生变化。
它不再只是:
工具。
它也不是:
权威。
甚至不完全只是:
助手。
我现在更愿意把它理解成:
一种能够持续扩大观察范围、搜索空间、假设空间、反证能力和认知迭代速度的外部认知系统。
它会犯错。
会遗忘。
会漂移。
会循环。
会非常认真地研究一个实际上并不重要的问题。
也会在某一刻提出一个让我重新思考几个月研究的问题。
这些情况都真实存在。
不需要为了认可它的优势而否认缺点。
也不需要因为看到它的缺点,就否认那些巨大优势。
成熟本身可能就意味着:
同时容纳这两个事实。
十七、AI 真正改变的,也许不是答案,而是人与知识的关系
这是我最后觉得最值得记录的一层。
最初使用 AI 时,我希望:
更快得到答案。
后来,我希望:
得到更好的答案。
再后来,我开始希望:
获得过去我一个人很难拥有的研究能力。
但现在,我越来越觉得:
AI 对我最大的改变,也许不是它让我拥有了多少答案。
而是:
它让我越来越难轻易相信一个答案。
包括它给我的答案。
也包括:
我自己的答案。
这是非常重要的变化。
因为人最危险的状态,并不是不知道。
而是:
非常确定地知道一个错误的东西。
真正的研究成熟,也许并不是知道得越来越多。
而是在知道越来越多以后,仍然能够保持:
可修正性。
我可以今天认为 A。
明天出现更强证据以后认为 B。
而不需要花大量精力证明:
“其实昨天的 A 也没有错。”
这种能力极其珍贵。
十八、一个人很难每天几十次推翻自己,但 AI 让这件事第一次变得可规模化
这也许是 AI 最容易被忽略的一种生产力。
以前所谓“反思”,通常是一种低频活动。
一个项目结束以后反思。
一个阶段结束以后总结。
一年以后复盘。
但在 AI 辅助研究中,
理论上我们可以把反思变成:
实时过程。
提出命题以后马上攻击。
形成框架以后马上找反例。
形成判断以后马上做反事实。
找到支持证据以后主动找反证。
每完成一个研究支线以后重新问:
它有没有改变母命题?
如果没有:
为什么继续?
这种认知迭代速度,是过去非常难实现的。
所以 AI 也许不仅提高了:
它还可能提高:
自我修正的生产率。
如果这是成立的,那么它的意义可能比单纯节省多少小时更加深远。
十九、所以,我现在更看重研究中的“成长资产”
今天再重新评价这些长期研究,我越来越不会只问:
最终发表了多少文章?
形成了多少理论?
完成了多少报告?
这些当然重要。
但我也会问:
经过这几个月以后,
我判断 Evidence 的能力是不是提高了?
是不是比以前更敢于 Kill 一个自己投入很多的方向?
是不是更能区分 FACT、INFERENCE、HYPOTHESIS 和 UNKNOWN?
是不是更少被漂亮概念吸引?
是不是更快发现研究开始进入循环?
是不是更愿意返回现实问题?
是不是越来越能区分“信息很多”和“证据足够”?
是不是越来越能够接受“不知道”?
如果这些能力提高了,
那么即使某一个最终结论后来被推翻,
研究仍然没有白做。
因为研究过程中形成了一种可以进入下一轮问题的能力。
这就是:
它不像一篇报告那么容易展示。
却可能拥有更长的半衰期。
二十、结果仍然重要,但结果与成长不是二选一
所以我要特别把这件事情讲清楚。
说“研究过程中的成长很重要”,绝不意味着:
研究结果不重要。
这不是一句“过程比结果重要”的安慰话。
如果是现实项目:
钱有没有赚到,
项目有没有成功,
系统有没有运行,
政策有没有产生效果,
工程有没有真正解决问题,
这些都必须看结果。
不能因为过程很努力,就宣布成功。
但是长期研究存在另外一个时间尺度。
单次研究看:
非常重要。
长期看:
可能才是完整收益。
因此,更准确的表达不是:
“过程比结果重要。”
而是:
“结果决定这一次研究解决了什么;成长决定未来还有多少问题你有能力解决。”
这两者不是冲突关系。
而是不同时间尺度上的价值。
二十一、这可能也是 AI 时代人真正应该守住的位置
随着 AI 越来越强,一个很自然的问题会出现:
如果 AI 能搜索、
能推理、
能写作、
能编码、
能研究,
人还剩下什么?
我现在越来越不愿意把答案写成某一个固定能力。
因为技术还会继续发展。
今天认为人独有的某一种技能,明天 AI 可能又取得明显进步。
更稳健的答案可能是:
人必须越来越承担对整个认知过程的最终责任。
不是每个答案都亲自生产。
而是决定:
什么问题值得解决。
什么证据可以进入判断。
什么风险能够接受。
什么时候应该继续。
什么时候应该停止。
什么时候应该让 AI 做。
什么时候必须由人接管。
什么结果可以影响真实世界。
什么结果现在只能继续保持为假设。
这是一种:
认知责任。
AI 可以极大放大认知能力。
但放大能力之后,
最终仍然需要有人承担:
判断的责任。
结语:最后真正被改变的,是研究者自己
所以,当我今天再回头看那句:
“是不是平台的能力底线还是降智?”
我觉得真正有价值的已经不是答案。
答案当然重要。
平台确实存在能力边界。
长上下文确实不等于稳定利用全部历史。
长周期 Agent 也确实存在可靠性和轨迹漂移问题。
Benchmark 与真实开放研究之间同样存在距离。
这些都是真实问题。
也必须继续被技术解决。
但比这些更加重要的是:
我对 AI 的期待发生了变化。
一开始,我希望 AI 帮我更快找到答案。
后来,我希望它帮我找到更好的答案。
再后来,我开始意识到:
也许它最大的价值之一,是让我越来越难轻易相信自己的答案。
这不是退步。
恰恰相反。
一个人开始真正能够说:
“我不知道。”
“这里没有足够证据。”
“昨天的判断可能错了。”
“这个理论没有必要存在。”
“这条研究支线应该结束。”
“这个问题可能本身就问错了。”
同时又不会因此失去行动能力,
我认为,这才是研究真正成熟的开始。
AI 给我们的,可能是一种前所未有的知识生产能力。
但它也迫使我们学习另外一门以前没有如此重要的能力:
如何与一个极其聪明、极其高效,却又并不永远可靠的认知系统长期相处。
不神化。
不轻视。
不盲从。
也不因为一次失败就否定它。
知道它强在哪里。
知道它弱在哪里。
让它做它擅长的事情。
同时守住最终判断。
接受它的局限,
也接受自己的局限。
然后利用两者之间不断产生的摩擦,
逼迫自己的认识继续前进。
也许 AI 最深刻的意义,从来就不是替人类消灭不确定性。
恰恰相反。
它可能让我们第一次能够以如此低的成本,
持续面对自己的不确定性。
而不确定性并不只意味着危险。
它意味着错误的可能。
也意味着新的可能。
意味着旧理论可能倒下。
也意味着新的世界可能打开。
真正成熟的研究者,并不是拥有越来越多永远正确的答案。
而是拥有越来越强的能力:
面对复杂世界,仍然保持判断;
面对新的证据,仍然能够修改自己;
面对未知,既不急于制造答案,也不因此停止行动;
面对 AI,既充分使用它的力量,也不把自己的判断交出去。
最终,一次研究最重要的成果,也许是一份报告。
也许是一个新的理论。
也许是一项现实决策。
但如果把时间拉得足够长,
我越来越相信,
还有一种成果更加持久:
研究本身改变了研究者。
AI 最后真正帮助生产的,
也许不仅是更多内容、更多报告、更多答案。
而是:
一个比昨天更好的思考者。
后记:我现在怎样重新理解“AI 平台”
今天,我已经很难再用“好不好用”“聪不聪明”“有没有降智”这样的单一尺度评价一个 AI 平台。
我更愿意把平台能力拆成几个不同的问题。
它能够看多远?
能够连续工作多久?
能够记住多少?
能够真正使用多少已经存在的信息?
能够多稳定地保持一个目标?
能够在什么情况下知道自己不知道?
能够接受多少来自人的纠正?
能不能真正回到此前的错误并重新审查?
面对一个没有唯一答案的问题,它是在继续制造答案,还是能够帮助我们维持必要的不确定性?
这些问题没有一个能够只靠一个 Benchmark 回答。
而且答案还会随着模型、工具、上下文架构、Agent 编排以及使用方式不断改变。
所以,对 AI 平台真正成熟的认知,也许本来就不应该是一个固定结论。
它也应该是一种:
持续评价。
就像研究本身。
写给自己的最后一句话
认可 AI 的优势,并不要求我否认它的不足。
接受平台的不足,也并不意味着降低对结果的要求。
真正值得争取的,不是一个永远不会犯错的 AI。
至少在今天,更现实也更重要的是:
人与 AI 在不断发现错误、纠正错误、形成新判断的过程中,能不能共同构成一个比单独的人、也比单独的 AI 更强的认知系统。
如果答案是可以,
那么我们今天面对的,
可能就不只是一次工具升级。
而是一种新的学习方式、
新的研究方式,
以及最终——
一种新的成长方式。
资料说明
本文关于当前 AI 能力与边界的事实判断,主要交叉参考了 DeepResearch Bench II、OpenAI BrowseComp、METR Time Horizon、Microsoft SentinelBench 与长周期委托可靠性研究、Lost in the Middle、RULER、LongBench v2、OSWorld/OSWorld 2.0、Stanford AI Index 2026 与 NIST AI RMF 等公开研究。它们共同支持的并不是“AI 不可靠”这样一个简单结论,而是更细致的判断:能力快速增长是真实的;不同任务上的可靠性差异也是真实的;长上下文、长轨迹、开放式研究以及现实执行仍然是重要的前沿难题。

