大数跨境

一边像博士,一边像小学生:这才是2026年的真实AI

一边像博士,一边像小学生:这才是2026年的真实AI 卢山说AI精进
2026-09-30
3
导读:企业AI转型真正难的不是“买什么模型”,而是重新设计人与AI之间的分工。

左手商业.右手AI

有故事.有方法.有工具

2026年9月30日

2026年第273篇,总第1352篇原创文章

全文2738字,阅读时间约8分钟



如果你想真正看懂2026年的人工智能,斯坦福大学发布的《2026 人工智能指数报告》,几乎是一份绕不开的年度报告。



这不是一份单纯讨论“大模型谁更强”的技术报告,而是一份试图回答更大问题的年度观察:人工智能的技术能力发展到了什么程度?钱正在流向哪里?企业到底用得怎么样?AI正在怎样改变工作、科学、医疗和教育?各国政府如何应对?普通人又怎么看待这场变化?


《AI Index》由斯坦福大学以人为本人工智能研究院(Stanford HAI)组织编制,自2017年以来持续跟踪人工智能的发展。2026年报告由AI Index指导委员会及来自学术界、产业界的专家共同参与,报告同时提供公开数据和互动工具。斯坦福将其定位为面向政策制定者、研究人员、企业管理者和公众的综合性、数据驱动的AI年度观察。 【来源:Stanford HAI】


更重要的是,这份报告的观察范围已经越来越广。2026年报告分为9个主题:研究与开发、技术性能、负责任AI、经济、科学、医疗、教育、政策与治理、公众舆论。换句话说,它关注的已经不只是“AI能不能做得更好”,而是AI进入真实世界以后,正在发生什么。而这也正是我想做这个系列的原因。


很多人面对AI信息有一种典型状态:每天都在看到新闻,却越来越看不懂AI。


今天是某个模型刷新榜单,明天是某家公司融资数十亿美元,后天又出现AI裁员、AI智能体、AI机器人、AI医疗……信息越来越多,但脑子里的“地图”却没有建立起来。


所以,我准备把这份报告拆成一个系列,系列名称就叫:《2026 AI大变局:读懂人工智能指数报告》


整个系列一共9篇,不追求把报告重新翻译一遍,而是沿着一条认知升级路径,把“报告解读”逐渐变成一张属于普通人的“AI时代认知地图”。


在上一篇文章里(点击阅读:中美AI已经没有代差,真正的差距还剩什么?),这篇聊聊真实的AI能力,其实一边是“海水”,一边是“火焰”。



一个AI可以解决复杂的数学问题、写程序、分析论文,甚至开始帮助科学家做研究,却可能在一些人类觉得并不复杂的任务上犯下低级错误。听起来有些矛盾,但这恰恰是理解2026年人工智能最重要的一把钥匙。


在上一篇《中美AI已经没有代差,真正的差距还剩什么?》里,我们讨论了中美领先模型性能差距正在明显缩小。但模型排行榜不断上涨,很容易给普通人造成另一个错觉:既然AI已经这么强,是不是意味着它正在全面接近甚至超过人类?斯坦福《2026 AI Index Report》给出的答案远比“是”或者“不是”复杂。今天AI最典型的特征,不是简单意义上的“越来越聪明”,而是能力边界正在以前所未有的速度向外扩张,同时依然存在大量令人意外的短板。


【报告发现】AI的能力边界,正在快速向外推


先看AI究竟变强了多少。斯坦福报告指出,在国际数学奥林匹克竞赛IMO上,2025年Google DeepMind的Gemini Deep Think和OpenAI的实验性推理模型都达到了金牌水平。这是一个很有象征意义的节点,因为IMO并不是简单的知识问答,而是要求解决从未见过的高难度数学问题。【来源:Stanford HAI,2026 AI Index】


类似变化还出现在其他高难度测试上。在专门用于测试前沿AI能力的Humanity's Last Exam(HLE)中,顶尖模型的成绩从2025年初的8.8%提高到2026年初的44.3%;在强调复杂数学推理的FrontierMath基准上,最好成绩从2024年底的6.3%提升至2026年初的50%。【来源:Stanford HAI,Technical Performance】


换句话说,一些过去被认为需要人类专家进行长时间思考的任务,正在迅速进入AI的能力范围。


如果故事到这里结束,我们很容易得出一个结论:AI距离“什么都会”似乎已经不远了。


问题恰恰出现在这里。


斯坦福报告用了一个非常形象的概念描述今天的AI——Jagged Frontier,锯齿状前沿。它的意思是,AI的能力边界不是一条整齐向前推进的直线,而更像锯齿:在某些极难任务上,它已经达到甚至超过很多人类专家;换一个看似简单的任务,它却可能突然表现得非常笨拙。【来源:Stanford HAI,Technical Performance】



报告举了一个非常有意思的例子:AI在高难度数学推理上的进步已经非常显著,但在ClockBench这样的视觉时间识别测试中,模型读取模拟钟表时间仍然存在明显困难。对一个普通成年人来说,“现在几点了”可能比奥数简单得多,但对于AI而言,事情并不是这样。【来源:Stanford HAI,Technical Performance】


这可能是理解当前AI最反直觉的地方:人类眼里的难题,不一定是AI的难题;人类眼里的简单问题,也不一定对AI简单。


【我的解读】不要再问“AI相当于几岁的人”


我们过去特别喜欢用人的智力体系去理解AI。


GPT相当于大学生了吗?博士生了吗?是不是已经超过90%的人?这些说法听起来直观,却越来越容易误导我们,因为人的能力往往具有较强的连续性:一个能够解决奥数金牌题的人,通常不会突然看不懂钟表。


AI不是这样。


它可以阅读远超任何个人一生能够阅读的文本,可以高速调用知识和生成代码,也可以在特定推理任务上达到极高水平;但它没有按照人类“儿童—学生—成年人—专家”的路径成长。因此,试图用一个统一的“智商”或者“年龄”描述AI,本身就可能存在问题。


这也解释了为什么很多人在使用AI时会出现两种完全相反的极端。


一种人试了一次,让AI写篇文章、算道题,发现它犯错,于是得出结论:“AI也不过如此。”


另一种人看到AI拿下数学竞赛金牌、完成复杂编程任务,又得出另一个结论:“人类很快就没有价值了。”


这两种判断可能都低估了AI真正的特点。


我们既容易因为AI犯低级错误而低估它,也容易因为AI解决高级问题而高估它。


真正值得观察的,是这条“锯齿状前沿”究竟正在向哪里移动。


这在AI Agent和机器人领域表现得更加明显。AI已经不满足于“给你一个答案”,而是开始操作电脑、调用工具、执行连续任务。斯坦福报告显示,在OSWorld这一测试AI操作真实电脑环境能力的基准中,最佳系统的成功率已经从2024年的约12%提高到2025年的约66%。进步速度非常快,但距离人在复杂真实环境中的稳定表现仍有差距。【来源:Stanford HAI,Technical Performance】


到了机器人领域,这种反差更加明显。在模拟环境中,一些机器人系统已经能够完成很复杂的任务;进入真实家庭和开放环境后,面对随意摆放的物品、不断变化的位置以及大量意外情况,可靠性仍然会明显下降。


这背后其实隐藏着AI下一阶段最重要的一个关键词:可靠性。


过去三年,我们最关心的是AI“能不能做到”。未来几年,企业真正关心的问题会逐渐变成:它能不能连续做100次、1000次,都足够可靠?


一次写对代码,与持续维护一个生产系统不是一回事;一次准确分析合同,与每天审核上万份合同不是一回事;机器人在实验室里成功拿起一个杯子,与进入工厂连续工作几个月也完全不是一回事。


能力决定AI有没有机会进入一个场景,可靠性才决定它能不能真正留下来。


【对你有什么用】真正危险的不是不会用AI,而是不知道什么时候该相信它


这对普通人意味着什么?


以后评价一个人的AI能力,可能不能只看“会不会写Prompt”,而要看三种能力:知道什么任务适合交给AI,知道如何验证AI的结果,以及知道什么时候必须由人做最后判断。


例如,让AI帮你整理会议纪要、比较大量公开资料、生成初步方案,风险相对容易控制;但如果涉及医疗诊断、投资决策、法律合同、安全生产等高风险场景,“AI给了答案”绝不能等同于“答案就是正确的”。


对于企业管理者,这一点更加重要。很多企业推进AI时容易走两个极端:要么因为AI偶尔犯错就禁止使用,要么看到Demo效果惊艳就迅速推向生产环境。真正成熟的AI管理应该在两者之间建立一套机制:哪些任务可以完全自动化,哪些必须Human-in-the-loop(人在回路),哪些属于高风险任务,必须保留人工审批和责任边界。


这也是为什么我越来越认为,企业AI转型真正难的不是“买什么模型”,而是重新设计人与AI之间的分工。


对投资人来说,“锯齿状前沿”同样提供了一个非常实用的判断框架。一个AI产品Demo做得漂亮,并不等于它能够形成真正的商业价值。需要进一步追问:它解决的是偶发任务还是高频任务?准确率达到多少才能商业化?错误一次的成本是多少?人工复核成本是多少?随着使用规模扩大,错误率和服务成本会怎样变化?


这些问题往往比模型排行榜上的几个百分点更接近一家AI公司的真实价值。


回过头再看斯坦福这份报告,你会发现2026年的AI正处在一个非常有意思的阶段:它在一些过去被认为属于“人类高级智力”的领域快速突破,却依然会在一些简单、开放和需要持续可靠执行的任务上跌倒。


所以,以后再有人问:“AI到底有多聪明?”


也许我们应该换一个问题:“在我准备交给它的这个具体任务上,它到底有多可靠?”


从“聪不聪明”到“哪里可靠”,看起来只是换了一个问法,背后却是我们理解AI方式的一次重要升级。


而当AI越来越可靠,真正巨大的变化就会发生在另一个地方——工作。


因为企业并不需要一个“像人一样聪明”的AI。只要AI在某些工作环节上做到更快、更便宜、更稳定,它就足以改变岗位的价值。


下一篇《2026 AI大变局:读懂人工智能指数报告》,我们继续讨论一个与每个人都更直接相关的问题:《AI不会平均地影响所有人:2026年,职场真正开始分化》。


图片和引用来源:斯坦福《2026 人工智能指数报告》




版权及免责声明:“卢山说AI精进”个人公众号的文章均为本人原创(含联合AI创作部分)。未经本人许可,禁止进行转载、摘编及复制等任何使用。如需转载、引用或者有其它意向,请事先通过本公众号后台等方式申请并获得授权。原创文章中的部分文字、图片源于网络,如有任何问题请联系本公众号。

近期精华文章回顾:

            • 中美AI已经没有代差,真正的差距还剩什么?

            • 超过40万份CT“喂”出的医疗AI,能给普通人带来什么?

            • ChatGPT出现1378天后,采购供应链到底变了什么?

            • 库存、流程、供应商:AI到底能帮采购解决什么?

            • AI进入采购之后,真正值钱的不是降本,而是这件事

            • 辉瑞、九州通、阿斯利康:AI正在怎样重做采购?

            • 从ChatGPT写邮件,到AI替你谈判:1300多天,采购AI经历了什么?

            • 当采购人开始管理AI,供应链的下一场革命来了

            【声明】内容源于网络
            0
            0
            卢山说AI精进
            “卢山说AI精进"主理人。聚焦:① AI知识科普,拆解AI趋势、工具和应用;② “一人公司”实践——探索AI时代个人创业与效率最大化的全新路径;③ 企业AI落地,深耕“AI+”场景,助力企业真正实现降本增效。不讲空洞技术,只讲AI商业实战。
            内容 1122
            粉丝 0
            卢山说AI精进 “卢山说AI精进"主理人。聚焦:① AI知识科普,拆解AI趋势、工具和应用;② “一人公司”实践——探索AI时代个人创业与效率最大化的全新路径;③ 企业AI落地,深耕“AI+”场景,助力企业真正实现降本增效。不讲空洞技术,只讲AI商业实战。
            总阅读4.0k
            粉丝0
            内容1.1k