作者|张勇毅
编辑|靖宇
「AI 用多了,人会不会逐渐变笨?」
这是过去三年争议最大的话题之一。担忧者凭体感,乐观者靠立场,双方长期缺乏确凿证据。8 月 18 日,《经济学人》刊发重磅研究,为这场争论提供了迄今最硬核的数据支撑。
研究对象涵盖 2.7 万名中国中学生。数据显示,使用 AI 后,学生作业分数平均提升 18%,单份作业耗时从 64 分钟缩短至 45 分钟。然而月考成绩揭晓:在闭卷考试中,使用 AI 的学生成绩比未使用者低 20%。
以往作业分是考试成绩的可靠「晴雨表」,但在 AI 介入后,这一规律失效。作业分越高,往往意味着 AI 依赖度越深,导致「用得越狠,考得越惨」。
作业分,第一次开始「撒谎」。
作业分超过 100 的人群中,不用 AI 者分数升至 112,而使用 AI 者跌至 64。|图片来源:经济学人
该数据源自斯德哥尔摩大学与香港大学三位经济学家发表的论文《生成式 AI 学习惩罚》。
《生成式 AI 学习惩罚》|图片来源:SSRN
样本取自中国中部一个百万人口县城,具有典型代表性。研究追踪了当地九成中学生(26811 人),横跨 2022 年 9 月至 2025 年 6 月,历时 30 个月。线上系统记录作业用时,数据库收录各类考试成绩,配合回收率超 96% 的全员问卷,首次实现了对「写多快、考多好」的硬数据测量。
2022 年 9 月,AI 使用率几乎为零;至 2025 年 6 月,这一数字飙升至 80%。曲线两次显著跳升分别对应 DeepSeek V2.5 和 R1 的发布,主流工具包括豆包、DeepSeek、文心一言等。
采纳曲线的两次跳升均与 DeepSeek 版本发布吻合|图片来源:CEPR
研究结论明确:作业效率提升 18%,耗时减少 30%,但月考成绩下降 20%(约 1.4 个标准差)。惩罚效应在各学科分布不均:社科类跌幅最大(27%),数学次之(22%),英语 17%,语文最轻(9%)。初中生受影响程度比高中生高四成,男生甚于女生。
值得注意的是,原本成绩最优的学生群体跌幅最惨。
关于升学考试的影响,网传「中考暴跌 24%、高考暴跌 18%」的说法略显夸张。论文指出,这是针对使用满两年以上学生的完整惩罚效应,全体 AI 用户的平均影响约为 7%。但这恰恰揭示了更严峻的事实:AI 的学习惩罚需要两年才能完全显现,短期研究普遍低估了其成本。
消失的模范生
研究初期曾有一个安慰性结论:约两成学生虽使用 AI 但未外包作业,成绩未受损。这似乎暗示问题不在工具而在用法。
论文对「外包」设定了量化标准:作业用时少于 50 分钟视为「内包」,少于 45 分钟则为真「外包」。数据显示,初期仅将 AI 作为辅助、仍花费时间写作业的学生,其考试成绩与未使用者无异。甚至在 50 至 65 分钟的重叠区间内,两类学生表现一致。AI 本身无毒,毒性在于省下的时间未被用于深度学习。
若止步于此,这只是一篇「工具无罪」的常规报告。但深入分析发现,使用满 5 个月后,外包比例从 58% 激增至 81%,完全外包者从 34% 涨至 50%。那些坚持花 65 分钟以上认真作业的「模范用户」,全是上手不足 5 个月的新手。
采纳满 6 个月后,样本中再无一名 AI 用户的作业用时超过 65 分钟。
在 26811 人的样本中,「正确使用 AI」并非稳定状态,而是一个维持不到半年的过渡期。作者指出,AI 挤掉的正是强度最高的那部分努力。
用满六个月后,65 分钟以上的作业用时区间彻底消失|图片来源:CEPR
这项研究撕掉了「只要教会孩子正确使用,一切都会好起来」的遮羞布。数据表明,没有人能长期保持「正确使用」。作业分上涨、家长点赞、老师认可,这些正向反馈构成了畸形激励机制,诱导学生不断压缩思考时间。
大人的考场
上述现象不仅限于青少年。过去一年,同样的能力退化曲线在成年人群体中已重现四次。
首先是医疗领域。《柳叶刀·胃肠病学和肝病学》发表的一项波兰研究显示,19 名资深医生在使用 AI 辅助数月后,脱离 AI 独立操作时,腺瘤检出率从 28.4% 降至 22.4%,相对下降 20%。
这与中学生的月考跌幅惊人一致。这是医学界首次在真实临床中证实「AI 导致人类技能生疏」,且发生在基本功最扎实的专家群体中。
其次是写作领域。麻省理工媒体实验室的脑电实验发现,使用 ChatGPT 的学生神经连接强度最低,较纯手工写作组低 55%;写完不久,83% 的人无法复述自己文章中的句子。研究团队将此命名为「认知负债」。
第三次出现在职场。微软研究院与卡内基梅隆大学的调查显示,对 AI 输出越自信的知识工作者,自主核查的投入越少。
第四次波及程序员。METR 机构的对照实验显示,资深程序员使用 AI 后实际效率降低,却主观感觉快了 20%。后续复测失败,原因是大多数开发者已拒绝在无 AI 环境下工作。
这与无人肯花 65 分钟写作业的教室如出一辙。
脱离 AI 后,专业人员的检出率未能恢复至原有水平|图片来源:METR
临床、脑电、问卷、对照实验,四次预警指向同一结论:AI 在场,产出变好;AI 离场,能力变差。
AI 并未降低智商,而是抽走了「变聪明」的关键工序——打草稿、试错与推演。认知科学称此为「认知卸载」。计算器替代了运算,导航替代了记路,而 AI 接管了心智模型构建的核心过程。
工作中看似从「执行者」升级为「把关人」,但若缺乏亲手推演的底稿,所谓的审核只是面对黑箱。一旦 AI 逻辑链深处出错,人类将无从察觉。对学生而言,作业是草稿,考试是 Debug;草稿外包,考试必败。
区别在于,学生每月有闭卷考试暴露问题,而大多数成年人的工作没有月考。
研究最后留有余地:随着时间推移,AI 学习惩罚正在收窄。同样使用满 5 个月,2023 年初的学生平均损失 25%,2025 年 6 月已降至 16%。
同样使用满 5 个月,惩罚效应从 25% 收窄至 16%|图片来源:CEPR
师生正在适应,工具端也在尝试改进(如强制展示推演过程)。但作者判断,损失虽在减小,却无归零迹象。
9 月 1 日开学,这场涉及 2.7 万人的实验将在全国更大范围内重演。当看到孩子作业天天满分,或许应先问一句:这 100 分是孩子挣来的,还是 AI 挣来的?
下一次向老板提交方案前,这个问题,不妨也先问自己一遍。
*头图来源:网络
本文为极客公园原创文章。

