AI的承诺,为什么不能只靠AI兑现?
——世界银行《2026年世界发展报告:人工智能的承诺》解读
AI提供的是新的能力可能性;发展红利则取决于这些能力如何被采用、适配、组织和治理。
一位肯尼亚农民通过手机向AI询问作物病害,获得过去很难接触到的农艺知识;与此同时,一位印度客服人员发现,自己查找客户资料、处理常见问题的部分工作,正在被同类技术接管。世界银行《2026年世界发展报告》第一章并置的这两个场景,揭示了一个容易被宏大叙事掩盖的问题:同一种技术,既可能填补长期存在的能力缺口,也可能替代已经形成的就业机会。关键不只是AI能做什么,还在于它进入了怎样的经济结构、组织流程与制度环境。
这份题为 World Development Report 2026: The Promise of Artificial Intelligence 的报告,将关注点放在低收入和中等收入国家:它们如何利用AI解决生产率不足、专业人才短缺和公共服务供给不充分等发展难题,又如何避免技术依赖、利益集中与社会风险。报告并不否认前沿技术突破的重要性,但它反复强调,对大多数发展中经济体而言,最大的机会未必在于训练出最强的模型,而在于把已经存在的AI,变成真正适合本地需要、能够持续运行的发展工具。
一、从“机器替代多少人”,转向“社会缺少什么能力”
讨论AI时,很容易从现有职业出发:程序员会不会减少?客服会不会消失?教师会不会被替代?报告则先把职业拆解为任务,再追问:哪些任务依赖稀缺的专业知识?哪些任务过去因为缺少专家,根本没有得到充分完成?
这种任务视角非常重要。教师的工作不仅是讲课,还包括备课、诊断学习困难、批改作业和反馈;农民虽然主要从事生产劳动,却同样需要判断播种时间、投入品配置与销售机会。报告强调,AI能够支持的非例行认知任务,并不只存在于办公室和高技能职业中,也存在于小企业和农场的日常决策之中。
AI不是简单增加专家人数,而是扩大专业能力的有效供给
传统的发展政策通常通过教育和培训增加专业人才。然而,培养医生、教师、工程师和农艺专家需要长期投入,无法迅速填补所有能力缺口。AI提供了一条不同的路径:不必先培养出足够多的专家,便有可能让更多人完成其中一部分原本需要专业知识的任务。
报告讨论了几种机制。AI承担某些专业任务后,职业中剩余任务对特定技能的要求可能降低;一些任务可以迁移到相邻职业,由经验相对不足的人员在AI辅助下完成;原有专业人员也可以提高工作效率,把时间用于更复杂、更需要人际互动和判断的事务。这并不意味着取消职业资格或降低安全标准,而是提示我们:职业名称可能不变,职业内部的任务结构却已经发生变化。
由此,报告提出了一种有条件的乐观主义:技术在补足最稀缺资源时,可能产生较大的发展收益。但这种收益不是自动发生的。专业建议即使更容易获得,也必须有人能够理解、判断并付诸行动;一个任务的瓶颈被消除之后,其他环节还可能成为新的约束。
从这个角度看,AI的发展意义不能仅仅用“节省多少人工”衡量,还应包括:它是否让原本得不到服务的人获得服务,让原本无法完成的任务变得可行。
二、贯穿全文的框架:能力、集中度与互补条件
报告的九章分为三个部分:首先解释AI的关键特征,然后评估其经济、社会和政治影响,最后讨论政府如何塑造这些影响。报告第6页的图O.1将这套逻辑浓缩为一个框架:能力、集中度和互补条件,通过采用、适配与前沿推进三条路径,影响发展结果;政府则以赋能者、使用者和监管者三种身份介入这一过程。
能力:AI能够把什么变得更容易?
这里的“能力”不只是模型在测试集上的成绩,而是识别模式、理解信息、支持决策和完成任务的实际可能性。
报告区分预测型AI、生成式AI和智能体AI。预测型AI用于分类、预测和决策支持;生成式AI用于创造文本、图像等内容,并提供更容易使用的交互方式;智能体AI则进一步围绕目标规划并执行多步骤任务。三者可以相互结合,而不是一种出现后,前一种便失去价值。
因此,发展政策不能把“采用AI”简单等同于“部署一个大语言模型聊天窗口”。有些问题需要的是预测、排序和资源配置,而不是生成一段更流畅的文字。
集中度:谁掌握这些能力的关键入口?
报告将AI技术栈划分为应用、模型、数据、基础设施和硬件五个相互依赖的层次。进一步从价值链看,还必须考虑矿产、电力、水、数据标注和各种专业劳动。技术栈说明AI如何运行,价值链则说明经济价值在哪里产生、就业在哪里形成。
集中具有双重效应。一方面,大型企业把多个技术层次整合起来,可以降低使用门槛,使资源有限的机构也能调用先进能力;另一方面,同样的整合也可能形成捆绑销售、竞争排斥和供应商锁定。发展中国家面临的不是“集中必然有害”这样简单的结论,而是如何利用规模经济,同时避免丧失选择权。
互补条件:为什么能接触AI,却未必能用好AI?
AI的有效使用,需要电力、网络、教育、技能、数据、组织流程和制度保障。报告延续了《2016年世界发展报告》关于数字技术需要“非数字互补条件”的思路,同时强调,AI还需要适合其运行和本地化的数字条件。
这里尤其值得区分两类条件:一类使AI能够被正确地适配,例如本地数据、专业知识和技术人才;另一类使适配后的应用能够被持续使用,例如终端设备、工作流程、人员培训和责任安排。模型“懂本地”,与组织“用得好”,并不是同一件事。
报告中的医疗案例说明了这种差别:一个系统在原有环境中表现良好,换到另一类患者群体后可能失效;一个眼部疾病筛查系统,也可能因为基层诊所的照明条件与训练图像不同,而拒绝处理大量图像。问题不一定在于模型不够强,而可能在于训练环境与使用环境不匹配。
这就形成了报告中的一个深层张力:最需要AI弥补能力不足的地方,往往也是最缺乏互补条件的地方。技术潜力最大,并不意味着实际收益一定最大。
三、采用、适配与前沿推进:不是所有国家都需要走向同一个终点
报告提出的三条路径,分别是采用现成AI工具、将AI适配到本地需要,以及参与前沿AI开发。三者需要的资金、技能和基础设施通常依次增加,但这不意味着每个国家都必须完整走完一条固定的升级阶梯。报告明确指出,大多数发展中国家不必推进AI前沿,也能获得可观收益;但采用和适配具有广泛必要性。
采用解决“有没有工具可用”,适配解决“工具是否适合这里”。
适配也不只是把界面翻译成本地语言。它可能涉及连接本地知识库、调整模型、改进输入数据、重新设计交互方式,以及把应用嵌入实际业务流程。一个农民需要的不是抽象的“最佳种植建议”,而是适合其地块、土壤、作物和季节条件的建议;基层服务人员需要的也不是以资源充裕环境为默认前提的标准答案。
“小AI”不是“大模型的廉价替代品”
专题一提出的“Small AI”,很容易被误读为小语言模型。报告的含义更宽:它可以是参数较少的模型,可以是只完成一个狭窄任务的预测系统,也可以是后台仍运行大型模型、但通过普通电话或短信服务低资源用户的应用。共同点是:围绕实际任务和现有条件设计,而不是围绕模型规模设计。
例如,Nuru可以在手机上离线识别作物病害;加纳的Rori数学辅导服务则使用云端模型,通过文字消息提供帮助。报告介绍的随机试验发现,Rori带来的数学学习改善大致相当于一年常规学习,文中给出的运行成本约为每名学生5美元。这个数字说明低成本服务的可能性,却不能被直接当作跨地区部署的完整成本预算。
“小AI”的真正意义,是把设计顺序倒过来:先问人们拥有什么设备、能够承担什么费用、需要完成什么任务,再选择技术。
不过,报告也明确提醒,小并不总是更好。复杂、开放性任务可能需要更强的模型;高风险任务必须满足更高的性能要求,并接受本地验证和持续监测。“足够好”应当是可靠应用的起点,而不是降低质量要求的借口。
四、经济影响:扩散很快,转型未必同样快
第四章并没有把AI的经济影响压缩成一个生产率数字,而是区分三条渠道:作为生产投入,AI改变任务效率和劳动需求;作为产业产出,AI价值链扩张带来投资和就业;通过价格、收入、交易成本和资源重新配置,AI还会产生跨行业、跨国家的连锁影响。
这意味着,一个国家即使尚未广泛采用AI,也可能受到其他国家采用AI的影响。例如,服务外包需求可能变化,进口产品的价格和质量可能变化,新的知识和技术也可能通过贸易与投资传入。不能只观察本国企业“用了多少AI”,便判断其经济影响。
聊天工具的普及,不等于组织转型已经完成
报告第113页的图4.2显示,在所调查的六个发展中经济体中,使用AI聊天工具的正规企业平均占比为20%,美国为34%;使用智能体或AI流程自动化的占比分别为10%和24%。这些数据来自印度、约旦、肯尼亚、墨西哥、尼日利亚和泰国等调查样本,采用国家层面的等权平均,并不代表全球所有企业。
报告据此强调“快速扩散、浅层采用与缓慢转型”之间的区别。信息搜索、写作和翻译,可以在不显著改变组织结构的情况下发生;将AI嵌入生产、客户服务和跨部门流程,则需要更深的互补投入。
这也是为什么企业能力如此重要。报告发现,管理实践更规范、创新活动更多、市场联系更强的企业,往往也更容易采用AI并进行更复杂的应用。这里首先是相关性证据,但它提示了一种可能的累积优势:已经具备较强能力的企业,能够更快把新工具转化为经营收益。
肯尼亚小企业AI导师的案例进一步显示了这种异质性:原本经营较好的企业从建议中受益,而能力较弱的经营者可能因为照搬不适合自身情境的通用建议,表现反而恶化。AI并不必然缩小企业间差距,也可能放大判断和实施能力上的差异。
职业暴露率,不是未来失业率
按照报告采用的生成式AI职业暴露口径,低收入和中等收入国家约有4.5%的现有岗位被归入更可能受到自动化影响的范围,高收入国家为14.2%;前一组国家另有约16.2%的岗位具有获得AI辅助的潜力。
这些数字不能读成“AI将消灭4.5%的工作”。职业暴露衡量的是任务与技术能力的对应关系,不等于实际采用,也没有完整纳入成本、制度约束、新任务创造和需求扩张。报告专门指出,暴露指标往往依赖静态任务描述及专家或模型判断,因此存在明确的测量边界。
同时,总体暴露较低也不意味着风险不重要。呼叫中心、软件和专业服务可能只占发展中经济体就业的一部分,却承载着青年进入正式部门、获得中产收入和积累专业经验的重要机会。报告转引的中国和印度研究已经观察到,部分岗位的招聘需求受到影响,入门级劳动者尤其值得关注。
因此,合理的政策目标不是永久保住每一种既有岗位,而是让劳动者有能力跨任务、跨企业和跨职业转移。专题五提出,社会保障应更多跟随劳动者,而不是固定绑定某个雇主,并逐步覆盖原本缺乏保障的劳动者。
五、公共服务:最需要跨越的,是“技术有效”到“发展有效”的距离
第五章把公共部门的AI应用区分为前端与后端。前端直接面对公众,例如教学支持和医疗筛查;后端则包括资源配置、风险识别、行政管理和监督审计。不同位置面临的约束并不相同:前端往往受技能、语言、终端和连接条件限制,后端则更容易受到数据质量、数据碎片化和系统互联不足的制约。
报告特别重视预测型AI在后台的价值。例如,肯尼亚司法系统使用算法辅助案件与调解员的匹配,巴西则利用审计数据识别更可能存在腐败风险的地方政府。这些应用不一定具有聊天机器人那样直观的展示效果,却可能改善公共资源的配置方式。
一个值得停下来细看的证据漏斗
报告第171页的图B5.3.1呈现了一个重要结果:在筛选出的9,762项AI数字健康干预研究中,只有57项同时满足面向一线服务、使用真实患者和服务人员数据进行检验、处于低资源情境等条件;其中只有17项提供了关于健康结果、服务质量或效率等方面的因果证据。
这里的含义不是“只有约0.2%的医疗AI有效”,而是:在这项综述的范围内,能够直接支持特定公共政策决策的因果证据非常有限。低资源情境还包括高收入国家内部的资源不足地区,不能把这一统计简单等同于某一收入组的全部医疗研究。
四层评估,缺一层都可能产生误判
专题六在第302页提出了一条完整的评估链:
目标界定 → 本地模型验证 → 人机互动与实际使用 → 最终发展结果。
首先,要弄清模型究竟在优化什么。系统追求的准确率、处理速度或成本,是否对应公共机构真正关心的目标?其次,要使用部署环境中的真实数据验证,而不能只接受供应商在别处取得的性能成绩。再次,要观察人们是否能够接触工具、是否正确使用、是否选择性采纳或推翻建议。最后,必须比较有AI与可行替代方案下的结果,评估其对受益者、非受益者及公共资源使用的影响。
报告举了一个假设性例子:即使聊天机器人能够帮助基层人员识别高风险孕妇,如果缺乏把她们送往诊所的交通条件,系统也可能没有改善最终健康结果。模型没有失败,但发展干预没有完成。
同样,使用次数、用户满意度和处理量可以帮助改进系统,却不能直接回答“没有这个系统会怎样”。报告强调,影响评估应采用清晰的反事实,并将AI与最佳可行的人力或技术替代方案比较,而不是与一个人为设定的低效基线比较。
这一判断对企业同样具有启发性:交付一个可运行的系统,与创造一个净收益为正的组织变革,是两项不同的工作。
六、政治影响:AI不仅改变效率,也改变谁有能力制定规则
第六章将权力关系分为四个层次:国家之间、政府与企业之间、企业与个人之间,以及公民与国家之间。这样处理,使报告超越了“技术收益减去技术风险”的简单核算,转而追问收益和风险由谁分配、由谁承担。
国家之间的核心问题,是依赖与自主。拥有本地数据中心,不等于摆脱对外部芯片、软件和服务的依赖;试图在国内复制整个AI技术栈,又可能造成昂贵的重复建设和市场碎片化。报告提出的中间路径是:在可能的层次上实现供应商多元化,同时保持互操作性,结合开放模型、数据治理和国际合作,减少单一依赖,而不是追求所有环节完全自给。
政府与企业之间的核心问题,是公共投入能否形成公共价值。为吸引AI投资而提供税收优惠、低价能源和基础设施支持,可能促进产业发展,也可能把财务和技术风险更多留给公众,把收益更多留给少数企业。报告同时指出,问题不只是政府对企业过度迁就;规则突然变化、承诺缺乏稳定性,也会削弱投资与能力转移。
企业与个人之间的核心问题,是市场力量与议价能力。数据反馈和转换成本可能强化领先企业的优势;数据标注等劳动市场中,少数购买方面对大量劳动者,又可能形成买方垄断。算法管理本身不必然比人工管理更差,但如果劳动者看不见决策依据、无法申诉,也缺乏可选择的雇主,技术就会强化原有的不对称。
公民与国家之间的核心问题,是能力扩张能否受到问责约束。AI能够帮助政府发现风险,也能够扩大监测和信息操纵能力;自动化可以减少某些人为随意性,却不能自动保证公平。因此,公众需要的不只是“相信系统”,还包括知情、质疑、申诉和获得纠正的实际渠道。
据此可以进一步理解“数字自主”:它不应只用模型是否自行开发衡量,也应看一个组织或社会能否控制数据、替换供应商、审查系统,并对影响自身的规则提出异议。
七、两种容易被短期收益掩盖的长期成本
人的能力:使用AI完成任务,不等于学会完成任务
专题三讨论了一个与全文主旨构成张力的问题:AI能够扩大人们当下可调用的能力,但过度依赖AI,也可能削弱形成这些能力的学习过程。
报告区分了有教学设计的AI辅导与不受约束的答案获取。前者可以通过提示、解释和反馈促进学习;后者可能让使用者绕过必要的思考与练习,使眼前作品更好,却未必使离开工具后的独立表现更好。报告也明确提醒,部分认知影响证据来自规模较小、观察期较短的实验,不能据此断言AI必然造成长期能力退化。
这一问题并不限于课堂。如果企业用AI大量替代入门级任务,也可能同时减少青年员工积累经验的机会。项目判断、情境理解和复杂协调等能力,往往需要在实际工作中形成。组织节省了当期培训和用工成本,却可能削弱未来专家的培养机制。报告将其视为值得警惕的长期组织能力问题,而不是已经确定发生的普遍结果。
这里最重要的区分是:能力的调用,与能力的形成,不是同一过程。AI治理既要关心今天的任务完成率,也要关心明天是否仍有人能够理解、监督和改进系统。
自然资源:AI用于绿色治理,不意味着AI产业自动绿色
专题四同时讨论AI的环境足迹与环境治理价值。
前者贯穿矿产开采、硬件制造、运行中的能源和水资源消耗,以及电子废弃物处置;后者则包括电网调度、交通与物流优化、环境监测、天气预测和灾害应对。报告没有据此给出“AI总体必然有利于环境”的判断,而是明确指出,净环境影响仍不清晰,需要透明的测量和治理。
更值得注意的是成本的分配。如果数据中心获得优惠电价,而电网扩建成本被转移给其他用户;如果设施选址重视能源价格和招商条件,却忽视当地水资源约束,那么技术投资的私人收益与社区承担的社会成本就可能分离。
因此,报告提出将数据中心的用电灵活性、设施选址和新增清洁能源供给纳入政策考量。其启示不是拒绝算力建设,而是避免把“新增算力”直接等同于“新增发展福利”。
八、政府的三种角色:补条件、会使用、能治理
报告最后三章的价值,在于把前面的分析转化为行动逻辑。但这些行动不是一张可以任意挑选的政策清单。报告强调,政策之间具有互补性,应优先缓解最具约束力的瓶颈:有培训而没有电力与网络,有数据中心而没有人才和应用需求,都可能产生有限回报。
作为赋能者:让更多主体有条件用好AI
政府首先要补足基础设施、基本教育、数字技能和数据治理条件,并改善企业获取信息、融资和市场机会的环境。
这里,“提供算力”只是其中一个选项,不应压倒其他投入。报告提出的工具包括开放和改善公共数据、支持本地语言资源、扩大可负担计算服务的获取,以及帮助企业了解哪些应用有效、如何融入业务。对不同基础条件的经济体,投入组合应当不同。
报告还提出,税收和监管安排不应人为鼓励企业以AI替代劳动,而忽视通过AI增强劳动者能力的可能性。这不是反对自动化,而是要求技术选择更多反映实际生产价值,而不是制度造成的相对成本扭曲。
作为使用者:把AI当作持续运营能力,而不是一次性交付项目
第八章最鲜明的提醒,是从问题而非技术出发:并非所有公共问题都需要AI;把AI叠加在设计不良的流程上,可能只是把低效率自动化。智能体系统尤其如此——它们能够跨步骤行动,因此更需要提前设定授权、审计轨迹和失败处置机制。
一旦决定采用AI,政府也不能把签约、上线和验收视为终点。模型、数据、政策和用户行为都可能变化,系统因此需要持续监测、更新和维护。报告对比了两种模式:项目模式重建设和交付,容易在移交后陷入运营投入不足;产品模式则保留持续负责的小型内部团队、稳定预算和迭代机制。
采购合同也必须保护未来选择权。尤其值得注意的是,报告要求可迁移的不只是原始数据,还有组织在使用过程中积累的上下文:交互记录、行政决策、操作手册和配置。如果这些知识无法导出,更换供应商就可能意味着重新开始。
供应商锁定甚至可能在正式采购之前形成。低价试点、合作项目和捐赠软件,会逐步积累数据、配置和系统连接,等到正式签约时,替换成本已经很高。因此,治理必须从早期试验开始,而不能等到采购合同阶段才介入。
作为监管者:用可信治理支持采用,而不是在创新与安全之间简单二选一
报告主张从自愿标准和既有法律出发,逐步补足治理缺口,但这不能被理解为“先放任发展,出现问题后再监管”。
其逻辑是,标准能够把透明、公平和安全等原则转化为可执行、可测试的要求;既有的数据保护、消费者保护等制度则可以立即发挥作用。当自愿安排不足以保障权利、安全和公共利益时,政府需要以有约束力的规则加以支撑。报告明确反对把治理完全交给市场。
比模仿一部先进法律更重要的,是具备执行能力。报告提出实验、强化执行、共同设计和信息公开等原则,并警惕只有制度外观、缺乏落实能力的模仿。公众信任也不是靠宣传获得,而应建立在系统确实值得信任的基础上。
三种角色,还需要一个跨部门协调框架
专题七指出,AI横跨部门,而公共机构通常按部门组织预算、权限和数据。这种结构性错位,会同时妨碍应用、产业支持和监管。
报告因此提出“横向协调—纵向实施”的两层框架:横向形成共同方向、标准与共享条件,纵向保留行业部门的专业知识和实施责任。它追求的不是让一个机构包办所有AI事务,而是避免各部门各建系统、各定规则、各自承担却无法共同解决跨界问题。
九、如何评价这份报告:贡献在框架,阅读时必须守住证据边界
这份报告的重要贡献,是把技术能力、经济结构、组织实施与政治治理放进同一个解释框架。它既没有把AI当成自动带来繁荣的外生力量,也没有把发展中国家仅仅当作风险的被动承受者。
第一,调查覆盖不等于总体代表性。企业采用数据主要覆盖至少五名雇员的正规企业,并集中于制造业、建筑业和服务业。它为理解企业采用提供了新证据,却不能直接外推到所有自雇劳动者、非正规微型企业和农业经营主体。
第二,不同研究中的“收益”并不具有同一含义。第122页表4.1同时列入产出、任务时间、创新性、预测准确性和开发者感知等指标;研究设计也不完全相同。时间节省不能直接等同于企业生产率提高,更不能直接等同于社会福利增加。这些结果需要按任务、样本和测量口径分别解读。
第三,采用相关性与因果效果必须分开。能力较强的企业或农户可能更愿意采用AI,所以采用者表现更好,并不自动证明差异全部由AI造成。农业专题对这一问题作了明确提示:自愿使用咨询服务的农民,可能在管理能力、风险偏好和投入条件上,本来就不同于未使用者。
第四,宏观情景不是增长承诺。报告的部分宏观估算把任务层面的效果、职业暴露和采用程度结合起来,显示在既定假设下,先进经济体可能获得更大的生产率收益。这类分析的重要用途,是揭示采用差距的后果,而不是给未来经济增长率盖章。
第五,AI的快速变化让评估本身成为持续任务。固定模型版本有助于明确研究对象,却可能很快失去现实代表性;持续更新又会使干预内容发生变化。网络效应、跨机构溢出和对照组自行采用,也会影响因果识别。报告并未提供一个可以消除这些困难的万能方法,而是要求更审慎的研究设计。
沿着这些边界继续思考,真正值得研究的,就不再只是“AI是否提高绩效”,而是:什么互补条件最关键?什么人机分工能够兼顾短期效率与长期学习?什么合同安排能够保护组织积累的知识?一种有效的试点在扩张之后,是否仍然有效、包容且可负担?
结语:AI的最终尺度,应当是人的发展
读完这份报告,最值得保留的不是某个增长预测,也不是某项令人兴奋的应用,而是一种判断技术的方式。
不要只问模型有多强,还要问它解决了什么稀缺问题;不要只问采用速度有多快,还要问组织是否真正改变;不要只问创造了多少价值,还要问谁获得收益、谁承担成本;不要只问今天能完成什么,还要问明天是否仍然拥有学习、监督和自主选择的能力。
报告最后把问题重新拉回到一个朴素的目标:AI应扩大人的能力与机会,改善公共服务、企业经营和生活水平。能否实现这一目标,取决于AI是否被广泛、有效且负责任地用于真实的发展问题。
模型变得更聪明,只是技术进步;让更多人因此获得更好的生活,才是发展。
报告来源
World Bank. (2026). World Development Report 2026: The Promise of Artificial Intelligence. World Bank. DOI: 10.1596/978-1-4648-2331-2.
本文为对所附英文报告的学术解读,不是世界银行官方译文;文中的综合判断与评论不代表世界银行立场。

