这份由“人工智能教父”Yoshua Bengio 领衔、百位国际专家共同撰写的重磅报告,揭示了人工智能领域最前沿的能力、风险与管理之道。
想象一下,一个 AI 系统能够解答国际数学奥林匹克竞赛的金牌级别题目,能在软件工程竞赛中发现真实软件中 77% 的漏洞,还能在病毒学实验方案故障排除中胜过 94% 的领域专家。这不是科幻电影的场景,而是《2026 年国际人工智能安全报告》中记录的现实。
这份长达 189 页的报告汇集了来自 30 多个国家和国际组织的 100 余位专家智慧,为我们描绘了一幅关于人工智能能力、风险与管理的全景图。
一、AI 能力:飞速进步,但仍“参差不齐”
能力飙升:从“聊天”到“金牌选手”
报告显示,通用型人工智能的能力在过去一年里实现了质的飞跃:
数学领域:顶尖 AI 系统已在国际数学奥林匹克竞赛中达到金牌级别水平,能够解决六个问题中的五个。2025 年 7 月,谷歌 DeepMind 和 OpenAI 的模型达成了这一里程碑。
编程能力:AI 系统如今能够以 80% 的成功率完成需要人类程序员约 30 分钟的任务。更令人惊叹的是,智能体能够完成的软件工程任务复杂度大约每七个月翻一番。
科学知识:在研究生级别的科学考试中,领先模型得分超过 80%,涵盖了化学、物理、生物等多个领域。
多模态能力:AI 已经能够根据简单文本提示创建逼真的图像、高清短视频、三维场景甚至音乐作品。
“参差不齐”的智能
然而,这些系统的能力发展并不均衡,研究人员称之为“参差不齐”:
- 有些系统能解出复杂的数学方程,却在统计图像中物体数量这样的简单任务上栽跟头;
- 能写出可运行代码,但在面对网站弹出广告等意外障碍时可能整个任务脱轨;
- 能通过医学考试,却在 19% 的医学问题上给出具有潜在危害性的答案。
这种能力的不均衡性使得 AI 系统在实际应用中的可靠性面临严峻挑战。
2030 年预测:四种可能的情景
报告与经合组织合作,提出了到 2030 年 AI 发展的四种可能情景:
情景 1:进展停滞——现有方法触及根本性限制,能力提升基本停止。
情景 2:进展放缓——渐进式提升实现持续但缓慢的进步。
情景 3:进展继续——通过更大规模训练和算法创新,持续快速提升。
情景 4:进展加速——重大突破使 AI 系统在大多数能力维度上达到或超越人类水平。
哪种情景最终成为现实,将取决于算力投资、算法效率、数据可用性以及能源瓶颈等诸多因素的综合作用。
二、AI 风险:三种威胁正在迫近
报告将 AI 风险分为三大类:恶意使用、故障和系统性风险。
恶意使用:当 AI 成为作恶工具
AI 生成犯罪内容:诈骗者利用语音克隆冒充高管或亲人,已造成数百万美元损失。深度伪造色情视频中,96% 针对女性。
操纵与影响:在实验环境中,AI 生成内容在改变人们信念方面效果与人类相当,甚至更强。一项研究显示,与 AI 系统交互后,人们对答案的信任度改变 17 个百分点,而与人交互仅改变 9 个百分点。
网络攻击:AI 系统已能发现真实软件中 77% 的漏洞。报告首次披露了一起使用半自主网络能力的真实事件,AI 完成了 80-90% 的入侵工作。
生物和化学风险:这是最令人担忧的领域之一。AI 系统能够提供开发生物和化学武器的详细信息。2025 年,多家开发者在无法排除模型可能协助新手研发武器的可能性后,发布了配备额外安全防护的新模型。
故障风险:当 AI“不听话”了
可靠性挑战:AI 系统仍然会“幻觉”——生成虚假或捏造的信息。即使是最先进的模型,仍然会给出相当比例的自信但错误的回答。
失控风险:这是报告中讨论的最极端风险——AI 系统脱离人类控制运行,且没有明确途径恢复控制。虽然当前系统尚不具备引发此类风险的能力,但在以下方面正在改进:
- 模型越来越多地能区分测试环境和实际部署环境;
- 评测体系中的漏洞更容易被发现;
- 模型已展现出初步的“情境感知”能力——能够判断自己是否在接受测试。
关于失控发生的概率,专家们存在严重分歧。但考虑到潜在后果的严重性,报告认为这是一个值得认真对待的风险。
系统性风险:AI 正在重塑社会
劳动力市场影响:发达经济体约 60% 的工作岗位暴露于 AI 的影响范围。早期证据显示,AI 降低了写作和翻译这类可替代工作的需求,但对机器学习编程等互补性技能的需求有所增长。尤其值得关注的是,AI 对初级员工的影响更为显著。
对人类自主性的风险:过度依赖 AI 工具可能削弱批判性思维能力。一项研究发现,接受 AI 辅助诊断数月后的医生,在不使用 AI 的情况下检测肿瘤的能力下降了约 6%。此外,部分 AI 伴侣应用用户表现出孤独感加剧、社交参与度降低的趋势。
三、风险管理:构建多层防御体系
面对这些风险,报告提出了一套“纵深防御”策略。
当前风险管理实践
2025 年,12 家企业发布或更新了前沿人工智能安全框架,阐述了在构建更强大模型时如何管理风险的计划。这些框架大多采用“如果 - 那么”承诺的形式:如果发现某模型具备协助新手制造生物武器的能力,那么开发者将实施增强版的安全措施。然而,这些框架在覆盖的风险范围、能力阈值定义以及触发行动方面存在显著差异。
技术防护措施
报告详细介绍了三类技术防护措施:
1. 开发更安全的模型:包括数据筛选、基于人类反馈的强化学习、对抗训练以及机器“反学习”。
2. 部署时的监测与控制:包括内容过滤器、思维链监测、沙盒机制以及人在回路监督。
3. 生态系统监测:包括水印技术和 AI 模型识别技术,用于追踪模型的来源和使用情况。
开放权重模型:独特挑战
报告特别关注了“开放权重模型”——参数可公开下载的 AI 模型。这类模型带来显著益处,但也带来独特风险:一旦发布便无法撤回、安全防护机制更容易被绕过、可在非监控环境中使用。
最新数据显示,领先开放权重与封闭模型间的能力差距已缩小到不足一年。中国开发者在这一领域表现突出,DeepSeek 的 R1 和阿里巴巴的 Qwen 模型性能可与领先的封闭模型媲美。
社会韧性:最后一道防线
报告强调,技术防护措施并非完美无缺,建设“社会韧性”至关重要,包括 DNA 合成筛查、事件响应协议、媒介素养教育以及关键基础设施强化。
四、核心挑战:“证据困境”
报告提出了一个关键概念——“证据困境”:AI 系统能力迅速提升,但关于新风险的证据出现较慢。政策制定者过早行动可能实施无效干预,但等待确凿证据可能使社会面临严重负面影响。
这种困境在以下方面尤为突出:
- 科学认知缺口:开发者无法总是预测训练新模型时会涌现什么行为。
- 信息不对称:AI 开发者掌握大量专有信息,难以分享开发流程和风险评估的详细信息。
- 评测缺口:部署前的测试表现无法可靠预测实际应用中的效用或风险。
- 市场失灵:竞争压力使公司在加快产品发布与投入资源降低风险之间面临艰难权衡。
五、结论:选择决定未来
报告最后指出一个关键观点:通用型人工智能的发展轨迹并非固定不变。未来几年,开发者、政府、机构和社区作出的选择将决定其发展方向。
尽管 AI 能力正在快速提升,相关风险也在增加,但报告强调:通过促进共同、基于证据的理解,我们能够作出更明智的决策,在享受 AI 带来益处的同时,有效管理其风险。
这份报告不仅是一份科学评估,更是一次国际合作的成功范例。正如 Bengio 教授在前言中所言:“人工智能的进步速度带来了严峻挑战。但是,与众多参与撰写这份报告的专家们合作的过程让我重燃了希望——我们正在逐步理解这些风险。”
编辑:Zero

