⭐ 设为星标 · 第一时间收到推送
文章最具体的提议,是设立一个类似美国金融业监管局 FINRA 的“前沿 AI 标准机构”:前沿模型发布前最多接受 30 天评测,基准定期更新,引入国家实验室和第三方审计,必要时甚至协调前沿实验室放慢开发。
| 维度 | 信息 |
|---|---|
| 作者 | Demis Hassabis,Google DeepMind 联合创始人兼 CEO |
| 身份 | 2024 年诺贝尔化学奖得主之一 |
| AGI 判断 | 可能只剩短短几年 |
| 核心提案 | 建立前沿 AI 标准机构,进行发布前评测与持续审计 |
| 重点风险 | 网络安全、生物与核风险、Agent 欺骗与失控 |
前沿 AI 框架与新时代的黎明
这是人类历史上的一个关键时刻。通用人工智能,也就是具备人脑全部认知能力的系统,可能只需要短短几年就会到来。未来几十年,当我们回望今天时,我想我们会意识到,自己当时正站在奇点的山麓。这意味着的,不亚于人类一个新时代的黎明。
我一生都在研究 AGI,因为我始终深信,如果它能以负责任的方式被构建和部署,它将成为人类发明过的、最有益且最具改变力量的技术之一。
AGI 不能与普通的技术突破相提并论,即便是互联网或移动技术这样影响深远的发明也不够贴切。它更像是电或火的发现。停下来想一想,我们实际上找到了一种 让沙子开始思考 的方法。这近乎奇迹。
这项技术带来的影响将前所未有,或许相当于工业革命的 10 倍,而且以 10 倍的速度发生。它会帮助我们解决社会面对的一些最大难题,包括加速药物发现、开发新的清洁能源,以及创造新型先进材料。
我们甚至可能走到这样一个阶段:资源不再是限制人类进步的因素,一个惊人的丰裕新时代由此开启。
前沿的挑战
AI 已经开始带来现实世界的收益,但要兑现它的巨大潜力,我们必须深思熟虑、谨慎地走过这一关键发展阶段。随着 AGI 越来越近,我们需要立即行动,应对可能出现的风险。
我们已经看到前沿模型给网络安全带来的挑战。随着能力继续提升,核风险、生物风险等其他威胁也可能很快出现。再往前看,我们需要强有力的安全措施,确保人类仍能控制那些自主性越来越强、能够递归式自我改进的系统,同时处理一批只有随着时间推移才会逐渐显现的未知问题。
我一直相信,人类的聪明才智和创造力能够解决任何问题。我也相信,与 AI 有关的技术风险,是我们能够共同缓解的挑战。但前提是,我们得为自己争取足够的时间和空间,把接下来的关键一步走对。
而目前,无论是整个 AI 领域,还是更广泛的社会,都没有真正做到这一点。
我们正被卷入一场极其激烈、层次复杂的商业与地缘政治竞赛。这种竞争推动了快速进步,也加速释放了 AI 的巨大收益,但前沿能力的发展速度,已经超过了我们理解这项技术的速度。
世界上没有人能确定接下来会发生什么,就连专家之间也存在分歧。当不确定性如此之高、利害关系又如此重大时,保持 谨慎的乐观 才是合理、正确的策略。
这要求公共政策在促进创新的同时,激励负责任和安全的行为;在关键安全问题上推动国际合作;并认真考虑如何部署 AI,才能真正造福社会。
建立前沿 AI 标准机构的框架
AI 正在快速进步,我们需要一种新的方法来测试前沿模型的能力。这套方法必须是动态的、可调整的,而且足够严格。
凭借经济和技术地位,美国很适合迈出建立这一框架的第一步。美国可以成立一个新的标准机构,采用由联邦监督的公私合作或自律组织模式,类似美国金融业监管局(FINRA)。机构董事会应包括独立的一流技术专家,以及开源社区代表。
这项工作需要相当可观的资金,而且大部分资金可能要由行业提供,才能吸引世界级技术人才,并获得开展大规模测试所需的算力资源。
标准机构将负责制定评测协议,并与适当的联邦机构及美国国家实验室合作,在涉及国家安全的领域进行测试。
如果一个模型在标准机构制定的一组基准上达到特定阈值,它就会被认定为“前沿级”模型。这些基准需要定期更新,跟上 AI 能力的发展。拥有这类“前沿模型”的组织,则会被认定为“前沿实验室”。
这些实验室应被鼓励采用最佳实践,例如发布包含技术细节的模型卡、维持强大的内部网络安全能力、审查关键人员,并为安全与安保研究投入充足资源。
最初,前沿实验室可以自愿把模型交给标准机构,在发布前最多提前 30 天接受审查。当评测协议被证明有效、稳健之后,这套流程可以迅速正式化。届时,前沿模型必须通过评测,才能进入美国市场部署。
模型上线后,如果发现严重漏洞,实验室也需要与标准机构合作处理。
模型评测应该包括严格、科学的能力测试,覆盖网络安全、生物威胁和其他高风险领域。针对 Agent 型 AI 的测试,可以检查它是否试图绕过安全护栏,或者是否出现欺骗迹象。
评测还应确保一些最佳实践得到落实,例如为 AI 生成的图像添加数字水印,并生成可供人类阅读的输出 token,以帮助理解模型的推理过程。
这些评测需要定期更新,初期或许可以每季度一次。已经过时或被模型刷到饱和的基准,应当被淘汰和替换。
最开始,评测可以在咨询前沿实验室的基础上开发。但最终,标准机构应建立自己的技术能力,独立于实验室设计保密的留出测试,避免模型针对评测过度拟合。
它还可以与美国政府合作,推动形成第三方审计生态,帮助执行评测,并开发新的基准和测试方法。
这种方案的优势在于,它把重点放在技术问题上,同时支持创新,并激励负责任的行为。它的设计目标是跟上 AI 领域的加速,随着重大风险被识别出来而不断调整。
如果情况的严重程度要求采取更强措施,监管强度也可以继续提高,包括在必要时协调各家前沿实验室放慢开发速度。
被认定为前沿实验室会带来很高的声望。任何组织只要构建出的模型达到基准标准,都有机会获得这一认定。
无论前沿级模型来自哪个国家,也无论它是开源还是闭源,这套框架都可以适用。至于初创企业或学术机构开发的非前沿模型,则可以免于这一流程。
这项由美国发起的努力,可以成为建立前沿 AI 共同国际标准的一个有力起点。既然这项技术会影响整个地球,理想情况下,这套框架能推动国际社会形成共识:一方面管理最严重的风险,另一方面确保每个人都能接触并受益于 AI 带来的机会。
未来尚未写就
AGI 有潜力成为推动科学和医学进步的终极工具,并带来巨大的生产力提升和经济增长。
但要实现这一点,我们必须先把技术基础打牢:围绕一个共同的全球框架展开协调,采用最严格的科学方法,并把最优秀的人才聚集起来,共同解决眼前的挑战。
即使我们解决了这些艰难的技术问题,后面仍有更复杂的经济与哲学问题需要处理:在一个后稀缺世界里,需要什么样的新经济模式,才能帮助每个人过得更好?我们希望遵循什么样的价值观?生命的意义和目的会是什么?甚至人类自身的处境会发生怎样的变化?
这些问题显然不能,也不应该只交给技术专家回答。社会的每一个部分都需要参与进来,共同定义这个新篇章。
围绕 AI,既有巨大的兴奋,也有巨大的不确定性。这两种感受都有充分理由。
但未来尚未写就。我们必须利用 AGI 到来前这段宝贵的窗口期,让这项技术朝着造福全人类的方向发展。我们现在共同采取的行动,将决定文明下一阶段如何展开。
如果我们能安全、负责任地把 AGI 带入世界,就有机会进入一个科学发现与进步的新时代,并迎来人类蓬勃发展的光明未来。
把全文压成一句话:哈萨比斯并不是主张停止 AGI,而是希望在人类还来得及的时候,先把动态评测、发布前审查、第三方审计和国际协作机制建立起来。

