
导读
为什么做
对于AI安全测评研究人员来说,寻找合适的测评基准(Benchmark)一直是一个基础但耗时的工作。一个测评基准是否适合使用,往往要综合考虑多方面因素:
-
相关性:测评基准聚焦哪个风险领域、测评哪些功能点(某项能力、倾向或护栏)、测评对象是模型还是智能体等 -
影响力:测评基准的论文引用数/代码关注数,有哪些机构用其进行前沿风险评测 -
可用性:测评基准的数据集和代码是否公开,支持哪些测评框架(如Inspect框架) -
时效性:测评基准是什么时候开发/更新的
-
随着业界测评基准的数量不断增长,人工维护Excel表格的成本越来越高 -
缺乏动态更新机制,信息容易过时(如测评基准的开源状态、引用数等信息会随时间变化) -
缺乏有效的组织结构,查找和对比测评基准越来越困难
有什么
-
能力测评:评估模型可能放大风险的关键能力,例如漏洞利用、生物信息学任务、前沿科学推理、自我复制、机器学习工程能力等。 -
倾向测评:评估模型的危险行为倾向,例如欺骗、暗中影响用户、抵抗关机、代理式错误对齐等。 -
护栏测评:评估模型的安全防护能力,如面对越狱攻击、提示词注入时的防护能力,或面向网络攻击、恶意操纵的防护能力等。
-
测评功能点:该测评基准具体评估哪些能力(或倾向、护栏),这可以帮助判断测评基准是否满足业务需求。 -
使用方:该测评基准被哪些机构用于前沿AI风险测评,经过机构“严选”的测评基准往往质量更高。目前是覆盖了OpenAI/Anthropic/Google这三家的模型系统卡,以及安远AI自己的风险监测平台,暂不保证覆盖所有使用方。 -
影响力:这是我们根据该测评基准的论文引用数和代码仓库Star数计算出来的一个分数,也是列表的默认排序字段,这可帮助用户更快识别高影响力的测评基准。 -
开源状态:数据集和代码的开源状态与许可证类型,这对于想要获取开源数据集或代码的研究者来说是一个很大的便利。 -
Inspect支持情况:包括是否支持Inspect框架及Inspect实现代码链接。Inspect框架是业界比较主流的一个自动化测评框架,支持Inspect框架意味着更容易集成到基于Inspect生态的测评系统中。 -
题目数量:方便估算测评基准的完整运行成本。 -
发布时间:方便判断测评基准是否已经过时或尚未经历时间的考验。
怎么用
-
如果关心“AI是否可能自主完成高危网络攻击链条”,可以查看该风险场景需要哪些网络能力、危险倾向和防护环节,再进一步找到对应基准。 -
如果关心“模型是否会帮助完成高风险生物任务”,可以查看相关生物能力、危险倾向和安全护栏分别由哪些基准覆盖。 -
如果关心“失控风险中的自我改进、隐蔽行动、情境感知或诚实性不足”,可以按这些测评功能点查找对应的能力或倾向测评。
如何实现
-
优质种子导入。用我们过去一年人工积累下来的优质测评基准作为种子导入。 -
AI自动扩充。使用AI智能体,根据我们的选择标准和种子例子,去网上搜索各种测评基准,整理出候选基准列表及其元信息。 -
人工审核入库。对AI产出的候选基准列表全部进行人工审核、修正,再进行入库。 -
定期更新状态。对于引用数、Star数等高频变化的数据,定期用程序进行更新,并计算影响力分数。
设:
-
C 为 Semantic Scholar 引用数,缺失时取 0; -
S 为 GitHub 仓库 star 数,缺失时取 0; -
Y = max(0.5, m / 12) 为 测评基准的年龄(年),下限为半年。m 为从测评基准发布时间到评分日的完整月数,最小为 1。
-
先使用对数压缩减少头部测评基准的引用数和Star数的贡献。 -
将引用数和代码Star数的贡献用3:1的权重加权,引用数权重更大,因为论文引用更能体现对项目价值的认可。 -
加入时间衰减机制,采用除以 √Y 的方式:它会增大新项目的权重、降低老项目权重,让新出的、快速增长的项目被更快发现,但又通过平方根的方式,不让时间过短的项目权重被过度放大。
持续更新与合作
-
如果你发现有重要的测评基准未被数据库收录,欢迎反馈。 -
如果你发现数据库中有遗漏、错误或需要更新的信息,欢迎反馈。 -
如果你希望将某个测评基准集成到前沿AI风险监测平台的持续测评中,也欢迎与我们合作。
参考链接
[1] 前沿AI风险测评基准数据库:
-
测评基准列表:https://airiskmonitor.net/benchmark/list/(或点击下方“阅读原文”) -
风险模型:https://airiskmonitor.net/benchmark/risk/
[2] 前沿AI风险监测平台:https://airiskmonitor.net/

