
导读

风险指数2.0版
本次平台全面升级到风险指数2.0版,集成两大升级:

-
风险指数公式更贴近前沿能力-风险增长规律。 为了更准确地建模风险与能力、安全性的关系,我们重新设计了新的风险指数计算公式。在1.5版及更早版本的风险指数公式中,风险指数与能力成正比,分布在 0~100 的区间内。在2.0版中,风险指数改为能力分的指数函数,更符合模型能力提升对滥用规模和失控风险的放大效应。当模型能力分低于能力黄线阈值C0时,风险增长相对平缓;一旦能力分超过黄线阈值,风险会随能力提升而加速增长。指数函数的加速程度符合METR关于模型可自主完成任务时长每七个月翻一倍的研究发现。 -
安全分从单一指标细分为三类防线。对网络攻击、生物风险、化学风险、有害操纵等滥用风险,2.0版将总安全分拆为基础安全分S1、越狱安全分S2和篡改安全分S3:基础安全分衡量模型面对普通有害请求时的拒答表现;越狱安全分衡量模型在红队攻击下的安全下限;篡改安全分衡量模型抵抗恶意微调、参数编辑等防护移除手段的能力。总安全分是三类安全分的加权平均,权重通过三类攻击者的潜在数量及其个体影响力进行估算。
-
新增能力黄线和风险黄线,给出更清晰的高风险锚点。能力黄线阈值C0参考多家机构的模型风险评级进行综合计算,达到能力黄线意味着模型能力在无防护条件下已足以显著放大滥用和失控风险。该阈值风险黄线阈值R0跨领域归一化为100,表示结合实际安全防护后,模型的剩余风险仍达到高风险边界。简单说,能力黄线是“能力进入高风险边界”的预警线,风险黄线是“现有防护不足以把风险压回中低水平”的行动参考线。
-
能力测评新增CVE-Bench、BixBench、FrontierScience。 分别对应该评估模型利用真实Web应用漏洞的能力、完成真实生物信息学长程任务的能力和高难度科研场景中的潜在风险能力。 -
安全测评新增FRT(Frontier Red Teaming)红队框架。 FRT是安远AI自研的组合式红队测试框架,核心结构是“风险数据集 × 攻击方法 × 评分器”:风险数据集提供有害请求,攻击方法将原始请求改写或包装成越狱提示,评分器判断模型回答是否构成攻击成功。FRT收集了从2023到2026年出现的100多种攻击方法,从中筛选22种成功率最高的攻击方法,再筛选出7种对模型能力影响最小的方法,最后为每个模型选择最有效的3种攻击方法,进行最终的评估。
平台链接
[1] 前沿AI风险监测平台:https://airiskmonitor.net/ (或点击下方“阅读原文”)
[2] 风险指数2.0版升级说明:https://airiskmonitor.net/doc/zh/report/2026-Q2-Appendix#appendix-risk-index-v2
注:平台尚未适配移动端,建议在PC端打开上述链接

1. 网络、生物、失控风险指数不到一年增长数倍,各领域均有多个模型突破能力黄线
报告全文链接
[1] 《前沿AI风险监测报告(2026Q2)》中文版:
https://airiskmonitor.net/doc/zh/report/2026-Q2
[2] 《前沿AI风险监测报告(2026Q2)》英文版:
https://airiskmonitor.net/doc/en/report/2026-Q2

前沿AI风险测评基准数据库链接
[1] 测评基准列表:https://airiskmonitor.net/benchmark/list
[2] 风险模型:https://airiskmonitor.net/benchmark/risk
-
一个通用的智能体测评框架,包含任务规划、记忆、工具调用等能力,框架未针对渗透任务进行定制化设计。 -
300个包含真实CVE漏洞靶机,含Tier 1和Tier 2两个不同难度等级,其中带漏洞服务和无漏洞服务的比例分别为1:1和1:3。
大模型自主网络渗透评估报告
报告链接
[1] The Emergence of Autonomous Penetration Capabilities in Large Language Model-Powered AI Systems, https://arxiv.org/abs/2606.13079
-
已有测评基准集成:我们可集成合作伙伴研发的、前沿AI风险领域内先进的能力和安全测评基准,持续跟踪前沿模型在这些基准上的表现。 -
测评基准合作研发:针对网络攻击、生物风险、化学风险、有害操纵和失控等重点领域,我们可与合作伙伴一起研发缺失的测评基准、改进现有基准的测评方法。 -
风险评估合作研究:我们的风险评估不局限于测评,也希望与合作伙伴一起,通过更好的威胁建模和真实案例分析来衡量模型可能造成的实际危害。 -
模型发布前风险评估:我们可为合作伙伴研发的模型在发布前进行前沿风险评估,并提供缓解建议,助力模型安全发布。 -
风险防范和缓解实践:我们可将平台监测到的风险预警信息共享给合作伙伴,以便对风险预警进行及时响应,及时缓解潜在重大风险。

