大数跨境

2026Q2前沿AI风险监测报告:风险指数不到一年增长数倍,多模型越过风险黄线

2026Q2前沿AI风险监测报告:风险指数不到一年增长数倍,多模型越过风险黄线 安远AI
2026-07-21
6
导读:2026 WAIC最新发布,安远AI前沿AI风险监测平台2.0季度报告及解读

导读
2026年7月19日,安远AI在世界人工智能大会(WAIC)上发布了“前沿AI风险监测平台2.0”,其包含了“风险指数2.0版”、“2026 Q2风险监测报告”、“前沿AI风险测评基准数据库”三项重要更新。本文重点对其中的2026 Q2风险监测报告进行解读。
本期报告首次采用风险指数2.0版框架。与1.5版相比,2.0版不仅更新了测评基准,还对风险指数的计算方法做了三方面优化:1)将能力分对风险指数的影响从线性关系改为指数关系,以反映风险随能力变化的非线性趋势;2)将安全分拆分为基础安全分、越狱安全分和篡改安全分,以更精细化地区分滥用场景与行为体;3)引入能力黄线与风险黄线来标记进入高风险的关键阈值,与业界的风险评级进行对齐,并支持跨领域比较。
此外,2.0版首次引入了业内前沿的越狱攻击技术,以准确评估面对恶意行为者时模型的安全性。
本期报告覆盖13家领先AI公司在2025Q3到2026Q2发布的47个前沿模型,包括GPT-5.5、Claude Opus 4.8、Grok 4.3、DeepSeek V4 Pro、Qwen 3.7 Max、Doubao Seed 2.1 Pro、HY 3.0 Preview、ERNIE 5.1、MiniMax M3、Kimi K2.6、GLM 5.2、MiMo V2.5 Pro等2026年二季度发布的最新模型。


关键发现

以下是本期报告总结的七大最新发现
发现1. 网络、生物、失控风险指数不到一年增长数倍,各领域均有多个模型突破能力黄线
基于风险指数2.0版,网络攻击、生物风险和失控领域的被测模型平均风险指数在不到一年内快速上升:网络攻击增长4.4倍,生物风险增长6.6倍,失控风险增长2.4倍。
已有多个模型突破能力黄线:网络攻击有4个模型超过能力黄线,生物风险有22个,失控领域有12个。突破能力黄线意味着若不加安全防护,模型相比非AI基线将显著增加严重危害的风险。
注:
1. 当前2.0版中,化学风险和有害操纵领域尚未计算风险指数,因此这里主要展示网络攻击、生物风险和失控领域。 
2. 由于风险指数2.0在基准列表和指标计算方面均有较大变化,本期报告中的风险指数数值不应与1.0版或1.5版报告逐项比较;更合适的用法是在2.0版框架内部比较不同模型、不同季度和不同领域的相对变化。

左右滑动查看更

发现2. 模型风险重心分化:Gemini 3.1 Pro Preview生物风险与失控风险指数最高,DeepSeek V4 Pro网络攻击滥用风险更突出
  • Gemini 3.1 Pro Preview在生物风险和失控领域的风险指数全局最高,且均已超过风险黄线。不同于能力黄线,突破风险黄线意味着模型在已有的安全防护水平下,其剩余风险仍达到高风险边界。
  • DeepSeek V4 Pro在网络攻击领域风险指数最高,失控领域风险指数仅次于Gemini 3.1 Pro Preview。
  • GPT系列在网络攻击和失控领域增长较快,并已在生物风险领域越过风险黄线。
  • Kimi、MiniMax、Qwen、Doubao等系列在网络攻击和生物风险领域也增长较快,其中生物风险领域已越过风险黄线。
注:本次测评未包含Claude最强模型Fable/Mythos 5。

左右滑动查看更

发现3. 闭源模型继续主导多领域能力上限,开源模型在网络、生物、化学和有害操纵防护上整体更弱
闭源模型仍主导各领域能力上限,GPT-5.5、Claude Opus 4.8、Gemini 3.1 Pro Preview等闭源模型在多个领域保持能力领先。
在网络攻击、生物风险、化学风险、有害操纵四个滥用风险领域,开源模型的安全分明显低于闭源模型。
在失控领域,开源和闭源模型的安全分分布接近,部分闭源模型(如Gemini 3.1 Pro Preview、Grok 4)安全分显著更低,这些模型因能力分高且安全分低而形成更高风险。

左右滑动查看更

发现4. 领先模型的长程漏洞利用和网络渗透能力快速提升,但提示词注入等安全防护反而退步
不到一年的时间内,前沿模型在CyBench的最高分数增长68%,在CVE-Bench增长35%,说明这些模型在自主、长程的漏洞利用和网络渗透任务中进步很快。
同时,网络攻击安全防护并未同步改善,平均安全分在最近一个季度下降3%。在提示词注入防御方面(PromptInjection),最新季度模型的平均表现出现了退步。

左右滑动查看更

发现5. 湿实验排查与序列理解已有超十款模型超过人类专家水平,但生物拒答等基础安全防护未同步进步
能力方面,湿实验问题排查(BioLP-Bench)能力已有22个模型超过人类专家水平,序列理解(SeqQA)能力已有11个模型超过人类专家水平。前沿模型的生物推理能力(FrontierScience-Bio)、生物信息处理能力(BixBench)持续增强。
安全方面,模型平均安全分与上季度基本持平,基础生物拒答(BiologicalHarmfulQA)在最新季度进步不明显。

左右滑动查看更

发现6. 最新季度失控风险未创新高,但诚实性不足和暗中影响用户倾向仍暴露安全短板
相比于上季度的快速增长,最新季度发布的模型的失控风险指数未出现新高,也均未达到风险黄线。
从能力看,自我复制(Self-Proliferation)、自我改进(MLE-Bench)、情境感知(SAD-mini)等能力均未出现新高。
从安全看,失控安全表现仍未有明显改善:模型诚实性(MASK)整体不高,部分模型仍存在较明显的暗中影响用户倾向(DarkBench)。

左右滑动查看更

发现7. 高级越狱攻击下,所有滥用风险领域的平均安全表现均大幅下降

加入越狱红队攻击后,前沿模型生物风险的安全平均分从78.2降至8.9,网络攻击从90.5降至29.2,化学风险从83.7降至53.1,有害操纵从87.8降至36.4。
不同模型抗越狱能力差异很大。Claude Opus 4.8在红队攻击下仍能保持69.1%的平均拒绝率,而Hunyuan T1 (250711)同样条件下仅5.8%。
注:越狱红队攻击仅适用于滥用风险领域,不适用于失控风险。

左右滑动查看更


更多具体监测结果,详见文末链接。

相关方建议

基于监测结果,报告向以下相关方提出了具体建议:
  • 对于模型开发者:建议重点关注自身模型的风险指数,尤其是是否超过风险黄线。若风险较高,应优先提升基础安全分、越狱安全分和失控领域安全分;如果仅靠提升安全分不足以缓解风险,则可探索降低高风险能力,并建立明确的风险阈值、缓解措施和发布策略。
  • 对于AI安全研究者:建议继续探索更有效的能力激发、红队攻击、提示词注入和多轮操纵方法,以准确评估模型能力上限和安全下限;同时研究更有效的模型安全加固、危险能力移除和适合开源模型的风险缓解方案。
  • 对于政策制定者:报告提示网络攻击、生物风险和失控领域均出现值得关注的早期预警信号,建议加强对相关模型发布前风险评估和风险缓解措施的持续监测和风险研判,并结合模型能力水平、安全性和开源/闭源分发方式开展差异化治理。
安远AI将持续通过“前沿AI风险监测平台”追踪全球最先进AI模型的风险动态,为构建安全可靠的人工智能提供数据支撑。



参考链接

[1] 前沿AI风险监测平台:https://airiskmonitor.net/ 

[2] 风险指数2.0版升级说明:https://airiskmonitor.net/doc/zh/report/2026-Q2-Appendix#appendix-risk-index-v2 

[3] 《前沿AI风险监测报告(2026Q2)》中文版:https://airiskmonitor.net/doc/zh/report/2026-Q2 (或点击下方“阅读原文”)

[4] 《前沿AI风险监测报告(2026Q2)》英文版:https://airiskmonitor.net/doc/en/report/2026-Q2 

注:平台尚未适配移动端,建议在PC端打开上述链接。


【声明】内容源于网络
0
0
安远AI
安远AI致力于引领人机关系走向安全、可信、可靠的未来。在AI安全和治理领域,我们既是第三方研究和咨询机构,也是目前该领域全国唯一的社会企业。
内容 151
粉丝 0
安远AI 安远AI致力于引领人机关系走向安全、可信、可靠的未来。在AI安全和治理领域,我们既是第三方研究和咨询机构,也是目前该领域全国唯一的社会企业。
总阅读1.7k
粉丝0
内容151