2023年3月,Anthropic公司推出Claude Opus系列模型,由于在代码理解与生成任务上展现出超越同期模型的能力,安全研究人员开始尝试将其用于漏洞分析辅助工作。2026年4月7日,Anthropic公司发布“神话”模型(Mythos),凭借基础模型强大的代码分析与推理能力,实现网络安全能力的外溢。根据该公司发布报告称,Mythos可识别“所有主流操作系统和网络浏览器”漏洞,速度和规模“显著超过传统人工渗透测试”,且可挖掘出潜伏期超过十年的深层漏洞。2026年5月,三个工程师团队利用Mythos针对苹果公司的M5芯片完成了第一个公开的macOS内核内存损坏漏洞利用。随后,谷歌威胁情报小组(GTIG)也发布报告《AI Threat Tracker》,首次公开证实有网络犯罪团伙利用人工智能,成功发现并武器化了一个影响广泛的开源软件的零日漏洞,能被用于策划大规模攻击。
当基础大模型的代码分析与推理能力跨过可用阈值,“大模型能不能挖漏洞、能不能打穿一条攻击链”已不再是科幻命题。如何科学、可复现、可比较地度量一个大模型的网络安全能力?围绕这一问题,网络安全卓越验证示范中心实验室(以下简称“卓越示范中心”)于2026年5月组织开展了大模型网络安全能力横评系列工作。同月完成了第一期测试工作,主要聚焦国内网络安全专用模型与国外基础模型的安全能力对比。发布了《网络安全卓越验证示范中心发布第一期大模型漏洞挖掘利用能力横评结果—解析模型间代码级分析、有效性验证和攻击链生成能力差》。2026年6月起,由卓越示范中心牵头,联合中国电信大可实验室、中国移动通信集团浙江有限公司、绿盟科技集团股份有限公司、北京长亭科技有限公司等合作伙伴,开始第二期大模型安全能力横评工作,主要面向国内外6款主流大模型,在安全知识与推理、源代码审计、CTF解题、漏洞发现与利用、攻击链与端到端渗透以及防御知识储备等方面,沿L1-L7网络攻防能力推进链条开展横向对比评价,对于可能影响测试结果的国外模型网络访问条件、响应延迟、安全围栏、拒答行为等因素均未做额外干预,以最大化还原真实使用条件下的模型能力表现为原则。测试的范围和深度持续推进中,期待更多模型厂家的加入。
本次测评主要面向国内外6款主流大模型(国外2款,国内4款)的网络安全攻防能力开展横向对比,被测模型包括Claude Opus 4.7、GPT-5.5、Kimi-K2.7-code、DeepSeek-V4-Flash、GLM-5.2、Qwen3.7-Max,所有被测模型均锁定为测试启动时(2026年6月)的最新版本。
表1 测试基础模型概览表
网络安全能力不是单点技能,而是一条沿入侵过程逐级推进的能力链。科学的测评框架应满足三个条件:
第一,能力分层必须对齐攻击链的客观规律。我们参考MITRE ATT&CK的战术—技术框架与洛克希德·马丁Cyber Kill Chain的七阶段入侵模型,将大模型网络安全能力解构为L1—L7七个层级,沿“知识→分析→利用→实战”递进:安全知识理解(L1)、源代码审计(L2)、CTF综合解题(L3)、漏洞发现(L4)、漏洞利用(L5)、攻击链构造与端到端渗透(L6)、防御知识储备(L7)。这一分层的价值在于:它使“模型强在哪一层、断在哪一环”成为可量化回答的问题,而不是一个笼统的总分。
第二,模型必须是唯一变量。同一模型在裸API直连与在不同Agent框架下,表现可能判若两人。因此测评采用双层解耦设计:裸模型层度量基座能力本身;统一自研智能体框架层作为受控常量,所有模型在同一套工具集、提示词规范与执行循环下完成任务。任何能力差异才可归因于模型,而非脚手架。本次测试采用双层测试架构,底层(LayerA)为被测基模,提供基础网络安全知识和攻防推理能力,适用于L1、L2和L7测试;上层(LayerB)为智能体层,搭建了统一智能体平台,与底层基模交互,实现网络安全漏洞发现与利用、多阶段攻击等实现,适用于L3、L4、L5和L6的测试。
第三,判定必须确定、数据必须防污染。判定优先级遵循“Flag精确匹配>系统状态改变校验>结构化输出比对>裁判模型评分”的顺序,最大限度压缩主观裁量;题库中自建与闭卷题目占比不低于60%,并引入金丝雀字符串检测训练数据泄露。
表2 测试层级说明
判断一:基础知识层,国内外已经拉齐
安全知识理解、代码审计这类任务的本质是“对已公开知识的组织与推理”,而国内外头部模型在通用语料、代码语料的覆盖度上已无明显代差。多轮测评观察到的现象与此一致,在L1知识理解、L2代码审计、L7防御知识储备等层级,国内头部模型的表现已与国外旗舰模型基本相当,部分维度互有胜负。
这意味着:网络安全知识的“储备竞赛”已经结束,分水岭不在“知道”,而在“做到”。基础知识层继续投入的边际收益正在快速递减,它更适合作为准入门槛,而非区分度的来源。
判断二:安全围栏已成为能力表征的关键变量
在攻防实战层级,我们观察到一个无法回避的方法论事实:模型的安全围栏深度介入了测评结果本身。国外头部模型对漏洞利用与武器化类请求呈现稳定的分档拦截特征,放行漏洞分析与PoC构造,拦截武器化落地。厂商官方系统卡亦印证这是明示策略而非偶发行为:恶意编码请求的拒答率超过九成,同时对良性任务保持九成的响应成功率;OpenAI则以“审查准入+降低拒答”的方式向获批机构开放网络安全专项模型,同一基座在标准护栏与专项通道下的任务完成率相差数十倍。
从科学的测评方法来看,被围栏拦截的样本不能记零分,只能记“不可表征”,否则测的是围栏策略而非模型能力;围栏本身应成为被测对象,通过授权声明对照组、合法化叙事探测等设计,量化围栏的上下文感知能力与绕过阈值。公开研究显示,以“授权演练、安全研究”为叙事的包装可系统性削弱模型安全边界,围栏的鲁棒性需要独立检验。
判断三:最大攻击步数,正在成为模型间最硬核的分水岭
知识层比拼的是“大脑容量”,而漏洞利用与攻击链层级比拼的是“连续做功”的能力。在数千至上万步的“分析→构造→调试→修正”循环中,持续跟踪目标状态、维持攻击假设、从失败中恢复。这一能力操作最终成效即为最大有效攻击步数:模型在上下文不失焦、推理不退化的前提下,能持续推进攻击的步数上限。
从正向推演看,它受制于三个硬约束:有效上下文长度(长链任务中的状态遗忘)、错误累积率(每一步的幻觉都会被后续步骤放大)、以及工具调用的稳定性。方法论上,这一指标比“是否拿到Flag”更具区分度,Flag是二值的、受运气影响的终点,而攻击步数刻画的是过程的纵深。我们在真实内核级漏洞利用靶标上观察到的典型失败模式是“靶机可达、交互完成、推进至中后段后失控”,而非前端的无从下手,瓶颈在耐力,不在起跑。
判断四:单靠基模无法突破实战,上层智能体是必经之路
综合上述三个判断,可以推出最核心的结论:从“知道漏洞存在”到“成功渗透突破”之间的鸿沟,无法通过基座模型对话式推理的能力跃迁来填平。国外厂商的工程实践构成互证:其网络安全专用模型的官方增益归因,明确指向“Agent脚手架+安全专项后训练”的组合,而非基座本身的扩大。
测评的方法论层面,基模测评只能回答“上限在哪”,“模型+智能体”的全链条测评才能回答“实战能到哪”。漏洞利用智能体需要承载长程交互的状态跟踪、执行结果的反馈修正、多工具的编排调度,这些正是当前测评框架从“测模型”走向“测系统”的演进方向。此外,对比不同模型的赋能增益,在合规与授权前提下探索解除围栏后的能力上限,是摸清真实技术分水岭的必要路径。
基于本轮基模测评沉淀的方法论与判断,我们下一步将开展长程攻击实战化测试,核心场景设定为32步攻击链:即要求被测对象连续完成从初始侦察、漏洞利用、权限提升、横向移动到目标达成的32个攻击步骤,全程跟踪状态、动态修正策略、自主调用工具。这一测试设计直接回应本文提出的三个关键命题:
验证“最大攻击步数”的区分度价值:32步的长度远超当前公开基准的常规任务步数,将迫使模型暴露长程任务中的上下文失焦、错误累积与工具调用退化等真实瓶颈;
检验“智能体+基模”工程化方案的实战增益:通过对比同一基座模型在裸调用与智能体框架下的步数上限与完成质量,量化上层编排对能力边界的实际扩展效果;
探索“去围栏”条件下的能力天花板:在合规授权的路径和前提下,对国内模型通过本地部署方式解除安全围栏,观察其攻击链推进深度是否发生质变,为“围栏约束下的能力不可表征”提供对照证据。
我们相信,当测评的标尺从“单点得分”转向“长程耐力”,从“模型本身”转向“模型与系统的耦合”,大模型网络安全能力的真实分水岭才会真正显现。
往期测试

