大数跨境

报告发布 | 大模型安全测评体系与实践报告(2026)

报告发布 | 大模型安全测评体系与实践报告(2026) 数世咨询
2026-09-18
4
导读:当前,大模型正在从“聊天助手”变成能够调用知识库、数据库和业务工具的“数字员工”。

摘要



当前,大模型正在从“聊天助手”变成能够调用知识库、数据库和业务工具的“数字员工”。风险也随之从“说错一句话”扩展到泄露敏感信息、越权调用工具乃至错误执行真实业务操作。如何确认大模型足够可靠?答案不是凭感觉使用,而是通过覆盖全生命周期的安全测评,为能力划定边界。

AI应用快速扩张的同时,安全事件也在增加。根据斯坦福《AI Index Report 2026》,受访组织的AI采用率达到88%,2025年记录的AI相关事件为362起,高于2024年的233起。与此同时,备案登记、国家标准和相关安全检测机制陆续落地,大模型安全治理正由原则要求走向制度化、常态化。本报告由360基于公开资料与自身测评实践编制,面向政府、行业组织和企业,重点回答三个问题:大模型风险怎么看、安全测评怎么做、测评结果怎么用。

针对上述变化,本报告提出六个核心判断:

判断一 · 风险认知:大模型的风险不只在“说错话”,更在“做错事”。AI 正从回答问题的工具,转变为能够自主执行任务的系统,安全边界需要被重新定义。

判断二 · 发展节奏:AI 跑得越快,安全测评越不能缺席。应用扩张与安全事件同步上升,发展与安全必须并重。

判断三 · 测评方法:不能用同一套试卷和同一条合格线考所有模型。不同模型、不同场景和不同风险等级,需要分级分类、场景化的测评体系,一个应用一套策略。

判断四 · 治理机制:安全测评不是一次性验收,而是持续治理机制。它应贯穿模型上线前、运行中和变更后的全过程,形成“事前评测防风险、事中多层强防护、事后迭代提能力”的闭环。

判断五 · 结果应用:测评结果不能只回答“得了多少分”。更要回答“能不能用、可以用在哪里、需要什么控制措施”,让测评直接支撑准入与整改决策。

判断六 · 价值定调:安全测评不是给发展踩刹车,将成为人工智能规模化应用的重要基础设施。

在产业层面,本报告进一步将上述判断凝结为行业需要建立的四个共识——安全测评应与 AI 应用发展同步推进,能力越强、接入越深越要分级管控,安全测评必须持续贯穿全生命周期,测评必须与业务场景匹配。所以,大模型安全测评应以业务场景为起点,以风险分级为依据,围绕大模型全生命周期开展安全可靠性、安全对抗、隐私、业务和运营五维测评,最终形成“准入—整改—复测—运行监测”闭环。

报告按“背景—概念—风险图景—重点风险—测评维度—实施方法—结果应用—实践验证”展开:第一章分析大模型规模化应用的安全挑战、治理制度与产业共识;第二章界定安全测评的内涵、对象与边界;第三章呈现贯穿全生命周期的五阶段风险图景;第四章归纳五类重点风险;第五章构建五大测评维度;第六章给出测评实施方法;第七章说明测评结论如何转化为准入、整改、复测和运行监测;第八章以360大模型卫士的阶段性实践验证相关能力。

对政府与行业组织,建议推动分级分类测评、行业风险库与测评基准建设,促进结果互认;对模型及服务提供者,建议把安全测评嵌入研发、发布、升级和运营全流程;对模型使用企业,建议建立模型资产清单、上线安全门槛、周期性复测与事件处置机制。

第一章 产业背景:大模型规模化应用的安全挑战与测评需求


1.1 大模型加快进入真实业务场景

从通用问答进入专业业务。大模型不再只是聊天工具,开始承担客服、法务咨询、金融分析、医疗辅助、代码生成等专业任务。专业场景对准确性、合规性和责任边界的要求远高于通用闲聊,一次错误回答可能直接造成业务损失。

从信息辅助进入业务流程。大模型从“提供信息”走向“执行任务”:智能体可以调用知识库、读写数据库、发送邮件、创建工单、操作系统。模型错误不再停留在“说错一句话”,而是可能触发真实的业务动作。

从公开服务进入政企内部系统。大模型加速进入政务大厅、企业内部办公、金融风控、能源调度等关键场景,接触大量敏感数据和核心系统。一旦被攻破或误用,影响范围从个体用户扩大到组织与公共安全。

1.2 大模型风险影响不断扩大

一次错误回答可能进入真实决策。全美已有 455 起 AI 编造判例事件,模型幻觉输出被直接引用进司法文书;国内也出现全国首例 AI “幻觉”案宣判。当模型输出进入审批、风控、医疗等决策链路,错误会被自动流程放大,后果难以挽回。

数据、知识库和系统连接扩大风险范围。模型接入知识库、数据库、邮件和工具后,攻击面从“模型输出”扩展到“系统连接”,提示词注入、越权调用、数据外泄风险随之增加。

模型能力提升带来新的安全边界问题。模型能力快速升级,GPT-6 Astra 已成为首个网络安全能力“关键级”模型,在 ExploitBench 评测中拿到满分并发现两个真实零日漏洞。能力越强,被滥用时危害越大,安全边界需要同步重新划定。

1.3 大模型安全治理进入制度化阶段

国内大模型安全法律政策体系。《网络安全法》《数据安全法》《个人信息保护法》与《生成式人工智能服务管理暂行办法》等构成基础框架;确立具有舆论属性的生成式AI服务须开展安全评估后履行算法备案。要求大模型服务“先测后用、先备案后上线”,测评成为合规准入的前置环节。

大模型备案与登记管理要求。我国逐步形成“模型备案+产品登记”的分类管理机制:具有舆论属性或者社会动员能力的生成式人工智能服务,按照相关规定开展安全评估,并履行算法备案等手续;调用已备案模型提供服务的应用,按要求开展登记。相关主体还需同时遵守网络安全、数据安全和个人信息保护等法律法规。具体法律责任应根据违法行为及所适用的法律条款判定,不宜将不同法规中的处罚额度简单等同于“未备案处罚”。

大模型安全相关国家标准。《网络安全技术 生成式人工智能服务安全基本要求》(GB/T 45654—2025)于 2025 年 11 月 1 日实施,明确 5 类 31 种风险并提出量化要求:训练数据中违法信息占比超5% 的来源应拒用、人工抽检合格率不低于 96%、技术抽检不低于 98%;生成内容安全性抽样合格率不低于 90%、应拒答问题拒答率不低于 95%、非拒答拒答率不高于 5%。公安部发布《大模型系统安全测评要求》等标准,形成“备案+登记+常态化检测”的闭环。

重点行业大模型应用安全要求。金融、能源、政务、医疗等关键行业陆续出台专项安全要求,如能源行业数据安全管理、电力监控系统安全防护等规定,大模型应用须满足行业级安全基线,行业监管持续收紧。

国际背景:全球大模型安全评估框架。欧盟《人工智能法案》按风险分级实施监管,面向高风险系统设置严格义务;英国 AI 安全研究所对 30 多个前沿模型开展持续测试,模型完成网络安全任务的平均成功率从约 10% 提升到约 50%,但所有被测系统仍可被发现弱点;OpenAI 等前沿机构呼吁建立“能力分级、统一测试、独立评估、重大事故报告”的强制性规则。国际产业侧,AI 应用采用率与安全事件同步上升(斯坦福 2026 AI 指数:组织采用率 88%,2025 年 AI 相关事件 362 起)。全球治理正在趋同于“能力越强,越需要独立的、对抗性的、动态的测评”。

1.4 当前大模型测评存在的主要问题

重能力跑分,轻安全风险。市场高度关注榜单排名,但能力高分不等于安全可靠:通用能力测评无法回答“在恶意攻击下是否守得住边界”,榜单排名高却可能在特定业务中频繁出错或泄露敏感信息。

重内容合规,轻系统与业务风险。大量测评停留在内容审核层面,忽视提示词注入、权限越界、工具调用越权等系统与业务风险——而这些恰恰是模型进入业务流程、智能体时代的主要风险。

重通用题库,轻行业场景。通用题库测不出行业特定风险;金融、政务、医疗、教育等场景的风险形态和合规要求差异显著,需要专属测试集与独立合格线。

重上线前测试,轻持续复测。多数组织“上线测一次”即结束,但模型版本、知识库、提示词、场景持续变化,问题可能在数月后才暴露,缺乏持续测评意味着风险长期处于未知状态。

重综合得分,轻风险处置。单一综合分数掩盖了风险分布,无法回答“哪里危险、能不能上线、需要什么控制措施”;测评报告停留在分数清单层面,不能支撑准入与整改决策。

厂商自测结果,缺乏统一尺度。各厂商自测的口径、题库、方法和判定标准不一,结果不可比、不可互认,行业亟需统一的测评方法和第三方验证机制。

1.5 行业需要建立的四个共识

如果说前面讨论的是“应用和风险在怎么变”,这里要回答“行业应该认同什么”。基于大模型安全测评的演进趋势与行业实践,我们认为产业侧需要建立四个共识——它们不是对现状的描述,而是对方向的判断。

共识一:安全测评应与 AI 应用发展同步推进。AI 应用正在快速进入生产系统,但安全治理能力并未同步成熟——这正是 OpenAI 等前沿机构也在呼吁建立测评体系的原因。测评不是上线前的可选项,而是与部署同频的必答题:扩张越快,测评越不能缺位。

共识二:能力越强、接入越深,越要分级管控。模型能力等级与潜在危害直接相关;接入知识库、外部工具与系统权限后,风险还会进一步放大。因此,应综合模型能力、数据敏感程度、业务重要性和操作权限确定测评强度与准入要求,为高能力、高权限模型设置与其风险等级相匹配的安全门槛和控制措施,不能与低风险模型共用同一条合格线。

共识三:安全测评必须持续贯穿全生命周期。上线只是起点,模型版本、知识库、提示词、外部工具和用户行为都在持续变化,问题可能数月后才被发现——行业已出现智能体越权事件在 7 个月后才被披露的案例。只有把测评嵌入上线前、运行中和变更后的全过程,才能及时发现问题、控制风险。

共识四:测评必须与业务场景匹配。榜单排名反映的是通用能力,不能说明模型是否适合客服、政务、金融、医疗或企业办公等具体场景;同一模型在不同场景下的风险表现差异显著。测评内容、测试集与合格线都应围绕业务场景构建,“一张卷子考天下”既测不准也管不住。

1.6 大模型安全测评的产业价值

为政府监管提供技术依据。测评提供可量化、可追溯的技术证据,支撑备案评估、分级监管与事件处置,让监管“有数可依”、处置“有据可查”。

为行业建立共同安全尺度。统一测评方法、指标与基准,促进结果互认和信息共享,避免“各自为测”,让安全成为 AI 产业的公共基础设施。

为企业选型和上线提供决策依据。企业依据测评结果选模型、定场景、设控制措施,把安全风险前置化解在选型和上线阶段,避免“先上线、后补救”。

第二章 概念界定:大模型安全测评的内涵、对象与边界


2.1 什么是大模型安全测评

大模型安全测评是以风险为导向,围绕模型及其数据、系统与业务连接,采用标准化测试集与方法,对模型在真实场景中的安全性、可靠性、隐私保护与合规水平进行系统检验,并输出可支撑决策的结论。它区别于能力跑分:回答的不是“这个模型有多聪明”,而是“这个模型在哪里会出错、出错会造成什么后果、需要什么控制措施”。

本报告由安全研究机构基于自身实践编制,定位是面向政府、行业与企业的测评指南。国家监管侧已建立备案评测与安全检测机制,本报告将其作为必须接受的合规基线;在此之上,提供一套面向业务场景、可落地执行的分级分类测评方法,两者互为补充而非替代。

2.2 能力评测、安全测评与合规评估的区别

三者目标、方法和结论不同:能力评测考察“能不能干”,关注理解、推理、任务完成与生成质量;安全测评考察“守不守得住”,关注对抗攻击下的边界、拒答行为、越权与泄露防护;合规评估考察“合不合规”,关注备案登记、内容标识、数据与个人信息保护、行业监管要求。实践中三者互为补充:能力是底座,安全是底线,合规是门槛。本报告聚焦安全测评,并将合规要求作为测评的基线条件。

2.3 大模型安全测评的主要对象

训练数据与微调数据。测评数据来源合规性、敏感信息、有害内容占比、偏见与数据质量,防范“带病数据”进入模型——学习材料本身不可靠,模型再强也可能把错误和偏见一起放大。

基础模型与微调模型。测评基础模型的能力基线、安全对齐与对抗鲁棒性;测评微调模型是否引入新风险、是否破坏原有安全边界。

模型输入与生成内容。测评输入侧的越狱、提示词注入等攻击防护,输出侧的违禁内容、幻觉、偏见、隐私泄露与引用准确性。

知识库与检索增强系统。测评知识库引用准确性、误引用、敏感信息脱敏、检索注入与越权访问——知识库是模型“说得对不对”的重要来源,也是泄露的主要渠道。

模型接口与部署环境。测评接口暴露面、鉴权与权限配置、供应链组件可信度、部署配置与版本管理——给模型开错一扇门、配错一把钥匙,可能让它接触或处理不该接触的信息。

安全防护与运营管理机制。测评内容安全护栏、告警与处置流程、日志留痕、责任划分与变更管理——这决定了问题发生后能否定位、能否追责、能否整改。

2.4 不同大模型应用形态的测评差异

自研大模型。测评覆盖全生命周期:训练数据、模型对齐、部署配置与持续运营,并须满足模型备案要求。

基于开源模型微调的行业模型。重点测评微调数据质量与合规性、微调后安全边界是否回退、行业场景适配度。

调用第三方模型接口的应用。重点测评接入层防护:提示词安全、上下文过滤、输出复测、接口限流与日志;模型本身的风险由提供商负责,但应用方承担接入与使用责任。

私有化部署的大模型。重点测评部署环境安全、权限配置、数据隔离与供应链组件安全,同时关注模型后续更新与维护机制。

面向公众与内部使用的大模型。面向公众服务须满足备案、标识、内容合规与更高对抗测试要求;内部使用重点防范敏感数据泄露、越权访问与业务误操作。

2.5 大模型安全测评的主要时点

模型选型阶段。对比候选模型的能力、安全与场景适配,用测评结果支撑选型决策,避免“先选后用、事后补救”。

开发与微调阶段。对微调数据、提示词、知识库与工具配置进行安全测试,在开发过程中及时修正引入的风险。

上线前阶段。开展覆盖内容、隐私、对抗、业务与系统的全面测评,确认达到上线标准并满足备案登记要求。

运行阶段。通过线上监测、定期抽测、红队演练与用户反馈闭环,及时发现能力漂移与新型攻击。

版本及配置变更阶段。模型升级、知识库更新、提示词或权限变化、业务范围扩大等触发重新测评,确保变更不引入新的风险。

第三章 风险图景:贯穿全生命周期的大模型安全风险


3.1 核心观点

大模型的风险不是上线后才突然出现的,而是在每个阶段积累、传递和放大的:数据里的偏见会被模型放大,训练中的幻觉会带到部署环境,部署时开错的权限会在运行时造成泄露,运行期的异常若无人监测会持续累积。因此,测评不能只在“上线前”做一次,而应贯穿模型的全生命周期——从它“出生”到它“退休”。

3.2 五阶段风险全景

我们把大模型的全生命周期划分为五个阶段,每个阶段都有其主导风险与观察要点:

数据准备阶段。这一阶段收集、清洗、筛选、标注训练与微调数据。主要风险包括数据来源不合规、隐私信息混入、错误信息沉淀、偏见与有害表达遗留、恶意数据投毒。测评关注数据来源、敏感信息、有害内容、代表性与数据质量——学习材料本身不可靠,模型再强也可能把错误和偏见一起放大。

训练与推理阶段。这一阶段通过预训练、微调和安全对齐,提升模型能力并约束其行为。主要风险包括事实幻觉、复杂推理失误、训练内容记忆、偏见输出、越狱后突破安全限制。测评关注准确性、推理能力、拒答能力、隐私记忆与安全对抗能力——模型可能“自信地答错”,也可能在被巧妙诱导后越过原本设定的安全边界。


集成与部署阶段。这一阶段将模型接入知识库、业务系统、接口、账号权限和外部工具。主要风险包括模型来源不明、组件被篡改、权限配置过大、接口暴露、版本变更失控。测评关注模型与组件可信度、访问权限、接口安全、日志审计与版本追溯——给模型开错一扇门、配错一把钥匙,可能让它接触或处理不该接触的信息。

应用与运行阶段。这一阶段模型以客服、办公助手、代码助手或智能体的形式处理真实用户请求。主要风险包括提示词注入、知识库误引用、敏感信息泄露、工具调用越权、错误操作未经确认。测评关注真实任务完成率、提示词注入防护、工具调用边界、人工审批与异常中止——过去的模型主要可能“说错”,能调用工具后,它还可能“做错”。

持续运营与演进阶段。这一阶段模型、提示词、知识库、外部工具和用户行为持续变化。主要风险包括模型表现漂移、知识过期、新攻击手法出现、异常输出累积、用户过度依赖。测评关注周期复测、变更评估、线上监测、红队演练与用户反馈闭环——大模型更像持续成长的数字员工,不能只在“入职”时考试一次。

3.3 对测评的含义

风险分布决定了测评的形态:不同阶段的风险不同,测评的时点、内容和方法也应不同。上线前测评解决“能不能上”的问题,运行中监测解决“有没有出事”的问题,变更后复测解决“变化有没有引入新风险”的问题。全生命周期视角,是设计一切测评方案的前提。

第四章 风险聚焦:大模型安全的五类重点风险

第三章按生命周期回答了“风险在哪里”,本章按风险类别回答“重点防范什么”。五类风险与全生命周期视角互为补充:前者帮助识别风险源头,后者帮助聚焦防护资源。

4.1 可靠性风险:它可能“答错”

大模型善于生成自然、连贯的语言,但自然流畅并不自动等于真实准确。可靠性风险包括:幻觉与事实错误、编造不存在的来源和引用;长文本理解偏差、复杂推理遗漏关键条件;在不同提问方式下给出不稳定甚至相互矛盾的回答。可靠性风险是其他风险的基础放大器——错误的输出进入业务流程,可能直接导致错误决策。

4.2 安全对抗风险:它可能“被带偏”

攻击者不直接攻击模型参数,而是攻击它的“语言接口”。典型形态包括:恶意用户通过越狱提示绕过安全限制;恶意指令隐藏在网页、邮件或文档中,诱导模型违背原始规则(提示词注入);攻击者利用模型的工具调用能力,间接实施越权操作。随着模型从“对话”走向“执行”,安全对抗风险的危害等级显著上升。

4.3 数据与隐私风险:它可能“说出不该说的”

模型在对话中可能不当引用或泄露用户输入、上下文资料和知识库内容;不同权限的用户可能获得超出自身范围的信息;对话、日志和调用记录中可能残留敏感数据。知识库未脱敏、权限边界不严、日志管理缺失,是数据与隐私风险的主要来源。

4.4 业务执行风险:它可能“做了不该做的”

当模型连接工具和系统权限,风险从“说错”升级为“做错”:智能体误发邮件、误建工单、误修改数据;错误判断被自动流程放大;关键业务操作缺少人工确认和可回退机制。业务执行风险的核心特征是“动作性”——一旦发生,影响直接作用于真实系统,后果难以撤回。

4.5 治理与合规风险:出了问题,可能“说不清、追不回”

多数组织说不清模型使用了什么数据、为何做出某项回答;缺少操作留痕、版本记录和责任边界;内容安全、个人信息、知识产权等要求未被纳入日常管理。治理与合规风险不直接表现为“答错”或“做错”,但它决定了问题发生后能否定位、能否追责、能否整改,是组织安全能力的“兜底线”。

收束:五类风险共同构成大模型应用的防范重点。测评资源应优先投向与自身业务强相关的风险类别:面向公众服务的组织重点防可靠性、安全对抗与内容合规风险;接入业务系统与工具的组织重点防数据隐私、业务执行与治理风险。

第五章 测评维度:大模型安全测评的指标体系


风险类别决定测评维度。本报告聚焦安全测评,不替代通用模型能力跑分。其中“安全可靠性测评”只考察与安全使用直接相关的准确性、稳定性和关键任务完成情况。一套完整的安全测评应覆盖五个维度,分别回答“结果靠不靠谱、边界守不守得住、数据会不会泄露、业务能不能安全执行、变更后是否仍然可靠”。

第六章 方法路径:大模型安全测评的实施方法论


6.1 测评起点:业务场景,而非模型参数

有效的测评从业务场景开始:明确面向谁、解决什么问题、接触哪些数据、是否调用外部工具;划定高风险动作——哪些内容必须拒答、哪些操作必须人工确认;为每个场景设定可接受的上线标准。场景定义了测评的边界,参数定义不了。

6.2 测试集设计:四层测试集

一套完整的测试集由四层构成:基础题测试通用理解、问答、摘要、推理和生成能力;业务题采用真实或脱敏后的工作任务,测试实际可用性;边界题测试模糊提问、极端条件、信息冲突和错误诱导;攻击题模拟越狱、提示词注入、敏感信息套取和越权操作。四层测试集分别对应能力、业务、可靠性与安全对抗四个层面的风险。

6.3 判定方式:自动化与人工复核结合

自动化评测适合大批量、可重复的基础测试,效率高、可复现;专家复核适合专业事实、高风险内容和复杂业务判断;真实用户试用可以发现实验室中未暴露的实际问题。对高风险结果,应保留问题样本、判定依据和修复记录,确保测评结论可追溯、可复核。

6.4 测评指标:可比较、可决策

测评结果需要用指标量化:正确率、任务完成率、引用准确率衡量能力与可靠性;攻击成功率、越权率、敏感信息泄露率衡量安全与隐私;正确拒答率(该拒绝时能否拒绝)与误拒率(该正常回答时是否过度保守)衡量拒答行为质量;稳定性、响应速度、人工介入率衡量运营表现。指标应围绕业务目标定义,避免“为了分数而测”。

6.5 分级分类:场景化测评与差异化合格线

分级分类测评。根据模型能力及潜在危害、应用行业与业务重要性、数据敏感程度、服务对象与开放范围、系统权限及操作影响等因素,确定测评强度与准入要求,形成基础级、重要级、高风险级等不同测评要求。高能力、高风险场景从严,低风险场景从简,把测评资源用在刀刃上。

场景化测评。金融、医疗、政务、教育等行业应增加行业专项测试集,落实“不能一张试卷考所有模型”。场景化测评的产出不是单一分数,而是“该场景下的风险清单与使用条件”。

第七章 结果应用:测评结论的转化与持续治理


测评本身不产生安全,把测评结论转化为准入决策、整改闭环与持续测评机制,测评才真正产生价值。本章回答“测完之后怎么办”。

第八章 实践验证:360 大模型卫士的落地与成效


8.1 以模治模、以测促防的产品理念

360 大模型卫士防护系统专注大模型内容安全防护,兼具“内容安全护栏”与“内容安全评测”双重核心能力,可支撑 AI 业务合规备案、AI 业务内容合规防护、企业 AI 应用风控、模型上线前风险评估、大模型选型测试等场景。它秉承“以模治模、以测促防”的设计理念,专项训练风险检测大模型、安全代答大模型、评测裁判大模型等安全模型,搭建内容安全智能体。通俗地说:模型上线前,它能当“考官”做评测;模型上线后,它能当“门卫”守边界。

8.2 五道防线:把风险地图变成可执行的防护

内容安全护栏围绕业务大模型的输入与输出,形成干预回复、敏感词拒答、风险/攻击 AI 识别、安全代答、输出内容复测五道防线。系统内置 200 万条多维度敏感词库,覆盖涉政、涉黄、暴力、违禁品等风险类别,每条敏感词关联风险等级、所属场景与处置建议;风险检测大模型覆盖 100+ 内容安全风险类目,在保证召回率的前提下,风险检测准确率达 90% 以上。五道防线正是把“识别有害请求、防越狱、防注入、防泄露、防越权”变成一道道可执行的工序。

8.3 实践数据与典型案例

在安全护栏加固测试中,Llama3-8B的安全回复率从64.90%提升至86.20%,相对提升32.82%;DeepSeek R1-671B从82.22%提升至94.05%,相对提升11.83%;在该测试集和判定口径下,模型幻觉问题下降约50%。上述结果表明,测评能够识别模型在特定测试条件下的风险缺口,并通过加固前后对比检验防护措施的有效性。

针对智能体与MCP(模型上下文协议)生态,360在抽样测评的MCP服务及相关组件中发现,约10%的样本存在安全漏洞、约6%的样本易受提示词注入攻击;在已分析的智能体安全问题中,约80%与权限、接口、流程等工程实现有关,约20%来自模型本身。在面向第22届东盟博览会的实战防护中,360大模型卫士处理380万次请求,拦截恶意请求117次,完成安全代答790次,识别攻击571次。

8.4 权威认可

在 2026 年国家网络安全宣传周期间发布的“2026 年人工智能技术赋能网络安全应用测试”结果中,360 在大模型安全护栏能力检测场景获得第一名。该测试由中央网信办等 16 家部委单位指导、国家互联网应急中心主办,面向全社会遴选优秀的人工智能网络安全产品。

此前,360 大模型卫士已获多项权威认可:首家通过中国信通院“大模型安全防护围栏能力检验”并获证;大模型卫士评估系统获国家网络与信息系统安全产品质量检验检测中心“大模型安全评估系统(增强级)认证”;入选 IDC《中国大模型安全评估平台厂商技术评估,2025》综合实力领先。早在2024 年,经 360 大模型内容安全护栏技术加固的 360 智脑,已连续两个季度在中国信通院 AISafety榜单排名第一。

结语

当 AI 应用扩张与安全事件同步上升,安全测评已从“可选项”变为“必答题”。

本报告围绕三件事展开:风险怎么看——大模型的风险不是上线后才突然出现,而是贯穿数据准备、训练与推理、集成与部署、应用与运行、持续运营与演进的全生命周期;测评怎么做——建立覆盖能力、安全、隐私、业务、运营五大维度的指标体系,采用分级分类、场景化、自动化与人工复核相结合的测评方法;结果怎么用——测评结论直接支撑准入决策、整改闭环与持续测评机制,让“能不能用、可以用在哪里、需要什么控制措施”有据可依。

当前,大模型安全测评正在经历三个关键转变:从企业自测走向制度化、第三方与体系化治理;从统一评分走向分级分类测评;从上线前测试走向覆盖全生命周期的持续测评。这些转变标志着 AI 产业从“能力竞赛”走向“能力与安全并重”的成熟阶段——安全测评正在成为 AI 应用的基本门槛,而非附加选项。

测评本身也在持续进化。随着智能体、多模态与工具调用成为主流应用形态,测评对象从“模型本身”扩展到“模型+系统+业务”的整体;测评方法从人工抽检走向自动化、红队对抗与专家复核相结合;测评证据从静态报告走向可追溯、可复现的持续证据链。今天划定的安全边界,可能随着模型升级与场景扩展而失效,唯有把测评嵌入研发、发布、升级与运营的全流程,才能让安全能力与模型能力同步成长。

让安全成为产业公共基础设施,需要各方共同行动。政府与监管部门应完善分级分类要求、推动第三方测评与重大事件报告机制;行业组织应建设行业风险库、业务场景测试集与测评基准,促进结果互认;模型与服务提供者应把安全测评嵌入研发、发布、升级和运营流程;模型使用企业应建立模型资产清单、上线安全门槛、周期性复测与事件处置机制。

360将坚持“以模治模、以测促防”的理念,持续投入安全测评与防护能力建设,与政府、行业组织和企业一道,推动大模型安全测评从“单点实践”走向“行业共识”,让安全测评真正成为 AI 规模化落地的信任基础设施。

让大模型更强只是开始;让它在正确的边界内稳定工作,才是人工智能走向可信应用的关键一步。

附录 主要法律法规、标准及参考文献

  • 《生成式人工智能服务管理暂行办法》(国家互联网信息办公室等七部门,2023)

  • 《互联网信息服务算法推荐管理规定》(2022)《互联网信息服务深度合成管理规定》(2023)《人工智能生成合成内容标识办法》(2025)

  • 《网络安全技术 生成式人工智能服务安全基本要求》GB/T 45654—2025(2025-11-01 实施)

  • 《生成式人工智能预训练和优化训练数据安全规范》《生成式人工智能数据标注安全规范》《网络安全技术 人工智能生成合成内容标识方法》等配套标准

  • 公安部《大模型系统安全测评要求》及大模型服务安全检测方案(2025)

  • Stanford HAI, 2026 AI Index Report

  • UK AI Security Institute, Frontier AI Trends Report

  • 《智能体规范应用与创新发展实施意见》(2026)

  • 《人工智能安全治理框架》3.0 

免责声明

本报告由360AI安全实验室联合相关专家编制,仅供行业交流参考,不构成任何投资、法律或决策建议。

报告内容基于公开资料及编制方测评实践,编制方力求准确完整,但不对其绝对准确性和时效性作保证。读者据此决策的风险自行承担。

未经书面授权,不得篡改或用于商业用途;转载引用须注明出处。最终解释权归360AI安全实验室所有。



编 制 机 构:360AI安全实验室

联 合 编 制 专 家(排名不分先后)

赵 鸣 无锡学院网络空间安全学院

周 波 无锡数据集团有限公司

严星宇 国联民生证券股份有限公司

李少鹏 北京数字世界咨询有限公司

张向征 三六零科技集团有限公司

邹权臣 三六零科技集团有限公司

孙 林 三六零科技集团有限公司

魏晓雷 三六零科技集团有限公司

管 铭 三六零科技集团有限公司

刘 超 三六零科技集团有限公司

【声明】内容源于网络
0
0
数世咨询
中国数字化领域独立的第三方服务机构,提供网络安全行业的调查、研究与咨询服务。
内容 1176
粉丝 0
数世咨询 中国数字化领域独立的第三方服务机构,提供网络安全行业的调查、研究与咨询服务。
总阅读12.8k
粉丝0
内容1.2k