Hi~新朋友,记得关注我们哟
在生成过程中发挥作用的 LLM 安全监控器通常会分析一系列安全分数,以捕捉不正确或有害的输出。研究人员发现,只分析单个安全分数就能达到几乎相同的性能。
● 最新消息:来自阿姆斯特丹大学、威斯康星大学麦迪逊分校和约翰斯·霍普金斯大学的研究团队提出了一种名为"CRC Monitor"的简易监控系统(CRC 即保形风险控制)。该系统通过将单个安全分数与针对具体任务精心校准的阈值进行比较,即可高效评估输出内容的安全性。
● 关键见解:现有系统(如 e-valuator)通常在每一步推理或对话后对 LLM 输出打分并分析历史数据以决定是否停止。而更简单的方法是:一旦最新一步的分数低于阈值便立即停止。难点在于如何可靠地设定阈值。基于有限验证集测得的误报率可能因偶然因素低于新数据上的实际误报率,因此阈值的选取需更加保守。
工作原理
研究人员针对“错误数学推理”和“有害主题内容”两类任务校准了 CRC Monitor 的阈值。对于每个数据集,他们使用独立的验证模型(verifier)对每一步输出文本进行评分,旨在找到同时满足以下两个标准的阈值:(i)尽可能多地捕捉不安全输出;(ii)将误报数量控制在用户定义的上限之下。
✴ 数学推理场景:研究人员构建了一个校准数据集,利用 Anthropic Claude Haiku 4.5 和 Mistral-7B-Instruct 生成 MATH 数据集解答,并由 Alibaba Qwen2.5-Math-PRM-7B 作为 verifier 进行打分,最终使用 OpenAI o3-mini 验证解答 correctness 以创建标签。
✴ 有害内容场景:在 Anthropic Red Teaming 和 FineHarm 数据集上进行评估。Verifier 分别选用 Llama Guard(针对 Red Teaming)和经过微调的 Qwen2.5-1.5B 模型(针对 FineHarm)来检测有害性。
✴ 阈值选择策略:研究人员在验证集上测试多个阈值,测量其错误停止安全输出的频率。鉴于真实数据上的误报率可能高于验证数据,他们在实测误报率基础上增加了一个小的补偿值,随后选择在修正后的误报率低于用户定义上限的前提下,尽可能大的阈值。
✴ 推理执行:在生成阶段,一旦 verifier 评分低于设定阈值,系统即刻停止输出生成。
测试结果
CRC Monitor 能够更快地标记不安全回应,在严格保持用户指定误报率的同时,大多数实验表现与 e-valuator 相当。
✴ MATH 数据集(误报率上限 20%):该系统检测到约 80% 由 Mistral-7B-Instruct 生成的错误解答(与 e-valuator 持平),但平均在推理进程约 35% 时发出警报,优于 e-valuator 的 40%。
✴ 搭配更强的 Claude Haiku 4.5 时:CRC Monitor 检测到约 75% 的错误解答(e-valuator 为 76%),平均在推理进程约 40% 时报警,显著早于 e-valuator 的 49%。
✴ FineHarm 数据集(误报率上限 20%):CRC Monitor 检测到接近 99.5% 的有害输出,平均在对话进程约 14% 时报警,两项指标均与 e-valuator 持平。
✴ Anthropic Red Teaming 数据集:CRC Monitor 检测到的有害对话比例较低(32%,e-valuator 为 54%),但其报警速度极快,平均在对话进程约 26% 时触发,远早于 e-valuator 的 55%。
重要原因
阻止 LLM 生成不良输出可通过更简单、低成本的方式实现。有效的监控器仅需最新一轮的安全分数、校准后的阈值及对错误的预设容忍度,即可在生成过程中拦截问题内容。这种方法能比竞争方案更早发现问题,减少用户接触错误或冒犯性内容的机会,同时降低部分推理成本。研究人员建议,该方法适用于分层监控架构:持续生成廉价信号并按校准规则停止,仅当廉价信号指示质量较差时,才切换至更昂贵的 verifier。
我们在想
既然简单的安全检测方法能达到与复杂方法相当的效力,那么改进背后的 verifier 模型,可能比设计更复杂的结果加权方式带来更大的性能提升。

