← 返回题目列表

大模型上线后如何进行安全监控、漂移检测和事件响应?

高频 中等 第 2 / 25 题 更新于 2026/07/25
安全监控漂移检测事件响应线上评估

简化版

上线后要监控输入风险、拒答与拦截、工具调用、事实错误、成本、用户反馈,并按模型/Prompt/数据源/租户/场景分组观察漂移。日志必须脱敏且受控。发现高危异常时要能限流、关闭工具、回滚版本、切换安全模式,并把复盘案例加入回归集。核心——只监控最终文本会漏掉被执行层拦截的危险工具调用和未返回给用户的内部泄露

详细版

监控分三类:质量(任务成功率、事实性)、安全(注入命中、越权尝试、敏感数据、误拒)、系统(延迟、Token、错误率、调用链)。只看最终文本会漏掉危险工具调用和内部泄露,要全链路 Trace。

漂移来源:用户分布、攻击手法、知识库、工具、模型版本、策略变化。要保留版本标签和 Trace,用固定金丝雀集持续评测,结合线上抽样人工审核,而不是依赖单个实时总分。

完整版教学

一、需要记录什么

请求 ID、版本、风险类别、Guardrail 决策、工具名与授权结果、延迟、Token、最终状态
Prompt 和输出按【最小必要】采集,对密钥/PII/业务敏感数据脱敏或不落盘
⚠️ 安全日志本身是敏感资产 → 需要访问控制、保留期限、审计
   (别让安全监控系统成为新的泄露点)

二、指标与告警(关注变化率,不只看绝对值)

安全:危险内容通过率、安全请求误拒率、注入/Jailbreak/越权工具调用率、跨租户访问
质量:任务成功率、事实性、人工接管率、用户纠错和投诉
系统:单请求 Token/工具次数/费用异常、P95/P99 延迟、超时、失败率
→ 告警阈值【按场景分层】,关注【变化率】而非只有固定绝对值
   (突然翻倍的越权尝试比一个固定阈值更能反映攻击)

三、漂移检测:数据漂移 vs 行为漂移

数据漂移:输入的主题/语言/长度/风险类别【分布】变化(用户变了、来了新攻击)
行为漂移:同一【金丝雀集】的得分变化(模型/链路行为变了)
⚠️ 检索库更新、工具返回格式变化 → 即使模型版本没变,应用也可能退化
漂移信号提示【需要调查】,不自动证明模型失效

金丝雀集(固定的代表性样本)是发现行为漂移的关键——用同一批题持续跑,得分掉了就是行为变了

四、灰度与回滚

新模型/Prompt/Judge/Guardrail/知识库 → 先离线回归 → 灰度到少量流量
  → 对照旧版本观察质量/安全/成本 → 达标再放量
发布记录支持【快速回滚】;工具权限和策略配置也要【版本化】

五、事件响应(四步)

出了安全事件,处理顺序很关键:

① 限制影响范围:吊销凭证、关闭写工具、隔离租户、降级为只读
② 保存证据:判断受影响的数据和用户
③ 修复根因 + 通知相关方
④ 恢复前用【原攻击 + 相邻变体】验证(确认真修好了,不是碰巧不复现)

记忆钩子:先止血(限流/关工具/回滚)再溯源——事件响应第一优先级是控制损害,不是先查根因。

六、常见误区与追问

  • 误区:监控最终文本就够。 会漏掉被执行层拦截的危险工具调用和没返回给用户的内部泄露,要全链路 Trace。
  • 误区:安全日志随便存。 它是敏感资产,要脱敏+访问控制+保留期限,否则监控系统成新泄露点。
  • 误区:告警只看固定绝对阈值。 要关注变化率并按场景分层,突然翻倍的越权比固定阈值更能预警。
  • 误区:模型版本没变就不会退化。 检索库/工具格式变化也会让应用退化(行为漂移),要金丝雀集监控。
  • 误区:出事先查根因。 先止血(限流/关工具/隔离/回滚)控制损害,再溯源修复。
  • 追问:监控分哪几类? 质量、安全、系统三类,且要全链路 Trace 而非只看最终文本。
  • 追问:数据漂移和行为漂移区别? 数据漂移是输入分布变化,行为漂移是同一金丝雀集得分变化。
  • 追问:事件响应的顺序? 限制影响范围(止血)→ 保存证据 → 修复根因+通知 → 用原攻击+变体验证再恢复。

七、加强记忆

线上安全记「看得见、拦得住、退得回、学得会」:全链路 Trace 提供证据(别只看最终文本,会漏工具调用和内部泄露)、分层告警发现异常(关注变化率,数据漂移 vs 行为漂移用金丝雀集)、权限开关限制损害(限流/关工具/回滚/降级)、复盘样本推动下一轮回归。核心纪律钉死:安全日志要脱敏受控(别成新泄露点)、模型没变也可能因检索/工具漂移退化、事件响应先止血再溯源、恢复前用原攻击+变体验证真修好了。灰度发布 + 版本化 + 快速回滚兜底。