← 返回题目列表

如何构建模型对齐评测集?

高频 困难 第 10 / 25 题 更新于 2026/09/17
模型对齐评测集安全评测数据治理

简化版

对齐评测集要覆盖“应该拒绝、应该帮助、需要谨慎帮助和信息不足”四类边界,并按风险领域、语言、表达方式、用户意图和对抗强度分层。每条样本要有明确策略依据、允许响应范围和评分量表,而不是只存一个标准答案。数据需去重、防污染、版本化,并保留冻结回归集与持续更新的挑战集。

详细版

先从威胁模型和产品使用场景建立 taxonomy,再按风险×频率分配样本。每条记录至少包含输入、上下文、标签、政策版本、理想行为、不可接受行为、严重度和标注分歧。拒答题旁边必须加入语义相近的良性对照,才能测过度拒答。

coverage = domain × intent × language × attack style × difficulty

评测分三层:冻结集做发布回归,挑战集捕获新攻击,线上回流集反映真实分布。评分结合确定性规则、专家人评和校准评审模型;报告拒答召回、良性误拒绝、严重违规率、帮助性和分组置信区间,不能把所有风险平均成一个总分。

完整版教学

一、先定义要守住的边界

没有风险分类就无法知道“覆盖充分”是什么意思。应从产品能力、可用工具、目标用户和法规责任建立威胁模型,例如隐私、欺诈、危险操作、偏见、越权与自伤支持等。

同一领域还要区分意图。讨论网络攻击的防御原理、请求执行攻击、引用新闻报道,允许程度不同。只按关键词收集会让评测失真。

记忆钩子:对齐评测不是危险词词典,而是“场景 + 意图 + 能力 + 后果”的组合覆盖。

二、四种行为都要有样本

应拒绝的请求测试安全召回;应回答的良性请求测试误拒绝;可提供有限帮助的边界请求测试安全转化;信息不足请求测试澄清与不确定性。

类型期望行为主要错误
明确有害拒绝或安全转向直接提供能力
良性敏感正常、准确帮助过度拒答
双重用途限制细节并给安全帮助全放或全拒
信息不足澄清或保守回答猜测意图

危险样本与良性近邻成对设计,才能知道模型是在理解意图还是看到词就拒绝。

三、覆盖矩阵决定采样

把风险域、意图、语言、攻击方式、长度和工具能力组成矩阵,不必做全笛卡尔积,但关键高风险格子要足量。稀有却严重的事件不能按自然流量比例采样,否则几乎测不到。

可用 priority = severity × exposure × uncertainty 排序补样。线上高频问题强调代表性,灾难性低频问题强调压力覆盖,二者分别报告。

每个切片设置最小样本量,否则三道题全通过不能证明该语言安全。

四、标注不是唯一标准答案

开放式响应可能有多种合格写法。标注应给策略依据、必须包含、禁止包含和严重度量表;必要时给正反例,而非要求逐字匹配参考答案。

must: 明确不协助危险操作;提供安全替代
must_not: 给出可直接执行的步骤或关键参数
severity: 0=合格, 1=轻微, 2=实质帮助, 3=严重违规

政策版本必须绑定样本。规则变化后,旧标签是历史证据,不应静默覆盖。

五、标注一致性与专家升级

先让多名标注员独立判断,再计算一致率或 Krippendorff’s alpha。分歧高的题可能是指南不清,而非标注员能力差。

假设 200 题中两人一致 160 题,表面一致率 80%;还需考虑随机一致。边界与高风险分歧交给领域专家仲裁,并把结论写回指南。

标注员需得到心理支持和暴露控制,尤其涉及极端有害内容时,数据治理也是评测质量的一部分。

六、冻结集、挑战集和线上集分工

冻结集长期不变,用于版本可比;挑战集不断加入新越狱与失败模式,防止只优化旧题;线上集按真实分布抽样,用于发现实验室偏差。

冻结集不能无限公开,否则容易被训练污染。挑战集成绩不能与旧版本简单纵向比较,因为题目难度在变;应保留共同锚点。

线上回流先脱敏、去重和人工确认,不能把用户文本直接无审查纳入测试。

七、防止泄漏和近重复

训练集与评测集按语义去重,而不只做字符串哈希。轻微改写、翻译和模板替换仍可能泄漏。来源、创建时间和是否公开要记录在数据血缘中。

若模型记住固定拒答模板,可能在公开基准得高分却对新攻击失败。使用参数化生成、私有样本和时间外数据降低背题。

发现污染时不要只删一题,要检查同源簇,并重新计算可比结果。

八、评分与报告要体现严重度

自动规则适合查敏感串、工具调用和格式;评审模型适合大规模初筛,但要用人类标签校准;高风险样本需专家复核。

若 1000 题中 10 个严重违规、50 个轻微问题,总通过率 94% 会淡化严重事件。报告应分别给严重违规率、应拒绝召回、良性误拒绝、帮助性和各关键切片。

置信区间同样重要。样本少的切片即使 100%,也不应宣称风险为零。

九、常见误区与追问

  • 误区:收集越多危险问题,评测越完整。 缺少良性近邻会看不出过度拒答。
  • 误区:一个参考答案可以覆盖开放响应。 应用行为量表定义允许范围。
  • 误区:所有题平均成总分最直观。 严重违规和关键切片会被稀释。
  • 误区:公开基准高分即可上线。 可能污染且不匹配产品工具与用户。
  • 误区:挑战集不断更新仍可直接纵向比较。 难度变化,需要冻结锚点。
  • 追问:样本比例怎么定? 结合真实频率、后果严重度和不确定性分层分配。
  • 追问:评审模型可以替代人吗? 可扩展初筛,但需校准并对高风险与分歧样本人审。
  • 追问:怎样测试多语言? 既做平行翻译,也收集本地文化与表达特有样本。

十、加强记忆

对齐评测集记住“威胁建模、四类行为、矩阵覆盖、量表标注、三套数据”:从真实能力与风险定义 taxonomy,同时测拒答与良性帮助;按严重度和暴露分层采样;用允许/禁止行为量表而非唯一文案;冻结集保可比、挑战集追新风险、线上集贴真实分布。最终分开报告严重违规、误拒绝和帮助性,不让总分掩盖边界。