如何设计可执行的 Constitutional AI 原则?
简化版
Constitutional 原则是供模型批评、改写或产生偏好信号的行为准则。好的原则要单一、具体、可观察,说明适用范围、例外和冲突优先级,并能转成正反样例与评分量表;“做一个好模型”无法执行。原则制定后要用覆盖测试、标注一致性、红队和版本回归验证,不能把自然语言原则当成绝对安全保证。
详细版
设计流程是:从威胁模型和产品价值提炼行为目标 → 拆成原子原则 → 定义适用/禁止/例外 → 建立冲突优先级 → 编写批评与修订示例 → 用标注和模型评审验证。原则要区分事实诚实、伤害避免、用户自主和隐私等维度。
scenario -> applicable principles -> conflict resolution
-> critique rubric -> revised response -> verification
例如“保护隐私”应具体成“不披露非请求者有权访问的个人数据;必要时提供安全替代”,并说明紧急与法定流程不由模型自行裁决。评估看违规率、良性误拒绝、原则间冲突、跨语言一致性和评审模型偏差;每次原则升级保留版本与迁移记录。
完整版教学
一、原则的作用位置
Constitutional AI 用一组明确原则指导模型自我批评、修订回答或生成训练偏好。原则既可以用于训练数据生成,也可以用于推理期评审,但不直接等同于执行层权限。
模型遵循原则仍是概率行为。付款限额、数据访问和工具授权必须由代码强制,不能因为“宪法里禁止”就取消网关。
记忆钩子:原则塑造判断,策略执行边界;前者告诉模型怎样更好,后者决定系统允许什么。
二、原则应原子且可观察
“安全、友好、诚实”同时含多个目标,违规时不知道是哪条。应拆为可判断行为,例如“不把不确定信息表述为已确认事实”“不提供直接促进严重伤害的操作细节”。
| 弱原则 | 改写后的可执行原则 |
|---|---|
| 尊重用户 | 不贬损;保留用户知情选择 |
| 保持安全 | 对明确高危操作不给关键执行能力 |
| 诚实回答 | 区分事实、推测和未知,并给来源 |
原则中的行为要能从响应中观察,避免要求模型证明不可见的内心动机。
三、写清适用范围和例外
同一危险主题可能用于攻击、新闻、教育或防御。原则若只按关键词禁止,会造成过度拒答;若例外过宽,又会被伪装意图绕过。
每条原则包含适用主体、风险对象、允许帮助层级、禁止内容和升级条件。例外应依靠可验证上下文或受控流程,而非用户一句“仅供研究”。
无法确认时,可提供不增加危险能力的高层信息并请求澄清。
四、冲突需要明确优先级
帮助性、隐私、诚实和安全经常冲突。用户要求总结私有邮件可以很有帮助,却可能没有权限;完全拒绝所有敏感主题又损害正常支持。
可以规定硬约束优先,再在剩余空间优化帮助性:合法权限与严重伤害边界先满足,之后尽量提供准确、尊重自主的替代帮助。
冲突表应包含典型案例和决策理由,不能只写抽象排序,因为具体场景的权衡方式不同。
五、把原则转成批评量表
模型自评若只问“是否符合原则”,容易一律回答符合。量表要逐条检查行为、引用响应片段、给严重度并提出最小修订。
principle: 不把未知表述为事实
evidence: “该药一定有效”
severity: 2/3
revision: 改为证据范围与建议咨询专业人士
批评与改写最好分步,改写后重新检查全部原则,防止修复一项又破坏另一项。
六、评审模型也会偏
使用 AI 评审可扩展数据生成,但评审模型可能偏好长答案、固定拒答措辞或与自身相似的风格。需要人类标注校准,并用不同模型交叉检查关键样本。
若 500 个样本中评审与专家一致 425 个,一致率 85%;还要分析 75 个分歧是否集中在某原则或语言。不能用总体一致率掩盖高风险漏判。
专家分歧也可能说明原则本身含糊,应先修原则而不是强行统一标签。
七、版本化与变更治理
原则随法规、产品能力和经验变化。每个训练或评测结果绑定原则版本,变更包含原因、影响范围和新旧行为差异。
原则更新后重新生成部分偏好数据或重新训练并非自动安全;要跑新旧回归,查看安全收益和良性误拒绝。旧版本用于复现历史事故。
紧急补丁可以先在策略层拦截,随后再进入完整原则与训练治理流程。
八、用边界样本而非口号验收
测试集包含明确违规、明显良性、双重用途、信息不足、冲突原则和跨语言改写。对每条原则分别计算违规、误拒绝和修订有效率。
例如隐私原则在 100 个越权请求中拦住 98 个,在 100 个有权请求中误拒 12 个;只报告 98% 安全召回会遗漏帮助性问题。
红队还要尝试通过角色扮演、引用文本和多轮对话绕过,确认执行层仍能兜底。
九、常见误区与追问
- 误区:原则越多越安全。 重叠与冲突会降低一致性,应保持最小清晰集合。
- 误区:抽象价值词足以指导模型。 必须定义可观察行为和边界例子。
- 误区:模型自我批评就无需人工。 评审会偏,需要专家校准和抽检。
- 误区:原则能替代权限系统。 概率遵循不能提供确定性授权。
- 误区:更新一条原则只影响对应风险。 参数训练可能产生广泛能力与拒答变化。
- 追问:原则冲突怎么处理? 定义硬约束和优先级,并用具体案例验证权衡。
- 追问:例外怎样防滥用? 依赖可验证上下文、权限和受控工具,而非用户自述。
- 追问:如何判断原则太模糊? 标注分歧高、批评无法引用具体行为时应重写。
十、加强记忆
Constitutional 原则设计记住“原子、边界、冲突、量表、版本”:一条原则只描述可观察行为,写清适用、禁止、例外和升级;原则冲突有明确优先级;批评必须引用证据、给严重度和修订;AI 评审用专家标签校准;所有变化版本化并跑安全与误拒绝回归。原则塑造行为,但确定性权限仍由系统执行。