跳转至

[89] Constitutional AI:用规则与 AI 反馈降低人工标注压力

  • 资料类型:论文
  • 原始来源:https://arxiv.org/abs/2212.08073
  • 对应章节:第 15 章(后训练:对齐与安全)

一句话

Constitutional AI 提供了一种思路:先把价值与边界写成规则,再让模型按规则自我批评、自我改写,把部分人类反馈工作转移给 AI,但前提是你能把规则写清、并用评测去验收。

你该从这篇论文带走什么

  • 规则写不清,AI 反馈就会变成新的噪声源。所谓降低成本,不是减少严谨,而是把严谨从标注搬到规则与门禁。
  • 这类方法更像是把对齐做成一个可迭代的规范体系,而不是只做一次训练。
  • 在产品层面,它强调了同一件事:安全边界要能被验收,不能只写在口号里。[20]

在本书里怎么用

  • 适合作为引子,解释为什么对齐不只是训练技术,而是规则、评测、发布门禁共同组成的体系。
  • 也可以用于设计标注指导:把标准写成可执行条款,再把条款映射到评测用例与红队集。[18]

常见误用

  • 把规则写成大而空的价值宣言,无法指导具体回答优劣,最后训练得到的只是更会说漂亮话。
  • 忽视规则冲突与优先级,导致模型在不同场景表现不一致,调参也很难收敛。