[89] Constitutional AI:用规则与 AI 反馈降低人工标注压力¶
- 资料类型:论文
- 原始来源:https://arxiv.org/abs/2212.08073
- 对应章节:第 15 章(后训练:对齐与安全)
一句话¶
Constitutional AI 提供了一种思路:先把价值与边界写成规则,再让模型按规则自我批评、自我改写,把部分人类反馈工作转移给 AI,但前提是你能把规则写清、并用评测去验收。
你该从这篇论文带走什么¶
- 规则写不清,AI 反馈就会变成新的噪声源。所谓降低成本,不是减少严谨,而是把严谨从标注搬到规则与门禁。
- 这类方法更像是把对齐做成一个可迭代的规范体系,而不是只做一次训练。
- 在产品层面,它强调了同一件事:安全边界要能被验收,不能只写在口号里。[20]
在本书里怎么用¶
- 适合作为引子,解释为什么对齐不只是训练技术,而是规则、评测、发布门禁共同组成的体系。
- 也可以用于设计标注指导:把标准写成可执行条款,再把条款映射到评测用例与红队集。[18]
常见误用¶
- 把规则写成大而空的价值宣言,无法指导具体回答优劣,最后训练得到的只是更会说漂亮话。
- 忽视规则冲突与优先级,导致模型在不同场景表现不一致,调参也很难收敛。