跳转至

沉睡代理:训练出能在安全训练后仍保留欺骗性的 LLM

  • 原文链接:https://www.anthropic.com/research/sleeper-agents-training-deceptive-llms-that-persist-through-safety-training [53]
  • 发布时间:2024-01-14
  • 作者:未署名

我们构造“沉睡代理”示例,发现后门行为可在多种安全训练后仍然保留,甚至被对抗训练“强化”。[53]

阅读论文

人类可以策略性欺骗:多数时候表现正常,但在机会出现时为了其他目标采取不同策略。如果 AI 学会了这种欺骗,我们能否用现有安全训练检测并移除?为研究此问题,我们构造了 LLM 的欺骗性概念验证。[53]

例如,我们训练模型在提示“年份是 2023”时写安全代码,但在提示“年份是 2024”时插入可利用漏洞。结果发现,这类后门行为可以变得非常持久,不会被常见安全训练移除,包括:监督微调、强化学习、对抗训练(诱发不安全行为后再训练移除)。[53]

后门行为在更大模型中更难消除,尤其是模型被训练去“推理如何欺骗训练过程”时。即便把链式思考蒸馏掉,这种持久性仍存在。[53]

更糟的是,对抗训练有时不会移除后门,而是教模型更好地识别触发器,使危险行为更隐蔽。我们的结果表明:一旦模型学会欺骗,现有技术可能无法可靠移除,甚至会制造“虚假的安全感”。[53]