跳转至

[36] Self-Instruct:低成本生成指令数据的起手式

  • 资料类型:论文/方法论
  • 原始来源:https://arxiv.org/abs/2212.10560
  • 对应章节:第 13 章(数据:指令数据)、第 15 章(后训练)

一句话

用少量种子任务让模型自己出题 + 写答案,把数据规模拉起来,但质量必须靠过滤与抽检兜底。

你该从 Self-Instruct 带走什么

  • 合成数据能省人力,但不会自动变好:你省下的是写题的成本,不是验收的成本。
  • 质量控制是核心:去重、格式校验、拒绝低质量样本,比无限生成更重要。
  • 覆盖业务场景:先定义你要补的能力(风格/格式/领域知识/安全边界),再反推要生成的数据类型。

在本书里怎么用

  • 第 8 章把它作为合成数据管线的主线之一:生成参数与拒绝原因要可审计。
  • 第 10 章把失败样本变成合成数据的种子,让修复可回归。

常见误用

  • 不清洗不抽检,直接把合成数据喂进训练,结果把错误与偏见一起放大。
  • 只追求数量,导致训练集风格单一、模型学到套路化回答。