[36] Self-Instruct:低成本生成指令数据的起手式¶
- 资料类型:论文/方法论
- 原始来源:https://arxiv.org/abs/2212.10560
- 对应章节:第 13 章(数据:指令数据)、第 15 章(后训练)
一句话¶
用少量种子任务让模型自己出题 + 写答案,把数据规模拉起来,但质量必须靠过滤与抽检兜底。
你该从 Self-Instruct 带走什么¶
- 合成数据能省人力,但不会自动变好:你省下的是写题的成本,不是验收的成本。
- 质量控制是核心:去重、格式校验、拒绝低质量样本,比无限生成更重要。
- 覆盖业务场景:先定义你要补的能力(风格/格式/领域知识/安全边界),再反推要生成的数据类型。
在本书里怎么用¶
- 第 8 章把它作为合成数据管线的主线之一:生成参数与拒绝原因要可审计。
- 第 10 章把失败样本变成合成数据的种子,让修复可回归。
常见误用¶
- 不清洗不抽检,直接把合成数据喂进训练,结果把错误与偏见一起放大。
- 只追求数量,导致训练集风格单一、模型学到套路化回答。