[66] WizardLM / Evol-Instruct:让合成指令更难一点¶
- 资料类型:论文
- 原始来源:https://arxiv.org/abs/2304.12244
- 对应章节:第 13 章(数据:指令构造)、第 15 章(后训练)
一句话¶
Self-Instruct 容易出题太简单,Evol-Instruct 通过进化策略把指令拉难,逼模型学会更复杂的推理与约束遵循。
你该从 WizardLM 带走什么¶
- 难度需要设计:合成数据如果太顺,模型在真实复杂场景会掉链子。
- 多样性要量化:不同任务族、不同约束、不同文体要有覆盖统计,不然就是换皮重复。
- 质量门禁仍然必需:越复杂越容易胡编,所以过滤与抽检要更严格。
在本书里怎么用¶
- 第 8 章把它作为合成数据增强的下一步:先跑通 Self-Instruct,再逐步引入进化策略。
- 第 10 章把它和失败样本结合:用真实失败样本驱动进化方向,让修复可回归。
常见误用¶
- 一上来进化得太复杂,超出模型能力,生成数据质量雪崩。
- 只看数据量不看覆盖与拒绝原因,训练集越来越像套路集合。