[47] QLoRA:把微调从奢侈品变成日用品¶
- 资料类型:论文
- 原始来源:https://arxiv.org/abs/2305.14314
- 对应章节:第 15 章(后训练:微调)、第 16 章(推理优化)
一句话¶
用 4-bit 量化把显存压下来,再用 LoRA 做参数高效训练,小团队也能微调大模型。
你该从 QLoRA 带走什么¶
- 先把成本打下来:对个人/小团队来说,能跑得起经常比理论最优更重要。
- 质量仍要用评测兜底:量化与微调叠加后,可能出现不可预期退化,必须做回归对比。
- 配置可追溯:序列长度、batch、目标层、量化参数,任何一个改动都要能复盘。
在本书里怎么用¶
- 第 10 章把它作为默认起手式之一:先跑通闭环(数据→训练→评测→回滚),再谈更贵方案。
- 第 11 章说明训练侧 4-bit和推理侧量化不是一回事:要分别评估与验收。
常见误用¶
- 没有基线评测就调参,最后只剩感觉更像。
- 只追求能训起来,忽略数据质量与失败样本,训练越多越偏。