跳转至

[47] QLoRA:把微调从奢侈品变成日用品

  • 资料类型:论文
  • 原始来源:https://arxiv.org/abs/2305.14314
  • 对应章节:第 15 章(后训练:微调)、第 16 章(推理优化)

一句话

用 4-bit 量化把显存压下来,再用 LoRA 做参数高效训练,小团队也能微调大模型。

你该从 QLoRA 带走什么

  • 先把成本打下来:对个人/小团队来说,能跑得起经常比理论最优更重要。
  • 质量仍要用评测兜底:量化与微调叠加后,可能出现不可预期退化,必须做回归对比。
  • 配置可追溯:序列长度、batch、目标层、量化参数,任何一个改动都要能复盘。

在本书里怎么用

  • 第 10 章把它作为默认起手式之一:先跑通闭环(数据→训练→评测→回滚),再谈更贵方案。
  • 第 11 章说明训练侧 4-bit和推理侧量化不是一回事:要分别评估与验收。

常见误用

  • 没有基线评测就调参,最后只剩感觉更像。
  • 只追求能训起来,忽略数据质量与失败样本,训练越多越偏。