跳转至

推理优化论文合订本:投机解码与推理加速

本书聚焦 LLM 推理优化(推理阶段的延迟、吞吐与成本),重点覆盖投机解码、注意力/缓存优化、Serving 调度与量化压缩等方向。[1][2][8][10][11][12]

阅读建议:先从第 2 章:KV Cache 全景建立完整的 KV Cache 心智模型——理解为什么 KV Cache 是推理的核心瓶颈,以及从架构级、Token 级到系统级的全部优化路径。[10][13][14][15] 然后进入第 1 章的论文清单:先理解投机解码的主线与不同验证策略,再补齐注意力与 KV 结构优化,最后把方法映射到系统层的吞吐与延迟指标。[1][3][7][8][10][11][12]

本书不做原文快照,所有来源统一在 references.md 中;每篇论文都有独立解读页,点击清单标题即可展开。