LLM Inference Handbook

LLM Inference Handbook 集技术术语表、指南和参考资料于一体。它涵盖了你需要了解的有关 LLM inference 的一切内容:从核心概念和性能指标(例如 Time to First Token 和 Tokens per Second),到优化技术(例如 continuous batching和 prefix caching)、GPU architecture,以及 BYOC和 on-prem等部署模式。

动机

我们编写这本手册,是为了解决开发者普遍面临的一个问题:LLM inference 知识往往支离破碎;它们深埋在学术论文中、散落于厂商博客里、隐藏在 GitHub issue 中,或零散地出现在 Discord 讨论串里。更糟糕的是,其中很多内容都默认你已经理解了技术栈的一半。

很少有资源能将这些知识汇集在一起——例如,inference 与 training 有何不同、为了满足 SLO 为什么 goodput 比 raw throughput 更重要,以及 prefill-decode disaggregation在实践中如何运作。

因此,我们开始将这些内容系统地整理到一起。

适用人群

本手册面向在生产环境中部署、扩展或运维 LLM 的工程师,无论你是在 fine-tuning 小型开放模型,还是在自己的技术栈上运行大规模部署。

如果你的目标是让 LLM inference 更快、成本更低或更可靠,那么这本手册正适合你。

使用方式

你可以从头读到尾,也可以把它当作速查表。无论如何浏览都没有错。随着这一领域不断发展,我们会持续更新本手册,因为 LLM inference 的变化非常快,今天有效的方法,明天未必仍是最佳选择。

交互式工具

本手册提供了多种交互式工具,帮助你通过直接尝试相关概念来学习:

贡献

欢迎贡献!如果你发现错误、有改进建议或希望添加新主题,请在我们的 GitHub repository中提交 issue 或 pull request。