What is LLM inference?

LLM inference 是指使用 GPT-5、GLM-5 和 DeepSeek-V3.2 等训练完成的 LLM,根据用户输入生成有意义的输出;这些输入通常以自然语言 prompt的形式提供。在 inference 过程中,模型通过其庞大的参数集合处理 prompt,生成文本、代码片段、摘要和翻译等回复。

从本质上说,这就是 LLM 真正“开始工作”的时刻。以下是一些现实中的示例:

使用下方的可视化工具查看请求在 LLM inference 过程中的流转方式。有关详细信息,请了解 LLM inference 如何工作。

可视化工具:LLM Inference Visualizer

什么是 inference server?

Inference server 是管理 LLM inference 运行方式的组件。它负责加载模型、连接所需硬件(例如 GPU),并处理应用程序请求。当 prompt 到达时,服务器会分配资源、执行模型并返回输出。

LLM inference server 所做的远不止简单的请求与响应。它们提供许多大规模运行 LLM 所必需的功能,例如:

在 LLM 领域,人们经常在一定程度上交替使用 inference server 和 inference framework 这两个术语。

热门的 inference framework包括 vLLM、SGLang、MAX 和 TensorRT LLM。它们旨在最大限度地提高 GPU 效率,同时让 LLM 更容易进行大规模部署。

Serving 与 inference 有什么区别?

Inference 是计算过程。Serving 则是将这种计算能力提供给用户和应用程序的生产过程。

在日常讨论中,人们经常交替使用这两个术语,因为现代 framework 通常同时处理两者。vLLM、SGLang、MAX 和 TensorRT LLM 等工具不仅能高效运行 inference,还能管理请求并公开 API。因此,inference framework 和 serving framework 通常指同一类系统。

不过严格来说,两者并不相同;一旦开始设计基础设施,这种区别就非常重要。

因此,当有人交替使用这两个术语时,通常只是没有严格区分其 inference engine 恰好同时也是服务器这一事实,而这种情况完全很常见。

什么是 inference optimization?

Inference optimization 是一组让 LLM inference 更快、更便宜、更高效的技术。其目标是在不损害模型质量的前提下,降低 latency、提升 throughput 并减少硬件成本。

一些常见策略包括:

在实践中,inference optimization 可能决定一个应用是迟缓而昂贵,还是能提供快速且具成本效益的用户体验。

请在 inference optimization章节中了解更多信息。

为什么需要关注 LLM inference?

你可能会想:我只是在使用 OpenAI API,真的需要理解 inference 吗?

OpenAI、Anthropic 等提供的 serverless API 让 inference 看起来很简单。你发送 prompt,获取回复,然后按 Token 付费。基础设施、model optimization 和 scaling 全都隐藏在幕后。

但关键在于:走得越深入,inference 就越重要。

随着应用不断增长,你最终会遇到 serverless API 无法完全解决的限制,例如成本、latency、定制或合规。这时,团队便会开始探索 hybrid 或 self-hosted 解决方案。

及早理解 LLM inference,例如 batching、caching、quantization和 routing,可以让你获得显著优势。它有助于你评估不同模型服务商和 inference framework的功能,从而做出更明智的选择、避免意外问题,并构建扩展性更强的系统。

有关更多信息,请参阅 serverless vs. self-hosted LLM inference。