What is LLM inference?
LLM inference 是指使用 GPT-5、GLM-5 和 DeepSeek-V3.2 等训练完成的 LLM,根据用户输入生成有意义的输出;这些输入通常以自然语言 prompt的形式提供。在 inference 过程中,模型通过其庞大的参数集合处理 prompt,生成文本、代码片段、摘要和翻译等回复。
从本质上说,这就是 LLM 真正“开始工作”的时刻。以下是一些现实中的示例:
- 客户支持 chatbot:实时生成个性化且符合上下文的客户咨询回复。
- 写作助手:补全句子、纠正语法或总结长篇文档。
- 开发者工具:将自然语言描述转换为可执行代码。
- AI agent:自主执行复杂的多步骤推理和决策过程。
使用下方的可视化工具查看请求在 LLM inference 过程中的流转方式。有关详细信息,请了解 LLM inference 如何工作。
可视化工具:LLM Inference Visualizer
什么是 inference server?
Inference server 是管理 LLM inference 运行方式的组件。它负责加载模型、连接所需硬件(例如 GPU),并处理应用程序请求。当 prompt 到达时,服务器会分配资源、执行模型并返回输出。
LLM inference server 所做的远不止简单的请求与响应。它们提供许多大规模运行 LLM 所必需的功能,例如:
- Batching:合并多个请求,以提高 GPU 效率
- Streaming:在 Token 生成时立即发送,以降低 latency
- Scaling:根据需求增加或减少 replica
- Monitoring:公开指标,用于性能分析和调试
在 LLM 领域,人们经常在一定程度上交替使用 inference server 和 inference framework 这两个术语。
- Inference server 通常强调接收请求、运行模型并返回结果的 runtime component。
- Inference framework 通常强调范围更广的工具包或库,它们提供 API、优化功能和集成,以便高效地提供 model serving。
热门的 inference framework包括 vLLM、SGLang、MAX 和 TensorRT LLM。它们旨在最大限度地提高 GPU 效率,同时让 LLM 更容易进行大规模部署。
Serving 与 inference 有什么区别?
Inference 是计算过程。Serving 则是将这种计算能力提供给用户和应用程序的生产过程。
在日常讨论中,人们经常交替使用这两个术语,因为现代 framework 通常同时处理两者。vLLM、SGLang、MAX 和 TensorRT LLM 等工具不仅能高效运行 inference,还能管理请求并公开 API。因此,inference framework 和 serving framework 通常指同一类系统。
不过严格来说,两者并不相同;一旦开始设计基础设施,这种区别就非常重要。
- Inference 就是 forward pass:输入 Token,输出 next-token distribution,并在 prefill 和 decode loop 中重复这一过程。它是一种计算操作。你可以在 Jupyter notebook 或 Python 脚本中运行 inference,完全不需要服务器。这仍然属于 inference,但并没有向外提供任何服务。
- Serving 包括将这种能力转化为可靠生产服务所需的一切:API surface(例如 HTTP/gRPC)、request queuing and scheduling、跨并发请求的 batching、跨 replica 的 load balancing、autoscaling、model loading and version management、health check、observability 以及 resource allocation。
因此,当有人交替使用这两个术语时,通常只是没有严格区分其 inference engine 恰好同时也是服务器这一事实,而这种情况完全很常见。
什么是 inference optimization?
Inference optimization 是一组让 LLM inference 更快、更便宜、更高效的技术。其目标是在不损害模型质量的前提下,降低 latency、提升 throughput 并减少硬件成本。
一些常见策略包括:
- Continuous batching:动态组合请求,以提高 GPU utilization
- KV cache management:复用或 offload attention cache,以高效处理较长的 prompt
- Speculative decoding:使用较小的 draft model 加快 Token 生成
- Quantization:以较低 precision(例如 INT8、FP8)运行模型,以节省内存和算力
- Prefix caching:缓存常见的 prompt segment,减少重复计算
- Multi-GPU distribution/Parallelism:将 LLM 拆分到多个 GPU 上,以支持更大的 context window
在实践中,inference optimization 可能决定一个应用是迟缓而昂贵,还是能提供快速且具成本效益的用户体验。
请在 inference optimization章节中了解更多信息。
为什么需要关注 LLM inference?
你可能会想:我只是在使用 OpenAI API,真的需要理解 inference 吗?
OpenAI、Anthropic 等提供的 serverless API 让 inference 看起来很简单。你发送 prompt,获取回复,然后按 Token 付费。基础设施、model optimization 和 scaling 全都隐藏在幕后。
但关键在于:走得越深入,inference 就越重要。
随着应用不断增长,你最终会遇到 serverless API 无法完全解决的限制,例如成本、latency、定制或合规。这时,团队便会开始探索 hybrid 或 self-hosted 解决方案。
及早理解 LLM inference,例如 batching、caching、quantization和 routing,可以让你获得显著优势。它有助于你评估不同模型服务商和 inference framework的功能,从而做出更明智的选择、避免意外问题,并构建扩展性更强的系统。
- 如果你是开发者或工程师:在现代 AI 应用开发中,inference 正在变得和数据库或 API 一样基础。了解其工作原理,有助于你设计更快、成本更低且更可靠的系统。糟糕的 inference 实现可能导致响应缓慢、计算成本高昂以及用户体验不佳。
- 如果你是技术负责人:Inference efficiency 会直接影响收益。优化不佳的配置可能消耗 10 倍的 GPU 时长,同时性能反而更差。理解 inference 有助于你评估供应商、做出自建或购买的决策,并为团队设定切合实际的性能目标。
- 如果你只是对 AI 感到好奇:Inference 正是魔法发生的地方。了解其工作原理,可以帮助你区分 AI 炒作与现实,并让你在参与 AI 讨论时成为更有判断力的信息消费者和贡献者。
有关更多信息,请参阅 serverless vs. self-hosted LLM inference。