Planning your deployment

在生产环境中运行 LLM 之前,你首先需要做出几个关键决策。这些早期选择将决定你的基础设施需求和成本,以及模型在具体使用场景中的表现。

了解 serverless LLM API 与 self-hosted LLM deployment 之间的区别。

为你的使用场景选择合适的模型。

为 LLM inference 选择合适的 NVIDIA 或 AMD GPU,例如 L4、A100、H100、B200、MI250X、MI300X 和 MI350X。

了解如何计算 LLM serving 所需的 GPU memory。

了解 LLM inference framework 的作用、为什么仅执行原始模型不足以满足生产需求,以及如何为你的使用场景选择合适的 inference framework。

Bring Your Own Cloud (BYOC) 是一种 deployment model,由供应商在你的 cloud 环境中运行软件,将 managed orchestration 与完整的数据控制权相结合。

On-prem LLM 是部署在组织自有基础设施中的大型语言模型,例如私有 data center 或 air-gapped environment。这种模式可以让组织完全掌控数据、模型、性能和成本。