Planning your deployment
在生产环境中运行 LLM 之前,你首先需要做出几个关键决策。这些早期选择将决定你的基础设施需求和成本,以及模型在具体使用场景中的表现。
Serverless 与 self-hosted LLM inference
了解 serverless LLM API 与 self-hosted LLM deployment 之间的区别。
选择合适的模型
为你的使用场景选择合适的模型。
选择合适的 GPU
为 LLM inference 选择合适的 NVIDIA 或 AMD GPU,例如 L4、A100、H100、B200、MI250X、MI300X 和 MI350X。
计算 LLM serving 所需的 GPU memory
了解如何计算 LLM serving 所需的 GPU memory。
选择合适的 inference framework
了解 LLM inference framework 的作用、为什么仅执行原始模型不足以满足生产需求,以及如何为你的使用场景选择合适的 inference framework。
Bring Your Own Cloud (BYOC)
Bring Your Own Cloud (BYOC) 是一种 deployment model,由供应商在你的 cloud 环境中运行软件,将 managed orchestration 与完整的数据控制权相结合。
On-prem LLM deployment
On-prem LLM 是部署在组织自有基础设施中的大型语言模型,例如私有 data center 或 air-gapped environment。这种模式可以让组织完全掌控数据、模型、性能和成本。