Foundation
LLM 推理是模型与现实世界交汇的环节。它为即时聊天回复、代码生成等各种应用提供支持,并直接影响延迟、成本和用户体验。理解推理的工作原理,是构建更智能、更快速、更可靠的 AI 应用的第一步。
什么是 LLM 推理?
LLM 推理是使用训练好的语言模型,根据提示词生成回复或预测结果的过程。
训练与推理
LLM 训练负责构建模型,而 LLM 推理则应用模型,根据新的输入实时生成输出。
LLM 如何工作?
了解 LLM 的工作原理,内容涵盖词元化、Transformer 架构(注意力、注意力掩码),以及推理中的预填充和解码阶段。
LLM 推理在哪里运行?
了解 CPU、GPU 和 TPU 之间的区别,以及它们各自适合部署在哪里。
LLM 推理的关键指标
衡量延迟和吞吐量等关键指标,以优化 LLM 推理性能。