LLM 应用进阶2026-06-01 更新⚡ 高频考点 · 第 3 期
Transformer & 推理优化
18 课时
9 小时
视频 / 图文
推理优化是 LLM 落地最难也最被低估的方向——面试中「为什么推理比训练贵得多」「怎么让推理跑得更快」是高频压轴题。这门课从 Attention 数学本质出发,系统覆盖 KV Cache、FlashAttention、vLLM / TensorRT-LLM、量化技术,帮你在面试和工作中都讲清楚推理优化的底层逻辑。
学完这门课,你能做到:
- 从数学层面讲清楚 Attention 计算复杂度与优化动机
- 理解 KV Cache / PagedAttention / Continuous Batching 原理
- 掌握 FlashAttention v1/v2/v3 演进与 IO 复杂度分析
- 掌握 GPTQ / AWQ / GGUF 量化的原理与工程实践
- 对比 vLLM / TGI / TensorRT-LLM 的适用场景与选型
- 40 道高频推理优化面试题的标准答案与推导过程
- Attention 机制数学本质深度拆解
- KV Cache / PagedAttention 原理
- FlashAttention 原理与 v1/v2/v3 演进
- vLLM / TGI / TensorRT-LLM 性能对比
- 量化技术:GPTQ / AWQ / GGUF
- Speculative Decoding 等推理加速