LLM 应用进阶2026-06-01 更新⚡ 高频考点 · 第 3 期

Transformer & 推理优化

18 课时 9 小时 视频 / 图文

推理优化是 LLM 落地最难也最被低估的方向——面试中「为什么推理比训练贵得多」「怎么让推理跑得更快」是高频压轴题。这门课从 Attention 数学本质出发,系统覆盖 KV Cache、FlashAttention、vLLM / TensorRT-LLM、量化技术,帮你在面试和工作中都讲清楚推理优化的底层逻辑。

学完这门课,你能做到:

  • 从数学层面讲清楚 Attention 计算复杂度与优化动机
  • 理解 KV Cache / PagedAttention / Continuous Batching 原理
  • 掌握 FlashAttention v1/v2/v3 演进与 IO 复杂度分析
  • 掌握 GPTQ / AWQ / GGUF 量化的原理与工程实践
  • 对比 vLLM / TGI / TensorRT-LLM 的适用场景与选型
  • 40 道高频推理优化面试题的标准答案与推导过程
  • Attention 机制数学本质深度拆解
  • KV Cache / PagedAttention 原理
  • FlashAttention 原理与 v1/v2/v3 演进
  • vLLM / TGI / TensorRT-LLM 性能对比
  • 量化技术:GPTQ / AWQ / GGUF
  • Speculative Decoding 等推理加速
课程咨询
小红书咨询报名

📕 私信「兔老板工作室」小红书,立即咨询报名

私信即报 · 无需平台付款 · 长期有效

课程分为 4 大模块,共 18 课时。

01 Attention 机制深度
6 课时 · 3 小时
+
  • Self-Attention 数学本质30 min
  • Multi-Head Attention 的设计动机28 min
  • MQA / GQA / MLA 演进32 min
  • 位置编码演进:正弦 → RoPE → ALiBi30 min
  • 滑动窗口注意力与 Long Context28 min
  • Attention 模块小测:12 道高频面试题28 min
02 KV Cache 与 PagedAttention
4 课时 · 2 小时
+
  • KV Cache 原理与显存分析30 min
  • PagedAttention:虚拟内存思想32 min
  • Continuous Batching 原理28 min
  • KV Cache 模块小测:8 道高频面试题24 min
03 FlashAttention 与量化
4 课时 · 2 小时
+
  • FlashAttention v1/v2/v3 演进32 min
  • IO 复杂度分析与显存优化28 min
  • 量化原理:PTQ vs QAT28 min
  • GPTQ / AWQ / GGUF 对比30 min
04 推理框架与 Speculative Decoding
4 课时 · 2 小时
+
  • vLLM 架构与使用30 min
  • TGI / TensorRT-LLM 对比28 min
  • Speculative Decoding 原理30 min
  • 推理框架模块小测:10 道高频面试题28 min

🎯 适合谁

  • 大厂推理 / 性能优化岗求职者
  • 想深耕 LLM 系统优化的工程师
  • 面试常被问「为什么快」却答不上来的同学
  • 已掌握 LLM 基础,想啃下硬骨头

🚀 学完你能收获

  • 从数学到工程的全链路推理优化知识
  • 主流推理框架的选型决策能力
  • 面试中能讲清楚"为什么这么优化"
  • 性能优化岗位的核心竞争力

📋 前置要求

  • 熟悉 PyTorch 基础
  • 了解 Transformer 架构(建议先看全栈班模块 1)
  • 具备基本的高性能计算概念更佳

学习节奏

  • 总时长 9 小时,建议 2 周完成
  • 每周 8 课时 + 实操演练
  • 报名后立即开通,永久回看
兔老板

博主介绍

中科院博士 · 资深算法工程师 · 100+ 真实面试官 · 公众号「松鼠NLP」作者

查看完整博主介绍 →

啃下大模型推理岗最难的硬骨头

推理优化是性能岗核心,关注小红书「兔老板工作室」立即咨询报名。