LLM 应用进阶2026-06-01 更新💎 深度专题 · 第 4 期

LLM 微调与对齐

20 课时 10 小时 视频 / 图文

微调与对齐是让通用大模型适配具体业务的核心技术,也是大厂算法岗的必考内容。这门课从 LoRA / QLoRA 原理出发,延伸到 SFT 数据准备、RLHF / DPO 对齐范式,再到 DeepSpeed ZeRO 分布式训练,带你掌握从调 API 到真正训模型的完整链路。

学完这门课,你能做到:

  • 深入理解 LoRA / QLoRA / AdaLoRA 原理与工程经验
  • 掌握 SFT 全流程:数据准备 → 训练配置 → 效果评估
  • 理解 RLHF 三阶段(SFT / RM / PPO)的核心逻辑
  • 掌握 DPO / KTO 等新型对齐范式的原理与选型
  • 独立完成 1 次 LoRA 微调实战,从数据到训练到评估
  • 30 道高频微调面试题的标准答案与原理推导
  • LoRA / QLoRA / AdaLoRA 原理与工程经验
  • SFT 数据准备与训练流水线
  • RLHF / DPO / KTO 范式对比
  • Reward Model 设计要点
  • DeepSpeed ZeRO / FSDP 分布式训练
  • 30 道高频微调面试题精讲
课程咨询
🎯
小红书咨询报名

📕 私信「兔老板工作室」小红书,立即咨询报名

私信即报 · 无需平台付款 · 长期有效

课程分为 4 大模块,共 20 课时。

01 PEFT 高效微调
6 课时 · 3 小时
+
  • 全参数微调 vs 参数高效微调28 min
  • LoRA 原理深度拆解34 min
  • QLoRA:4-bit 量化 + LoRA32 min
  • AdaLoRA / DoRA 等变体28 min
  • PEFT 库工程实战30 min
  • PEFT 模块小测:12 道高频面试题30 min
02 SFT 监督微调
4 课时 · 2 小时
+
  • 指令数据准备与质量控制30 min
  • Chat Template 与数据格式26 min
  • Transformers Trainer 微调实战36 min
  • SFT 模块小测:8 道高频面试题24 min
03 对齐范式 (RLHF / DPO / KTO)
6 课时 · 3 小时
+
  • RLHF 三阶段:SFT → RM → PPO32 min
  • Reward Model 设计要点28 min
  • DPO:直接偏好优化原理30 min
  • KTO / IPO / SimPO 等变体30 min
  • 对齐范式小测:15 道高频面试题32 min
04 分布式训练实战
4 课时 · 2 小时
+
  • DeepSpeed ZeRO-1/2/3 原理30 min
  • FSDP 实战与显存优化32 min
  • 多机多卡训练踩坑经验28 min
  • 分布式模块小测:10 道高频面试题26 min

🎯 适合谁

  • 大厂算法岗求职者(必考)
  • 想深耕 LLM 训练方向的工程师
  • 已掌握 LLM 基础,想进一步专精训练
  • 在校研究生做 LLM 相关研究

🚀 学完你能收获

  • 系统化的微调与对齐知识体系
  • 主流对齐范式的对比与选型能力
  • 分布式训练的工程经验
  • 30 道高频微调面试题的标准答案
  • 大厂算法岗的核心竞争力

📋 前置要求

  • 熟悉 PyTorch 与深度学习基础
  • 了解 Transformer 架构(建议先看全栈班模块 1)
  • 有 GPU 资源访问权限更佳

学习节奏

  • 总时长 10 小时,建议 2-3 周完成
  • 每周 6-8 课时 + 实操演练
  • 报名后立即开通,永久回看
兔老板

博主介绍

中科院博士 · 资深算法工程师 · 100+ 真实面试官 · 公众号「松鼠NLP」作者

查看完整博主介绍 →

啃下大厂算法岗最硬的骨头

微调与对齐是算法岗核心考察点,关注小红书「兔老板工作室」立即咨询报名。