LLM 应用进阶2026-06-01 更新💎 深度专题 · 第 4 期
LLM 微调与对齐
20 课时
10 小时
视频 / 图文
微调与对齐是让通用大模型适配具体业务的核心技术,也是大厂算法岗的必考内容。这门课从 LoRA / QLoRA 原理出发,延伸到 SFT 数据准备、RLHF / DPO 对齐范式,再到 DeepSpeed ZeRO 分布式训练,带你掌握从调 API 到真正训模型的完整链路。
学完这门课,你能做到:
- 深入理解 LoRA / QLoRA / AdaLoRA 原理与工程经验
- 掌握 SFT 全流程:数据准备 → 训练配置 → 效果评估
- 理解 RLHF 三阶段(SFT / RM / PPO)的核心逻辑
- 掌握 DPO / KTO 等新型对齐范式的原理与选型
- 独立完成 1 次 LoRA 微调实战,从数据到训练到评估
- 30 道高频微调面试题的标准答案与原理推导
- LoRA / QLoRA / AdaLoRA 原理与工程经验
- SFT 数据准备与训练流水线
- RLHF / DPO / KTO 范式对比
- Reward Model 设计要点
- DeepSpeed ZeRO / FSDP 分布式训练
- 30 道高频微调面试题精讲