AI算法工程师、机器学习工程师、NLP工程师、模型训练工程师
掌握主流微调技术(全量微调、LoRA、QLoRA、DPO)的原理与工程实现
具备构建高质量微调数据集、评估数据质量的能力
熟练使用DeepSpeed、vLLM等工具完成分布式训练与推理部署
能够独立完成从数据准备到模型上线的全流程微调任务
1. 大模型微调基础与原理
Transformer架构回顾与微调数学原理
SFT(监督微调)vs. RLHF(人类反馈强化学习)vs. DPO(直接偏好优化)的对比与选型
开源模型生态(Llama、Qwen、Mistral等)的特点与微调适配
2. 微调范式深度对比
全量微调 vs. 参数高效微调(PEFT):算力、显存、收敛速度、性能权衡
LoRA、QLoRA、Adapter、Prefix Tuning的实现机制与适用场景
量化技术与微调的协同(QLoRA原理与实战)
3. 微调数据集构建与处理
指令数据格式规范(Alpaca、ShareGPT格式)
数据清洗、去重、隐私脱敏的自动化脚本实现
数据难度分级、多样性增强与配比策略(通用数据 vs. 垂直领域数据)
4. 数据合成与质量评估
利用教师模型(GPT-4、Claude)进行指令数据合成
数据质量评估指标:多样性、复杂度、正确性、对抗性
灾难性遗忘的检测与缓解策略
5. 分布式训练框架实战
DeepSpeed ZeRO(零冗余优化器)各阶段配置与选型
混合精度训练(FP16/BF16)与梯度累积
多机多卡训练配置、断点续训与故障恢复
6. 训练过程监控与调优
WandB/TensorBoard 训练指标监控(Loss、梯度范数、学习率)
超参数调优策略(学习率、批次大小、Epoch)
过拟合检测与正则化技术(权重衰减、Dropout、数据增强)
7. 模型推理加速技术
量化技术实战:GPTQ、AWQ、bitsandbytes
推理框架对比与使用:vLLM(PagedAttention)、TensorRT-LLM、TGI
推理性能基准测试(延迟、吞吐量、显存占用)
8. 模型评估与评测体系
自动化评估框架(OpenCompass、HELM)的使用
评测指标:BLEU、ROUGE、GPT-4作为裁判、人工评估
垂直领域评测集的构建与领域能力验证
9. RAG与微调的协同工程
RAG系统原理回顾与向量数据库选型
微调与RAG的对比实验设计与效果评估
混合架构的实现:微调增强知识理解 + RAG增强知识检索
10. LLMOps 工程化实践
模型版本管理(HuggingFace Hub、ModelScope)
训练流水线自动化(Docker、K8s、Slurm)
模型打包、镜像构建与上线流程
11. 微调案例实战(一):垂直领域对话模型
以医疗/法律/客服场景为例,完整演示数据构造、LoRA微调、评估、部署
常见问题排查(Loss不收敛、输出重复、格式错误)
12. 微调案例实战(二):代码模型与工具调用
代码模型的微调技巧(代码数据格式、函数调用格式)
工具调用(Function Calling)微调的实现与评估
Agent场景下的微调优化策略