课程概述
微调技术选型困难
大模型微调方法众多(Adapter、Prefix Tuning、LoRA、QLoRA 等),缺乏系统化的技术对比与选型指导,难以针对实际场景做出最优选择。
训练资源消耗巨大
全参数微调动辄需要数百 GB 显存,单卡根本无法承载。如何利用量化、分布式训练等技术降低资源门槛是核心挑战。
生产部署经验缺乏
从实验室模型到生产级服务之间存在巨大鸿沟,涉及数据工程、模型服务化、容器化部署等一系列工程化难题。
国产化适配需求迫切
在国产算力平台(如华为昇腾)上进行大模型训练与推理已成为刚需,但相关实践经验和文档资料仍然稀缺。
配套课程项目
课程实战代码全部开源,GitHub 1,000+ Stars,是国内最受欢迎的大模型微调入门项目之一。
核心技术栈
Hugging Face Transformers
业界标准大模型开发框架,涵盖模型加载、Tokenizer、Pipeline 等核心功能,支持数千种预训练模型的快速调用与微调。
PEFT / LoRA / QLoRA
Hugging Face 参数高效微调工具库,通过低秩适配(LoRA)和量化微调(QLoRA)大幅降低显存需求,实现消费级 GPU 上的大模型微调。
Microsoft DeepSpeed
微软开源的分布式训练框架,提供 ZeRO 内存优化、混合引擎和端到端 RLHF 训练流水线,支撑千亿参数级模型训练。
华为昇腾 Ascend 910
国产化 AI 训练处理器平台,课程深入讲解在昇腾 910 上进行大模型部署、推理与微调训练的全流程实战。
核心价值
体系化掌握微调技术
从 Adapter Tuning 到 QLoRA,从 RLHF 到 MoE,系统梳理大模型微调技术图谱,建立完整的技术认知框架。
全流程实战能力
覆盖数据准备、模型训练、评估验证、服务部署全链路,每个环节均配套完整代码实战,学完即可上手项目。
生产级部署技能
从个性化 ChatBot 到 RAG 增强检索,从 Docker 容器化到分布式推理,掌握将模型推向生产环境的关键工程能力。
国产化平台实践
深入华为昇腾平台实战,掌握国产化算力适配能力,为信创环境下的大模型应用开发打下坚实基础。
学习收益
- 系统掌握 Prompt Tuning、Prefix Tuning、LoRA、QLoRA 等主流微调方法的原理与适用场景
- 熟练使用 Hugging Face Transformers 和 PEFT 工具库完成大模型微调全流程
- 能够基于 QLoRA 在消费级 GPU 上完成 DeepSeek v4 等大模型的微调与私有化部署
- 掌握 DeepSpeed 分布式训练框架,具备千亿参数级模型训练的工程能力
- 具备在华为昇腾等国产算力平台上进行模型训练与推理的实战经验
详细大纲
01 预热篇:AI 大模型技术总览与微调原理
AI 大模型四阶技术总览
- 深度解读 AI 发展四轮浪潮:弱人工智能、机器学习、深度学习、大语言模型
- AI 大模型四阶技术:提示工程、AI 智能体、大模型微调、预训练技术
- 把握浪潮:AI 大模型是打造超级个体的巨大机会
大模型微调技术原理揭秘
- 大语言模型技术发展与演进:从统计机器学习到基于 Transformer 的大模型
- PEFT 高效微调技术初探:Adapter Tuning、Prefix Tuning、Prompt Tuning、P-Tuning v1/v2
- LoRA 系列方法深度解析:LoRA、QLoRA、AdaLoRA 原理与对比
- 统一微调框架 UniPELT 与少样本方法 IA3 前沿探索
ChatGPT 大模型训练技术解读
- 基于人类反馈的强化学习微调技术 RLHF:SFT、Reward Model、强化学习微调
- 混合专家模型 MoE 技术架构:Switch Transformer、Expert Choice、GLaM
- 理解 RLHF + MoE 在 ChatGPT 类模型中的核心作用
02 工具篇:Hugging Face Transformers 与 PEFT 实战
Hugging Face Transformers 核心功能
- Transformers 库核心概念:Pipeline、Model、Tokenizer 三大组件
- 使用 Pipeline 快速实现情感分析、自动摘要等 NLP 任务
- 预训练模型加载、保存与 Tokenizer 分词策略详解
Hugging Face PEFT 高效微调工具库
- PEFT 库核心概念:PeftConfig 参数配置与 PeftModel 模型管理
- 使用 Auto Classes 简化模型加载流程
- 使用 PEFT 库实现 LoRA 模型微调完整流程
03 实战篇:QLoRA 微调与个性化应用开发
使用 QLoRA 微调 DeepSeek v4
- 模型微调数据集准备:Hugging Face Datasets 获取、数据清洗与编码
- 构建 PEFT QLoRA 微调管道:模型定义、训练、验证与保存
- 使用 GPT-4 构造高质量私有化训练数据
- 端到端运行私有化 DeepSeek v4 模型服务
基于微调大模型打造个性化 ChatBot
- 开发环境搭建:MiniConda、Jupyter Lab、LangChain、Chroma 向量数据库
- 使用 LangChain PromptTemplate 与 Agents 实现 ChatBot 核心逻辑
- 生产级部署:Docker 容器化构建与 ChatBot 服务部署
结合检索增强生成(RAG)的 ChatBot
- Embedding 嵌入技术原理与 OpenAI Embedding 模型实战
- 使用 Chroma 向量数据库搭建 ChatBot 知识库
- 使用 LangChain 实现 RAG 增强的智能问答系统
04 进阶篇:DeepSpeed 分布式训练与 RLHF
DeepSpeed 分布式训练框架
- DeepSpeed 核心模块:Training、Inference、Compression、4Science
- 分布式技术架构:分布式训练、推理与通信策略
- ZeRO 冗余优化技术:内存消耗分析、ZeRO-Offload、ZeRO-Stage3
- 端到端 RLHF 训练系统 DeepSpeed-Chat 与混合引擎 Hybrid Engine
使用 DeepSpeed Chat 实现 RLHF 模型微调
- Meta OPT 系列模型介绍与数据集准备
- RLHF 三阶段训练:Actor 模型、Reward 模型、一键式强化学习训练
- 使用 DeepSpeed Chat 部署运行模型推理服务
05 拓展篇:国产化适配与大模型预训练
国产化适配:华为昇腾 910 模型微调实战
- 华为 AI 全栈全场景平台与昇腾 Ascend 310/910 处理器介绍
- 在昇腾 910 上部署 DeepSeek v4:安装、推理与训练全流程
- 国产化算力平台适配的关键经验与最佳实践
Qwen3.6 预训练技术揭秘
- Qwen3.6 大模型系列介绍与技术架构解析
- 在 Hugging Face 上使用与部署 Qwen3.6 模型
- 详解 Qwen3.6 大模型优缺点与适用场景
实战:预训练 Qwen3.6 大模型
- 训练数据准备:开源数据集选取、中文数据集优化与 Token 编码效率提升
- 使用 QLoRA + DeepSpeed 预训练 Qwen3.6:GPU 选型与量化预训练脚本详解
- Qwen3.6 预训练端到端实战
讲师介绍
彭靖田
创始人 / CEO华为 2012 实验室深度学习创始团队成员,加州大学访问学者。曾任才云科技技术合伙人(2020 年被字节跳动收购为火山引擎云),品览数据联合创始人兼 CTO(累计融资近 2 亿元)。Kubeflow 维护者 / TensorFlow 贡献者 / Linux CNCF 程序委员会成员。