返回首页

AI 大模型微调训练营

从微调技术原理到分布式训练实战,系统掌握 LoRA / QLoRA / RLHF / DeepSpeed 等核心技术,手把手带你完成大模型全流程训练与部署。

20 节 · 约 50h 5 大篇章 Transformers / PEFT / DeepSpeed / 昇腾
面向人群: AI 工程师 / 算法工程师 / 研究型开发者

课程概述

01

微调技术选型困难

大模型微调方法众多(Adapter、Prefix Tuning、LoRA、QLoRA 等),缺乏系统化的技术对比与选型指导,难以针对实际场景做出最优选择。

02

训练资源消耗巨大

全参数微调动辄需要数百 GB 显存,单卡根本无法承载。如何利用量化、分布式训练等技术降低资源门槛是核心挑战。

03

生产部署经验缺乏

从实验室模型到生产级服务之间存在巨大鸿沟,涉及数据工程、模型服务化、容器化部署等一系列工程化难题。

04

国产化适配需求迫切

在国产算力平台(如华为昇腾)上进行大模型训练与推理已成为刚需,但相关实践经验和文档资料仍然稀缺。

配套课程项目

课程实战代码全部开源,GitHub 1,000+ Stars,是国内最受欢迎的大模型微调入门项目之一。

核心技术栈

Hugging Face Transformers

业界标准大模型开发框架,涵盖模型加载、Tokenizer、Pipeline 等核心功能,支持数千种预训练模型的快速调用与微调。

PEFT / LoRA / QLoRA

Hugging Face 参数高效微调工具库,通过低秩适配(LoRA)和量化微调(QLoRA)大幅降低显存需求,实现消费级 GPU 上的大模型微调。

Microsoft DeepSpeed

微软开源的分布式训练框架,提供 ZeRO 内存优化、混合引擎和端到端 RLHF 训练流水线,支撑千亿参数级模型训练。

华为昇腾 Ascend 910

国产化 AI 训练处理器平台,课程深入讲解在昇腾 910 上进行大模型部署、推理与微调训练的全流程实战。

核心价值

🚀

体系化掌握微调技术

从 Adapter Tuning 到 QLoRA,从 RLHF 到 MoE,系统梳理大模型微调技术图谱,建立完整的技术认知框架。

💼

全流程实战能力

覆盖数据准备、模型训练、评估验证、服务部署全链路,每个环节均配套完整代码实战,学完即可上手项目。

🔬

生产级部署技能

从个性化 ChatBot 到 RAG 增强检索,从 Docker 容器化到分布式推理,掌握将模型推向生产环境的关键工程能力。

🛡️

国产化平台实践

深入华为昇腾平台实战,掌握国产化算力适配能力,为信创环境下的大模型应用开发打下坚实基础。

学习收益

  • 系统掌握 Prompt Tuning、Prefix Tuning、LoRA、QLoRA 等主流微调方法的原理与适用场景
  • 熟练使用 Hugging Face Transformers 和 PEFT 工具库完成大模型微调全流程
  • 能够基于 QLoRA 在消费级 GPU 上完成 DeepSeek v4 等大模型的微调与私有化部署
  • 掌握 DeepSpeed 分布式训练框架,具备千亿参数级模型训练的工程能力
  • 具备在华为昇腾等国产算力平台上进行模型训练与推理的实战经验

详细大纲

01 预热篇:AI 大模型技术总览与微调原理

AI 大模型四阶技术总览

  • 深度解读 AI 发展四轮浪潮:弱人工智能、机器学习、深度学习、大语言模型
  • AI 大模型四阶技术:提示工程、AI 智能体、大模型微调、预训练技术
  • 把握浪潮:AI 大模型是打造超级个体的巨大机会

大模型微调技术原理揭秘

  • 大语言模型技术发展与演进:从统计机器学习到基于 Transformer 的大模型
  • PEFT 高效微调技术初探:Adapter Tuning、Prefix Tuning、Prompt Tuning、P-Tuning v1/v2
  • LoRA 系列方法深度解析:LoRA、QLoRA、AdaLoRA 原理与对比
  • 统一微调框架 UniPELT 与少样本方法 IA3 前沿探索

ChatGPT 大模型训练技术解读

  • 基于人类反馈的强化学习微调技术 RLHF:SFT、Reward Model、强化学习微调
  • 混合专家模型 MoE 技术架构:Switch Transformer、Expert Choice、GLaM
  • 理解 RLHF + MoE 在 ChatGPT 类模型中的核心作用
02 工具篇:Hugging Face Transformers 与 PEFT 实战

Hugging Face Transformers 核心功能

  • Transformers 库核心概念:Pipeline、Model、Tokenizer 三大组件
  • 使用 Pipeline 快速实现情感分析、自动摘要等 NLP 任务
  • 预训练模型加载、保存与 Tokenizer 分词策略详解

Hugging Face PEFT 高效微调工具库

  • PEFT 库核心概念:PeftConfig 参数配置与 PeftModel 模型管理
  • 使用 Auto Classes 简化模型加载流程
  • 使用 PEFT 库实现 LoRA 模型微调完整流程
03 实战篇:QLoRA 微调与个性化应用开发

使用 QLoRA 微调 DeepSeek v4

  • 模型微调数据集准备:Hugging Face Datasets 获取、数据清洗与编码
  • 构建 PEFT QLoRA 微调管道:模型定义、训练、验证与保存
  • 使用 GPT-4 构造高质量私有化训练数据
  • 端到端运行私有化 DeepSeek v4 模型服务

基于微调大模型打造个性化 ChatBot

  • 开发环境搭建:MiniConda、Jupyter Lab、LangChain、Chroma 向量数据库
  • 使用 LangChain PromptTemplate 与 Agents 实现 ChatBot 核心逻辑
  • 生产级部署:Docker 容器化构建与 ChatBot 服务部署

结合检索增强生成(RAG)的 ChatBot

  • Embedding 嵌入技术原理与 OpenAI Embedding 模型实战
  • 使用 Chroma 向量数据库搭建 ChatBot 知识库
  • 使用 LangChain 实现 RAG 增强的智能问答系统
04 进阶篇:DeepSpeed 分布式训练与 RLHF

DeepSpeed 分布式训练框架

  • DeepSpeed 核心模块:Training、Inference、Compression、4Science
  • 分布式技术架构:分布式训练、推理与通信策略
  • ZeRO 冗余优化技术:内存消耗分析、ZeRO-Offload、ZeRO-Stage3
  • 端到端 RLHF 训练系统 DeepSpeed-Chat 与混合引擎 Hybrid Engine

使用 DeepSpeed Chat 实现 RLHF 模型微调

  • Meta OPT 系列模型介绍与数据集准备
  • RLHF 三阶段训练:Actor 模型、Reward 模型、一键式强化学习训练
  • 使用 DeepSpeed Chat 部署运行模型推理服务
05 拓展篇:国产化适配与大模型预训练

国产化适配:华为昇腾 910 模型微调实战

  • 华为 AI 全栈全场景平台与昇腾 Ascend 310/910 处理器介绍
  • 在昇腾 910 上部署 DeepSeek v4:安装、推理与训练全流程
  • 国产化算力平台适配的关键经验与最佳实践

Qwen3.6 预训练技术揭秘

  • Qwen3.6 大模型系列介绍与技术架构解析
  • 在 Hugging Face 上使用与部署 Qwen3.6 模型
  • 详解 Qwen3.6 大模型优缺点与适用场景

实战:预训练 Qwen3.6 大模型

  • 训练数据准备:开源数据集选取、中文数据集优化与 Token 编码效率提升
  • 使用 QLoRA + DeepSpeed 预训练 Qwen3.6:GPU 选型与量化预训练脚本详解
  • Qwen3.6 预训练端到端实战

讲师介绍

彭靖田

创始人 / CEO
谷歌 AI 开发者专家(GDE)10 万+ AI 学员3 次创业成功退出浙大竺可桢学院《深入理解 TensorFlow》作者

华为 2012 实验室深度学习创始团队成员,加州大学访问学者。曾任才云科技技术合伙人(2020 年被字节跳动收购为火山引擎云),品览数据联合创始人兼 CTO(累计融资近 2 亿元)。Kubeflow 维护者 / TensorFlow 贡献者 / Linux CNCF 程序委员会成员。

开始学习

扫码关注公众号「彭靖田」,咨询课程详情

公众号二维码
更多联系方式