AI大模型微调,从原理剖析到企业级落地实战资源介绍:
整套课下来,你不仅能搞明白微调的各种原理,还能跟着做完一个完整的金融大模型微调项目,从SFT到奖励模型到GRPO,把多机多卡分布式训练也走一遍。讲师讲得比较接地气,不堆术语,适合想深入大模型微调方向的人。
主要内容:
第1章先讲高效微调的原理
告诉你什么场景该微调、什么场景该用RAG,微调和全量微调到底差在哪。然后从预训练流程讲起,包括网络通信、数据并行、模型并行、3D并行这些分布式训练的基础知识。最后重点讲LoRA和QLoRA的原理,这两个是现在最常用的高效微调方法,LoRA那节讲了半个多小时,非常细。
第2章讲强化学习
包括PPO、RLHF、DPO、GRPO这些概念。这些东西现在特别火,因为大模型对齐人类偏好就靠它们。课程会用大白话把每个算法的核心思想讲清楚,不堆公式。
第3章讲数据工程
这是微调里最容易被忽视但最重要的一环。会讲预训练数据集、SFT数据集、偏好数据集、COT数据集分别长什么样,然后带着你实际构建这几种数据集,不是光讲理论。
第4章是Llama-Factory实战
这是一个很流行的微调工具。从安装、准备模型和数据开始,手把手带你做LoRA微调,然后验证效果,分析核心参数。还会教你接入TensorBoard看训练过程。后半部分专门做了一个Text2SQL模型的微调实战,从数据集格式、准备、处理、注册到微调、校验,最后还讲了DeepSpeed分布式训练。
第5章讲Embedding模型微调
这个主要是为了解决RAG的痛点。会讲什么场景需要微调Embedding、怎么选基础模型、怎么准备数据集、怎么清洗、怎么微调、怎么检验效果。整个流程走一遍,用的是医疗场景的数据。
第6章讲模型蒸馏
先讲蒸馏和微调的本质区别,然后讲为什么蒸馏方案最近火起来了。接着讲蒸馏流程、资源评估、服务器租赁、基础模型下载、全量微调工具安装部署,最后基于Llama-Factory做全量微调,对比蒸馏前后的效果。
第7章开始是企业金融大模型微调项目
SFT方案设计与落地,37节课,非常详细。从项目背景、需求、技术方案讲起,然后讲微调技术流程、数据集选择、模型选型、方案选型。数据集构建部分讲了单轮和多轮怎么建。然后是LoRA微调的完整流程:环境构建、基座模型下载、数据样本初始化、数据处理、LoRA参数配置、SFT参数配置、数据整理器、基础模型加载、模型评估内存优化回调、最佳模型保存、早停机制、checkpoints机制、DeepSpeed分布式参数配置、TensorBoard监控。监控指标部分专门讲了train_loss、eval_loss、learning_rate、grad_norm怎么看。最后是多轮对话数据处理、ROUGE指标、Perplexity指标、效果评估说明和模型部署。
第8章是奖励模型方案设计与落地
32节课。先讲需求背景,为什么选GRPO,为什么GRPO必须微调奖励模型。然后讲整体流程设计、数据集构建方案、构建策略、脚本执行、训练路径分析。奖励模型选型部分讲了基于RewardBench排行榜怎么选。后面大量篇幅讲多机多卡环境搭建:方案设计、分布式推理部署、主机规划、多机免密、conda环境安装、开源模型下载、同步虚拟环境、共享目录、pdsh工具安装、hosts设置、Ray集群启动、分布式推理测试、分布式微调环境构建。最后是奖励模型的项目脚本设计、微调思路、全流程代码设计、开源奖励模型安装部署、多机多卡分布式微调演练、分布式环境启动、效果校验脚本开发和校验。
第9章是GRPO方案设计与落地
7节课。讲为什么需要GRPO、方案选型、数据准备、环境准备、代码设计、流程演示,最后项目总结。
资源目录:
.
├── 视频
│ ├── 1-1 课程介绍.mp4
│ ├── 1-10 高效微调原理之预训练之3D并行.mp4
│ ├── 1-11 高效微调原理之微调步骤.mp4
│ ├── 1-12 高效微调原理之LoRA原理.mp4
│ ├── 1-2 高效微调原理之什么场景需要微调?.mp4
│ ├── 1-3 高效微调原理之什么场景需要RAG?.mp4
│ ├── 1-4 高效微调原理之微调和全量微调的区别.mp4
│ ├── 1-5 高效微调原理之预训练的流程.mp4
│ ├── 1-6 高效微调原理之预训练的两个挑战.mp4
│ ├── 1-7 高效微调原理之预训练之网络通信.mp4
│ ├── 1-8 高效微调原理之预训练之数据并行.mp4
│ ├── 1-9 高效微调原理之预训练之模型并行.mp4
│ ├── 2-1 强化学习微调之什么是强化学习?.mp4
│ ├── 2-2 强化学习微调之什么是PPO?.mp4
│ ├── 2-3 强化学习微调之什么是RLHF?.mp4
│ ├── 2-4 强化学习微调之什么是DPO?.mp4
│ ├── 2-5 强化学习微调之什么是GRPO?.mp4
│ ├── 3-1 大模型微调数据的重要性.mp4
│ ├── 3-10 大模型微调数据集构建实操-构建SFT数据集.mp4
│ ├── 3-11 大模型微调数据集构建实操-构建偏好数据集.mp4
│ ├── 3-2 大模型微调数据格式划分.mp4
│ ├── 3-3 大模型微调预训练数据集.mp4
│ ├── 3-4 大模型微调SFT数据集.mp4
│ ├── 3-5 大模型微调偏好数据集.mp4
│ ├── 3-6 大模型微调COT数据集.mp4
│ ├── 3-7 大模型微调数据集生成实战.mp4
│ ├── 3-8 大模型微调数据集工具部署.mp4
│ ├── 3-9 大模型微调数据集构建实操-构建COT数据集.mp4
│ ├── 4-10 Text2SQL模型微调之数据处理.mp4
│ ├── 4-11 Text2SQL模型微调之数据集注册.mp4
│ ├── 4-12 Text2SQL模型微调之微调实战.mp4
│ ├── 4-15 Text2SQL模型微调之基于DeepSpeed实战.mp4
│ ├── 4-3 Llama-Factory微调之模型和数据准备.mp4
│ ├── 4-4 Llama-Factory微调之LoRa微调实战.mp4
│ ├── 4-5 Llama-Factory微调之模型效果验证.mp4
│ ├── 4-8 Text2SQL模型微调之数据集格式说明.mp4
│ ├── 4-9 Text2SQL模型微调之数据集准备.mp4
│ ├── 5-11 Embedding模型微调之微调数据准备核心逻辑.mp4
│ ├── 5-12 Embedding模型微调之微调核心代码.mp4
│ ├── 5-13 Embedding模型微调之微调效果检验.mp4
│ ├── 5-2 Embedding模型微调之适用场景剖析.mp4
│ ├── 5-3 Embedding模型微调之基础模型选型.mp4
│ ├── 5-4 Embedding模型微调之数据集准备.mp4
│ ├── 5-5 Embedding模型微调之技术方案选型.mp4
│ ├── 5-6 Embedding模型微调之环境准备.mp4
│ ├── 5-7 Embedding模型微调之基础模型校验.mp4
│ ├── 5-8 Embedding模型微调之数据集校验.mp4
│ ├── 5-9 Embedding模型微调之数据集清洗.mp4
│ ├── 6-1 模型蒸馏之蒸馏和微调的本质区别.mp4
│ ├── 6-10 模型蒸馏之蒸馏数据格式说明.mp4
│ ├── 6-11 模型蒸馏之基础模型效果测试.mp4
│ ├── 6-12 模型蒸馏之蒸馏数据集准备.mp4
│ ├── 6-13 模型蒸馏之基于Llama-Factory进行全量微调.mp4
│ ├── 6-14 模型蒸馏之模型蒸馏前后效果对比.mp4
│ ├── 6-2 模型蒸馏之微调和全量微调的本质区别.mp4
│ ├── 6-3 模型蒸馏之为什么蒸馏方案突然火了起来?.mp4
│ ├── 6-4 模型蒸馏之模型推理能力的重要性.mp4
│ ├── 6-5 模型蒸馏之蒸馏流程剖析.mp4
│ ├── 6-6 模型蒸馏之全量微调工具推荐.mp4
│ ├── 6-7 模型蒸馏之资源评估和服务器租赁.mp4
│ ├── 6-8 模型蒸馏之基础模型下载.mp4
│ ├── 6-9 模型蒸馏之全量微调工具安装部署.mp4
│ ├── 7-1 整体项目之项目背景.mp4
│ ├── 7-10 SFT 微调之数据集构建 – 单轮数据集构建.mp4
│ ├── 7-11 SFT 微调之数据集构建 – 多轮数据集构建.mp4
│ ├── 7-12 SFT 微调之 LoRa 微调 – 微调技术方案选型.mp4
│ ├── 7-13 SFT微调之LoRa微调-微调技术方案设计思考.mp4
│ ├── 7-14 SFT微调之LoRa微调-微调环境构建.mp4
│ ├── 7-15 SFT微调之LoRa微调-微调基座模型下载.mp4
│ ├── 7-16 SFT微调之LoRa微调-数据样本初始化.mp4
│ ├── 7-17 SFT微调之LoRa微调-数据处理.mp4
│ ├── 7-18 SFT微调之LoRa微调-LoRA参数配置.mp4
│ ├── 7-19 SFT微调之LoRa微调-SFT微调参数配置.mp4
│ ├── 7-2 整体项目之项目需求.mp4
│ ├── 7-20 SFT微调之LoRa微调-创建数据整理器.mp4
│ ├── 7-21 SFT微调之LoRa微调-基础模型加载.mp4
│ ├── 7-22 SFT微调之LoRa微调-模型评估内存优化回调函数.mp4
│ ├── 7-23 SFT微调之LoRa微调-最佳模型保存函数.mp4
│ ├── 7-24 SFT微调之LoRa微调-最后模型保存函数.mp4
│ ├── 7-25 SFT微调之LoRa微调-模型微调的早停机制.mp4
│ ├── 7-26 SFT微调之LoRa微调-微调的checkpoints机制设置.mp4
│ ├── 7-28 SFT微调之LoRa微调-TensorBoard可视化监控.mp4
│ ├── 7-29 SFT微调之LoRa微调-核心监控指标之train_loss分析.mp4
│ ├── 7-3 整体项目之技术方案.mp4
│ ├── 7-30 SFT微调之LoRa微调-核心监控指标之eval_loss分析.mp4
│ ├── 7-31 SFT微调之LoRa微调-核心监控指标之learning_rate分析.mp4
│ ├── 7-32 SFT微调之LoRa微调-核心监控指标之grad_norm分析.mp4
│ ├── 7-33 SFT微调之LoRa微调-多轮对话微调数据处理.mp4
│ ├── 7-34 SFT微调之LoRa微调-微调效果评估之ROUGE指标.mp4
│ ├── 7-35 SFT微调之LoRa微调-微调效果评估之Perplexity指标.mp4
│ ├── 7-36 SFT微调之LoRa微调-微调效果评估之评估效果说明.mp4
│ ├── 7-37 SFT微调之LoRa微调-微调效果评估之SFT模型部署.mp4
│ ├── 7-4 SFT 微调之微调技术流程.mp4
│ ├── 7-5 SFT 微调之数据集选择.mp4
│ ├── 7-6 SFT 微调之模型选型.mp4
│ ├── 7-7 SFT 微调之微调方案选型.mp4
│ ├── 7-8 SFT 微调之数据集构建 – 数据集解析.mp4
│ ├── 7-9 SFT 微调之数据集构建 – 数据构建策略.mp4
│ ├── 8-1 奖励模型之需求背景分.mp4
│ ├── 8-10 奖励模型之奖励模型选型.mp4
│ ├── 8-11 奖励模型之微调方案技术选型.mp4
│ ├── 8-12 多机多卡环境之方案设计.mp4
│ ├── 8-13 多机多卡环境之分布式推理部署方案设计.mp4
│ ├── 8-14 多机多卡环境之主机规划.mp4
│ ├── 8-15 多机多卡环境之多机免密.mp4
│ ├── 8-16 多机多卡环境之conda环境安装.mp4
│ ├── 8-17 多机多卡环境之开源模型下载.mp4
│ ├── 8-18 多机多卡环境之同步虚拟环境.mp4
│ ├── 8-19 多机多卡环境之创建共享目录.mp4
│ ├── 8-2 奖励模型之为什么选GRPO?.mp4
│ ├── 8-20 多机多卡环境之pdsh工具安装.mp4
│ ├── 8-21 多机多卡环境之设置hosts地址.mp4
│ ├── 8-22 多机多卡环境之Ray集群启动.mp4
│ ├── 8-23 多机多卡环境之模型分布式推理测试.mp4
│ ├── 8-24 多机多卡环境之分布式微调环境构建.mp4
│ ├── 8-25 奖励模型之项目脚本设计.mp4
│ ├── 8-26 奖励模型之奖励模型微调思路.mp4
│ ├── 8-27 奖励模型之全流程代码设计.mp4
│ ├── 8-28 奖励模型之开源奖励模型安装部署.mp4
│ ├── 8-29 奖励模型之多机多卡分布式微调演练.mp4
│ ├── 8-3 奖励模型之为什么GRPO必须微调奖励模型?.mp4
│ ├── 8-30 奖励模型之分布式环境启动.mp4
│ ├── 8-31 奖励模型之效果校验脚本开发.mp4
│ ├── 8-32 奖励模型之微调效果校验.mp4
│ ├── 8-4 奖励模型之整体流程设计.mp4
│ ├── 8-5 奖励模型之微调数据集构建方案思考.mp4
│ ├── 8-6 奖励模型之微调数据集构建策略.mp4
│ ├── 8-7 奖励模型之微调数据集构建脚本执行.mp4
│ ├── 8-8 奖励模型之奖励模型训练路径分析.mp4
│ └── 8-9 奖励模型之基于RewardBench排行榜选型.mp4
│ ├── 9-1 强化学习之为什么需要GRPO?.mp4
│ ├── 9-2 强化学习之GRPO落地的方案选型.mp4
│ ├── 9-3 强化学习之GRPO数据准备.mp4
│ ├── 9-4 强化学习之GRPO环境准备.mp4
│ ├── 9-5 强化学习之GRPO代码设计.mp4
│ ├── 9-6 强化学习之GRPO流程演示.mp4
│ └── 9-7 项目总结.mp4
└── 资料
├── 1DeepSeek专题之蒸馏专属…pdf.html
├── peft-lesson-master.zip
├── 微调实战之微调Embeddin…pdf.html
├── 大模型高效微调原理剖析.pdf.html
├── 微调基础之强化学习微调.pdf.html
└── 微调基础之微调数据工程.pdf.html

