大模型全栈总览【合集·下】
手册 · 覆盖 运营,约 5 分钟。
👀快看👀
作者: 大模型解码室
原文链接: 大模型全栈总览
推荐指数:⭐️⭐️⭐️⭐️⭐️
观看时间:3h48min
⚡️摘要⚡️
该系列由大模型解码室作者制作整理,内容包含大模型强化学习的视频课程合集,涵盖了从基础到进阶的各个方面,包括 RLHF、DPO、IPO、KTO 等概念和实战演练,以及分布式训练中的数据并行等技术。
🤖分集🤖
08大模型全栈-强化学习01-RLHF前言传统强化学习
介绍强化学习的关键实体、交互过程,通过例子强调奖励设计,并且对奖励概念及在 NLP 领域的应用进行了讨论。
09大模型全栈-强化学习02-RLHF前言LLM强化学习
阐述大语言模型中强化学习应用,包括概念、输出、收益、状态、策略区分及举例。
10大模型全栈-强化学习03-RLHF原理以及流程介绍
RLHF 模型由四个模型构成,训练流程分为三个阶段。各模型作用明确,有多种损失函数。但也存在算力消耗大、容易崩溃等挑战。
11大模型全栈-强化学习04-RLHF实战-deepspeed-chat实战
微软开源的 DeepSpeed Chat 项目,解决大型模型强化学习问题。提出混合引擎等技术,降低内存消耗,提供易用训练代码,实验证明成果并指出不稳定性及建议。
12大模型全栈-强化学习05-RLHF实战-端到端全流程解决方案-轩辕大模型强化学习完整流程介绍(数据+奖励模型+强化学习调参经验)
介绍轩辕 6B 大模型全栈学习实践,涵盖强化学习,包括偏好数据构建、奖励模型训练及强化学习阶段细节等。
13大模型全栈-强化学习06-DPO流程、代码以及损失函数介绍
探讨强化学习中 DPO 相较 on policy 的优势,包括降低复杂度等,介绍训练流程、数据集、超参数及损失函数与代码。
14大模型全栈-强化学习07-DPO原理公式推导
介绍 DPO 算法中 DPU 和 PPU 优化目标一致,展开 KL 散度计算与公式推导,讨论奖励模型及 DPO 变体。
15大模型全栈-强化学习08-DPO变体:IPO、KTO:无需偏好数据实现对齐
介绍 DPO 变体 IPO 和 KTO,IPO 用正则项防过拟合,KTO 创新数据获取与反馈,比较二者实践表现。
16大模型全栈-强化学习09-DPO变体:TDPO:更细粒度控制的DPO;RPO:带有离线奖励的DPO
讨论强化学习中 TDPO 和 RPO 改进模型,TDPO 控制 token 级 KL 散度,RPO 引入奖励差异性,二者实践效果良好。
17大模型全栈-强化学习10-DPO变体-DPOP+ORPO:微调阶段实现对齐
阐述了DPOP 和 ORPO 在强化学习中的作用,DPOP 避免负面样本影响,ORPO 实现模型对齐,还提及局限性及应用。
18大模型全栈-分布式训练01-数据并行01-数据并行-Ring–Allreduce和PS原理
阐述数据并行和模型参数并行概念及应用,包括数据分割处理、参数同步更新等,还讨论相关并行策略及在 PyTorch 中的应用。
19大模型全栈-分布式训练02-数据并行-deepspeed zero1/2/3原理
探讨数据并行中的模型参数并行技术,介绍 DeepSpeed 的 Zero 系列及 FSDP、CPU Offload 等,强调理解其重要性以加速训练。
✏️课代表✏️
强化学习在大模型中的重要性:强调了强化学习在优化大模型性能中的作用,特别是通过 RLHF 和 DPO 等技术实现模型对齐和提升。
DPO 和其变体的应用:详细阐述了 DPO 原理和公式推导,以及 IPO、KTO、TDPO、RPO 等变体在实际应用中的效果和优势。
数据并行技术的探讨:介绍了数据并行和模型参数并行的概念,以及 DeepSpeed Zero 系列等技术在加速大模型训练中的应用。
微调阶段的对齐实现:DPOP 和 ORPO 在强化学习微调阶段的作用,以及它们如何避免负面样本影响和实现模型对齐。
分布式训练的并行策略:讨论了在 PyTorch 中实现数据并行的策略,包括数据分割处理和参数同步更新等。