大模型原理· 第 4 / 4 页

(一)预训练

大模型的训练往往始于预训练阶段。在这一阶段,主要目标是让模型学习到广泛的语言知识和模式。

(二)指令微调阶段

在预训练模型的基础上,通过指令微调来优化模型在具体任务上的表现。主要方法包括:

  1. 引导模型学习如何更好地响应人类指令。
  2. 开源数据集整理,帮助模型学习如何在不同场景下生成有意义的回答。构建指令集是改进预训练模型的关键步骤。通过设计一系列具有多样性的任务指令与反馈,可以引导模型学习更符合用户期望的生成内容。

(三)强化学习阶段

在强化学习阶段,先是在预训练好的模型上进行有监督微调,收集一些提示集合,让标注人员写出高质量回复,再用这个数据集微调基础模型。接着在微调后的模型上创建奖励模型。对于每个提示,让模型生成几个回复,再让标注人员排序。处理排序数据时,使用奖励模型(把输出变成奖励分数)。然后经过反馈调整,不断重复生成、评估、调整、优化四个步骤。奖励模型训练好后用在强化学习上,大模型参数来自之前的有监督微调模型,会持续更新,而奖励模型参数不更新,它给模型生成的内容打分后,大模型经过多次迭代,模型会优化策略,提升回答质量。

相关资料

更多