>> 德邦证券-德邦金工文献精译第十一期-了解GPT:训练篇-230629
| 上传日期: |
2023/6/29 |
大小: |
2939KB |
| 格式: |
pdf 共16页 |
来源: |
德邦证券 |
| 评级: |
-- |
作者: |
肖承志 |
| 下载权限: |
无限制-登录即可下载 |
|
|
2023年5月23日,微软盛大主办了"Build 2023"开发者大会。OpenAI的创始人Andrej Karpathy在此次大会中发表了一场关键专题演讲,题为“State of GPT”,为大众深入解读了GPT模型的最新状况与未来方向。 演讲总结了训练GPT的4个重要步骤:预训练、监督微调、奖励建模和强化学习。 预训练是GPT助手训练的关键步骤,占据了整个训练过程的绝大部分时间和计算资源。在预训练阶段,模型会利用数千个GPU在数月的时间里对海量的互联网数据集进行处理,从而学习一种强大的通用表示。这是一种无监督的学习过程,目标是学习预测给定上下文后的下一个单词。 监督微调是微调阶段的一部分,帮助模型更好地适应特定的任务或应用。监督微调的过程中会使用人工提供的对话样本来进行,例如在一个问答系统中,我们可能会提供一些特定的问题和正确答案组合,通过这些样本使模型适应问答任务。这阶段使用的数据集相对较小,但其质量更高,因此需要专业知识和经验来选择合适的微调数据以及适当地调整参数。 奖励建模对模型生成的不同输出进行人工排序,然后将这些排序结果作为奖励函数,引导模型优化其输出。这是一个使用人工智能进行排序和策略调整的过程,通过奖励函数可以实现对模型的微调和优化。 基于人类反馈的强化学习(RLHF)是一种特殊的训练方法,它在人工评估中的表现往往优于其他方法。在强化学习阶段,模型会根据评估员的反馈调整自己的行为,以获得更大的奖励和尽量避免惩罚。模型会根据这样的迭代过程逐渐学习到将奖励最大化的行为。 RLHF并不总是在所有任务均表现得更好。RLHF的主要思想是利用人类对模型已生成结果的评估,来反馈并优化模型的生成策略,从而提高生成结果的质量。然而,OpenAI发现,RLHF并不总是在所有任务中表现得更好。在处理需要大量探索和富有创造力的任务时,原有的基础模型更具有优势。 风险提示:数据不完备和滥用风险,信息安全风险,算法伦理风险
|
|