这篇报告介绍了ChatGPT语言模型使用的技术。论文标题是《Training languagemodels to follow instructions with human feedback》,于2022年3月4日预发布于ArXiv,论文介绍了OpenAI的InstructGPT模型。ChatGPT模型并未公开发表具体实现方式,但ChatGPT模型是基于InstructGPT模型进化而来的版本,它们同属于OpenAI的GPT3.5系列模型。
构建InstructGPT模型需要一个预训练模型、一个“提示”集合以及若干标注员:1) InstructGPT模型是基于OpenAI先前发布的GPT-3系列模型基础上一系列微调改进的模型;2)“提示”集合是部分用户请求OpenAIAPI生成的以及标注员生成的数据集合,这部分数据使得模型更好的读懂用户的意图;3)40个数据标注员对该论文模型的输出进行人类反馈,得到了强化学习训练所需要的奖励模型。 训练InstructGPT模型的步骤如下:1)收集演示数据,训练监督策略。使用标注员团队提供的演示数据、使用监督学习方法对预训练GPT-3模型进行微调;2)收集比较数据,训练奖励模型。给定“提示”,让模型产生多个输出,标注人员对其好坏进行排序,训练一个奖励模型来预测人类的偏好;3)使用PPO算法根据奖励模型优化策略。用奖励模型的输出作为标量奖励,使用强化学习PPO算法来进一步微调第一步的监督模型。第二步和第三步可以连续迭代:更新后的策略可以训练出新的奖励模型,转而又优化新的策略。 InstructGPT(最小13亿参数量)的效果显著优于GPT-3(1750亿参数量)。论文结果表明,使用人类反馈进行微调是使语言模型符合人类意图的一个有前途的方向。InstructGPT模型的泛化能力、真实性、降低不良信息输出方面均有提高。 此外,存在一定局限性:1)雇佣的标注员只能代表用户群体的一小部分,存在偏置;2)模型容易被误用,产生令人信服的错误信息、仇恨或辱骂内容等。这样的大型语言模型的部署应该非常小心。 有许多开放性问题需要进一步探索。如在减少模型有偏见或其他有害输出的倾向方面,可用过滤预训练数据等方法;在模型可控性方面,可以将基于人类反馈的强化学习方法与其他可控性方法相结合。此外,对于大型语言模型,如何更好的综合各群体的价值观、达成广泛共识将是未来最需要解决的问题。 风险提示:数据不完备和滥用风险,信息安全风险,算法伦理风险 研究报告全文:TableMain证券研究报告金融工程专题文献精译2022年03月16日金融工程专题训练语言模型以遵循带有人类反金融工程专题证券分析师馈的指令肖承志姓名德邦金工文献精译第八期资格编号S0120521080003资格编号TableSummaryS11305XXXXXX投资要点邮箱xiaoczteboncomcn邮箱xxxxxteboncomcn研究助理这篇报告介绍了ChatGPT语言模型使用的技术论文标题是Traininglanguage于年月日预发布modelstofollowinstructionswithhumanfeedback202234于ArXiv论文介绍了OpenAI的InstructGPT模型ChatGPT模型并未公开发表相关研究具体实现方式但ChatGPT模型是基于InstructGPT模型进化而来的版本它们1股价是否充分反映了业绩中应计同属于OpenAI的GPT35系列模型和现金流部分所蕴含的未来盈利信息德邦金工文献精译第七期构建InstructGPT模型需要一个预训练模型一个提示集合以及若干标注员202207131InstructGPT模型是基于OpenAI先前发布的GPT-3系列模型基础上一系列微调改进的模型提示集合是部分用户请求生成的以及标注员2资产配置管理风格和绩效衡量2OpenAIAPI德邦金工文献精译第六期生成的数据集合这部分数据使得模型更好的读懂用户的意图340个数据标注20220711员对该论文模型的输出进行人类反馈得到了强化学习训练所需要的奖励模型规模很重要如果控制了绩差股3训练InstructGPT模型的步骤如下1收集演示数据训练监督策略使用标注德邦金工文献精译第五期员团队提供的演示数据使用监督学习方法对预训练GPT-3模型进行微调2收20220528集比较数据训练奖励模型给定提示让模型产生多个输出标注人员对其4中国股市的规模和价值因子模型好坏进行排序训练一个奖励模型来预测人类的偏好3使用PPO算法根据奖德邦金工文献精译第四期励模型优化策略用奖励模型的输出作为标量奖励使用强化学习PPO算法来进20220422一步微调第一步的监督模型第二步和第三步可以连续迭代更新后的策略可以训练出新的奖励模型转而又优化新的策略5机器学习驱动下的金融对不确定性的吸收和加剧德邦金工文献精InstructGPT最小13亿参数量的效果显著优于GPT-31750亿参数量论译第三期20220211文结果表明使用人类反馈进行微调是使语言模型符合人类意图的一个有前途的6不可知的基本面分析是可行的方向InstructGPT模型的泛化能力真实性降低不良信息输出方面均有提高德邦金工文献精译第二期此外存在一定局限性1雇佣的标注员只能代表用户群体的一小部分存在偏20220114置2模型容易被误用产生令人信服的错误信息仇恨或辱骂内容等这样的大型语言模型的部署应该非常小心7机器学习因子在线性因子模型中捕获非线性德邦金工文献精译有许多开放性问题需要进一步探索如在减少模型有偏见或其他有害输出的倾向第一期20210917方面可用过滤预训练数据等方法在模型可控性方面可以将基于人类反馈的强化学习方法与其他可控性方法相结合此外对于大型语言模型如何更好的综合各群体的价值观达成广泛共识将是未来最需要解决的问题风险提示数据不完备和滥用风险信息安全风险算法伦理风险请务必阅读正文之后的信息披露和法律声明金融工程专题内容目录1摘要42简介43相关工作74方法与实验细节941高级方法942数据集1043任务1044人工数据收集1145模型1146评价135结果1451API分布上的结果1452公开NLP数据集合上的结果1653定性结果196讨论2061对齐研究的影响2062在向谁对齐2163局限性22631方法论22632模型2264开放性问题2365更广泛的影响247风险提示248参考文献24信息披露30230请务必阅读正文之后的信息披露和法律声明金融工程专题图表目录图1人工评估各模型5图2构建InstructGPT的三个步骤5图3数据集数据类别分布和数据集说明性提示9图4API分布上的标签器收集的元数据12图5模型的偏好结果15图6API分布的元数据结果15图7模型的对比结果16图8TruthfulQA数据集的结果17图9比较RealToxicityPrompts上的人工评估和自动评估17图101750亿PPO-ptx模型1750亿的InstructGPT与没有附加前缀的1750亿的GPT-3相比的泛化示例18图111750亿的PPO-ptx模型1750亿的InstructGPT中的简单错误19330请务必阅读正文之后的信息披露和法律声明金融工程专题1摘要这篇报告是德邦金工文献精译的第八期我们介绍ChatGPT语言模型技术ChatGPT模型并未公开发表具体实现方式但ChatGPT模型是基于InstructGPT模型进化而来的版本它们同属于OpenAI的GPT35系列模型论文的标题是Traininglanguagemodelstofollowinstructionswithhumanfeedback于2022年3月4日预发布于Arxiv作者是LongOuyang等该论文展示一种方法通过对人类反馈进行微调使InstructGPT语言模型在多项广泛的任务中匹配用户意图从一组标签标注器的输入指令和通过OpenAIAPI提交的输入指令开始收集了所需模型行为的标签演示数据集使用监督学习对GPT-3进行微调然后该论文收集了模型排名数据使用人类反馈的强化学习技术来进一步微调这个监督模型该论文将得到的模型称为InstructGPT评估结果显示13亿个参数InstructGPT模型的输出优于1750亿GPT-3的输出模型参数量下降的一百多倍此外InstructGPT模型在公开的NLP数据集上提高真实性减少毒性比其他模型具有最少的性能衰退尽管InstructGPT仍然会犯一些简单的错误但论文结果表明使用人类反馈进行微调是使语言模型符合人类意图的一个有前途的方向2简介给定自然语言处理NLPNaturalLanguageProcessing任务的一些示例作为输入大型语言模型LMsLargeLanguageModels可以被prompt执行一系列自然语言处理任务prompt方法给模型一个任务提示例如在情感分析任务中输入Ilovethismovie后提前给定一个提示Thismovieisxxx预训练模型看到提示后明白自己要输出greatnice等夸赞的形容词然而这些模型经常表达出意想不到的行为如编造事实生成有偏见或有害的文本以及根本不遵循用户指示Bender等人2021Bommasani2021Tamkin等人2021Gehman等人2020这是因为最近许多的大型语言模型中语言建模的目标在互联网上预测网页的下一个分词与有效和安全地遵循用户的指示的目标不同Radford等人2019布朗等人2020Fedus等人2021Rae等人2021Thoppilan等人2022语言建模目标是不一致的避免这些意外对于要在数以百计的应用中部署使用的语言模型来说尤其重要按照用户的意图去训练语言模型该论文在对齐语言模型方面取得了进展Leike等人2018这既包括明确的意图如遵循指示也包括隐含的意图如保持诚实无偏和无害用Askell等人2021的话说该论文希望语言模型是有帮助的它们应该帮助用户解决他们的任务诚实的它们不应该编造信息或误导用户无害的它们不应该对人或环境造成身体心理或社会上的伤害该论文在第46节详细说明这些评估标准430请务必阅读正文之后的信息披露和法律声明金融工程专题图1人工评估各模型资料来源Traininglanguagemodelstofollowinstructionswithhumanfeedback德邦研究所注在该论文的API提示分布上对各种模型的人工评估根据每个模型的输出优于175BSFT模型的输出的频率进行评估该论文的InstructGPT模型PPO-ptx及其未经预训练混合训练的变体PPO显着优于GPT-3基准GPT和GPTprompted13亿参数量的PPO-ptx模型优于1750亿参数量的GPT-3论文误差条为95置信区间该论文重点是调整语言模型的微调方法具体来说该论文使用基于人类反馈的强化学习方法RLHFReinforcementLearningfromHumanFeedback对GPT-3进行微调Christiano等人2017Stiennon等人2020以遵循广泛的书面指令如图2RLHF技术将人类偏好作为奖励信号来微调论文模型图2构建InstructGPT的三个步骤资料来源Traininglanguagemodelstofollowinstructionswithhumanfeedback德邦研究所注说明构建InstructGPT方法的三个步骤1监督微调supervisedfine-tuning以下简称SFT2奖励模型RM训练3在该奖励模型上使用强化学习近端策略优化算法PPOproximalpolicyoptimization蓝色箭头表示该数据用于训练该论文模型其中一个模型在第2步中框A-D是模型输出样本由标注员人工排名有关该方法的更多细节请参阅第3节530请务必阅读正文之后的信息披露和法律声明金融工程专题该论文团队雇佣了一个由40人的承包商团队根据他们在筛选测试中的表现来标记论文数据详情见34然后收集用户提交给OpenAIAPI的提示主要是英语和标注员编写的提示的集合并使用它来训练监督学习基线接下来在更大的API提示集上收集来自模型的输出之间的人工标记比较数据集然后在这个数据集上训练一个奖励模型RMRewardModel来预测标注员更喜欢哪个模型输出最后该论文使用这个RM作为奖励函数并对监督学习基线模型进行微调用PPO算法Schulman等人2017来最大化这个奖励该程序将GPT-3的行为变得与特定人群主要是该论文标注员和研究人员的偏好更贴合而不是任何更广泛的人类价值观概念将在62节中进一步讨论最终的模型被称为InstructGPT该论文评估模型的方式主要是让标注员对测试集上的模型输出质量打分包括来自固定用户的提示他们的数据没有在训练数据中该论文还对一系列公开NLP数据集进行自动评估该论文训练了三个规模13亿60亿和1750亿个参数的模型并且所有的模型都使用GPT-3架构主要发现如下与GPT-3的输出相比标注员明显更喜欢InstructGPT输出测试集中来自13亿参数InstructGPT模型的输出比来自1750亿GPT-3的输出更好尽管它的参数少了100多倍这些模型具有相同的体系结构唯一的不同之处在于InstructGPT对人工数据进行了微调即使该论文在GPT-3中添加少样本提示以使其更好地遵循指令模型表现仍不如InstructGPT该论文的1750亿InstructGPT输出在853的情况下优于1750亿GPT-3输出在714的情况下优于少样本学习的1750亿GPT-3输出InstructGPT模型还根据该论文的标签生成更适当的输出并且更可靠地遵循指令中的显式约束InstructGPT模型的真实性比GPT-3有所提高在TruthfulQA基准测试中InstructGPT生成真实且信息丰富答案的频率是GPT-3的两倍该结果在非对抗GPT-3选择的问题子集上同样强大在该论文的API提示分布的封闭域任务中输出不应该包含输入中不存在的信息例如摘要和封闭域QAInstructGPT模型构成输入中不存在的信息的频率大约是GPT-3的一半分别为21和41的幻觉率InstructGPT的毒性比GPT-3略有改善但偏差不大为了测量毒性该论文使用RealToxicityPromptss数据集Gehman等人2020并进行自动和人工评估当提示尊重时InstructGPT模型产生的毒性输出比GPT-3少25左右在WinogenderRudinger2018和CrowSPairsNangia等人2020数据集上InstructGPT与GPT-3相比没有显著改善可以通过修改RLHF微调过程来最小化公开NLP数据集上的性能衰减在RLHF微调期间该论文在某些公开NLP数据集上观察到与GPT-3模型相比的性能衰减特别是SQuADRajpurkar等人2018DROPDua等人2019HellaSwagZellers等人2019和WMT2015法语到英语的翻译Bojar等人2015这是对齐税的一个例子因为该论文的对齐过程是以在可能关心的某些任务上表现更差为代价的通过将PPO更新与增加预训练分布PPO-ptx的对数概率的更新混合在一起该论文模型可以在不影响标签偏好得分的情况下大大减少这些数据集上的性能衰减630请务必阅读正文之后的信息披露和法律声明金融工程专题该论文的模型能泛化到不产生任何训练数据的留出标注员的偏好为了测试该论文模型的泛化性对留出标注员进行了初步实验并发现他们更喜欢InstructGPT输出而不是GPT-3输出与该论文标注员团队大致相同然而还需要做更多的工作来研究这些模型在更广泛的用户群体上的表现以及它们如何在人类对期望的行为不一致的情况下执行输入公开NLP数据集并不能反映该论文的语言模型是如何被使用的该论文比较了在人类偏好数据即InstructGPT上微调的GPT-3模型与在两个不同的公开NLP任务编译上微调的GPT-3模型FLAN模型Wei等人2021和T0模型Sanh等人2021特别是T0变体这些数据集由各种NLP任务组成并结合了每个任务的自然语言指令在API提示分布上FLAN和T0模型的表现略差于SFT基线标注员明显更喜欢InstructGPT模型与基线模型相比InstructGPT的胜率为7342而T0模型和FLAN模型的胜率分别为2682和2982InstructGPT模型对RLHF微调分布之外的指令显示出很好的泛化效果该论文定性地研究了InstructGPT的功能并发现它能够遵循总结代码回答关于代码的问题有时还能够遵循不同语言的指令尽管这些指令在微调发行版中非常罕见相比之下GPT-3虽然可以执行这些任务但需要更细致的提示并且通常不遵循这些领域的指令这个结果令人兴奋因为它表明模型能泛化遵循指令的概念即使在很少得到直接监督信号的任务上也会保持一定的一致性InstructGPT仍然会犯简单的错误例如InstructGPT仍然可能无法遵循指令编造事实对简单问题给出冗长的模棱两可的答案或者无法检测带有错误前提的指令总的来说该论文的结果表明使用人类偏好来微调大型语言模型库显著改善模型在广泛任务上的表现即使仍有许多工作要做以提升安全性和可靠性该论文的其余部分结构如下首先在第3节详细介绍相关工作然后在第4节深入研究该论文的方法和实验细节包括该论文的高级方法41数据集和任务42和43人工数据收集44如何训练模型45以及评估过程46然后在第5节中展示结果分为三个部分API提示分布的结果51公开NLP数据集的结果52和定性结果53最后在第6节对该论文的工作进行了扩展讨论包括对齐研究的影响61对齐的对象62局限性63开放性问题64以及这项工作的更广泛影响653相关工作关于从人类反馈中学习和对齐的研究该论文建立在先前的技术基础上使模型与人类意图保持一致特别是从人类反馈中强化学习RLHF这项技术最初开发用于在模拟环境和Atari游戏中训练简单的机器人Christiano等人2017Ibarz等人2018最近被用于微调语言模型来总结文本Ziegler等人2019Stiennon等人2020Bhm等人2019Wu等人2021这项工作反过来又730请务必阅读正文之后的信息披露和法律声明金融工程专题受到使用人类反馈作为奖励的领域的类似工作的影响涉及对话Jaques等人2019Yi等人2019Hancock等人2019翻译Kreutzer等人2018Bahdanau等人2016年语义解析Lawrence和Riezler2018年故事生成Zhou和Xu2020年评论生成Cho等人2018年和证据提取Perez等人2019年等Madaan等人2022使用书面的人类反馈来增强提示并提高GPT-3的性能也有一些研究使用强化学习和规范先验Nahian等人2021来对齐基于文本的环境中的智能体该论文的工作可以看作是将RLHF直接应用于对齐广泛分布的语言任务上的模型语言模型对齐的含义这个问题最近也受到了关注Gabriel2020Kenton等人2021在LMs中列出了由不对齐导致的行为问题包括产生有害的内容和玩弄错误指定的目标在同时进行的研究工作中Askell等人2021提出将语言助手作为对齐研究的测试平台研究一些简单的基线及其缩放性质训练语言模型遵循指令该论文的工作还涉及语言模型跨任务的泛化研究其中LMs在广泛的公开NLP数据集上进行微调通常以适当的指令作为前缀并在不同的NLP任务集上进行评估在这一领域已经有了一系列的工作Yi等人2019Mishra等人2021Wei等2021Khashabi等人2020Sanh等2021Aribandi等人2021它们在训练和评估数据指令格式预训练模型的大小和其他实验细节上有所不同研究一致的发现是在一系列NLP任务上通过指令对LMs进行微调可以提高它们在留出任务上的下游性能无论是在零样本设置还是在少样本设置下还有一个与可控性指令遵循相关的工作其中训练模型遵循自然语言指令在模拟环境中的可控性Bahdanau等人2018Abramson等人2020Zhao等2021评估语言模型的危害修改语言模型的行为的一个目标是将这些模型部署到现实世界中时要减轻它们的危害这些风险已被广泛记录Bender等人2021Bommasani等人2021Kenton等人2021Weidinger等人2021Tamkin等人2021语言模型可以产生有偏差的输出Dhamala等人2021Liang等2021Manela等人2021Caliskan等人2017Kirk等人2021泄露私人数据Carlini等人2021产生错误信息Solaiman等人2019Buchanan等人2021并被恶意使用有关全面详细的回顾参见Weidinger等人2021在特定领域部署语言模型会带来新的风险和挑战例如在对话系统中Henderson等人2018徐等2020Dinan等2019b目前出现了一个新兴但不断发展的领域旨在建立基准来具体评估这些毒性特别是围绕毒性Gehman等人2020年刻板印象Nadeem等人2020年和社会偏见Dhamala等人2021年Nangia等人2020鲁丁格等人2018在这些问题上取得重大进展是困难的因为对语言模型行为的善意干预可能会产生副作用Welbl等人2021Blodgett等人2020例如由于训练数据中存在偏见的相关性试图降低LMs毒性的努力可能会降低其从少数群体中文本建模的能力Xu等人2021修改语言模型的行为以减轻危害有许多方法可以改变语言模型的生成行为Solaiman和Dennison2021在一个小型的针对价值观的数据集上微调LMs这提高了模型在问答任务的能力Ngo等人2021通过删除预训练数据集中一些语言模型有高条件概率生成一组研究人员编写的触发短语的文档来过滤预训练数据集当在这个过滤后的数据集上训练时它们的LMs生成的有害文本更少代价是语言建模性能略有下降Xu等人2020使用多种方法来提高聊天机器人830请务必阅读正文之后的信息披露和法律声明金融工程专题的安全性包括数据过滤在生成过程中阻止某些单词或字格安全特定的控制标记Keskar等人2019Dinan等人2019a和人在环中数据收集Dinan等人2019b其他降低LMs产生的偏见的方法包括使用词嵌入正则化的方法Liu等人2019Huang等人2019数据增强的方法Liu等人2019Dinan等人2019aSheng等人2019零空间投影使敏感标记上的分布更加均匀的方法Liang等人2021不同的目标函数的方法Qian等人2019或因果中介分析的方法Vig等人2020也有一些工作使用第二个通常较小的语言模型引导语言模型生成的Dathathri等人2019Krause等人2020这一思想的变体已被应用于减少语言模型毒性Schick等人2021图3数据集数据类别分布和数据集说明性提示资料来源Traininglanguagemodelstofollowinstructionswithhumanfeedback德邦研究所4方法与实验细节41高级方法该论文遵循了Ziegler等人2019和Stiennon等人2020的方法他们将其应用于风格延续和摘要领域该论文从一个预训练的语言模型开始Radford等人2019Brown等人2020年Fedus等人2021Rae等人2021Thoppilan等人2022一个输入提示分布以及一个训练有素的标注员团队见44训练InstructGPT模型的步骤如下步骤1收集演示数据训练监督策略标注员团队提供了输入提示分布上所需行为的演示见42然后该论文使用监督学习用这些数据对一个预训练GPT-3模型进行微调步骤2收集比较数据训练奖励模型该论文收集了一个模型输出之间比较的数据集其中标注员指出他们更喜欢给定输入的哪个输出然后训练一个奖励模型来预测人类偏好的输出步骤3使用PPO算法根据奖励模型优化策略该论文使用RM的输出作为标量奖励使用PPO算法对监督策略进行微调以优化该奖励Schulman等人2017930请务必阅读正文之后的信息披露和法律声明金融工程专题步骤2和步骤3可以连续迭代根据当前最优策略收集更多的比较数据用于训练一个新的RM然后再训练一个新的策略在实践中大部分比较数据来自监督策略还有一些来自PPO策略42数据集该论文的提示数据集主要由提交给OpenAIAPI的文本提示组成特别是那些在Playground界面上使用早期版本的InstructGPT模型通过对演示数据子集进行监督学习训练的文本提示使用Playground的客户在使用InstructGPT模型的时候被告知他们的数据可以用于训练更多的模型在本文中该论文不使用来自生产API的客户的数据通过检查提示是否共享一个较长的公共前缀来启发式地去重并将提示的数量限制为每个用户ID200个该论文还根据用户ID创建训练验证和测试集以便验证和测试集不包含来自训练集中数据的用户数据为了避免模型学习可能是敏感的客户信息该论文过滤了训练分割中所有获取个人身份信息PIIpersonallyidentifiableinformation的提示为了训练第一个InstructGPT模型该论文要求标注员编写自己的提示这是因为需要一个初始的指令类提示源来引导流程而这类提示通常不会提交给API上的常规GPT-3模型该论文团队让标注员写出如下三类提示a简单简单地要求标注员想出任意一个任务同时确保任务足够多样b少量样本要求标签者想出一条指令以及该指令的多个查询响应对c基于用户在OpenAIAPI的等待列表应用中陈述了许多用例要求标注员提出与这些用例相对应的提示根据这些提示该论文生成了三个不同的数据集用于微调过程aSFT数据集使用标注员演示来训练SFT模型bRM数据集使用模型输出的标注员排名来训练RMcPPO数据集没有任何人为标签用作RLHF微调的输入SFT数据集包含大约13000个训练提示来自API和标注员编写的RM数据集有33000个训练提示来自API和标注员编写的PPO数据集有31000个训练提示仅来自API为了让该论文的数据集的组成显得更合理如图3该论文展示了由承包商标记的API提示特别是RM数据集的用例类别的分布大多数用例都是生成的而不是分类或QA图3还展示了一些说明性提示由研究人员编写以模拟提交给InstructGPT模型的提示类型43任务该论文的训练任务有两个来源a由标注员编写的提示数据集b提交给API上早期InstructGPT模型的提示数据集1030请务必阅读正文之后的信息披露和法律声明金融工程专题这些提示非常多样化包括生成问题回答对话摘要提取和其他自然语言任务见图3该论文的数据集超过96是英语但是在43节中也探测了该论文的模型响应其他语言的指令和完成编码任务的能力对于每个自然语言提示任务通常是直接通过自然语言指令指定的例如写一个关于一只聪明的青蛙的故事但也可以间接地通过几个例子例如给出两个青蛙故事的例子并提示模型生成一个新的例子或隐式续写例如提供一个关于青蛙的故事的开头在每种情况下都要求标注员尽最大努力推断编写提示的用户的意图并要求他们在任务非常不清楚情况下跳过输入此外标注者还会根据提供给他们的说明和他们的最佳判断考虑隐含意图如回答的真实性以及潜在的有害输出如偏见或有害的语言44人工数据收集为了产生该论文的演示和比较数据并进行主要评估该论文团队在Upwork和ScaleAI上雇佣了大约40名承包商与早期收集关于总结任务的人类偏好数据的工作相比Ziegler等人2019Stiennon等人2020Wu等人2021该论文的输入涵盖了更广泛的任务偶尔可能包括有争议和敏感的话题该论文的目标是选择一组标注员他们对不同人群的偏好敏感并且擅长识别潜在有害的输出因此该论文团队进行了筛选测试旨在测试出在这些任务中表现良好的标注员并选择他们在训练和评估过程中该论文的对齐标准可能会发生冲突例如当用户请求一个可能有害的响应时在训练过程中该论文优先考虑对用户的帮助不这样做需要做出一些困难的设计决策该论文把这些决策留给未来的工作更多讨论见64然而在最终的评估中该论文要求标注员优先考虑真实性和无害性正如Stiennon等人2020所述该论文在项目过程中与标注员密切合作该论文团队有一个培训贴标注员的入职流程为每个任务写详细的说明并在共享聊天室回答标注员的问题作为一项初步研究该论文也观察模型在多大程度上适用于其他标注员的偏好该论文团队聘请了一组单独的标注员他们不生产任何训练数据这些标签来自相同的供应商但没有经过筛选测试尽管任务很复杂但该论文团队发现标注者之间的一致性相当高训练标注者之间的一致性为72615而非训练标注者之间的一致性为77313相比之下在Stiennon等人2020的总结工作中研究人员之间的一致性为73445模型该论文从Brown等人2020的GPT-3预训练语言模型开始这些模型是在广泛分布的互联网数据上训练的适用于广泛的下游任务但行为特征不明确从这些模型开始该论文用三种不同的技术训练模型监督微调SFT该论文使用监督学习对标签机演示中的GPT-3进行了微调训练了16个周期使用余弦学习率衰减残差dropout为02该论文根据1130请务必阅读正文之后的信息披露和法律声明金融工程专题验证集上的RM分数进行最终的SFT模型选择与Wu等人2021类似该论文发现SFT模型在1epoch后就在验证损失上过拟合然而该论文团队发现尽管存在过拟合但训练更多epoch对RM评分和人类偏好评分都有提高奖励建模RM从移除最后的解嵌层的SFT模型开始该论文训练一个模型可以接受提示和响应并输出标量奖励该论文只使用了60亿RMs因为这样可以节省大量的计算资源还发现1750亿RM训练可能是不稳定的因此不太适合用作RL中的值函数在Stiennon等人2020中RM在同一输入上的两个模型输出之间的比较数据集上进行训练他们使用交叉熵损失函数将比较结果作为标签奖励的差异表示标注者更喜欢一种反应的对数概率为了加快比较收集的速度该论文为标注员提供了K4到K9之间的响应来排序这会产生个比较显示给标注员的每个提示符由于比较在每个标签任务2中都是非常相关的如果简单地将比较转移到一个数据集中对数据集的一次传递就会导致奖励模型过拟合相反该论文在所有的将每个提示符作为单个批2处理元素进行比较这在计算上更有效因为它只需要对每个补全进行一次RM的前向传递而不是对K次补全进行前向传递并且由于它不再过拟合因2此大大提升了验证精度和对数损失具体而言奖励模型的损失函数为11losslog2其中是提示x和有着参数的完成度y的奖励模型的标量输出是和这一对中的首选完成D是人工比较的数据集图4API分布上的标签器收集的元数据资料来源Traininglanguagemodelstofollowinstructionswithhumanfeedback德邦研究所最后由于RM损失对奖励的变化是不变的该论文使用偏差对奖励模型进行标准化以便标签演示在做RL之前获得平均分数0强化学习RL继Stiennon等人2020之后该论文再次使用PPO对环境上的SFT模型进行了微调Schulman等人2017该环境是一个bandit1230请务必阅读正文之后的信息披露和法律声明金融工程专题环境它提供一个随机的客户提示并期望对提示做出回应给定提示和回应它会产生由奖励模型决定的奖励并结束情节此外在每个令牌上添加SFT模型的每个令牌KL惩罚以缓解奖励模型的过度优化值函数从RM开始初始化该论文称这些模型为PPO该论文还尝试将这些预训练梯度混合到PPO梯度中以固定公开NLP数据集上的性能衰减该论文称这些模型为PPO-ptx在RL训练中最大化以下组合目标函数RLSFTobjectiveRLlog2RLpretrainlogRLSFT其中为习得的RL策略为监督训练模型为预训练分布KL奖励系数和预训练损失系数分别控制KL惩罚和预训练梯度的强度对于PPO模型被设置为0本文中的InstructGPT指的是PPO-ptx模型基线该论文比较了PPO模型与SFT模型和GPT-3模型的性能该论文还与当提供了少镜头前缀来提示GPT-3进入指令遵循模式GPT-3-prompted进行了比较这个前缀加在用户指定的指令的前面该论文还将InstructGPT与FLANWei等人2021和T0Sanh等人2021数据集上的微调1750亿GPT-3进行了比较这两个数据集都由各种NLP任务组成并结合了每个任务的自然语言指令数据集在包含的NLP数据集和使用的指令风格上有所不同该论文分别对大约100万个例子进行微调并选择在验证集上获得最高奖励模型分数的检查点46评价为了评估该论文的模型是如何一致的首先需要澄清在这种情况下一致意味着什么一致的定义在历史上一直是一个模糊和令人困惑的话题有各种各样有说服力的论点Chen等人2021年Leke等人2018Gabriel2020根据Leike等人2018的观点该论文团队的目标是训练根据用户意图行动的模型更实际地说为了该论文的语言任务使用了类似于Askell等人2021的框架他们定义了模型判断如果是有用诚实和无害的则它们是一致的为了有所帮助模型应该遵循指令但也可以从几个提示或其他可解释的模式如QquestionnA推断意图由于给定提示的意图可能是不明确或模糊的该论文依赖于标注员的判断主要评价指标是标注员偏好然而由于标注者并不是生成提示的用户因此在用户的实际意图和标注者仅阅读提示而认为的意图之间可能存在分歧目前尚不清楚如何在纯生成模型中衡量诚实这需要将模型的实际输出与它对正确输出的信念进行比较由于模型是一个大黑箱因此无法推断它的信念相反使用两个指标来衡量真实性模型关于世界的陈述是否真实1评估的模型在封闭域任务幻觉上编造信息的倾向以及2使用TruthfulQA数据集Lin等人2021与诚实相似衡量语言模型的有害性也带来了许多挑战在在大多数情况下1330请务必阅读正文之后的信息披露和法律声明金融工程专题语言模型的是否有害取决于在现实世界中如何使用它们的输出例如在部署的聊天机器人上下文中生成有害输出的模型可能是有害的但如果用于数据增强以训练更准确的有害性检测模型则甚至可能是有用的在项目早期该论文让标注员评估输出是否潜在有害然而该论文团队停止了这个做法因为这需要太多的关于输出最终将会被怎样使用的猜测因此该论文使用一套更具体的代理标准旨在捕获部署模型中可能最终有害的行为的不同方面让标注员评估输出在客户助理的上下文中是否不合适诋毁受保护的类别或包含性或暴力内容还旨在测量偏差和有害性的数据集上对该论文的模型进行了基准测试例如RealToxicityPromptssGehman等人2020和CrowS-PairsNangia等人2020总之可以把定量评估分为两个独立的部分对API分布的评估主要指标是人类对来自与该论文的训练分布相同来源的一组提示的偏好评分当使用API中的提示进行评估时只选择未包含在培训中的客户的提示然而考虑到训练提示是设计用于InstructGPT模型的它们很可能不利于GPT-3基线因此该论文也对API上提交给GPT-3模型的提示进行评估这些提示通常不是指令跟随风格而是专门为GPT-3设计的在这两种情况下对于每个模型该论文计算其输出优先于基线策略的频率该论文选择1750亿SFT模型作为基准因为它的性能接近中等水平此外该论文团队要求标注员在1-7Likert量表上判断每个响应的整体质量并为每个模型输出收集一系列元数据公开NLP数据集的评估对两种类型的公共数据集进行评估一是捕捉语言模型安全性的一个方面特别是真实性有害性和偏见二是捕捉传统NLP任务如问答阅读理解和总结的零样本任务的表现还在RealToxicityPromptss数据集上对有害性进行了人为评估Gehman等人20205结果在本节中该论文团队为第1节中的内容提供了实验证据分为三部分API提示分布的结果公开NLP数据集上的结果和定性结果51API分布上的结果与GPT-3的输出相比标注员明显更喜欢InstructGPT输出该论文的提示测试集上该论文团队的标注员在模型大小上明显倾向于InstructGPT输出这些结果如图1所示论文团队发现GPT-3输出表现最差通过使用精心设计的少样本提示GPT-3-prompted然后使用监督学习SFT进行演示训练最后使用PPO对比较数据进行训练可以获得显著的改进在PPO期间添加预训练混合的更新不会导致标注员偏好的大变化为了说明该论文的增益的大小当直接比较时1750亿的InstructGPT输出在853的时间优于GPT-3输出在714的时间优于少样本训练GPT-3输出1430请务必阅读正文之后的信息披露和法律声明金融工程专题图5模型的偏好结果资料来源Traininglanguagemodelstofollowinstructionswithhumanfeedback德邦研究所注该论文中通过比对1750亿SFT模型的胜率来衡量的模型结果左API上提交给GPT模型的提示结果右在API上提交给InstructGPT模型的提示结果上图来自留出的标注员的结果下图训练标注员的结果论文团队从提交给GPT-3模型的提示的评价中省略了GPT提示左因为这些提示已经被设计为对GPT-3执行与提交给InstructGPT模型的提示相反右该论文团队还发现在API上提交给GPT-3模型的提示上进行评估时结果没有显著变化如图5尽管PPO-ptx模型在更大规模的模型上表现稍差图6API分布的元数据结果资料来源Traininglanguagemodelstofollowinstructionswithhumanfeedback德邦研究所注API分布的元数据结果注意由于数据集的规模这些结果在模型大小上是折叠的与GPT-3相比PPO模型更适合于扮演客户助理的环境更善于遵循指令中的明确约束并尝试正确的指令并且不太可能出现幻觉即编造关于封闭域任务的信息在图6中该论文展示了标注员还沿着几个更具体的方面对InstructGPT输出进行了良好的评分具体来说与GPT-3相比InstructGPT输出更适合于担任客户助理的角色更多地遵循指令中定义的明确约束例如将答案写在2段或更短的范围内InstructGPT模型绝大多数情况都能完全正确地遵循指令并且在封闭域任务中不太会编造事实这些结果表明InstructGPT模型比GPT-3模型更可靠更容易控制该论文团队找到的其他元数据类别在该论文的API中出现的频1530请务必阅读正文之后的信息披露和法律声明金融工程专题率太低无法在该论文模型之间获得统计上的显著差异该论文的模型能够泛化到没有产生任何训练数据的留出标注员的偏好留出标注员与用来生成训练数据的工作者有相似的排名偏好如图5根据留出的标注员认为所有的InstructGPT模型大大优于GPT-3基线因此InstructGPT模型并不是简单地过度拟合训练标注者的偏好从奖励模型的泛化能力中也可以看到进一步的证据该论文进行了一个实验将标签者分成5组并使用5倍交叉验证在其中4组进行训练并在保留组进行评估来训练5个RMs使用3种不同的种子这些RMs在预测留出标注员偏好准确度为69609与预测训练集中标注员偏好准确度72404相比略有下降图7模型的对比结果资料来源Traininglanguagemodelstofollowinstructionswithhumanfeedback德邦研究所注论文团队的模型与FLAN和T0的Likert分数1-7级在InstructGPT提示分布上进行比较的结果FLAN和T0比默认的GPT-3表现更好与置于指令跟随模式的少样本GPT-3模型相当公开NLP数据集并不能反映语言模型是如何使用的在图7中该论文还将InstructGPT与在FLANWei等人2021和T0Sanh等人2021数据集上微调的1750亿GPT-3基线进行了比较该论文团队发现这些模型的表现优于GPT-3与GPT-3在选择良好提示的情况下相当但比该论文的SFT基线更差这表明这些数据集的多样性无法提高API提示分布的性能在直接的比较中1750亿InstructGPT模型输出在784的时间里优于该论文的FLAN模型在794的时间里优于论文团队的T0模型这些模型的Likert分数如图7所示论文团队相信InstructGPT模型优于FLAN和T0原因有二首先公开NLP数据集旨在捕获易于自动度量进行评估的任务例如分类问题回答以及一定程度上的总结和翻译任务然而分类和QA只占客户使用语言模型的一小部分约18而根据标注员的说法开放式生成和头脑风暴占该论文提示数据集的57如图3其次公开NLP数据集很难获得非常多样化的输入至少在现实世界用户感兴趣的输入类型上当然在NLP数据集中发现的任务确实代表了该论文团队希望语言模型能够解决的一种指令因此最广泛的指令跟踪模型将结合这两种类型的数据集52公开NLP数据集合上的结果1630请务必阅读正文之后的信息披露和法律声明金融工程专题InstructGPT模型的真实性比GPT-3有所提高根据TruthfulQA数据集上的人类评估的衡量结果与GPT-3相比该论文的PPO模型在生成真实和丰富的输出方面具有小量但是显著的改进如图8这种行为是默认的论文团队的模型不需要被特别指示说真话来显示提高的真实性有趣的是论文团队的13亿PPO-ptx模型是个例外它的性能略差于相同大小的GPT-3模型当在不是与GPT-3对抗性选择的提示上进行评估时PPO模型仍然明显比GPT-3更真实和丰富尽管绝对改进下降了几个百分点图8TruthfulQA数据集的结果资料来源Traininglanguagemodelstofollowinstructionswithhumanfeedback德邦研究所注TruthfulQA数据集的结果灰色条表示真实性的等级彩色条表示真实性和信息量的等级继Lin等人2021之后该论文还给出了一个有用的指令QA提示用来指示模型在不确定正确答案时以我没有意见回应在这种情况下PPO模型更倾向于诚实和无信息而不是自信地说出一个错误基准GPT-3模型在这方面做得并不好在真实性方面的改进也可以通过以下事实得到证明PPO模型在API分布的封闭域任务上产生幻觉即伪造信息的频率较低如图6图9比较RealToxicityPrompts上的人工评估和自动评估资料来源Traininglanguagemodelstofollowinstructionswithhumanfeedback德邦研究所注比较RealToxicityPrompts上的人工评估和自动评估PerspectiveAPI分数三种不同的1750亿模型总共标记了1729个提示同时存在和不存在尊重性的指令这里显示的自动评估是在与人工评估相同的提示集上计算的InstructGPT的毒性比GPT-3略有改善但偏差不大该论文团队首先在1730请务必阅读正文之后的信息披露和法律声明金融工程专题RealToxicityPrompts数据集上评估该论文模型Gehman等人2020通过两种方式来做到这一点前者一个标准的数据集评估流程通过PerspectiveAPI运行模型样本来自动获得毒性评分后者将这些样本发送给标注员以获得绝对毒性相对于提示的毒性连续性和总体输出偏好的评级根据提示有毒性该论文从这个数据集中统一采样提示以更好地评估该论文团队的模型在高输入毒性下的表现这与该数据集上标准的采样提示不同因此该论文绝对毒性数字被夸大了结果如图9所示该论文团队发现当被指示产生安全且尊重的输出尊重的提示时根据PerspectiveAPIInstructGPT模型产生的有毒输出比GPT-3模型产生的更少当尊重的提示被移除无提示时这种优势就消失了有趣的是当显式提示产生有毒的输出时InstructGPT输出比GPT-3的输出有毒得多这些结果在人类评估中得到了证实在尊重的提示设置中InstructGPT的有毒性小于GPT-3但在无提示设置中表现相似图101750亿PPO-ptx模型1750亿的InstructGPT与没有附加前缀的1750亿的GPT-3相比的泛化示例资料来源Traininglanguagemodelstofollowinstructionswithhumanfeedback德邦研究所注1750亿PPO-ptx模型1750亿的InstructGPT与没有附加前缀的1750亿GPT-3相比的泛化示例提示符是精心挑选的以说明某些行为但输出不是精心挑选的1InstructGPT可以遵循其他语言的指令尽管它有时会生成英语输出GPT-3需要更仔细的提示与英语类似2InstructGPT可以比GPT-3更可靠地总结和回答有关代码的问题尽管它在这里的答案不太正确对于代码QA示例GPT-3在大约50的时间内回答了这个问题为了评估模型生成有偏见言论的倾向该论文还在WinogenderRudinger等人2018和CrowS-PairsNangia等人2020数据集的修改版本上评估了InstructGPT这些数据集由成对的句子组成可以突出潜在的偏见该论文计算产生每对句子的相对概率和相关二进制概率分布的熵以比特为单位完全无1830请务必阅读正文之后的信息披露和法律声明金融工程专题偏的模型将在每对句子之间没有偏好因此将具有最大的熵根据这个指标该论文的模型的偏差并不比GPT-3少PPO-ptx模型显示出与GPT-3相似的偏差但当被指示产生尊重行为时它表现出更低的熵因此具有更高的偏差偏差的模式尚不清楚似乎被指示的模型对它们的输出更确定不管它们的输出是否表现出刻板的行为可以通过修改RLHF微调过程来最小化公开NLP数据集上的性能衰减默认情况下当该论文团队在API分布上训练PPO模型时它会受到对齐税的影响因为它在几个公开NLP数据集上的性能会下降该论文团队想要一个避免对齐税的对齐过程因为它鼓励使用未对齐但是更有能力的模型53定性结果InstructGPT模型对RLHF微调分布之外的指令显示出很好的泛化效果特别地该论文团队发现InstructGPT显示了遵循非英语语言指令的能力以及对代码进行总结和回答问题的能力这很有趣因为非英语语言和代码在论文团队的微调数据中只占很小一部分这表明在某些情况下对齐方法可以推广到对人类没有直接监督的输入图111750亿的PPO-ptx模型1750亿的InstructGPT中的简单错误资料来源Traininglanguagemodelstofollowinstructionswithhumanfeedback德邦研究所注与没有额外前缀的1750亿的GPT-3相比1750亿的PPO-ptx模型1750亿的InstructGPT中的简单错误提示是精心挑选的以说明某些行为但输出不是精心挑选的1InstructGPT可能会被假设错误的前提指令所迷惑并且继续跟随2InstructGPT可能拐弯抹角而不是直接回答简单的问题在这种情况下使用者会非常恼火注意这些示例并没有完全反映GPT-3回答问题的能力因为它没有被提示进入问题回答模式该论文没有定量地记录这些行为但是该论文在图10中显示了一些定性的例子该论文的1750亿PPO-ptx模型能够可靠地回答有关代码的问题也可以遵循其他语言的说明然而该论文团队注意到即使指令是另一种语言它也经常产生英语输出相比之下论文团队发现GPT-3可以执行这些任务但需要更仔细的提示并且很少遵循这些领域的指示1930请务必阅读正文之后的信息披露和法律声明金融工程专题InstructGPT仍然会犯简单的错误在1750亿PPO-ptx模型交互时论文团队注意到它仍然会犯一些简单的错误尽管它在许多不同的语言任务上表现出色举几个例子1当给出一个带有错误前提的指令时模型有时会错误地假设前提为真2模型可能会拐弯抹角当给出一个简单的问题时它有时会说这个问题没有一个答案并给出多个可能的答案即使从上下文中有一个相当明确的答案3当指令包含多个明确的约束条件例如列出10部1930年代在法国拍摄的电影或当约束条件对语言模型具有挑战性时模型的性能会下降例如用指定的句子数写一篇总结该论文在图11中展示了这些行为的一些例子该论文团队怀疑行为2的出现部分是因为该论文团队要求标注员奖励谦逊的行为因此他们可能倾向于奖励那些避免直接回答的输出而这被奖励模型所选择该论文团队怀疑行为1的发生是因为训练集中很少有假设错误前提的提示而且模型不能很好地推广到这些例子该论文团队认为通过收集对抗性数据可以显著减少这两种行为Dinan等人2019b6讨论61对齐研究的影响本研究是该论文团队更广泛的研究计划的一部分该计划旨在使人工智能系统与人类意图保持一致Christiano等人2017Ziegler等人2019年Stiennon等人2020尽管这项工作的重点是该论文团队当前的语言模型系统但该论文团队寻求适用于未来AI系统的通用和可扩展方法Leike等人2018该论文团队在这里使用的系统仍然相当有限但它们是当今最大的语言模型之一该论文团队将它们应用于广泛的语言任务包括分类总结问答创意写作对话等该论文在这项工作中的对齐研究方法是迭代的该论文团队正在改进当前AI系统的对齐而不是抽象地专注于对齐尚不存在的AI系统这种方法的一个缺点是该论文团队不会直接面对只有在对齐超人类的系统时才会出现的对齐问题Bostrom2014然而该论文确实提供了一个明确的经验反馈循环方法给出哪些有效哪些无效该论文团队相信这种反馈循环对改进对齐技术至关重要它迫使研究者跟上机器学习的进步此外该论文在这里使用的对齐技术RLHF是几篇关于对齐超人类系统文献提出的方法的重要部分Leike等人2018Irving等人2018Christiano等人2018例如RLHF是最近总结书籍任务的核心方法该任务展示了对齐超人类的AI系统的一些困难因为人类很难直接评估Wu等人2021年从本工作中该论文团队可以为更普遍的对齐研究提供借鉴1与预训练相比增加模型对齐的成本是适度的收集数据和计算训练运行包括实验运行的成本是训练GPT-3花费的一小部分训练1750亿SFT模型需要49petaflopss-天训练1750亿PPO-ptx模型需要60petaflopss-天而GPT-3则需要3640petaflopss-天Brown等人2020与此同时该论文团队的结果表明RLHF在使语言模型对用户更有帮助方面非常有效比模型大小增加100倍还有效这表明目前增加对现有语言模型的投资比训练更大的模型更具性价比至少对于该论文团队客户的自然语言任务分布而言是这样2030请务必阅读正文之后的信息披露和法律声明
|
相关研报
|
||||||||||||||||||||||
