研报下载就选股票报告网
您好,欢迎来到股票分析报告网!登录   忘记密码   注册
>> 长江证券-信息技术行业:用GPT-4解释GPT-2神经元,有望降低大模型对齐难度-230511
上传日期:   2023/5/11 大小:   999KB
格式:   pdf  共4页 来源:   长江证券
评级:   看好 作者:   宗建树
下载权限:   此报告为加密报告
事件描述
  2023年5月9日,OpenAI发布了一项新的研究,通过GPT-4来标记GPT-2中的所有307,200个神经元,并用简单的英语描述每个神经元在模型中所扮演的角色并对其评分。本次研究一共可以分为三个步骤:1)用GPT-4生成解释:给定一个GPT-2神经元,通过向GPT-4展示相关文本序列和激活来生成对其行为的解释;2)使用GPT-4进行模拟:使用GPT-4根据自己生成的解释,模拟以此激活的神经元会做什么;3)对比打分:将模拟神经元(GPT-4)的行为与实际神经元(GPT-2)的行为进行比较,对比GPT-4解释的结果与实际结果,并对此打分。
  事件评论
  本次研究有望提高AI模型的可解释性。虽然近年来语言模型变得更强大,部署更广泛,但其内部工作原理的一直处于“黑盒”状态,可解释性较低。传统的AI模型可解释性研究需要人工手动检查神经元,了解各个神经元和注意力头的参数代表了模型的哪些特征;但是这一过程只能用于小型AI模型,难以将其扩展到百亿级别的神经网络;而本次研究通过使用GPT-4将这一流程泛化,GPT-4对GPT-2的每一个神经元行为做出解释,可以充分理解大模型算法的组成架构。
  模型解释难度会随着模型复杂度提升而增加,GPT-4目前给出大部分的解释评分仍较低。通过评分,OpenAI的研究者衡量了这项技术在神经网络不同部分的效果。模型解释的难度会随着神经网络的层数增加而提高,所以对于较大的模型GPT-4的解释效果较差。目前,GPT-4给出的绝大多数解释评分较低,但研究者发现可以通过迭代解释、使用更大的模型、更改所解释模型的体系结构等方法来提高分数。
  本次研究有望降低AI大模型的调参与对齐的难度。因为大模型算法架构本身的“黑盒”原理,导致大模型的调参过程较为复杂,需要从指令调参与人工对齐两个步骤做出努力,实现指令调参模型(如InstructGPT)和被调参大模型(如ChatGPT)两者最佳状态的组合;此外,因为调参过程本身没有具体方向,研究人员很难根据调参结果来判断需要改进调参数据的成分还是改进模型架构本身。所以大模型调参与人工对齐的过程往往需要几个月的时间,经历多轮迭代才能得到较好拟合结果。而本次研究打开了AI模型训练的“黑盒”,提高了AI模型的可解释性,有望使研究人员在调参与人工对齐时对模型理解更加深入,更有目的性,让大模型调参方向更符合开发者的意图,甚至有望在未来实现人工对齐的自动化。
  风险提示
  1、大模型技术推进不及预期;
  2、大模型商业化落地的过程存在风险
 
Copyright © 2005 - 2021 Nxny.com All Rights Reserved 备案号:蜀ICP备15031742号-1