研报下载就选股票报告网
您好,欢迎来到股票分析报告网!登录   忘记密码   注册
>> 长江证券-信息技术行业大模型技术进化论系列二:性能进阶的GPT2与GPT3-230420
上传日期:   2023/4/20 大小:   3525KB
格式:   pdf  共14页 来源:   长江证券
评级:   看好 作者:   宗建树
下载权限:   此报告为加密报告
GPTT-2与GPT-3有哪些技术突破?
  OpenAI于2019年推出了GPT-2,于2020年推出了GPT-3。GPT-2与GPT-3沿袭了初代GPT的架构和训练模式:无监督预训练、Attention机制、Decoder架构与自回归训练模式。与初代GPT相比,GPT-2与GPT-3可应用的任务类型没有扩张,但任务表现有明显提升;技术方面的突破主要包含三个方面:1)参数量扩大带来了性能提升;2)性能提升带动泛化能力上升,所以省略了调参步骤;3)小样本学习(few shot learning)能力迅速提高。
  参数量扩大带来性能提升
  GPT-2数据集的规模是初代GPT的10倍,同时GPT-2模型的参数量也达到了15.4亿,是初代GPT的13倍。GPT-3参数量达到1750亿,这使得GPT-3成为目前为止最大的语言模型之一。GPT-2在模型规模、上下文长度、训练数据和训练算法方面都有明显的改进,这使得它在自然语言处理任务上的性能相对于初代GPT有了明显提升,可以较好的实现文本生成、文本推理、文本总结、翻译、问答系统等任务。GPT-3的性能在GPT-2基础上有了进一步提升。GPT-3在大多数任务中的表现超过了绝大多数的当时存在的经过小样本学习的最先进的模型(SOTA)。GPT-3在许多复杂的NLP任务中也超过了调参后的SOTA模型,例如闭卷问答、模式解析、机器翻译等。
  GPT-2:性能提升带来泛化能力提高
  GPT-2与GPT-3大模型都省略了调参步骤。GPT-2有较高的泛化能力,从大规模数据中学到的能力能够直接在多个任务之间进行迁移,调参不再是必选项。为了提高泛化能力,GPT-2与GPT-3都尽可能地丰富训练数据来源。在Transformer大模型推出之前,传统深度学习模型为了提高模型性能,一方面尽力提高训练数据量,另一方面尽力保持数据来源较为纯净,没有无关领域的噪音。但GPT-2与GPT-3抛弃调参步骤后,为了实现高泛化能力,在提高训练数据规模以外,主动丰富了数据的来源。
  GPT-3:小样本学习模式大幅度提高性能
  GPT-3的小样本学习能力较强。从GPT-3的结果来看,对于1750亿的模型,单样本学习任务的平均准确率达到了约46%,远高于无样本学习的约9%;当样本数量在1-10之间时,小样本学习的性能与样本几乎成正比;当样本数超过10时,性能增长的边际变化下降,逐渐趋于平缓。
  性能提升,但市场表现不及预期
  总体来说,GPT-2与GPT-3的市场表现不及预期。GPT-2与GPT-3推出了新技术,省去了监督调参步骤,提高了泛化能力,又通过小样本学习提高了模型性能。虽然这些更新引起了市场对大模型技术的关注,但GPT-2与GPT-3模型本身还未能达到可以商业化落地的阶段,业界大部分人只把两者看作一次常规的深度学习的技术更新。也正因为GPT-3的表现不及预期,OpenAI又重新拾起了调参步骤,通过深度调参GPT-3得到了如今浪潮之巅的ChatGPT。
  风险提示
  1、人工智能技术发展不及预期;
  2、人工智能商业化应用落地不及预期
 
Copyright © 2005 - 2021 Nxny.com All Rights Reserved 备案号:蜀ICP备15031742号-1