研报下载就选股票报告网
您好,欢迎来到股票分析报告网!登录   忘记密码   注册
>> 长江证券-软件与服务行业大模型技术探索系列一:预训练综述-230710
上传日期:   2023/7/10 大小:   4107KB
格式:   pdf  共15页 来源:   长江证券
评级:   看好 作者:   宗建树
下载权限:   此报告为加密报告
大模型的预训练需要在迭代中摸索最佳答案
  与传统的深度学习类似,由于模型神经网络的节点过于复杂且缺乏可解释性,大模型的工程化落地过程类似一个“黑盒”效应;在搭建模型算法、确定参数时并没有标准答案可以参照,模型的数据组成、结构到调参方式都需要一步步地迭代才能得到较好结果。所以大模型的工程化落地需要开发者在迭代中摸索最佳答案。
  预训练决定了大模型的性能下限
  大模型迭代过程包含预训练和调参两个步骤,预训练是指使用大型语料库对模型进行无监督的训练,使其学习语言的逻辑规律和语义表示形式。预训练可以赋予大模型最基本的逻辑推理和文本生成能力,确保模型在各种自然语言处理任务上的性能。完成预训练的模型可以采用迁移学习的形式,根据具体任务的数据进行模型参数的优化,以提高模型在特定任务上的性能。
  大模型的最终目标是实现高泛化性,而预训练是保证大模型高泛化性的先决条件
  传统的深度学习的应用场景是根据AI任务搭建深度学习模型,但由于每次AI任务都存在不同点,所以模型需要高度定制化,不同场景之间的模型难以兼容,因此传统深度学习模型的泛化能力较低;而预训练大模型由于训练机制较为完备,高参数量允许大模型可以直接面对大多数人工智能应用场景,不再需要根据特殊场景单独训练模型,所以具备较高的泛化性。
  大模型的预训练通常包含五个步骤
  大模型的预训练通常需要经历多次迭代,一般包含五个步骤:确定技术路线、搭建算法结构、匹配训练数据、模型训练、迭代与模型调整。每个步骤都会对模型性能产生影响,需要五个步骤相互配合,才能构建较为完备的大模型应用。大模型的技术路线主要有Encoder、Decoder、Encoder+Decoder三类,Decoder凭借更高的逻辑推理和文本生成能力在竞争中逐渐获胜。大模型的架构和训练策略也会对性能产生影响。更先进的模型架构和更有效的训练策略可以提升模型的学习能力和表达能力。此外,数据集的规模和质量对大模型性能有较大影响。更大规模、更多样化的语料库可以提供更多丰富的语言表达和语义信息,从而有助于模型学习更好的文本表达。当大模型的算法结构过于复杂,而训练数据的规模较小时,模型就容易出现过拟合的问题,所以大模型参数量需要与数据规模与模型复杂度相匹配。确定了模型采用Decoder技术路线,搭建好模型的算法结构与Attention机制,以及根据模型的算法准备了相应规模和场景的数据之后,下一步就到了模型训练阶段。模型训练需要将训练数据转化成向量后投喂进Attention层和神经网络层,经过多层计算后最终会得到一个向量。将这个向量乘上文本表征矩阵即可得到大模型词汇表的每个单词的概率。然后大模型会把输出的词向量与原文真实词向量进行对比,然后通过反向传播算法计算损失函数相对于模型参数的梯度,以指导参数的调整方向和幅度,从而将模型的损失逐渐降低。当损失函数的边际变化逐渐平缓时,模型的训练就达到了较为完备的地步。
  风险提示
  1、AI技术发展不及预期;
  2、下游应用需求不及预期。
  
 
Copyright © 2005 - 2021 Nxny.com All Rights Reserved 备案号:蜀ICP备15031742号-1