研报下载就选股票报告网
您好,欢迎来到股票分析报告网!登录   忘记密码   注册
>> 财通证券-计算机行业:大语言模型的前世、今生与未来-230831
上传日期:   2023/9/1 大小:   2523KB
格式:   pdf  共20页 来源:   财通证券
评级:   看好 作者:   杨烨
下载权限:   此报告为加密报告
大语言模型:NLP技术的奇点时刻。语言模型的核心是对任意一段文本序列进行概率建模,用一个高维向量来表示一个token的全部特征。我们将深度学习应用于NLP领域的范式转移总结为"有监督的机器学习->预训练+微调->预训练+提示"。其中,ChatGPT的横空出世开启了“预训练+提示”的新范式,这主要得益于OpenAI对生成类模型(GPT)和算法规模化(Scalability)这两个基础技术路线的成功押注,大语言模型“涌现”出了解决复杂问题的通用能力,催生了本轮全球范围内的生成式AI浪潮。
  大模型应用:数据感知与代理能力。如何将个人的个性化私有数据和企业多年积累的行业专有知识嫁接到大模型的通用能力上,是大模型在垂直领域商业化落地的核心技术问题。我们在报告中详细列举了三种目前业内主流的实践方法,并对其优劣进行了比较分析。除了获取外部数据外,通过增加代理能力(Agent),让大语言模型具备自主理解、规划、执行复杂任务的能力,同时与计算机内部环境,甚至物理世界进行交互,这也将显著打开大模型应用的想象空间。此外,我们认为提升模型支持的上下文长度是应用创新的关键靶点,模型小型化也将助力大模型应用的商业化落地。
  应用分析框架:通用能力与外部能力的组合。大模型应用可以被总结为,在基座模型的通用能力上,叠加一些其他的可实现的外部能力,这就包括上述的数据感知(可连接其他外部数据源)和代理能力(允许大模型与环境互动)。根据这一范式,我们可以将现阶段大模型的应用边界归纳为通用认知能力与上述两种外部能力的排列组合。基于此,展望未来大模型新应用的靶点可总结为:①通用能力的增强(上下文长度、复杂推理、数学、代码、多模态等)、②外部能力的扩充(处理非结构化数据、使用更复杂的工具、与物理世界的交互等)
  投资建议:AI大模型赋能下游应用,C端标准化工具类产品有望率先享受产业红利,重点公司包括金山办公、万兴科技、同花顺、科大讯飞、福昕软件等。AI在B端加速落地,具备细分行业数据与客户资源卡位的企业有望优先受益,重点公司包括恒生电子、拓尔思、税友股份等。算力是AI大模型产业化落地的必备环节,建议关注AI服务器相关厂商以及国产AI芯片厂商:浪潮信息、中科曙光、优刻得、紫光股份、海光信息、寒武纪、拓维信息、神州数码以及在向量数据库及垂直大模型领域有技术优势的星环科技等。
  风险提示:AI技术迭代不及预期的风险,商业化落地不及预期的风险,政策支持不及预期风险,全球宏观经济风险。
研究报告全文:计算机行业深度分析报告20230831大语言模型的前世今生与未来证券研究报告投资评级看好维持核心观点最近12月市场表现大语言模型NLP技术的奇点时刻语言模型的核心是对任意一段文本序列进行概率建模用一个高维向量来表示一个token的全部特征我们将深度计算机沪深300学习应用于NLP领域的范式转移总结为有监督的机器学习-预训练微调-51预训练提示其中ChatGPT的横空出世开启了预训练提示的新范式38这主要得益于OpenAI对生成类模型GPT和算法规模化Scalability这两25个基础技术路线的成功押注大语言模型涌现出了解决复杂问题的通用能12力催生了本轮全球范围内的生成式AI浪潮-1-14大模型应用数据感知与代理能力如何将个人的个性化私有数据和企业多年积累的行业专有知识嫁接到大模型的通用能力上是大模型在垂直领域商业化落地的核心技术问题我们在报告中详细列举了三种目前业内主流的分析师杨烨实践方法并对其优劣进行了比较分析除了获取外部数据外通过增加代理SAC证书编号S0160522050001yangye01ctseccom能力Agent让大语言模型具备自主理解规划执行复杂任务的能力同时与计算机内部环境甚至物理世界进行交互这也将显著打开大模型应用的想象空间此外我们认为提升模型支持的上下文长度是应用创新的关键靶相关报告点模型小型化也将助力大模型应用的商业化落地1华为产业系列深度凤凰磐涅AI昇腾2023-08-27应用分析框架通用能力与外部能力的组合大模型应用可以被总结为2大模型推理算力知多少在基座模型的通用能力上叠加一些其他的可实现的外部能力这就包括上述2023-08-23的数据感知可连接其他外部数据源和代理能力允许大模型与环境互动3活跃资本市场政策频出证券IT根据这一范式我们可以将现阶段大模型的应用边界归纳为通用认知能力与迎板块性机遇2023-08-17上述两种外部能力的排列组合基于此展望未来大模型新应用的靶点可总结为通用能力的增强上下文长度复杂推理数学代码多模态等外部能力的扩充处理非结构化数据使用更复杂的工具与物理世界的交互等投资建议AI大模型赋能下游应用C端标准化工具类产品有望率先享受产业红利重点公司包括金山办公万兴科技同花顺科大讯飞福昕软件等AI在B端加速落地具备细分行业数据与客户资源卡位的企业有望优先受益重点公司包括恒生电子拓尔思税友股份等算力是AI大模型产业化落地的必备环节建议关注AI服务器相关厂商以及国产AI芯片厂商浪潮信息中科曙光优刻得紫光股份海光信息寒武纪拓维信息神州数码以及在向量数据库及垂直大模型领域有技术优势的星环科技等风险提示AI技术迭代不及预期的风险商业化落地不及预期的风险政策支持不及预期风险全球宏观经济风险请阅读最后一页的重要声明行业深度分析报告证券研究报告内容目录1大语言模型NLP技术的奇点时刻411技术探索深度学习加速推进数据的无损压缩412技术应用预训练语言模型成为NLP主流513技术跃迁大语言模型可能打开通往AGI之路52OpenAI与GPT算法工程商业的融合621GPT系列模型的发展历程千锤百炼终见涌现622如何训练一个ChatGPT预训练获得智商指令微调提升情商723模型智能的涌现是生成式AI浪潮的充要条件83大模型应用数据感知与代理Agent能力1031外部数据三条融合垂域数据打造大模型的技术路径10311Fine-Tuning与In-ContextLearning的实现方式案例1132代理Agent为大模型加上四肢强化复杂任务处理能力13321与计算机内部交互插件Plugins与代码解释器CodeInterpreter13322与物理世界交互RoboticsTransformer2RT-21433上下文长度应用创新的关键靶点1534大模型小型化应用落地的降本之道164应用分析框架通用能力与外部能力的组合175投资建议186风险提示19图表目录图1人工智能底层算法的探索历程1958-2017年4图2自然语言处理NLP发生的三次技术范式转移5图3本次以GPT为代表的生成式AI技术进步路线图6图4OpenAI的GPT系列模型发展历程7图5GPT模型训练流程8图6当模型规模达到一定程度时将会出现涌现现象9图7思维链提示可以显著提升大语言模型的性能9图8打造垂域模型的三种基本方法10谨请参阅尾页重要声明及财通证券股票和行业评级标准2行业深度分析报告证券研究报告图9Delta-Tuning是对LLM参数高效的微调范式12图10Langchain向量数据库打造企业专属知识库问答系统12图11大模型驱动的自主代理系统13图12OpenAI发布首批70余款GPT-4插件14图13执行逻辑计算的代码解释器插件示例14图14机器人控制与思维链推理结合示例15图15大模型驱动的自主代理系统16图16模型小型化的主要实现路径16图17参数量化能够显著降低大模型的推理成本17谨请参阅尾页重要声明及财通证券股票和行业评级标准3行业深度分析报告证券研究报告1大语言模型NLP技术的奇点时刻11技术探索深度学习加速推进数据的无损压缩人类对机器智能的探索由来已久如何让机器像人类一样思考获得与人类相当的智能一直是全球人工智能学者毕生追求的圣杯自英国数学家阿兰图灵在1950年提出了机器能思考吗这一跨世纪的命题以来人类就从未停止对机器智能的探索从最简单的统计规则方法到借鉴人类大脑生物结构的神经网络模型再到如今拥有千亿级参数的超大规模预训练模型深度学习因其能够实现非线性空间的有效变换并能利用GPU等硬件实现加速计算因而成为人工智能研究领域的核心主线无论是早期的RNN还是其改进后的变体LSTM亦或是本轮生成式AI浪潮的起源Transformer它们本质上都是用一个更有效的神经网络去实现数据的无损压缩而数据的压缩能力或许就是机器智能的一种展现图1人工智能底层算法的探索历程1958-2017年时间事件1958年计算机科学家罗森布拉特提出了由两层神经元构成的神经网络这种网络被称为感知机Perceptron是最基本的神经网络结构1982年约翰霍普菲尔德提出了一种具有记忆存储能力的Hopfield网络开启了循环神经网络RecurrentNeuralNetworkRNN的时代也是LSTMLongShort-TermMemoryTransfomer模型的奠基者1986年AI教父杰弗里辛顿发明了适用于多层感知器的反向传播算法它成为了日后训练深度神经网络的基础1989年杨立昆现任Facebook首席人工智能科学家等人提出了卷积神经网络CNNConvolutionalNeuralNetworks被广泛应用于计算机视觉的图像处理领域2012年AlexNet一种卷积神经网络模型引入了利用GPU并行运算以压倒性的准确率夺得了当年ImageNet图像识别大赛的冠军这一成果带来了深度神经网络的又一次复兴其中论文的第二作者是未来OpenAI的首席科学家IlyaSutskever2016年AlphaGo这台由谷歌DeepMind开发的先进的人工智能棋手出人意料地击败了强大的围棋世界冠军李世石体现了人工智能在围棋这项历史悠久被誉为人类智慧皇冠上的明珠的棋类运动中取得了巨大的突破2017年谷歌机器翻译团队在发表的一篇具有里程碑意义的论文AttentionisAllYouNeed中精确提出了一种采用Attention机制的全新模型TransformerBertGPT等预训练模型随之孕育而生数据来源CSDN阿里云开发者社区财通证券研究所谨请参阅尾页重要声明及财通证券股票和行业评级标准4行业深度分析报告证券研究报告12技术应用预训练语言模型成为NLP主流从单一小模型到预训练模型的范式转移语言模型的本质是对任意一段文本序列进行概率建模用一个高维向量来表示一个token的全部特征早期的研究者发明了Word2Vec一种用于将自然语言中的单词表示为向量的技术它基于神经网络并且可以通过训练大规模语料库来学习单词之间的语义和语法关系是深度学习应用在NLP领域的早期范式随着对长文本特征提取能力更强计算效率更高的神经网络的提出研究者开始尝试用更多的数据去训练一个能力更强的模型预训练模型然后通过迁移学习的方法使其适用于下游特定的任务这就是Google在2018年提出的BERTBidirectionalEncoderRepresentationfromTransformers基于Transformer的双向编码器的核心思想然而OpenAI在这一时期坚定押注于GPTGenerativePre-TrainedTransformer基于Transformer的单向解码器这一路线坚信通过优化下一个词预测以及扩大训练模型的参数量和数据量机器能够对文本语料拥有与人类相似的理解能力当前OpenAI与ChatGPT的成功使得运用大语言模型做预训练提示的范式逐步取代了BERT时代预训练下游任务改造的范式成为了NLP业内新的主流图2自然语言处理NLP发生的三次技术范式转移数据来源BERTPre-trainingofDeepBidirectionalTransformersforLanguageUnderstandingJacobDevlinMing-WeiChang等财通证券研究所13技术跃迁大语言模型可能打开通往AGI之路直到2022年底ChatGPT横空出世学界和工业界开始意识到OpenAI对生成类模型GPT和算法规模化Scalability的两个基础技术路线押注可能是让机器获得智能的可行路径甚至是打开通往通用人工智能AGIArtificial谨请参阅尾页重要声明及财通证券股票和行业评级标准5行业深度分析报告证券研究报告GeneralIntelligence这一终极理想的金钥匙因此我们有理由相信当前以ChatGPT为代表的大语言模型开启的本轮科技浪潮其重要性可能高于过去任何一次AI技术的突破实现AGI的愿景可能已并不遥远当然技术的突破与未来的潜在瓶颈也正都源于此大模型与生俱来的Hallucination幻觉使其输出的内容天生具有可靠性低的特点另一方面大模型的模型规模化能力的天花板也有待进一步探索因此我们认为提升模型可靠性和提升模型性能共同构成了大模型未来迭代的核心靶点图3本次以GPT为代表的生成式AI技术进步路线图数据来源EmergentAbilitiesofLargeLanguageModelsJasonWeiYiTay等财通证券研究所2OpenAI与GPT算法工程商业的融合21GPT系列模型的发展历程千锤百炼终见涌现对GPT路线的执着探索GPT-132018年6月OpenAI推出基于TransformerDecoder改造的GPT-1但其在下游理解类任务的性能远低于同年10月Google推出的基于Encoder的BERT2019年GPT-2推出后尽管性能仍不如BERT但OpenAI发现Zero-shot和Few-shot的方式可能可以直接训练一个通用的语言模型到了2020年的GPT-3OpenAI决定直接将模型参数扩大到了175B这一举动正式掀开了大语言模型的序幕涌现能力的出现GPT-35OpenAI在GPT-3的基础上通过融合指令微调训练得到的InstructGPT基于代码数据训练的Codex以及基于人类反馈的强化学习RLHFReinforcementLearningfromHumanFeedback训练得到了GPT-35某种意义上实现了大模型能力的涌现在某些复杂能力谨请参阅尾页重要声明及财通证券股票和行业评级标准6行业深度分析报告证券研究报告上实现突破GPT-35也成为了开启本轮生成式AI浪潮的爆款产品ChatGPT背后的核心功臣AGI的曙光已现GPT-42023年3月OpenAI发布了基于GPT-35的SOTAState-Of-The-Art模型GPT-4该模型在多模态和可靠性方面实现了进一步扩展从泛化能力的角度GPT-4在创造力图片理解能力长文本处理能力和回答准确性方面都有所提升从工程能力的角度看通过与Azure在算力设施上深度定制合作GPT-4能够以千分之一的计算量去预测在一定计算规模下的性能预测最终模型的Loss从可靠性的角度GPT-4自去年8月训练完成后花费了大量时间做对齐Alignment甚至不惜牺牲部分性能以提升其内容输出的可靠性图4OpenAI的GPT系列模型发展历程数据来源GPT-4TechnicalReportOpenAI财通证券研究所22如何训练一个ChatGPT预训练获得智商指令微调提升情商模型的训练可分解为预训练基座模型和基座模型的微调基座模型BaseModel是经过海量数据预训练Pre-train所得到它具备一定的通用能力并将消耗千卡级别的GPU算力这一阶段模型获得了知识具备了智商但基座模型往往不能很好地胜任下游的各式任务以ChatGPT为例模型需要通过指令微调才能具备与人类流畅对话的能力其中数据集需要包含各种与人类行为情感相关的指令和任务使得基座模型在预训练阶段获得的能力被进一步解锁激发出来从而实现从智商到情商的跨越值得一提的是模型微调不可避免将带来某些性能上的取舍例如OpenAI在他们的指令微调论文中称其为对齐税alignmenttax谨请参阅尾页重要声明及财通证券股票和行业评级标准7行业深度分析报告证券研究报告图5GPT模型训练流程数据来源MicrosoftBuild官网财通证券研究所23模型智能的涌现是生成式AI浪潮的充要条件模型能力的涌现是生成式AI浪潮的充要条件过去模型的表现被认为与模型的规模之间服从PowerLaw即随着模型规模指数级上升模型性能只能线性增长但Google的研究者在2022年发现当模型规模达到某个阈值时模型对某些复杂问题的处理性能突然呈现快速增长这种现象则被称为EmergentAbilities即涌现能力例如研究者发现当大语言模型规模达到一定程度时思维链提示ChainofThoughtpromptingCoT可以显著提升大语言模型的性能尤其适用于处理涉及数学或推理的复杂任务Zero-shot-CoT在prompt提问的结尾只需附加Letsthinkstepbystep这几个词Few-shot-CoT在prompt中给与一些关键推理步骤的示例让模型学习相应的推理过程我们认为CoT的意义在于模型可能已经学到了底层的推理过程而非统计意义上记住了输入-输出的概率分布这是模型拥有智能的一个重要体现也显著打开了大语言模型未来应用的可为空间谨请参阅尾页重要声明及财通证券股票和行业评级标准8行业深度分析报告证券研究报告图6当模型规模达到一定程度时将会出现涌现现象数据来源EmergentAbilitiesofLargeLanguageModelsJasonWeiYiTay等财通证券研究所图7思维链提示可以显著提升大语言模型的性能数据来源Chain-of-ThoughtPromptingElicitsReasoninginLargeLanguageModelsJasonWeiXuezhiWang等财通证券研究所谨请参阅尾页重要声明及财通证券股票和行业评级标准9行业深度分析报告证券研究报告3大模型应用数据感知与代理Agent能力31外部数据三条融合垂域数据打造大模型的技术路径大模型与垂直领域Know-how的融合是商业化落地关键如何将个人的个性化私有数据和企业多年积累的行业专有知识嫁接到大模型的通用能力上是大模型在垂直领域商业化落地的核心技术问题目前开发者主要采用三种思路方案先通过大量的垂域语料数据通用语料数据做预训练再针对性地做指令微调从头训练模型方案在一个通用大模型的基础上通过指令微调将垂域知识训练到模型的参数中小幅改动模型方案在一个通用大模型的基础上通过上下文学习In-ContextLearning将垂域知识放在模型的提示词Prompt中不训练模型用模型图8打造垂域模型的三种基本方法数据来源Llama2OpenFoundationandFine-TunedChatModelsHugoTouvronLouisMartin等财通证券研究所方案实现难度最大模型对垂域知识的零样本学习能力最强Zero-shot算力消耗集中在预训练方案对垂域数据的质量和数量要求都很高且需要从头训练一个基座模型的工程能力和算力储备但是一旦训练成功模型推理泛化能力理论上是最好的大语言模型的知识是在预训练阶段获得的因此方案适合于有大量垂域数据和算力购买能力的大型公司谨请参阅尾页重要声明及财通证券股票和行业评级标准10行业深度分析报告证券研究报告方案实现难度次之模型能够具备一定的垂域知识零样本学习能力算力消耗集中在微调和推理方案本质是借鉴了Bert做下游任务改造的思路然而对大模型的微调实则将预训练阶段获得的能力以某种方式激发出来但这种能力的激发是有代价的包括但不限于会出现原有知识能力的遗忘此外微调后的模型通用能力上限依然受制于基座模型本身因此方案适合具有丰富调节参数经验团队的模型或应用厂商方案实现难度最低模型不具备垂域知识的零样本学习能力算力消耗集中在推理端方案是将垂域数据保存在一个外挂的向量数据库中通过In-ContextLearning让大模型在prompt中学习相关信息方案其实就是大家口中经常讲的MaaSModelasaService这一方式实现起来方便快捷并且能够快速实现外部数据的更新目前主要瓶颈是大语言模型对prompt中输入上下文长度In-ContextLength的支持值得一提的是方案并不完全和方案独立它们之间可以相互组合特别是在一些需要高频更新外部数据的应用场景方案是唯一能适用的办法此外方案为下游客户提供了一个低成本少量数据的冷启动的方式非常适合想要快速尝鲜大模型功能的下游客户311Fine-Tuning与In-ContextLearning的实现方式案例Delta-Tuning是对大模型参数高效的微调范式当大模型的规模越来越大时做全局的微调即重新训练所有的模型参数无疑会变得愈发不可行亟需一种参数高效Parameter-efficient的新范式清华与智源研究院在DeltaTuningAComprehensiveStudyofParameterEfficientMethodsforPre-trainedLanguageModels论文中对解决上述问题的方法进行了总结这些方法本质上都是在尽量不改变原有模型参数的情况下引入一个增量参数DeltaParemters进行微调因此将它命名为Delta-Tuning在众多Delta-Tuning的实践中最被开发者广泛关注和使用的当属微软提出的LoRALow-RankAdaptationofLargeLanguageModels大语言模型的低阶适应LoRA的原理是冻结预先训练好的模型参数在Transformer架构的每一层注入一个可训练的低秩矩阵并在模型训练过程中只训练降维矩阵A与升维矩阵B下图橙色部分其本质是基于大语言模型内在的低秩特性增加旁路矩阵来模拟全参数微调以微调175B参数的GPT-3为例与Adam调优的GPT-3相比LoRA可训练参数量减少了1万倍GPU内存需求减少了3倍显著降低了微调模型的成本谨请参阅尾页重要声明及财通证券股票和行业评级标准11行业深度分析报告证券研究报告图9Delta-Tuning是对LLM参数高效的微调范式数据来源LoRALow-RankAdaptationofLargeLanguageModelsEdwardJHuYelongShen等DeltaTuningAComprehensiveStudyofParameterEfficientMethodsforPre-trainedLanguageModelsNingDingYujiaQin等财通证券研究所Langchain向量数据库打造企业专属知识库问答系统LangChain是一套强大的大模型应用开发框架集成了模型I0数据连接链代理内存回调等模块赋予了大模型1数据感知可连接其他的外部数据源2代理能力允许大模型与环境互动在LangChain的帮助下开发者可以更加便捷的将大语言模型这一大脑装上四肢赋予其访问本地文件调用API接口访问互联网等进阶能力快速打造知识库问答聊天机器人结构化数据分析等功能因此使用LangChain将大模型与企业的垂域知识库连接通常以向量数据库的形式将用户输入的prompt在向量数据库中检索最相关的内容再将返回的内容和输入的prompt本身一起成为输入给大模型的最终prompt成为了另一种可实现大模型的通用能力垂直领域的专业知识的技术路径图10Langchain向量数据库打造企业专属知识库问答系统数据来源LangChain官网财通证券研究所谨请参阅尾页重要声明及财通证券股票和行业评级标准12行业深度分析报告证券研究报告32代理Agent为大模型加上四肢强化复杂任务处理能力提示工程的下一个前沿通过增加代理能力Agent让大语言模型具备自主理解规划执行复杂任务的能力彻底改变传统的人机交互方式是当前应用侧探讨的另一个热门方向目前大模型的代理能力可以体现在两方面1允许单个大模型使用工具2允许多个大模型协作竞争OpenAI安全系统负责人LilianWeng近期发表相关博文她认为在大语言模型驱动的AI智能体中大语言模型扮演了大脑的角色规划任务分解反思总结记忆短期记忆长期记忆工具使用调用API访问外部数据是实现它的三个核心组件此前在GitHub上关注度极高的AutoGPT项目实现了对大语言模型的循环调用本质上是对大语言模型代理能力的充分呈现因此也被称为提示工程的下一个前沿图11大模型驱动的自主代理系统数据来源Github财通证券研究所321与计算机内部交互插件Plugins与代码解释器CodeInterpreterGPT-4插件开放生态不断丰富代码解释器大幅提高用户工作效率2023年5月OpenAI发布首批70余款插件plugins使GPT-4能通过插件检索互联网实时数据调用公司或个人资料库执行订机票等操作插件功能的本质是在输入ChatGPT的prompt中增加一段备选插件的API生成手册是一种赋予大模型代理能力实现与计算机环境进行交互的经典案例2023年7月ChatGPT的代码解释器插件CodeInterpreter正式向所有Plus用户开放代码解释器具备以下功能使用Python进行编程处理上传和下载在受保护的沙箱化执行环境中运行持久会话等用户可直接使用自然语言要求ChatGPT读取文件100M以内分析编辑数据以及生成图片视频代码等代码解释器是典型的让模型使用工具的产品我们认为这代表了大模型应用未来发展的底层范式即应用开发将是一谨请参阅尾页重要声明及财通证券股票和行业评级标准13行业深度分析报告证券研究报告个面向自然语言编程的过程图12OpenAI发布首批70余款GPT-4插件图13执行逻辑计算的代码解释器插件示例数据来源量子位财通证券研究所数据来源OpenAI官网财通证券研究所322与物理世界交互RoboticsTransformer2RT-2谷歌发布机器人RT-2打开大模型与物理世界的交互窗口2023年7月谷歌DeepMind推出新款机器人模型RoboticsTransformer2RT-2RT-2是全新的视觉-语言-动作VLA模型可以从互联网和机器人数据中自动学习并将这些知识转化为机器人控制的通用指令以实现一系列操作动作同时在思维推理链加持下RT-2可执行深度语义推理完成复杂度更高的任务类似于实体机器人版的ChatGPT例如人类发出指示我需要锤钉子场景中的什么物体可能有用机器人计划选择桌上的石头机器人行动1129138122132132106127该字符串为机器人动作标记的数列我们认为RT-2展示了构建通用机器人的前景打开了大模型与物理世界的交互窗口随着多模态融合的大模型日益成熟以及以人形机器人为代表的新物理载体在硬件端迭代升级大模型的代理能力将被赋予更丰富的含义谨请参阅尾页重要声明及财通证券股票和行业评级标准14行业深度分析报告证券研究报告图14机器人控制与思维链推理结合示例数据来源谷歌DeepMind官网财通证券研究所33上下文长度应用创新的关键靶点上下文长度决定提示工程的复杂度如前文所述以GPT为代表的大语言模型带来的范式转移是用户只需要将完成任务所需信息输入到prompt中In-Context-Learning而无需将这些信息训练到模型的参数中Fine-Tuning无论是31介绍的引入外部数据的方案外挂向量数据库还是32介绍的代理能力Agent其本质都是一种提示工程PromptEngineering基于此我们可以认为上下文长度的拓展可能是推动应用落地的关键靶点更长的上下文长度-更大的提示工程潜力-功能更强大的大模型应用但实际使用中大模型支持的最大上下文长度往往存在限制GPT-4目前最大支持32kClaude可支持100k初代开源的LLaMa只支持2kLLaMa20则升级到了4k存在该限制的主要原因是1过长的输入会使模型在推理时计算和内存资源使用急剧扩大Transformer的计算复杂度和空间复杂度随序列长度N呈二次方增长2过长的训练数据也可能因为关联问题带来模型质量的下降Attention机制对长文本的中间记忆能力较弱为了实现提升大模型支持的最大上下文长度开发者尝试了多种方式包括但不限于更好的位置编码ALiBiAttentionwithLinearBiases稀疏注意力机制FlashAttention用于谨请参阅尾页重要声明及财通证券股票和行业评级标准15行业深度分析报告证券研究报告GPU的注意力层高效实现多查询注意力Multi-QueryAttentionMQA等等图15大模型驱动的自主代理系统模型名称最高输入发布者开源情况Claude-13-100K100KAnthropic商用MPT-7B-storywriter65KMosaicML开源且免费商用ChatGLM2-6B32K清华智谱开源但收费商用GPT-4-32k32KOpenAI商用LongChat-13B-16K16KLM-SYS开源但不可商用GPT-35-Turbo-16K16KOpenAI商用MPT-30B-chat8KMosaicML开源但不可商用XGen-7B系列8KSalesforce部分开源且免费商用PaLM28KGoogle商用LLaMa24KMeta开源且免费商用LLaMa12KMeta开源但不可商用数据来源Anthropic官网DataleanerMetaAI官网财通证券研究所34大模型小型化应用落地的降本之道模型小型化技术主要包括压缩参数和压缩结构大模型应用落地的另一个关键堵点是推理成本的高企除了以英伟达为代表的加速计算厂商在硬件侧持续降本外我们也可以对模型本身进行压缩以降低推理成本模型小型化是指在保持模型精度的前提下通过压缩模型参数和结构将已经训练好的大型模型缩小为能够在边缘端或其他资源受限环境中运行的精简小型模型根据深度学习模型压缩与加速综述中的分类压缩参数的主要方法包括参数剪枝参数量化低秩分解和参数共享等压缩结构的主要方法包括紧凑网络和知识蒸馏等图16模型小型化的主要实现路径类别技术描述压缩参数剪枝设计关于参数重要性的评价准则基于该准则判断网络参数的重要程度删除参数冗余参数参数量化将网络参数从32位全精度浮点数量化到更低位数低秩分解将高维参数向量降维分解为稀疏的低维向量参数共享利用结构化矩阵或聚类方法映射网络内部参数压缩紧凑网络从卷积核特殊层和网络结构3个级别设计新型轻量网络结构知识蒸馏将较大的教师模型的信息提炼到较小的学生模型混合混合方式前几种方法的结合方式数据来源深度学习模型压缩与加速综述高晗田育龙等财通证券研究所谨请参阅尾页重要声明及财通证券股票和行业评级标准16行业深度分析报告证券研究报告参数量化是目前降低模型推理成本的主流技术路径计算量FLOPs对应的是时间复杂度主要关注网络执行时间的长短即衡量每秒浮点运算次数参数量Params对应的是空间复杂度主要关注显存占用量即衡量网络模型中需要训练的参数总数当前参数量化是目前降低模型推理成本的主流技术路径其核心思想是通过将浮点计算转成低比特定点计算以降低数据精度有效降低模型计算强度参数大小和内存消耗即以牺牲部分模型性能为代价提升计算效率YufanLiu等人的研究结果显示当模型的FLOPs数量修剪为原来的50左右时模型牺牲的准确度约10即当接受约10的性能牺牲时可以节约50左右的算力成本图17参数量化能够显著降低大模型的推理成本数据来源LearningtoExploreDistillabilityandSparsabilityAJointFrameworkforModelCompressionYufanLiuJiajiongCao等财通证券研究所4应用分析框架通用能力与外部能力的组合大模型应用可以被总结为在基座模型的通用能力上叠加一些其他的可实现的外部能力以当前较有代表性的LangChain为例它可以为大模型提供数据感知可连接其他外部数据源和代理能力允许大模型与环境互动根据这一范式我们可以将现阶段大模型的应用边界归纳为通用认知能力与上述两种外部能力的排列组合基于此展望未来大模型新应用的靶点可总结为通用能力的增强上下文长度复杂推理数学代码多模态等外部能力的扩充处理非结构化数据使用更复杂的工具与物理世界的交互等谨请参阅尾页重要声明及财通证券股票和行业评级标准17行业深度分析报告证券研究报告1通用能力数据感知信息检索汇总再生成a多轮对话机器人i2C-虚拟人AI助手智能客服AI家教智能硬件ii2B-企业知识库问答OA私人助理营销机器人培训机器人b数据特征挖掘器i2C-基础数据分析个性化营销智能问诊ii2B-商业分析网安攻击关联分析c特定内容生成器i2C-办公场景WordPPT创作场景图片视频代码ii2B-金融报表法律文件研究报告病例2通用能力代理能力自主执行循环调用环境控制d机器人流程自动化RPAi2C-第三方Plugins代码解释器办公场景Excelii2B-智能OA智能中台低代码平台e任务解决型自主AIi2C-AutoGPTAgentGPTBabyAGIGPT-Engineer5投资建议AI大模型赋能下游应用C端标准化工具类产品有望率先享受产业红利建议关注金山办公万兴科技同花顺科大讯飞福昕软件等AI在B端加速落地具备细分行业数据与客户资源卡位的企业有望优先受益建议关注恒生电子拓尔思税友股份等算力是AI大模型产业化落地的必备环节建议关注AI服务器相关厂商以及国产AI芯片厂商浪潮信息中科曙光优刻得紫光股份海光信息寒武纪拓维信息神州数码以及在向量数据库及垂直大模型领域有技术优势的星环科技等谨请参阅尾页重要声明及财通证券股票和行业评级标准18行业深度分析报告证券研究报告6风险提示AI技术迭代不及预期的风险若AI技术迭代不及预期NLP模型优化受限则相关产业发展进度会受到影响商业化落地不及预期的风险ChatGPT盈利模式尚处于探索阶段后续商业化落地进展有待观察政策支持不及预期风险新行业新技术的推广需要政策支持存在政策支持不及预期风险全球宏观经济风险垂直领域公司与下游经济情况相关存在全球宏观经济风险谨请参阅尾页重要声明及财通证券股票和行业评级标准19行业深度分析报告证券研究报告信息披露分析师承诺作者具有中国证券业协会授予的证券投资咨询执业资格并注册为证券分析师具备专业胜任能力保证报告所采用的数据均来自合规渠道分析逻辑基于作者的职业理解本报告清晰地反映了作者的研究观点力求独立客观和公正结论不受任何第三方的授意或影响作者也不会因本报告中的具体推荐意见或观点而直接或间接收到任何形式的补偿资质声明财通证券股份有限公司具备中国证券监督管理委员会许可的证券投资咨询业务资格公司评级买入相对同期相关证券市场代表性指数涨幅大于10增持相对同期相关证券市场代表性指数涨幅在510之间中性相对同期相关证券市场代表性指数涨幅在-55之间减持相对同期相关证券市场代表性指数涨幅小于-5无评级由于我们无法获取必要的资料或者公司面临无法预见结果的重大不确定性事件或者其他原因致使我们无法给出明确的投资评级行业评级看好相对表现优于同期相关证券市场代表性指数中性相对表现与同期相关证券市场代表性指数持平看淡相对表现弱于同期相关证券市场代表性指数免责声明本报告仅供财通证券股份有限公司的客户使用本公司不会因接收人收到本报告而视其为本公司的当然客户本报告的信息来源于已公开的资料本公司不保证该等信息的准确性完整性本报告所载的资料工具意见及推测只提供给客户作参考之用并非作为或被视为出售或购买证券或其他投资标的邀请或向他人作出邀请本报告所载的资料意见及推测仅反映本公司于发布本报告当日的判断本报告所指的证券或投资标的价格价值及投资收入可能会波动在不同时期本公司可发出与本报告所载资料意见及推测不一致的报告本公司通过信息隔离墙对可能存在利益冲突的业务部门或关联机构之间的信息流动进行控制因此客户应注意在法律许可的情况下本公司及其所属关联机构可能会持有报告中提到的公司所发行的证券或期权并进行证券或期权交易也可能为这些公司提供或者争取提供投资银行财务顾问或者金融产品等相关服务在法律许可的情况下本公司的员工可能担任本报告所提到的公司的董事本报告中所指的投资及服务可能不适合个别客户不构成客户私人咨询建议在任何情况下本报告中的信息或所表述的意见均不构成对任何人的投资建议在任何情况下本公司不对任何人使用本报告中的任何内容所引致的任何损失负任何责任本报告仅作为客户作出投资决策和公司投资顾问为客户提供投资建议的参考客户应当独立作出投资决策而基于本报告作出任何投资决定或就本报告要求任何解释前应咨询所在证券机构投资顾问和服务人员的意见本报告的版权归本公司所有未经书面许可任何机构和个人不得以任何形式翻版复制发表或引用或再次分发给任何其他人或以任何侵犯本公司版权的其他方式使用谨请参阅尾页重要声明及财通证券股票和行业评级标准20
 
Copyright © 2005 - 2021 Nxny.com All Rights Reserved 备案号:蜀ICP备15031742号-1