研报下载就选股票报告网
您好,欢迎来到股票分析报告网!登录   忘记密码   注册
>> 申万宏源-2023AI行业投资策略-AI系列深度之七:大模型技术突破,AI多场景落地-221214
上传日期:   2022/12/14 大小:   2638KB
格式:   pdf  共49页 来源:   申万宏源
评级:   增持 作者:   施鑫展,刘洋,洪依真
下载权限:   此报告为加密报告
核心观点
  结论:大模型的出现促进底层技术迭代,衍生出AIGC应用受到关注;大小模型路线分化加剧,传统深度学习关注下游场景落地情况
  回顾:AI传统领军全面下跌,行业多方面挑战,宏观经济下行初期需求增量释放缓慢。
  落地场景需探索,人脸等已经红海,工业、医疗等尚在早期,AI独角兽IPO后股价表现较弱,与收入-薪酬匹配度仍然较低有关。
  行业热点在大模型:大规模预训练+无监督,大幅提升AI效率
  以GPT-3为代表的大模型,可以从大量未标记的数据中捕获知识,极大扩展模型的泛化能力。
  但仍存在缺陷:对逻辑理解欠缺,训练成本过高,普通机构难以复现。
  大模型应用:AIGC图像生成、GPTChat、自动驾驶等成为热点
  随着模型改进和像素提升,DALL-E2、Stable Diffusion等图像生产AIGC应用爆发;
   InstructGPT在GPTChat工具中应用效果提升,做到与人类进行谈话般的交互。
  重点行业AI落地场景逐一分析:智能制造、智慧仓储物流、智慧金融、智慧医疗、智能家居等。成熟的AI应用场景正在涌现,领军AI公司已有大量标杆案例
  相关标的:1)小模型和AI落地:推荐科大讯飞、大华股份、虹软科技、云从科技UW、格灵深瞳-U等;2)大模型和基础算法,建议关注商汤-W、百度等。
  风险提示:由于应用场景碎片化,下游落地慢于预期;数据保护政策强化,可能限制C端的AI应用;政府财政若持续紧张,可能暂缓或削减部分投资,则会对to G类的AI业务造成影响
研究报告全文:大模型技术突破AI多场景落地2023AI行业投资策略AI系列深度之七证券分析师洪依真A0230519060003施鑫展A0230519080002刘洋A0230513050006联系人洪依真hongyzswsresearchcom20221214核心观点结论大模型的出现促进底层技术迭代衍生出AIGC应用受到关注大小模型路线分化加剧传统深度学习关注下游场景落地情况回顾AI传统领军全面下跌行业多方面挑战宏观经济下行初期需求增量释放缓慢落地场景需探索人脸等已经红海工业医疗等尚在早期AI独角兽IPO后股价表现较弱与收入-薪酬匹配度仍然较低有关行业热点在大模型大规模预训练无监督大幅提升AI效率以GPT-3为代表的大模型可以从大量未标记的数据中捕获知识极大扩展模型的泛化能力但仍存在缺陷对逻辑理解欠缺训练成本过高普通机构难以复现大模型应用AIGC图像生成GPTChat自动驾驶等成为热点随着模型改进和像素提升DALL-E2StableDiffusion等图像生产AIGC应用爆发InstructGPT在GPTChat工具中应用效果提升做到与人类进行谈话般的交互重点行业AI落地场景逐一分析智能制造智慧仓储物流智慧金融智慧医疗智能家居等成熟的AI应用场景正在涌现领军AI公司已有大量标杆案例相关标的1小模型和AI落地推荐科大讯飞大华股份虹软科技云从科技-UW格灵深瞳-U等2大模型和基础算法建议关注商汤-W百度等风险提示由于应用场景碎片化下游落地慢于预期数据保护政策强化可能限制C端的AI应用政府财政若持续紧张可能暂缓或削减部分投资则会对toG类的AI业务造成影响wwwswsresearchcom2主要内容1复盘AI的投资逻辑到了哪个阶段2为何AI大模型模型成为行业新趋势3大模型的应用从AIGC到自动驾驶4传统深度学习成熟的应用场景涌现5投资分析意见3112022股价复盘估值下行关注落地得到验证今年初我们预判长期景气无需担忧2022AI重点关注AI企业的落地能力实际年初至12月5日AI传统领军全面下跌中证人工智能指数-20与申万计算机指数基本持平-22AI双杰分别-36-47科大讯飞-37商汤-W-74大幅下跌云从科技-UW-145相比上市价格略下跌AI的多方面挑战宏观经济下行初期需求增量释放缓慢a深度学习技术瓶颈CV底层技术迭代缓慢NLP等更新重点在大模型小公司难以参与b落地场景需探索人脸等已经红海工业医疗等尚在早期且需求受宏观经济影响c费用主要是薪酬支出较高而收入变现难度大dAI独角兽IPO后股价表现较弱与收入-薪酬匹配度仍然较低有关中证人工智能指数及代表个股2022年至今股价涨跌幅3010-102022-01-052022-02-052022-03-052022-04-052022-05-052022-06-052022-07-052022-08-052022-09-052022-10-052022-11-052022-12-05-30-50-70-中证人工智能指数大华股份科大讯飞商汤-W云从科技-uwwwwswsresearchcom资料来源wind申万宏源研究412从主题投资到泛化技术底座未来不会再有AI公司概念因为每个IT企业都是AI公司大模型和小模型传统AI公司更加分裂1互联网巨头参与多模态大模型进入壁垒极高2传统AI公司仍然以具体行业落地成本ROI作为主要考虑技术热点仍然为大模型已经在AIGC自动驾驶生命科学等行业得到应用相比CVNLP路线得到更多关注这也是为何这一轮大模型创新国内AI领军参与较少原因国内上一轮AI热与人脸识别等CV技术路线成熟相关然而本轮transformer等大模型底层更新集中于NLP传统AI公司关注点可能仍然在落地实际情况观察零售安防等高渗透行业在2022年景气度较低可能是A股AI领军今年股价表现一般的主要原因wwwswsresearchcom513长逻辑方面市场充分认可AI赛道的长期成长性七普凸显老龄化少子化借鉴日韩经验利用AI技术应对日本劳动人口见顶后工业机器人订单随即加速韩国亦呈现类似趋势2001年起我国劳动力增速持续低于1人口红利退潮期AI应用正当时AI应用长期景气归因政策竞争ROI1政策十四五规划纲要大篇幅详尽规划各地大量出台补贴税收优惠等鼓励措施2竞争本质是先进生产力对落后生产力的替代同行的竞争压力加速了AI的扩散应用3ROI典型AI赋能项目的ROI投资回报率达到50-150对企业客户足够有吸引力申万宏源计算机历年策略报告对AI发展阶段的判断AI2022年底前沿技术AI2018年底泡沫迭代但传统深度学习公司期整合接近结束出现上市后估值下降VPU给BAT安防供AI2017年底货泡沫期等待第一轮整合AI2021年底AI落地加速AI公司集中IPO人口红利退潮拉动需求AI2019年底整合两年后AI芯片算力成本5-10美元多个公司出现AI创新收入泡沫期竞争期领军期1预期行业爆发1行业有序竞争高成长2爆发后整合2行业整合成长08PEG12wwwswsresearchcom资料来源申万宏源研究613中短期市场关注AI的应用场景和落地节奏AI企业已经从技术驱动向商业驱动阶段发展市场希望看到能带来收入高增的应用场景我们对AI商业化落地场景有如下判断1金融零售数字政务等领域已经实现广泛应用且仍有潜力2智能制造和智慧城市是当前值得重点发力的领域3智能驾驶医疗教育的长期增长潜力大但仍需时间培育和积累人工智能在各行业的成长周期wwwswsresearchcom资料来源德勤申万宏源研究7主要内容1复盘AI的投资逻辑到了哪个阶段2为何AI大模型模型成为行业新趋势3大模型的应用从AIGC到自动驾驶4传统深度学习成熟的应用场景涌现5投资分析意见821行业更新热点在大模型什么是大规模预训练模型在自然语言理解NLP中之前需要对单个小任务进行训练现在单个大模型可以完成各种类型任务例如一个饱读诗书的人应该会写作对话阅读理解等多种技能而不需要对单独技能训练大模型可以做到对不同问题在一个模型上预训练DoubleDescent现象传统机器学习里模型过小则欠拟合模型过大则过拟合深度学习里DoubleDescent现象在2018年揭示随着模型参数变多TestError是先下降再上升然后第二次下降原则上在成本可接受的情况下模型越大准确率越好大规模预训练GPTGenerativePre-Training是OpenAI在2018年提出的模型利用Transformer模型来解决各种自然语言问题例如分类推理问答相似度等应用的模型GPT采用了预训练微调的训练模式使得大量无标记的数据得以利用大大提高了这些问题的效果图深度学习中的DoubleDescent现象图对于不同问题进行不同的预训练wwwswsresearchcom资料来源DeepDoubleDescentWhereBiggerModelsandMoreDataHurtGithub申万宏源研究921行业更新热点在大模型第一关键技术Transformer主要应用在NLP任务中详细见21Transfomer对RNN的改进GoogleBrain2017年提出针对RNN的弱点进行重新设计解决了RNN效率问题和传递中的缺陷等在机器翻译任务上Transformer表现超过了RNN和CNN只需要编解码器就能达到很好的效果第二关键技术自监督学习自监督学习属于无监督学习模型直接从无标签数据中自行学习一个特征提取器无需标注数据在预训练的模型中AR自回归LM和AE自动编码器是最常用的自监督学习方法第三关键技术微调在做具体任务时微调旨在利用其标注样本对预训练网络的参数进行调整也可以针对具体任务设计一个新网络把预训练的结果作为其输入wwwswsresearchcom1021Transfomer对RNN的改进Transformer取代RNN图Transformer的详细结构现有问题神经网络接收的输入是大小不一的向量且不同向量之间有一定的关系但是实际训练无法充分发挥这些输入之间的关系而导致模型训练结果效果极差Self-Attention自注意力机制实际上是想让机器注意到整个输入中不同部分之间的相关性RNN在计算的时候不是并行的每个单元需要等到其他需要输入单元的信息计算之后再进行运算尝试用CNN解决这个问题但需要叠加很多层才能捕捉长远的信息Self-Attention中每个单元都可以捕捉到整句的信息图Transfromer的基本结构wwwswsresearchcom资料来源AttentionIsAllYouNeed申万宏源研究1121行业更新热点在大模型大模型2018至今快速迭代图2018年后大模型迭代与参数量快速提升12018年OpenAI基于Transformer提出了GPT22019年Google推出了GPT的升级版BERT32019年OpenAI推出了GPT的升级版GPT2042020年GPT-352021SwitchTransformerMT-NLG分为单体模型混合模型两类单体稠密模型OpenAIGPT-3华为盘古鹏程盘古MindSpore支撑模型规模的扩展是全结构的扩容混合稀疏模型GoogleSwitchTransformer智源悟道20阿里M6一般来说是选择一个基础的稠密资料来源NvidiaDeveloperUsingDeepSpeedand模型通过MoE稀疏结构扩展FFN部分以此来达成MegatrontoTrainMegatron-TuringNLG530BtheWorldsLargestandMostPowerfulGenerativeLanguageModel模型的扩容申万宏源研究表主流大模型和参数对比单体模型公司模型名参数量数据量领域OpenAIGPT-31750亿570GB高质量数据集专注自然语言理解NLP浪潮源102457亿5000GB高质量中文数据集专注自然语言理解NLP微软-英伟达MT-NLG5300亿835GB高质量数据集专注自然语言理解NLP混合模型公司模型名参数量数据量领域谷歌SwitchTransformer16万亿专注自然语言理解NLP智源研究院悟道175万亿中文多模态认知蛋白质预测等系列模型wwwswsresearchcom资料来源CSDN申万宏源研究1222OpenAIGPT-3GPT-3更少的领域数据且不经过精调步骤去解决问题GPT-2舍弃了模型Fine-Tuning过程不再规定任务转向容量更大无监督训练更加通用GPT-3继续增加参数具有1750亿个参数的自然语言深度学习模型GPT-2100倍该模型经过了将近05万亿个单词的预训练并且在不进行微调的情况下可以在多个NLP基准上达到最先进的性能GPT-3在许多NLP数据集上均具有出色的性能包括翻译问答和文本填空任务这还包括一些需要即时推理或领域适应的任务例如给一句话中的单词替换成同义词或执行3位数的数学运算图GPT-3的训练数据集庞大图Few-shot下GPT-3有很好的表现图GPT-3不同尺寸模型效果对比wwwswsresearchcom资料来源LanguageModelsareFew-ShotLearners申万宏源研究1323微软和英伟达MT-NLG2021年10月微软和英伟达推出迄今为止训练最大最强的语言模型MT-NLGMT-NLG是最大最强的生成语言模型GenerativeLanguageModel基础设施英伟达A100TensorCoreGPU和HDRInfiniBand网络支撑的SOTA超级计算集群软件设计使用来自Megatron-LM的tensor-slicing来扩展节点内的模型并使用来自DeepSpeed的pipeline并行来跨节点扩展模型擅长应用完成预测Completionprediction阅读理解Readingcomprehension常识推理Commonsensereasoning自然语言推论Naturallanguageinferences词义消歧Wordsensedisambiguation图用于训练MT-NLG模型的数据集图MT-NLG在不同句法结构下的数学运算推理和自然语言推理的样本即使符号被严重混淆sample2该模型也可以从上下文中推断出基本的数学运算sample1虽然称不上拥有了算术能力但该模型似乎超越了仅记忆算术的水平wwwswsresearchcom资料来源NvidiaDeveloperUsingDeepSpeedandMegatrontoTrainMegatron-TuringNLG530BtheWorldsLargestandMost14PowerfulGenerativeLanguageModel申万宏源研究24GoogleSwitchTransformers16万亿参数的SwitchTransformers稀疏激活模型此模型可以保证计算成本基本保持不变的同时允许网络拥有巨量的参数谷歌改进了专家混合范式MoEMixture-of-Experts层图SwitchTransformer编码块通过简化MoE得到了一个易于理解易于训练的体系结构该结构还比同等大小的密集模型具有更大的采样效率可扩展高效的自然语言学习模型预训练微调和多任务训练表现出色但是参数量和任务效果并非完全等比例扩大图SwitchTransformer和T5下游任务对比结果Switch-Base是基于T5-Base的MoE稀疏扩展参数规模是T5-Large的10倍也就是说内存开销是T5的10倍算力开销是T5-Large的29右表格的下游任务对比来看在同样的算力开销下Switch-Base的效果比T5-Base整体上要好这个优势是通过33倍的内存开销换取的但是同时Switch-Base在参数量比T5-Large大了倍的情况下效果比T-Large要差一些wwwswsresearchcom资料来源SwitchTransformersScalingtoTrillionParameterModelswithSimpleandEfficientSparsity申万宏源研究1525华为云盘古大模型盘古最大中文语言预训练模型图复杂商用场景实测不同模型少样本学习达到的F1结果100表示跟fulllabel结果相同9852021年4月发布千亿参数40TB训练数据的全球最100大中文语言NLP预训练模型30亿参数的全球90最大视觉CV预训练模型8072865770628基于GPT思路提升商业落地可用性6050将P-tuningpriming等最新技术融入到盘古的40285微调框架中提升微调效果3020在样本极少的情况下盘古的少样本学习能力远超10GPT系列和BERT系列0盘古RoBERTaBERTGPT-3CNN英文ThePile825GB数据中文数据集最大开源项目CLUECorpus2020只包含100GB高质量数据集图各模型复杂商用场景实测得到目标F1结果所需的平均样本量要得到相同的F1结果盘古所需的数据量仅为中文300270GPT-3的19实现了近10倍的生产效率提升250为产业落地做出的更多努力200深入具体场景15010090打造通用API100455010盘古RoBERTaGPT-BERTCNNwwwswsresearchcom资料来源华为云官网申万宏源研究1626百度文心大模型多API跨模态百度文心NLPCV基本实现跨模态和多下游应用应用场景涵盖NLP大模型CV大模型跨模态大模型生物计算大模型行业大模型API包括了1ERNIE30文本理解与创作预置作文生成文案创作情感分析等任务提示2ERNIE-ViLGAI作画大模型3PLATO大模型开放域对话服务图百度文心大模型和多行业工具平台wwwswsresearchcom资料来源百度文心官网申万宏源研究1727以GPT为例大模型的优势和局限自监督学习功能大幅降低对数据量的需求传统的模型训练方式是反向传播算法先对网络中的参数进行随机初始化预训练大模型中不是随机初始化的再利用随机梯度下降等优化算法不断优化模型参数这种方式下对数据需求量较大GPT-3先使用海量数据预训练大模型得到一套模型参数然后用这套参数对模型进行初始化再进行训练大幅降低后续对数据量的需求预训练大模型细分场景微调更适合长尾落地大模型提供了一种预训练大模型下游任务微调的方式大规模预训练可以有效地从大量标记和未标记的数据中捕获知识通过将知识存储到大量的参数中并对特定任务进行微调极大扩展模型的泛化能力例在NLP领域预训练大模型共享了预训任务和部分下游任务的参数在一定程度上解决了通用性的难题可以被应用于翻译问答文本生成等自然语言任务有望进一步突破现有模型结构的精度局限此前深度学习模型精度提升主要依赖网络在结构变革例如从AlexNet到ResNet50再到NAS搜索出来的EfficientNetImageNetTop-1精度从58提升到了84但近年来提升有限大模型可能继续突破精度上限以谷歌2021年发布的视觉迁移模型BigTransfer为例扩大数据规模也能带来精度提升使用JFT-300M训练ResNet152x4精度可以上升到875相比ILSVRC-2012ResNet50结构提升了105有可能新的更佳的商业模式未来可能部分API收费不排除按调用量收费wwwswsresearchcom1827以GPT为例大模型的优势和局限对自然语言逻辑理解仍有缺陷基于2020年7月OpenAI首席执行SamAltman论点GPT-3仍然存在严重的弱点有时还会犯一些非常愚蠢的错误尽管GPT-3能观察到它读到的单词和短语之间的统计关系但不理解其含义复杂商用场景的少样本学习能力较弱对于微调并不友好在落地场景中难以进一步优化GPT-3只能进行直接的端到端的生成把知识库做成很长的一段文字直接放进prompt中难以融入领域知识对存储算力要求极高普通机构难以复现据NVIDIA估算如果要训练GPT-3即使单个机器的显存内存能装得下用8张V100的显卡训练时长预计要36年即使用512张V100训练也需要将近7个月如果拥有1024张80GBA100那么完整训练GPT-3的时长可以缩减到1个月以微软与OpenAI合作建造的AzureA工智能算力平台为例该算力平台投资约10亿美元使用该超算中心训练一次超大模型GPT-3大约花费1200万美元解决分布式训练问题上百台服务器之间的通信拓扑模型并行流水并行等问题模型训练是显存峰值问题GPT-3发布一年后只有NVIDIA微软等大企业可以复现wwwswsresearchcom资料来源新智元申万宏源研究19主要内容1复盘AI的投资逻辑到了哪个阶段2为何AI大模型模型成为行业新趋势3大模型的应用从AIGC到自动驾驶4传统深度学习成熟的应用场景涌现5投资分析意见20
 
Copyright © 2005 - 2021 Nxny.com All Rights Reserved 备案号:蜀ICP备15031742号-1