>> 财通证券-计算机行业专题报告:大模型推理算力知多少?-230823
| 上传日期: |
2023/8/23 |
大小: |
1249KB |
| 格式: |
pdf 共12页 |
来源: |
财通证券 |
| 评级: |
看好 |
作者: |
杨烨,罗云扬 |
| 行业名称: |
计算机 |
| 下载权限: |
此报告为加密报告 |
|
|
Transformer生成为访存密集型任务,显存及其带宽限制算力利用。Transformer作为自回归模型,生成每一个新的token,都需要将所有输入过的token反复计算,实际产业中,会将已经计算过的量(K、V值)预存下来,避免重复计算,导致每生成一个token,都需要与显存进行数据交互(访存),导致相比计算,Transformer模型在生成过程中对访存的需求更高。目前全球最先进AI芯片的计算速度“远快于”显存带宽。我们认为,针对大模型推理这类访存密集型任务,对其算力需求的估计,不能单单考虑其FLOPs的需求,更重要的瓶颈在于访存。 目前的优化手段主要是在算力成本与用户体验之间做平衡。实践中有大量优化技术以克服GPU利用率低的问题,但存在一定取舍,总结而言,在不做模型精简的情况下,GPU利用率与时延难以同时兼顾。而做参数量化、模型蒸馏等模型精简看似可以做到“兼顾”,但却舍弃了模型本身的效果。我们认为,高昂的推理算力成本是阻碍以GPT为代表的LLM模型应用大规模落地的重要原因之一,后续随着算力性价比不断提升,大模型应用发展前景广阔。 支撑GPT-3.5推理任务的A100数量或至少在5万张左右。根据我们测算,若以GPT-3.5当前的流量情况以及token生成速度,大约需要5万张左右的A100才能承载推理。而如果再考虑到:1.当前全球流量最高的网站月活水平;2.更高的精度以发挥更好的模型效果;3.GPT-4若想要解开限制等因素,推理算力的需求或为长期高景气,同时当前高昂的成本是阻碍应用大规模落地的主要因素之一。 英伟达L40s开启降本第一步,应用有望加速落地。L40s在特定场景下性价比超越A100,供货周期较短。我们认为,L40s的发布首先将为英伟达及其算力产业链相关企业带来更快的实际业绩受益,而非难以交付的“高增长订单”。同时,非超大型模型端的降本有望加速应用(或尤其图像领域)大规模落地。在千亿级甚至以上参数的超大模型训练与推理方面,A/H系列仍具有不可代替的能力,L40s的发布既填补了一部分腰部客户需求,但以科技巨头需求为主的A/H系列芯片又仍将需求旺盛。 投资建议:见正文 风险提示:AI技术迭代不及预期的风险,商业化落地不及预期的风险,政策支持不及预期风险,全球宏观经济风险。
研究报告全文:计算机行业专题报告20230823大模型推理算力知多少证券研究报告投资评级看好维持核心观点最近12月市场表现Transformer生成为访存密集型任务显存及其带宽限制算力利用Transformer作为自回归模型生成每一个新的token都需要将所有输入过的计算机沪深300token反复计算实际产业中会将已经计算过的量KV值预存下来避43免重复计算导致每生成一个token都需要与显存进行数据交互访存导31致相比计算Transformer模型在生成过程中对访存的需求更高目前全球最19先进AI芯片的计算速度远快于显存带宽我们认为针对大模型推理这类8访存密集型任务对其算力需求的估计不能单单考虑其FLOPs的需求更-4重要的瓶颈在于访存-16目前的优化手段主要是在算力成本与用户体验之间做平衡实践中有大量优化技术以克服GPU利用率低的问题但存在一定取舍总结而言在不分析师杨烨做模型精简的情况下GPU利用率与时延难以同时兼顾而做参数量化模SAC证书编号S0160522050001yangye01ctseccom型蒸馏等模型精简看似可以做到兼顾但却舍弃了模型本身的效果我们认为高昂的推理算力成本是阻碍以GPT为代表的LLM模型应用大规模落地分析师罗云扬的重要原因之一后续随着算力性价比不断提升大模型应用发展前景广阔SAC证书编号S0160522050002luoyyctseccom支撑GPT-35推理任务的A100数量或至少在5万张左右根据我们测算若以GPT-35当前的流量情况以及token生成速度大约需要5万张左右相关报告的A100才能承载推理而如果再考虑到1当前全球流量最高的网站月活水1活跃资本市场政策频出证券IT平2更高的精度以发挥更好的模型效果3GPT-4若想要解开限制等因素迎板块性机遇2023-08-17推理算力的需求或为长期高景气同时当前高昂的成本是阻碍应用大规模落2智能驾驶研究框架一总章地的主要因素之一2023-08-123券商信创已至深水区AI赋能提质英伟达L40s开启降本第一步应用有望加速落地L40s在特定场景下增效2023-08-07性价比超越A100供货周期较短我们认为L40s的发布首先将为英伟达及其算力产业链相关企业带来更快的实际业绩受益而非难以交付的高增长订单同时非超大型模型端的降本有望加速应用或尤其图像领域大规模落地在千亿级甚至以上参数的超大模型训练与推理方面AH系列仍具有不可代替的能力L40s的发布既填补了一部分腰部客户需求但以科技巨头需求为主的AH系列芯片又仍将需求旺盛投资建议见正文风险提示AI技术迭代不及预期的风险商业化落地不及预期的风险政策支持不及预期风险全球宏观经济风险请阅读最后一页的重要声明行业专题报告证券研究报告内容目录1推理算力成本高企大模型应用落地受钳制311Transformer生成为访存密集型任务显存带宽是产业发展瓶颈312平衡的两端算力成本vs用户体验52英伟达L40s开启算力降本第一步静待花开721FLOPS视角下或大幅低估算力需求722英伟达L40s开启降本第一步应用有望加速落地93投资建议104风险提示11图表目录图1大模型针对每一个token进行一次前向计算所需算力公式3图2自回归生成过程4图3以GPT-3为例生成阶段计算量与访存量需求4图4英伟达各类芯片计算访存比5图5AI推理常用加速手段6图6增大BatchSize对QPS与时延影响6图7GPT-4限制其流量7图8高昂算力成本限制应用落地7图9简单套用推理算力需求公式计算存在较多问题8图10GPT-35所需推理卡数量测算9图11L40s与A100中小模型训练对比9图12L40s与A100图像生成领域能力对比9图13英伟达L40s产品规格10谨请参阅尾页重要声明及财通证券股票和行业评级标准2行业专题报告证券研究报告1推理算力成本高企大模型应用落地受钳制11Transformer生成为访存密集型任务显存带宽是产业发展瓶颈Transformer是自回归模型推理过程中涉及多轮重复计算根据Openai的ScalingLawsforNeuralLanguageModelsTransformer模型针对每一个输入token做一次前向计算所需的算力与模型参数成正比而Transformer作为自回归模型生成每一个新的token都需要将所有输入过的token反复计算若不做任何形式的优化算力消耗极高实际产业中会将已经计算过的量预存下来避免重复计算具体流程如下图1大模型针对每一个token进行一次前向计算所需算力公式数据来源ScalingLawsforNeuralLanguageModels财通证券研究所注根据论文由于dmodel远大于nctx12则在计算一次前向计算时所需计算量时忽略2nlayernctxdattn项假设一个问答过程输入为你是谁经过预处理变成4个token最终输出为吴彦祖自回归解码流程如下你是谁这4个token会在Transformer计算时记录下CacheKV的信息最终通过Sampling阶段采样出来第一个token为吴模型将token吴对应的CacheKV信息存储下来并拼接上所有的历史CacheKV信息进行计算最后采样出来下一个token为彦彦传回来作为输入再次执行自己的输出作为自己的输入不断回归迭代就是自回归同样在While处判断需要继续生成计算和拼接CacheKV信息并采样出下一个token为祖最后在把祖作为输入生成下个token为gEndgEnd用来标识生成结束While循环检测到gEnd生成结束就会退出循环本次生成推理过程结束谨请参阅尾页重要声明及财通证券股票和行业评级标准3行业专题报告证券研究报告图2自回归生成过程数据来源百度智能云财通证券研究所相比计算Transformer模型在生成过程中对访存的需求更高正是由于推理阶段需要预存KV等信息以及自回归模型本身生成模式每生成一个token都需要与显存进行数据交互访存导致相比计算Transformer模型在生成过程中对访存的需求更高以GPT-3为例输入与输出分别为1000和250若针对单个请求所需访存量是计算量的5倍Transformer模型生成是访存密集型任务图3以GPT-3为例生成阶段计算量与访存量需求数据来源百度智能云财通证券研究所注BS为BatchSize一次性同时处理多少请求谨请参阅尾页重要声明及财通证券股票和行业评级标准4行业专题报告证券研究报告目前全球最先进AI芯片的计算速度远快于显存带宽从英伟达各类芯片本身的计算访存能力比来看对于Transformer模型生成这类访存密集型任务决定生成速度的不是芯片的强项FLOPS能力而是显存的带宽我们认为针对大模型推理这类访存密集型任务对其算力需求的估计不能单单考虑其FLOPs的需求更重要的瓶颈在于显存带宽图4英伟达各类芯片计算访存比T4V100A100SXMH100NVL显存带宽GBs320113420397800fp16算力TFLOPS651306243958int8算力TFLOPS13026012487916芯片计算访存比378214570945int8算力显存带宽数据来源Nvidia官网财通证券研究所注TFLOPS1012FLOPS而GBs109Bs12平衡的两端算力成本vs用户体验实践中通过大量优化技术提升GPU的低利用率为了解决推理中GPU利用率低成本高的弊端产业提出了较多优化方案在逻辑上将优化方案分为三类第一类优化是模型精简类即在模型真正执行之前就对模型的计算量进行精简从而提升推理速度这部分业界常见的优化方向包括参数量化减枝蒸馏和NASNeuralArchitectureSearch找到最贴合场景的神经网络模块并组合等第二类和第三类则分别是算子融合与单算子优化主要作用是在模型已经交由推理引擎在GPU上执行时提升GPU的利用效率除此之外还有诸如KernelFusionFlashattentionInflightbatchingStreaminference等针对LLM模型推理的技术我们认为模型精简的方式虽然能显著降低计算量但也会对模型本身的效果造成影响而其他优化技术亦存在一定瓶颈谨请参阅尾页重要声明及财通证券股票和行业评级标准5行业专题报告证券研究报告图5AI推理常用加速手段数据来源百度智能云财通证券研究所增大BatchSize并发量芯片算力的利用率与时延此消彼长以推理参数量为175B的GPT-3为例使用8卡A100显存为80G输入与输出token数分别为128和8随着Batchsize并发量的增加可以显著看到QPSQueries-per-second每秒可承受并发量的增加但时延平均每个请求完成时间亦显著提升以Batchsize为16时为例生成8个token所需的时间为0833秒如果简单线性外推则生成一篇1000个token的长文需要近2分钟同时由于需要对中间计算量KV信息等进行预存受到显存限制BatchSize也不能无限增大我们认为提升并发量虽然可以显著提升任务并发数但也会提升每个请求时延具体到应用则是每个用户感受到的生成用时这将影响用户体验图6增大BatchSize对QPS与时延影响数据来源百度智能云财通证券研究所谨请参阅尾页重要声明及财通证券股票和行业评级标准6行业专题报告证券研究报告考虑算力成本GPT-4选择直接限流以GPT-4为例在算力成本与响应速度之间OpenAI选择直接限制GPT-4一定时间内回答问题数量每3个小时GPT-4只能回答25个问题我们认为高昂的推理算力成本是阻碍以GPT为代表的LLM模型应用大规模落地的重要原因之一后续随着算力性价比不断提升大模型应用发展前景广阔图7GPT-4限制其流量图8高昂算力成本限制应用落地算力成本高昂被迫限制流量模型精简用户体验受影响大规模应用落地时间拉长数据来源OpenAI财通证券研究所数据来源财通证券研究所2英伟达L40s开启算力降本第一步静待花开21FLOPS视角下或大幅低估算力需求简单套用推理算力需求公式或造成芯片需求量的估算存在较多问题根据上文的实例数据图6直接使用2参数量token数芯片峰值算力芯片需求数量所需计算量公式为图1中公式除以单个芯片的算力则得出芯片需求数量估算推理算力需求将造成大幅低估我们分析认为原因主要是没有考虑到显存带宽的不足对推理速度的限制进而造成GPU计算单元的利用率较低同时根据上文图3推理实际上涉及两个阶段首先是将输入进行EncodeContext阶段然后进入重复多次while循环的Generation过程两个阶段的所需计算量与输入输出的大小与比值相关我们认为Tranformer模型结构复杂且种类繁多或难以准确计算出实际的算力消耗与需求但从OpenAI论文给出的计算方式出发至少应该考虑显存带宽等影响在计算GPU芯片需求数量时考虑算力利用率谨请参阅尾页重要声明及财通证券股票和行业评级标准7行业专题报告证券研究报告图9简单套用推理算力需求公式计算存在较多问题模型端推理算力消耗A输入token数128128128128128B输出token数88888CBS124816D总输出token数BC8163264128E总处理token数ABC13627254410882176现行推理算力估算公式推理算力消耗2参数量token数F公式得出的算力消耗TFLOPs-仅计算输出2175BD2856112224448G公式得出的算力消耗TFLOPs-计算输入输出2175BE476952190438087616芯片端算力供给H时延用时秒035039045059083IA100FP16算力TFLOPS624J8卡合计TFLOPS8I4992K8卡对应时间内可提供算力TFLOPsJH17641931224429604159消耗供给得出的算力利用率仅计算输出时算力利用率FK0203050811计算输入输出时算力利用率GK274985129183数据来源百度智能云天翼智库英伟达官网财通证券研究所注该算力利用率仅为公式计算出的算力消耗与芯片可提供算力间比值而非实际GPU运行时间角度的利用率支撑GPT-35推理任务的A100数量或至少在5万张左右考虑百度智能云在运用了一系列优化手段后的算力利用率情况以及对应的生成速度根据我们测算若将上述提到的算力利用率纳入考虑即使在较低精度下以GPT-35当前的流量情况以及token生成速度大约需要5万张左右的A100才能承载推理而如果再考虑到1当前全球流量最高的网站月活水平2更高的精度以发挥更好的模型效果3GPT-4若想要解开限制等因素推理算力的需求或为长期高景气的同时当前高昂的成本是阻碍应用大规模落地的主要因素之一谨请参阅尾页重要声明及财通证券股票和行业评级标准8行业专题报告证券研究报告图10GPT-35所需推理卡数量测算指标数值备注A模型参数量亿个1750展示以GPT35为例全球网站访问榜月均第1谷歌850亿B月均访问量亿次16第2youtube330亿第3facebook178亿C平均每次使用时间分钟75每次访问时长10-20分钟不等D平均实时并发万个278BC24603010000E平均每秒tokens输出个20假设GPT35平均每秒20个左右F峰值预留倍数10综合考虑并发峰值以及显存预留等因素G算力利用率15以显存带宽为代表的因素拖累算力利用率H所需算力储备FLOPS13E202ADEFG假设精度所需A100万块A100算力TF324155312TFLOPS1012FLOPSH312TFLOPSINT810391248TFLOPS1012FLOPSH1248TFLOPSINT45192496TFLOPS1012FLOPSH2496TFLOPS数据来源Similarweb英伟达官网财通证券研究所22英伟达L40s开启降本第一步应用有望加速落地L40s在特定场景下性价比超越A100供货周期较短在GPT-40B模型微调方面24张L40s表现是8张A100的17倍在图像生成方面24张L40s表现是8张A100的12倍同时相比漫长等待周期的AH芯片L40s可更快到货我们认为L40s的发布首先将为英伟达及其算力产业链相关企业带来更快的实际业绩受益而非难以交付的高增长订单同时非超大型模型端的降本有望加速应用或尤其图像领域大规模落地图11L40s与A100中小模型训练对比图12L40s与A100图像生成领域能力对比数据来源英伟达官网财通证券研究所数据来源英伟达官网财通证券研究所谨请参阅尾页重要声明及财通证券股票和行业评级标准9行业专题报告证券研究报告L40s定位与AH系列无冲突从L40s的产品规格上看其显存带宽互联接口相比AH仍有差距我们认为在千亿级甚至以上参数的超大模型训练与推理方面AH系列仍具有不可代替的能力L40s的发布既填补了一部分腰部客户需求但以科技巨头需求为主的AH系列芯片又仍将需求旺盛图13英伟达L40s产品规格数据来源英伟达官网财通证券研究所3投资建议AI大模型赋能下游应用C端标准化工具类产品有望率先享受产业红利建议关注金山办公万兴科技同花顺科大讯飞福昕软件等AI在B端加速落地具备细分行业数据与客户资源卡位的企业有望优先受益建议关注恒生电子拓尔思税友股份等算力是AI大模型产业化落地的必备环节建议关注AI服务器相关厂商以及国产AI芯片厂商浪潮信息中科曙光优刻得紫光股份海光信息寒武纪拓维信息神州数码以及在向量数据库及垂直大模型领域有技术优势的星环科技等谨请参阅尾页重要声明及财通证券股票和行业评级标准10行业专题报告证券研究报告4风险提示AI技术迭代不及预期的风险若AI技术迭代不及预期NLP模型优化受限则相关产业发展进度会受到影响商业化落地不及预期的风险ChatGPT盈利模式尚处于探索阶段后续商业化落地进展有待观察政策支持不及预期风险新行业新技术的推广需要政策支持存在政策支持不及预期风险全球宏观经济风险垂直领域公司与下游经济情况相关存在全球宏观经济风险谨请参阅尾页重要声明及财通证券股票和行业评级标准11行业专题报告证券研究报告信息披露分析师承诺作者具有中国证券业协会授予的证券投资咨询执业资格并注册为证券分析师具备专业胜任能力保证报告所采用的数据均来自合规渠道分析逻辑基于作者的职业理解本报告清晰地反映了作者的研究观点力求独立客观和公正结论不受任何第三方的授意或影响作者也不会因本报告中的具体推荐意见或观点而直接或间接收到任何形式的补偿资质声明财通证券股份有限公司具备中国证券监督管理委员会许可的证券投资咨询业务资格公司评级买入相对同期相关证券市场代表性指数涨幅大于10增持相对同期相关证券市场代表性指数涨幅在510之间中性相对同期相关证券市场代表性指数涨幅在-55之间减持相对同期相关证券市场代表性指数涨幅小于-5无评级由于我们无法获取必要的资料或者公司面临无法预见结果的重大不确定性事件或者其他原因致使我们无法给出明确的投资评级行业评级看好相对表现优于同期相关证券市场代表性指数中性相对表现与同期相关证券市场代表性指数持平看淡相对表现弱于同期相关证券市场代表性指数免责声明本报告仅供财通证券股份有限公司的客户使用本公司不会因接收人收到本报告而视其为本公司的当然客户本报告的信息来源于已公开的资料本公司不保证该等信息的准确性完整性本报告所载的资料工具意见及推测只提供给客户作参考之用并非作为或被视为出售或购买证券或其他投资标的邀请或向他人作出邀请本报告所载的资料意见及推测仅反映本公司于发布本报告当日的判断本报告所指的证券或投资标的价格价值及投资收入可能会波动在不同时期本公司可发出与本报告所载资料意见及推测不一致的报告本公司通过信息隔离墙对可能存在利益冲突的业务部门或关联机构之间的信息流动进行控制因此客户应注意在法律许可的情况下本公司及其所属关联机构可能会持有报告中提到的公司所发行的证券或期权并进行证券或期权交易也可能为这些公司提供或者争取提供投资银行财务顾问或者金融产品等相关服务在法律许可的情况下本公司的员工可能担任本报告所提到的公司的董事本报告中所指的投资及服务可能不适合个别客户不构成客户私人咨询建议在任何情况下本报告中的信息或所表述的意见均不构成对任何人的投资建议在任何情况下本公司不对任何人使用本报告中的任何内容所引致的任何损失负任何责任本报告仅作为客户作出投资决策和公司投资顾问为客户提供投资建议的参考客户应当独立作出投资决策而基于本报告作出任何投资决定或就本报告要求任何解释前应咨询所在证券机构投资顾问和服务人员的意见本报告的版权归本公司所有未经书面许可任何机构和个人不得以任何形式翻版复制发表或引用或再次分发给任何其他人或以任何侵犯本公司版权的其他方式使用谨请参阅尾页重要声明及财通证券股票和行业评级标准12
|
|