研报下载就选股票报告网
您好,欢迎来到股票分析报告网!登录   忘记密码   注册
>> 西部证券-计算机行业算力租赁深度研究报告:大模型发展的关键引擎,看好AI算力高景气持续-231010
上传日期:   2023/10/11 大小:   2794KB
格式:   pdf  共37页 来源:   西部证券
评级:   -- 作者:   邢开允
行业名称:   计算机
下载权限:   此报告为加密报告
核心结论
  GPU为驱动AI技术发展以及应用落地的关键引擎,大模型训练、微调、推理催生大量AI算力需求,英伟达A100与H100供不应求,在此背景下,AI算力租赁需求爆发。我们认为由于下游大模型无论是技术侧还是应用侧均呈百花齐放发展趋势,而上游AI算力资源作为重要支撑,稀缺性凸显,算力租赁市场需求将持续旺盛,未来成长空间广阔。1)根据英伟达与微软联合发布的论文,理论情况下用1个月训练出1750亿参数大模型需要1024张A100,而训练万亿参数GPT-4所需的A100卡可能达到万张量级;2)ChatGPT迎重大更新,微软Copilot即将全面开放,大模型应用进一步走向实处。我们测算,大模型推理侧GPU需求具备更大的增长空间,未来每家龙头大模型厂商推理侧A100需求有望达到十万张量级。
  大模型训练中的故障与中断问题对GPU集群的质与量提出了更高要求,云厂商的核心竞争力体现在资金、软硬件、下游客户等多个层面。根据Meta团队训练实践,虽然英伟达GPU具有优异的计算性能,但软、硬件等故障时常发生,各类任务频繁重启,训练经常中断,持续时间较短,理论上1个月能完成的训练实际用了3个月。所以云厂商不仅需要打造大规模算力集群以满足客户需求,还需具备强算力运维能力以帮助客户最大化利用已有的算力资源。我们认为现阶段云厂商的核心竞争力在于AI算力规模,而在未来,云服务能力将成为各大厂商抢占市场与客户的关键。
  建议关注:
  1.鸿博股份:深度绑定英伟达,AI算力稳步落地;
  2.青云科技:云服务技术背景+大集群运维经验,轻资产模式优势尽显;
  3.中贝通信:智算中心建设加速推进,计划年内落地AI算力5000P;
  4.恒润股份:在手算力2500P,携手运营商建设芜湖智算中心;
  5.云赛智联:国资背景加持,打造一线AI算力正规军;
  6.润建股份:拟投入2亿元布局算力租赁业务。
  风险提示:大模型发展不及预期;下游需求不及预期;行业竞争加剧;芯片价格波动;测算存在主观假设风险;关键假设存在误差风险。
研究报告全文:证券研究报告大模型发展的关键引擎看好AI算力高景气持续算力租赁深度研究报告西部证券研发中心2023年10月10日分析师邢开允S080051907000113072123839核心结论GPU为驱动AI技术发展以及应用落地的关键引擎大模型训练微调推理催生大量AI算力需求英伟达行业评级超配A100与H100供不应求在此背景下AI算力租赁需求爆发我们认为由于下游大模型无论是技术侧还是应用侧均呈百花齐放发展趋势而上游AI算力资源作为重要支撑稀缺性凸显算力租赁市场需求将持续前次评级超配旺盛未来成长空间广阔1根据英伟达与微软联合发布的论文理论情况下用1个月训练出1750亿参数评级变动维持大模型需要1024张A100而训练万亿参数GPT-4所需的A100卡可能达到万张量级2ChatGPT迎重大更新微软Copilot即将全面开放大模型应用进一步走向实处我们测算大模型推理侧GPU需求具备更大的增近一年行业走势长空间未来每家龙头大模型厂商推理侧A100需求有望达到十万张量级计算机沪深300大模型训练中的故障与中断问题对GPU集群的质与量提出了更高要求云厂商的核心竞争力体现在资金软硬件下游客户等多个层面根据Meta团队训练实践虽然英伟达GPU具有优异的计算性能但软硬60件等故障时常发生各类任务频繁重启训练经常中断持续时间较短理论上1个月能完成的训练实际4938用了3个月所以云厂商不仅需要打造大规模算力集群以满足客户需求还需具备强算力运维能力以帮助27客户最大化利用已有的算力资源我们认为现阶段云厂商的核心竞争力在于AI算力规模而在未来云服16务能力将成为各大厂商抢占市场与客户的关键5-62022-102023-022023-06建议关注1鸿博股份深度绑定英伟达AI算力稳步落地2青云科技云服务技术背景大集群运维经验轻资产模式优势尽显相对表现1个月3个月12个月3中贝通信智算中心建设加速推进计划年内落地AI算力5000P4恒润股份在手算力2500P携手运营商建设芜湖智算中心计算机-193-87632895云赛智联国资背景加持打造一线AI算力正规军沪深300-148-415-0976润建股份拟投入2亿元布局算力租赁业务风险提示大模型发展不及预期下游需求不及预期行业竞争加剧芯片价格波动测算存在主观假设风险关键假设存在误差风险请仔细阅读尾部的免责声明201AI算力需求空间测算02发展趋势目录目录03竞争格局和要素CONTENTSCONTENTS04重点公司算力布局情况05风险提示浪潮汹涌大模型开启新一轮技术革命AIGCAI20234阿里云通义千问发布面向企业用户开放阿里全系业务将接入谷歌大脑推出TransformerOpenAI推出15亿谷歌推出16万亿参数的SwitchOpenAI推出GPT-4谷歌大脑部门成立深度学习模型参数突破1亿参数的GPT-2Transformer谷歌推出PaLM2201120152017201820192020202120222023谷歌推出3亿参OpenAI推出1750亿参OpenAI推出InstructGPT数的BERT数的GPT-3与ChatGPTOpenAI成立OpenAI推出117微软和英伟达发布StabilityAI推出Stable亿参数的GPT-15300亿参数的MT-NLGDiffusion模型框架大模型Attention机制捕捉用理解上Transformer的Decoder参数少速度快效果好分支1750亿个参数户意图下文小样本学习能力深度学习框架PyTorch易使用API迭代更稳定人类ChatGPTTransfor-GPT3意图mer算力资源InstructGP微软云TGPT35OpenAI的独家云提供商AzureChatGPT连续算法GPT4对话屏蔽主动承连续对模型调优认错误话能力人类反馈强化学习RLHF资料来源迎接大模型时代大模型发展简史及攻略云布道师公众号西部证券研发中心请仔细阅读尾部的免责声明4训练规模突破临界值大模型智慧涌现大模型训练规模与参数量数据量及训练轮数等紧密相关当模型规模突破阙值即出现智慧涌现左图横坐标为模型训练的预训练规模用FLOPs综合表示纵轴为精确性等评判模型效果的指标当模型规模在一定范围内时模型能力并未随着规模提升而提高当规模超过此临界值时模型效果显著提升出现智慧涌现GPT-120186GPT-220192GPT-320205ChatGPTGPT352022GPT-4202312层48层96层96层参数量可能突破参数12亿参数15亿参数27B67B13B175B参数13B6B175B万亿数据5GB数据40GB数据45TB图训练规模超过阈值时效果显著提升图近年来超大规模预训练模型参数增长趋势资料来源EmergentAbilitiesofLargeLanguageModelsLargeLanguageModelsANewMooresLaw云布道师公众号西部证券研发中心请仔细阅读尾部的免责声明5迈入AI智能时代计算芯片依赖已从CPU转向GPUAI时代离不开机器学习而神经网络训练及推理需要进行大量的矩阵运算和卷积运算具有强并行运算与浮点计算能力的GPU逐渐成为计算主力军互联网时代移动互联网大数据短视频AI智能时代信息获取信息交换信息感知交互认知决策广告推荐短视频NLPChatGPT新闻媒体搜索社交出行服务应用在线教育AIGC手机汽车机器手机手机IoT设备端PCWindows人智能硬件单一服务器云数据中心边缘计算AI服务器大规模服务器集群整体性但服务器性能异构融合计算AIML大规模并行计能多核CPU核数虚服务器单核应用应用CDN应用加速算多重向量应用张量计算CPU拟化vCPU云网络分布网络云管端协同网络东西向流量为主依赖主频提升性能式存储--OS平台UNIXSolarisLinuxOpenStackK8SSparkTensorFlowCaffeTorch芯片PowerPCSparkIntelAMDIntelAMDNVIDIA-GPU3G5GADSL2G4GPCIE308GTSPCIE5032GTS网络PCIE10PCIE4016GTS100M网络25G网络10G网络100G网络2003201020172019资料来源云布道师公众号西部证券研发中心请仔细阅读尾部的免责声明6大模型训练微调推理催生大量AI算力需求算法架构训练数据及制作标注模型训练算法测试应用测试方法设计算力需求分阶训练阶段微调阶段推理阶段段小样本学习SFT监督学习RM奖励模型迁移学习参数加载推理计算信息交互单次GPT-35Small125亿计算量26PFLOPS天计算单次计算量天GPT-3XL275PFLOPS预计算力13504PFLOPS天ChatGPT2023年1月官网总访问量616亿次单次GPT-3175B计算量3640PFLOPS天单月运营算力约48744PFlops量PalM计算量5400亿29600PFLOPS天芯片GPT3175B3640PFLOPS通过模型剪枝量化优化到INT4813B50B模型13000张A100跑一天或433张A100跑一个月需求35000张A100跑一天或1024张A100跑一个月可采用A10或V100设备以阿里云GPU实例目录价计算成本920万月4000万月1024817万2200万月资料来源云布道师公众号西部证券研发中心请仔细阅读尾部的免责声明7大模型训练侧GPU需求测算2022年英伟达斯坦福联合微软研究院共同训练出了万亿级参数的GPT比1746亿参数的GPT-3还高出了一个量级论文中的测试基于DGXA100-80GB集群完成对于最大的1T规模的模型一共使用了384台8卡DGX-A100服务器服务器内部各GPU间使用超高速NVLink和NVSwitch互联每台机器装有8个200Gbps的InfiniBand网卡GPU利用率单张GPU训练时吞吐量单张GPU峰值吞吐量论文使用了数据并行流水线模型并行张量模型并行服务器通信优化等加速技术提高GPU利用率训练过程中英伟达A100卡使用数量的变化范围为323072GPU利用率随参数量增加而增长变化范围为4452图GPU利用率随着模型变大更大的矩阵乘法而提高资料来源EfficientLarge-ScaleLanguageModelTrainingonGPUClustersUsingMegatron-LM西部证券研发中心请仔细阅读尾部的免责声明8大模型训练侧GPU需求测算这篇论文给出了使用并行策略后训练时间的经验公式端到端训练时间其中T表示训练集的Token数量P表示模型参数数量n表示A100卡数量X表示训练时每张GPU的吞吐量X值由GPU峰值吞吐量与GPU利用率相乘得出论文中进行训练时采用混合精度即FP16在此精度下每张A100的峰值吞吐量非稀疏为312TFLOPS论文以GPT-3为例做了估计当T3000亿P1750亿A100卡数量n1024张批处理大小为1536时假设GPU利用率为45即每张A100训练时吞吐量为31245140TFLOPS估计GPT-3端到端训练时间s天据推测GPT-4的参数量达到万亿级别SemiAnalysis报道称GPT-4参数量为18万亿且采用更大的训练集GPT-4训练过程中A100卡数量达到万张量级GPT-4具体参数量目前暂无官方数据半导体咨询研究公司SemiAnalysis称OpenAI训练GPT-4的FLOPS约为2151025在大约25000个A100上训练了90-100天由于延迟和故障重启问题GPU利用率约为32-36资料来源SemiAnalysisEfficientLarge-ScaleLanguageModelTrainingonGPUClustersUsingMegatron-LM西部证券研发中心请仔细阅读尾部的免责声明9大模型推理侧GPU需求测算推理侧具备更大的成长空间根据Similarweb数据2023年8月ChatGPT的月度访问量为14亿包括直接访问外链等平均访问时长为7分钟假设1ChatGPT访客平均每次访问提问数为10个每个问题加上其回答的Token数量平均为1000假设2ChatGPT访客来自全球各地假设在每日24小时内平均分配访问量和计算量假设3在推理侧大模型运算更为简单我们仍保守假设GPU利用率为45推理过程中每个参数只需执行1次乘法运算和1次加法运算以GPT-3的参数量1750亿带入以下测算推理前一般采用量化等技术将模型优化到Int8精度在此精度下每张A100的峰值吞吐量非稀疏为624TOPS图2023年8月OpenAI月度访问量图英伟达A100卡规格资料来源Similarweb英伟达官网西部证券研发中心测算请仔细阅读尾部的免责声明10大模型推理侧GPU需求测算ChatGPT首先计算每月推理的算力需求每月推理侧Token数月度访问量平均提问数问题加回答数14109101000每月推理侧算力需求参数量每月推理侧数量单个计算量17510111410132再计算每秒推理侧的算力需求每月推理侧算力需求每秒推理侧算力需求TOPS30246060最后计算A100需求每秒推理侧算力需求191018A100需求张A100单张推理算力GPU利用率624101445实际应用中推理前可能会采用剪枝蒸馏等技术来进行模型压缩压缩一定程度上会降低模型性能此处暂不考虑这些因素资料来源Similarweb西部证券研发中心测算请仔细阅读尾部的免责声明11未来每家龙头大模型厂商推理侧A100需求有望达到十万张量级2023年9月25日ChatGPT进行重大更新GPT-4和GPT-35都具有了基于图像进行分析和对话的能力我们认为当模型参数增长至万亿级且具有多模态能力能承担更多生成分析等任务时将吸引更多用户ChatGPT月度访问量将高增2023年8月谷歌月度访问量为860亿约为ChatGPT的70倍在以下三点假设下长期来看我们推测未来ChatGPT推理侧A100需求将超过70万张假设1我们采用外媒SemiAnalysis给出的数据即使用GPT-4时每次推理只需使用2800亿个参数假设2多模态能力与更强大的分析能力将使得用户更加依赖大模型推理侧每日问答的Token平均数量达到30000甚至更多假设3随着大模型技术发展假设未来ChatGPT的月度访问量翻20倍达到300亿图ChatGPT重大更新资料来源emiAnalysis机器之心Similarweb西部证券研发中心测算请仔细阅读尾部的免责声明12大模型推理侧GPU需求测算微软Copilot2023年9月21日微软宣布基于GPT-4的Copilot将全面开放图OutlookCopilot以及TeamsCopilot示意图微软全球版Copilot于2023年9月26日随更新的Windows11以初期版本形式推出融入到画图照片Clipchamp等应用程序中全球版Microsoft365Copilot将于2023年11月1日起面向企业用户提供服务融入TeamsOutlookWordExcelLoopOneNote和OneDrive等应用程序中同时微软将推出AI助手Microsoft365Chat图WordCopilot示意图资料来源微软科技公众号西部证券研发中心请仔细阅读尾部的免责声明13大模型推理侧GPU需求测算CopilotWindows2023年5月微软宣布Windows用户突破10亿假设Windows中Copilot使用率为15-80用户每天使用Copilot时输入和输出的平均Token数量为500-5000每秒推理侧算力需求日活Copilot使用率每日Token人均输入输出数量推理参数量2A100需求A100单张推理算力GPU利用率246060624101445如下表所示当使用率为30每日人均输入输出Token数量为2000时WindowsCopilot的A100需求量超过1万张乐观估计当使用率为80每日人均输入输出Token数量为5000时A100需求量超过9万张图微软WindowsCopilot的A100需求量测算Copilot使用率A100需求量块153050805001731346257719233Token1000346269251154118466数量20006925138492308236932500017312346235770592329资料来源微软官网西部证券研发中心测算请仔细阅读尾部的免责声明14大模型推理侧GPU需求测算CopilotMicrosoft365微软曾在FY20Q1电话会议上披露Office365现已更名为Microsoft365商业版的月度活跃用户突破2亿而根据微软的季报及年报数据商业版用户数量年增速保持在15左右我们推测Microsoft365企业用户数目前已突破3亿假设Microsoft365中Copilot使用率为15-80企业用户使用Copilot时输入和输出的平均Token数量为2000-30000如下表所示当使用率为30每日人均输入输出Token数量为10000时Microsoft365Copilot的A100需求量超过2万张乐观估计当使用率为80每日人均输入输出Token数量为30000时A100需求量超过15万张图Microsoft365Copilot的A100需求量测算Copilot使用率A100需求量块1530508020002077415569251107950005193103871731227699Token数量1000010387207743462355397300003116162322103870166192资料来源微软官网西部证券研发中心测算请仔细阅读尾部的免责声明15驱动AI发展的关键引擎英伟达A100H100供不应求自年初以来英伟达A100一直处于供不应求的状态而其他加速卡由于性能生态等方面与英伟达存在较大差距大部分场景无法实现替代尤其在训练侧A100与H100具有极大的优势与较高的技术壁垒现阶段大模型技术突破遭遇瓶颈算力资源短缺为重要原因之一OpenAI表示GPU供应不足阻碍了其研发计划的推进例如模型微调和划拨专用容量等受到影响OpenAI联合创始人AndrejKarpathy曾转发了一篇博客文章这篇文章认为训练大语言模型的初创企业云服务供应商及其他大公司需要拥有超过1000张H100或A100A100方面GPT-4可能在10000-25000张A100上进行了训练Meta拥有约21000张A100特斯拉拥有约7000张A100StabilityAI拥有约5000张A100Falcon-40B在384张A100上进行了训练H100方面aOpenAI可能需要50000张Inflection可能需要22000张Meta可能需要25000张大型云厂商可能每家都需要30000张Azure谷歌AWSOracleLambda和CoreWeave以及其他私有云厂商可能总共需要10万张CoreWeave预订的H100数量约为35000-40000张而AnthropicHelsingMistralCharacter等每家可能需要10000张bInflection在其GPT-35等效模型中使用了3500张H100GCP拥有大约25000张H100微软Azure和Oracle可能有10000-40000张H100图国内A800需求量简单测算预训练精调推理企业数50500企业数102C大模型类型所需A800张数总计张所需A800张数总计张日活1亿GPT3100050000400200000大模型类型所需A800张数总计张GPT430001500002C1000001000000资料来源智东西西部证券研发中心测算请仔细阅读尾部的免责声明1601AI算力需求空间测算02发展趋势目录目录03竞争格局和要素CONTENTSCONTENTS04重点公司算力布局情况05风险提示大模型训练中的故障与中断问题对GPU集群的质与量提出了更高要求大模型架构复杂训练周期较长硬件系统软件驱动等等需要稳定运转才能最大化加速卡并行运算的能力保障模型训练的效率缩短训练的时间和成本虽然加速卡具有优异的计算性能但软硬件等故障时常发生各类任务频繁重启训练经常中断持续时间较短如果训练中断后不能及时恢复不仅会影响训练成功率还会使得训练成本居高不下大模型训练过程理想情况大模型训练过程现实情境大模型开发全景概览在各种硬件问题和配置问题中频繁重启任务任务一键提交半个月持续高效训练模型正常收敛持续训练时间基本都不超过1天资料来源新智元西部证券研发中心请仔细阅读尾部的免责声明18大模型训练中的故障与中断问题对GPU集群的质与量提出了更高要求Meta员工曾在训练OPT-175B模型的日志中提到几乎整个训练过程都要面对不停地重启和中断2021年9月开始历时3个月在某两周内由于硬件算法或实验稳定性问题训练重启了40多次其中绝大多5位工程师数重启都是由于硬件故障以及缺乏提供足够数量的缓冲节点来替换坏节点的能力1750亿参数1024张英伟达80GA100通过云接口更换一台机器可能需要几个小时最后两周解决基础设施问题占据了团队大部分时间因为这些硬件问题可能会在一除了云服务器客服没有专门的设备运维天中的任何时间导致训练中断几个小时团队后续团队虽然提出了各种加速重启的方案并安排了更多的人24小时轮值维护但依然使用实验室当时能找到的所有数据很明要面对硬件层面的各种问题内部训练进度的图表显示接下来的两周之内最长的3次连续训练时间长度只有28显很多时候模型是训练不足的天2天15天由于超参数与业内其他几家FAIRNLPgroupsMicrosoftNVIDIAOpenAI所公开的超参数有所不同所以不太清楚最优设置是什么以Meta团队的资源和效率使用992张A100卡需要大约33天的连续训练假设0次失败或重新启动才能完成3000亿Token的模型训练团队发现BF16是最适合的格式也是里程碑资料来源新智元CSDN西部证券研发中心请仔细阅读尾部的免责声明19案例阿里云面向AI大模型的解决方案训练数据除了提供多样化的GPU产品选型阿里云面向AI大模型的解决方案还包括1SCC高性能弹性计算机群以保证算力规模2灵活的算力切割及调度能力以满足更细粒度的计算需求3加速套件以提高效率LLM训练-选型推荐推理-选型推荐语言类大模型训应用场景全训参数规模30-65B练练1024512片8A10GN7i聊天机器人A100SCCGN7ex8V100GN6e32GB文案生成8A100GN7e80GB剧本生成模型微调参数规模30B以下摘要生成256128片4A10GN7i情绪分析A100SCCGN7ex8V100GN6V16GBAIGC训练-选型推荐推理-选型推荐非语言模型应用场参数规模3-10B景全训练推4片A100GN7e多片A10GN7i理文生图图生图文生视频图生视频模型微图生3D调参数规模3B以下文生音乐4片A10GN7i单片A10GN7iGPU服务器云网络负载均衡资料来源云布道师公众号西部证券研发中心请仔细阅读尾部的免责声明20
 
Copyright © 2005 - 2021 Nxny.com All Rights Reserved 备案号:蜀ICP备15031742号-1