研报下载就选股票报告网
您好,欢迎来到股票分析报告网!登录   忘记密码   注册
>> 华泰证券-计算机行业专题研究-ChatGPT服务器:深度拆解-230225
上传日期:   2023/2/25 大小:   2613KB
格式:   pdf  共23页 来源:   华泰证券
评级:   增持 作者:   谢春生
行业名称:   计算机
下载权限:   此报告为加密报告
GPT模型热潮有望带动ChatGPT服务器产业投资机遇
  我们认为,随着国内互联网厂商陆续开展ChatGPT类似产品研发,GPT大模型训练热潮或将带来底层算力需求快速释放。GPT模型算力需求分为训练+推理两类,产生于预训练、Finetune、日常运营三大场景。据我们测算,ChatGPT一次预训练需要3640 PFlop/s-day、单月运营需要算力7034.7PFlop/s-day。复盘服务器产业发展历程来看,我们认为AI服务器更适合承接GPT大模型算力需求。拆解AI服务器来看,主要硬件成本来自算力芯片,且以GPU为主。我们认为,随着GPT热潮带动算力需求逐步释放,国内ChatGPT服务器产业有望迎来发展机遇,建议关注:浪潮信息、景嘉微。
  ChatGPT:大模型+Transformer架构,带动并行计算需求
  ChatGPT发布之后,引发了全球范围的关注和讨论,百度、阿里、京东等国内各大厂商相继宣布GPT模型开发计划。从AI模型应用场景来看,主要包括推理和训练两类。从实践场景来看,算力需求场景包括预训练、Finetune及日常运营。以GPT-3模型为例,随着模型朝更大体量的方向演进,一次训练所需的计算量最高达3640PFlop/s-day,单月运营算力7034.7PFlop/s-day,对应成本约889万美元。我们认为,在Transformer架构加持下,GPT模型得以高效地完成大规模参数计算,随着模型持续迭代、参数体量不断提升,并行计算需求有望进一步释放。
  ChatGPT需要的服务器:AI训练型服务器+AI推理型服务器
  我们认为,计算架构的变化是推动服务器技术演进的关键变量。从计算场景来看,随着计算架构从PC到云计算,到边缘计算,再到AI训练,服务器需求也在发生相应变化。复盘主流服务器发展历程来看:1)通用服务器:以单机性能提升为迭代目标;2)云计算服务器:主要为承载大规模数据处理需求而生,以IaaS模式带来服务器商业模式的变革;3)边缘服务器:主要解决实时性、带宽成本、安全性等问题;4)AI服务器:专为人工智能训练设计,包括训练型和推理型,多采用大规模并行计算以提升效率。
  ChatGPT需要的芯片:CPU+GPU、FPGA、ASIC
  从产业需求来看,AI大模型训练需要大算力支持,智能算力需求释放有望带动AI服务器放量。目前国产AI服务器厂商主要包括浪潮信息、华为、新华三等,21H1国产AI服务器厂商占全球市场份额超35%。拆解AI服务器来看,主要硬件成本来自算力芯片,且以GPU为核心。目前海外主流AIGPU芯片包括英伟达H00、A100、V100等,受美国出口限制政策影响,目前国内在先进算力方面主要采购英伟达A800或更低端版本作为替代方案。考虑到部分国产AIGPU如华为昇腾在FP16浮点计算性能上已经实现对英伟达A100的加速追赶,未来随着国产生态打磨,AIGPU国产替代有望加速。
  投资建议:关注ChatGPT服务器产业链
  我们认为,随着GPT热潮带动算力需求逐步释放,国内AI服务器产业有望迎来发展机遇,建议关注核心环节龙头。目前国内AI服务器产业链公司主要包括:1)能够采购到海外高性能芯片的厂商:浪潮信息等;2)采用海光/寒武纪芯片的厂商:中科曙光;3)采用华为昇腾芯片的厂商:拓维信息等;4)底层芯片供应商:海光信息、寒武纪、景嘉微等。
  风险提示:宏观经济波动;下游需求不及预期;算力需求测算与实际不符。
  
  
研究报告全文:证券研究报告计算机ChatGPT服务器深度拆解华泰研究计算机增持维持2023年2月25日中国内地专题研究研究员谢春生GPT模型热潮有望带动ChatGPT服务器产业投资机遇SACNoS0570519080006xiechunshenghtsccomSFCNoBQZ938862129872036我们认为随着国内互联网厂商陆续开展ChatGPT类似产品研发GPT大模型训练热潮或将带来底层算力需求快速释放GPT模型算力需求分为训联系人林海亮练推理两类产生于预训练Finetune日常运营三大场景据我们测算SACNoS0570122060076linhailianghtsccomChatGPT一次预训练需要3640PFlops-day单月运营需要算力70347862128972228PFlops-day复盘服务器产业发展历程来看我们认为AI服务器更适合承接GPT大模型算力需求拆解AI服务器来看主要硬件成本来自算力芯片行业走势图且以GPU为主我们认为随着GPT热潮带动算力需求逐步释放国内ChatGPT服务器产业有望迎来发展机遇建议关注浪潮信息景嘉微计算机沪深3006ChatGPT大模型Transformer架构带动并行计算需求3ChatGPT发布之后引发了全球范围的关注和讨论百度阿里京东等国内各大厂商相继宣布GPT模型开发计划从AI模型应用场景来看主要13包括推理和训练两类从实践场景来看算力需求场景包括预训练Finetune22及日常运营以GPT-3模型为例随着模型朝更大体量的方向演进一次31训练所需的计算量最高达3640PFlops-day单月运营算力70347Feb-22Jun-22Oct-22Feb-23对应成本约万美元我们认为在架构加PFlops-day889Transformer资料来源Wind华泰研究持下模型得以高效地完成大规模参数计算随着模型持续迭代参GPT数体量不断提升并行计算需求有望进一步释放重点推荐目标价ChatGPT需要的服务器AI训练型服务器AI推理型服务器股票名称股票代码当地币种投资评级我们认为计算架构的变化是推动服务器技术演进的关键变量从计算场景浪潮信息000977CH4406买入来看随着计算架构从PC到云计算到边缘计算再到AI训练服务器景嘉微300474CH9674买入需求也在发生相应变化复盘主流服务器发展历程来看1通用服务器资料来源华泰研究预测以单机性能提升为迭代目标2云计算服务器主要为承载大规模数据处理需求而生以IaaS模式带来服务器商业模式的变革3边缘服务器主要解决实时性带宽成本安全性等问题4AI服务器专为人工智能训练设计包括训练型和推理型多采用大规模并行计算以提升效率ChatGPT需要的芯片CPUGPUFPGAASIC从产业需求来看AI大模型训练需要大算力支持智能算力需求释放有望带动AI服务器放量目前国产AI服务器厂商主要包括浪潮信息华为新华三等21H1国产AI服务器厂商占全球市场份额超35拆解AI服务器来看主要硬件成本来自算力芯片且以GPU为核心目前海外主流AIGPU芯片包括英伟达H00A100V100等受美国出口限制政策影响目前国内在先进算力方面主要采购英伟达A800或更低端版本作为替代方案考虑到部分国产AIGPU如华为昇腾在FP16浮点计算性能上已经实现对英伟达A100的加速追赶未来随着国产生态打磨AIGPU国产替代有望加速投资建议关注ChatGPT服务器产业链我们认为随着GPT热潮带动算力需求逐步释放国内AI服务器产业有望迎来发展机遇建议关注核心环节龙头目前国内AI服务器产业链公司主要包括1能够采购到海外高性能芯片的厂商浪潮信息等2采用海光寒武纪芯片的厂商中科曙光3采用华为昇腾芯片的厂商拓维信息等4底层芯片供应商海光信息寒武纪景嘉微等风险提示宏观经济波动下游需求不及预期算力需求测算与实际不符免责声明和披露以及分析师声明是报告的一部分请务必一起阅读1计算机AI服务器ChatGPT训练热潮有望带动AI服务器需求ChatGPT大模型Transformer架构带动并行计算需求大厂布局ChatGPT类似产品或将带来底层算力需求ChatGPT发布之后引发了全球范围的关注和讨论国内各大厂商相继宣布GPT模型开发计划据各公司官网2023年2月7日百度宣布将推出ChatGPT类似产品文心一言预计今年3月展开内测2月8日阿里宣布阿里版ChatGPT正在研发中目前处于内测阶段2月9日字节跳动旗下AILab宣布正在开展ChatGPT和AIGC相关研发未来将为PICO提供技术支持2月10日京东旗下言犀人工智能平台推出产业版ChatGPTChatJD我们认为随着国内互联网厂商陆续开展ChatGPT类似产品研发GPT大模型训练热潮或将带来底层算力需求快速释放AI模型对算力的需求主要体现在训练和推理两个层面当前主流的人工智能算法通常可分为训练和推理两个阶段据IDC数据2021年中国人工智能服务器工作负载中576的负载用于推理424用于模型训练据IDC预计到2026年AI推理的负载比例将进一步提升至622具体来看1训练阶段基于充裕的数据来调整和优化人工智能模型的参数使模型的准确度达到预期对于图像识别语音识别与自然语言处理等领域的复杂问题为了获得更准确的人工智能模型训练阶段常常需要处理大量数据集做反复的迭代计算耗费巨大的运算量2推理阶段训练阶段结束以后人工智能模型已经建立完毕已可用于推理或预测待处理输入数据对应的输出例如给定一张图片识别该图片中的物体此过程被称为推理阶段推理阶段对单个任务的计算能力要求不如训练那么大但是由于训练出来的模型会多次用于推理因此推理运算的总计算量也相当可观图表1中国人工智能服务器工作负载及预测推理训练1009080424415405393382378485706050403057658559560761862251520100202020212022E2023E2024E2025E2026E资料来源IDC华泰研究ChatGPT算力需求场景包括预训练Finetune及日常运营从ChatGPT实际应用情况来看从训练推理的框架出发我们可以将ChatGPT的算力需求按场景进一步拆分为预训练Finetune及日常运营三个部分1预训练主要通过大量无标注的纯文本数据训练模型基础语言能力得到类似GPT-123这样的基础大模型2Finetune在完成预训练的大模型基础上进行监督学习强化学习迁移学习等二次或多次训练实现对模型参数量的优化调整3日常运营基于用户输入信息加载模型参数进行推理计算并实现最终结果的反馈输出免责声明和披露以及分析师声明是报告的一部分请务必一起阅读2计算机图表2ChatGPT算力需求研究框架资料来源OpenAI华泰研究预训练阶段单次算力需求取决于模型参数量最高可达3640PFlops-dayChatGPT基于Transformer架构进行语言模型预训练GPT模型之所以能够高效地完成大规模参数计算我们认为离不开Transformer架构的加持拆解Transformer架构来看核心是由编码模块和解码模块构成而GPT模型只用到了解码模块拆解模块来看大致分为三层前馈神经网络层编码解码自注意力机制层Self-Attention自注意力机制掩码层其中1注意力机制层主要作用在于计算某个单词对于全部单词的权重即Attention从而能够更好地去学习所有输入之间的关系实现对文本内在关系的理解和更大规模的并行计算2前馈神经网络提供了对数据信息的高效存储及检索3掩码层在这一过程中帮助模型屏蔽位于计算位置右侧尚未出现的单词因此相较于前代深度学习架构RNNTransformer架构可以实现更大规模的并行计算大大提升了计算效率图表3Transformer解码模块拆解资料来源CSDN华泰研究单一大模型路线下需要完成大规模参数计算以GPT-3模型为例随着模型朝更大体量的方向演进参数量从GPT-3Small的125亿个增长到GPT-3175B的1746亿个一次训练所需的计算量从26PFlops-day增至3640PFlops-day与此同时在不同学习样本包括小样本单一样本零样本条件下的模型随着参数量的提升均实现不同幅度的上下文学习能力改善外在表现为语言准确率的提升我们认为随着大模型训练表现出越来越强大的实战能力未来或将成为NLP训练的主流选择免责声明和披露以及分析师声明是报告的一部分请务必一起阅读3计算机图表4不同NLP模型参数量及训练算力对比模型总计算量PFlops-day总计算量Flops参数量百万个令牌数量十亿T5模型T5-Small208E00180E20601000T5-Base764E00660E202201000T5-Large267E01231E217701000T5-3B104E02900E2130001000T5-11B382E02330E22110001000BERT模型BERT-Base189E00164E20109250BERT-Large616E00533E20355250ROBERTa-Base174E00150E211252000ROBERTa-Large493E01426E213552000GPT模型GPT-3Small260E00225E20125300GPT-3Medium742E00641E20356300GPT-3Large158E01137E21760300GPT-3XL275E01238E211320300GPT-327B552E01477E212650300GPT-367B139E02120E226660300GPT-313B268E02231E2212850300GPT-3175B364E03314E23174600300资料来源LanguageModelsareFew-ShotLearnersOpenAI2020华泰研究图表5随着模型参数量增长不同学习样本模型的准确度均有提升资料来源LanguageModelsareFew-ShotLearnersOpenAI2020华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读4计算机推理阶段预计单月运营算力需求约70347PFlops-dayChatGPT近一月访问量为889亿次据SimilarWeb数据2023年1月以来ChatGPT官网日访问量持续攀升从1月初的日均千万次级别到1月底日均两千万次再到2月中旬的三千万次级别随着软件效果的广泛传播用户访问次数愈发频繁加总近一月2023117-2023217ChatGPT官网访问量数据来看可得ChatGPT月访问量为889亿次图表6ChatGPT官网日访问量百万次DesktopMobileWeb4540353025201510501-11-41-71-101-131-161-191-221-251-281-312-32-62-92-122-15资料来源SimilarWeb华泰研究预计日常运营单月所需算力约70347PFlops-day日常运营过程中用户交互带来的数据处理需求同样也是一笔不小的算力开支据前文近一个月2023117-2023217ChatGPT官网总访问量为889亿次据Fortune杂志每次用户与ChatGPT互动产生的算力云服务成本约001美元基于此我们测算得2023年1月OpenAI为ChatGPT支付的运营算力成本约889万美元此外据Lambda使用训练一次1746亿参数的GPT-3模型所需花费的算力成本超过460万美元据OpenAI训练一次1746亿参数的GPT-3模型需要的算力约为3640PFlops-day我们假设单位算力成本固定测算得ChatGPT单月运营所需算力约70347PFlops-day图表7ChatGPT单月运营算力成本测算资料来源SimilarWebFortune华泰研究预测免责声明和披露以及分析师声明是报告的一部分请务必一起阅读5计算机Finetune阶段预计ChatGPT单月Finetune的算力需求至少为13504PFlops-day模型迭代带来Finetune算力需求从模型迭代的角度来看ChatGPT模型并不是静态的而是需要不断进行Finetune模型调优以确保模型处于最佳应用状态这一过程中一方面是需要开发者对模型参数进行调整确保输出内容不是有害和失真的另一方面需要基于用户反馈和PPO策略对模型进行大规模或小规模的迭代训练因此模型调优同样会为OpenAI带来算力成本具体算力需求和成本金额取决于模型的迭代速度预计ChatGPT单月Finetune算力需求至少为13504PFlops-day据IDC预计2022年中国人工智能服务器负载中推理和训练的比例分别为585415我们假设ChatGPT对推理和训练的算力需求分布与之保持一致且已知单月运营需要算力70347PFlops-day一次预训练需要算力3640PFlops-day基于此我们进一步假设1考虑到AI大模型预训练主要通过巨量数据喂养完成模型底层架构变化频率不高故我们假设每月最多进行一次预训练2人类反馈机制下模型需要不断获得人类指导以实现参数调优以月为单位可能多次进行由此我们计算得ChatGPT单月Finetune算力成本至少为13504PFlops-dayChatGPT需要的服务器AI训练型服务器AI推理型服务器随着计算场景扩展算力硬件也在发生变化在传统软件架构下主要的模式都是CS模式服务端大多是单机处理几千个轻量请求而在边缘计算场景下需要数万台服务器处理上亿个重负载请求边缘计算机本质上是用CES模式取代CS模式当前的互联网IT架构已经从CS模式逐步向CDN服务为核心的CES模式转变但当前的CDN模式比较大的局限性在于缺乏灵活性不能解决边缘上非结构化数据存储和处理的需求引入Edge端边缘端就是为了解决CS模式下无法处理的业务而在AI训练场景下计算量及数据类型的变化导致C-E-S又无法满足集中大算力需求计算架构回归C-S并向高效率并行计算演变图表8计算架构演变过程资料来源CSDN华泰研究服务器作为算力硬件核心面向不同计算场景分化演进我们认为计算架构的变化是推动服务器技术演进的关键变量从计算场景来看随着计算架构从PC到云计算到边缘计算再到AI训练服务器需求也在发生相应变化从单一服务器更加强调服务个体性能如稳定性吞吐量响应时间等云数据中心服务器对单个服务器性能要求下降但更强调数据中心整体性能如成本快速部署和交付边缘计算场景下开始出现异构计算等复杂环境计算对数据交互实时性要求有所提升需要在边缘端设立单独的服务器设施而AI服务器主要专为人工智能训练设计数据类型以向量张量为主多采用大规模并行计算以提升运算效率免责声明和披露以及分析师声明是报告的一部分请务必一起阅读6计算机图表9服务器类型演变过程资料来源CSDN华泰研究同一技术路线下服务器面向数据处理需求持续迭代复盘主流服务器发展历程来看随着数据量激增数据场景复杂化不同类型服务器发展驱动力也有所差异具体来看1通用服务器传统通用服务器的发展与计算机架构发展同步通过处理器的时钟频率指令集并行度核数等硬件指标的提升优化自身性能发展较为缓慢2云计算服务器云计算的概念于20世纪80年代提出仅20年后就有较为成熟的产品推出如VMware的VMwareWorkstation和亚马逊AWS等2010年随着OpenStack开源阿里云华为云等项目相继布局云计算行业快速走向成熟3边缘计算服务器边缘计算概念孵化于2015年仅2年后就有诸如亚马逊AWSGreengrass谷歌GMEC等边缘计算平台产生并在微软的带领下提前进入技术并购期4AI服务器AI服务器最早由思科在2018推出专为人工智能机器学习的工作服务而设计硬件架构更加适合AI训练场景下的算力需求图表10四类主流服务器发展历程复盘资料来源CSDN浪潮信息官网华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读7计算机云计算服务器大规模数据处理需求下的商业模式变革数据量激增带来大算力需求云计算服务器应运而生通用服务器通过提高硬件指标提升性能而随着CPU的工艺和单个CPU的核心数量接近极限通用服务器性能难以支持数据量激增带来的性能需求云计算服务器则通过虚拟化技术将计算和存储资源进行池化把原来物理隔离的单台计算资源进行虚拟化和集中化最终以集群化处理来达到单台服务器所难以实现的高性能计算同时云计算服务器集群的计算能力可以通过不断增加虚拟化服务器的数量来进行扩展突破单个服务器硬件限制应对数据量激增带来的性能需求云计算服务器节约部分硬件成本降低算力采购门槛早期大规模数据处理成本极高原因在于通用服务器的购置和运维成本居高不下传统服务器中均包含处理器摸块存储模块网络模块电源风扇等全套设备而云计算服务器体系架构精简省去重复的模块提高了利用率同时云计算服务器针对节能需求将存储模块进行虚拟化并去除了主板上的非必要硬件降低了整体计算成本并通过流量计费模式使得更多厂商可以负担算力开支降低了算力采购门槛图表11通用服务器-云计算服务升级资料来源华泰研究边缘服务器高数据密度和带宽限制下保证低时延边缘计算在云计算的基础上引入边缘层边缘计算是在靠近物或数据源头的网络边缘侧为应用提供融合计算存储和网络等资源在体系架构上边缘计算在终端层和云层之间引入边缘层从而将云服务扩展到网络边缘其中终端层由物联网设备构成最靠近用户负责收集原始数据并上传至上层进行计算边缘层由路由器网关边缘服务器等组成由于距离用户较近可以运行延迟敏感应用满足用户对低时延的要求云层由高性能服务器等组成可以执行复杂计算任务图表12边缘计算架构资料来源GSMA华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读8计算机边缘计算较云计算在实时性低成本和安全性等方面有优势1实时性边缘计算将原有云计算中心的计算任务部分或全部迁移到与用户距离更近的网络边缘进行处理而不是在外部数据中心或云端进行因此提高了数据传输性能保证了处理的实时性2低带宽成本终端产生的数据无需远距离传输至云端避免带宽成本同时边缘计算机制中边缘层可对终端产生数据进行预处理从而降低云计算中心的计算负载3安全性边缘计算在本地设备和边缘层设备中处理大部分数据而不是将其上传至云端减少实际存在风险的数据量避免数据泄露危险图表13边缘计算对比云计算边缘计算云计算目标应用物联网或移动应用一般互联网应用服务器节点的位置边缘网络网关WiFi接入点和蜂窝基站数据中心客户端与服务器的通信网络无线局域网4G5G等广域网可服务的设备数量数十亿计数百万计提供的服务类型基于本地信息服务基于全局信息的服务资料来源CSDN华泰研究AI服务器更适合深度学习等AI训练场景AI服务器采取GPU架构相较CPU更适合进行大规模并行计算通用服务器采用CPU作为计算能力来源而AI服务器为异构服务器可以根据应用范围采用不同的组合方式如CPUGPUCPUTPUCPU其他加速卡等主要以GPU提供计算能力从ChatGPT模型计算方式来看主要特征是采用了并行计算对比上一代深度学习模型RNN来看Transformer架构下AI模型可以为输入序列中的任何字符提供上下文因此可以一次处理所有输入而不是一次只处理一个词从而使得更大规模的参数计算成为可能而从GPU的计算方式来看由于GPU采用了数量众多的计算单元和超长的流水线因此其架构设计较CPU而言更适合进行大吞吐量的AI并行计算图表14GPU内部结构更适合进行大规模并行计算资料来源CSDN华泰研究深度学习主要进行矩阵向量计算AI服务器处理效率更高从ChatGPT模型结构来看基于Transformer架构ChatGPT模型采用注意力机制进行文本单词权重赋值并向前馈神经网络输出数值结果这一过程需要进行大量向量及张量运算而AI服务器中往往集成多个AIGPUAIGPU通常支持多重矩阵运算例如卷积池化和激活函数以加速深度学习算法的运算因此在人工智能场景下AI服务器往往较GPU服务器计算效率更高具备一定应用优势免责声明和披露以及分析师声明是报告的一部分请务必一起阅读9计算机图表15GPU服务器与AI服务器的区别GPU服务器AI服务器主要用途主要用于图形处理如游戏渲染视频编辑等主要用于人工智能和机器学习任务计算特征配备大量的浮点运算单元和高度并行的架构配备更多的矩阵运算单元针对深度学习算法进行了优化处理对象能够高效地处理大量的图形数据能够高效地处理大量的数学运算应用场景适用于大量图形处理的应用程序适用于需要高效机器学习的应用程序资料来源ChatGPT华泰研究AI服务器分类方式有两种1按应用场景AI服务器按照应用场景可以分为深度学习训练型和智能应用推理型训练任务对服务器算力要求较高需要训练型服务器提供高密度算力支持典型产品有中科曙光X785-G30和华为昇腾Atlas800型号9000型号9010推理任务则是利用训练后的模型提供服务对算力无较高要求典型产品有中科曙光X785-G40和华为昇腾Atlas800型号3000型号30102按芯片类型AI服务器为异构服务器可以根据应用范围调整计算模块结构可采用CPUGPUCPUFPGACPUTPUCPUASIC或CPU多种加速卡等组合形式目前产品中最常见的是CPU多块GPU的方式图表16AI服务器分类资料来源昇腾计算官网中科曙光官网华泰研究常见的AI服务器分为四路八路十六路一般来说通用服务器主要采用以CPU为主导的串行架构更擅长逻辑运算而AI服务器主要采用加速卡为主导的异构形式更擅长做大吞吐量的并行计算按CPU数量通用服务器可分为双路四路和八路等虽然AI服务器一般仅搭载1-2块CPU但GPU数量显著占优按GPU数量AI服务器可以分为四路八路和十六路服务器其中搭载8块GPU的八路AI服务器最常见图表17AI服务器与通用服务器路数注AI服务器路数指GPU数量通用服务器路数指CPU数量资料来源浪潮信息官网宁畅官网华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读10计算机AI服务器采用多芯片组合算力硬件成本更高我们以典型服务器产品为例拆解硬件构成可以更清晰地理解两类服务器硬件架构区别以浪潮通用服务器NF5280M6为例该服务器采用12颗第三代IntelXeon可扩展处理器据英特尔官网每颗CPU售价约64000万元故该服务器芯片成本约64000128000以浪潮AI服务器NF5688M6为例该服务器采用2颗第三代IntelXeon可扩展处理器8颗英伟达A800GPU的组合据英伟达官网每颗A800售价104000元故该服务器芯片成本约96万元图表18通用服务器AI服务器内部结构对比资料来源浪潮信息官网英伟达官网英特尔官网华泰研究ChatGPT需要的芯片CPUGPUFPGAASICChatGPT带动大模型训练热潮AI服务器需求有望放量GPT模型训练需要大算力支持或将带来AI服务器建设需求我们认为随着国内厂商陆续布局ChatGPT类似产品GPT大模型预训练调优及日常运营或将带来大量算力需求进而带动国内AI服务器市场放量以GPT-3175B模型预训练过程为例据OpenAI进行一次GPT-3175B模型的预训练需要的算力约3640PFlops-day我们假设以浪潮信息目前算力最强的AI服务器NF5688M6PFlops进行计算在预训练期限分别为3510天的假设下单一厂商需采购的AI服务器数量分别为24314673台图表19预训练需要的AI服务器数量测算参数量预训练需要的算力浪潮NF5688M6服务器计预训练完成时间服务器采购数量模型名称亿PFlops-day算速度PFlops天台GPT-3175B174603640053243GPT-3175B174603640055146GPT-3175B174603640051073资料来源OpenAI浪潮信息官网华泰研究预测AI大模型训练需求火热智能算力规模增长有望带动AI服务器放量据IDC数据以半精度FP16运算能力换算2021年中国智能算力规模约1552EFLOPS随着AI模型日益复杂计算数据量快速增长人工智能应用场景不断深化未来国内智能算力规模有望实现快速增长IDC预计2022年国内智能算力规模将同比增长727至2680EFLOPS预计2026年智能算力规模将达12714EFLOPS2022-2026年算力规模CAGR将达692我们认为AI服务器作为承载智能算力运算的主要基础设施有望受益于下游需求放量免责声明和披露以及分析师声明是报告的一部分请务必一起阅读11计算机图表20中国智能算力规模及预测中国智能算力规模及预测EFLOPS1400127141200100092288006407600427400268155220075317020192020202120222023202420252026资料来源IDC华泰研究国产厂商布局丰富产品矩阵占据全球AI服务器市场领先地位浪潮信息联想华为等国产厂商在全球AI服务器市场占据领先地位全球市场来看AI服务器市场份额TOP10厂商中国产厂商占据4席累计市场份额超35其中浪潮信息以202的份额排名第一国内市场来看AI服务器市场集中度较高排名前三的供应商为浪潮信息宁畅和华为CR3达7040我们认为国产厂商凭借强大产品竞争力已经在国际市场占据一定领先地位未来随着AI算力需求释放有望充分受益于产业成长机遇图表212021H1全球AI服务器市场竞争格局图表222021H1中国AI服务器市场竞争格局其他165浪潮信息其他326202安擎52浪潮信息新华三485戴尔13878富士通10Oracle12华为81思科26HPE98新华三39宁畅138IBM39华为48联想61资料来源IDC华泰研究资料来源IDC华泰研究浪潮信息AI服务器产品矩阵丰富产品力获国际认可目前公司AI服务器主要产品型号包括NF5688M6NF5488A5等据公司官网2021年上述两款AI服务器在国际权威AI基准测试MLPerf榜单中获得医学影像分割目标物体检测自然语言理解智能推荐等7项训练冠军可满足包括自然语言理解等在内的多项AI训练需求此外公司在AI领域的积累还包括AI资源平台AI算法平台等具备大量算力解决方案实施经验免责声明和披露以及分析师声明是报告的一部分请务必一起阅读12计算机图表23浪潮信息主要AI服务器产品矩阵资料来源浪潮信息官网华泰研究华为AI服务器融合自研加速卡与英特尔CPU公司AI服务器为Atlas800推理服务器系列旗下有型号3000型号3010型号9000和型号9010其中型号3000基于昇腾310芯片型号3010基于Intel处理器型号9000基于华为鲲鹏920昇腾910处理器型号9010基于Intel处理器华为昇腾910芯片旗舰级芯片加持下产品最高拥有224PFLOPSFP16的高密度算力并在设计结构优化下芯片间跨服务器互联时延可缩短1070图表24华为主要AI服务器产品资料来源华为官网华泰研究新华三AI服务器覆盖各训练负载要求结合软件平台构建AI完整生态公司主要产品型号包括R4900G5R5300G5R5500G5等可分别针对不同训练负载要求满足大小规模的推理训练任务软件层面公司通过新华三傲飞AIHPC融合管理平台全面提升AI作业效率约322022年新华三被国际权威分析机构Forrester认定为大型人工智能系统成熟厂商可以提供可靠的服务器解决方案同时新华三AI服务器在MLPerf测评中共斩获86项世界第一免责声明和披露以及分析师声明是报告的一部分请务必一起阅读13计算机图表25新华三主要AI服务器产品资料来源新华三官网华泰研究龙头厂商有望充分受益于算力需求释放我们认为随着ChatGPT待动大模型训练热潮以人工智能训练为代表的智能算力需求逐步释放有望带动AI服务器放量拆解AI服务器成本来看GPU等算力芯片为核心组件先进算力产品受美国出口管制影响但可通过采购A800实现基本替代我们认为浪潮信息等国产头部厂商凭借丰富产品矩阵和强大产品竞争力占据全球AI服务器市场主要份额未来有望充分受益于服务器需求释放GPU算力芯片为核心组件国产替代未来可期拆解来看AI服务器主要成本包括算力芯片内存存储等据IDC的2018年服务器成本结构拆分数据芯片成本在基础型服务器中约占总成本的32在高性能或具有更强运算能力的服务器中芯片相关成本占比可以高达50-83以机器学习型AI服务器为例其主要成本由GPUCPU内存及其他部件组成其中GPU成本占比最高达到728图表262018年全球服务器成本结构拆分CPUGPUmemorystorage其他1008709023302090250087802970180100256601505026872840273250302032010233250980基础型高性能型推理型训练型资料来源IDC华泰研究AI服务器算力芯片以GPU为主据IDC2022年国内人工智能芯片市场中GPU芯片占据主要市场份额达890主因GPU芯片并行计算架构更加适合于复杂数学计算场景可以较好支持高度并行的工作负载因此常用于数据中心的模型训练以及边缘侧及端侧的推理工作负载此外其他主要的人工智能芯片还包括NPUASICFPGA等一般而言AI服务器中算力芯片需求数量取决于服务器设计性能要求需求种类取决于成本功耗算法等指标常见的算力芯片组合如8xGPU2xCPU4xGPU2xCPU8xFPGA1xCPU4xFPGA1xCPU等免责声明和披露以及分析师声明是报告的一部分请务必一起阅读14计算机图表272022年中国人工智能芯片市场规模占比ASICFPGANPU100496GPU890GPUNPUASICFPGA资料来源IDC华泰研究GPU结构计算单元显存计算单元StreamingMultiprocessor计算单元的功能是执行计算其中每一个SM都有独立的控制单元寄存器缓存指令流水线显存GlobalMemory显存是在GPU板卡上的DRAM容量大但速度慢1计算单元底层架构显卡核心构成多样不同核心专注不同任务以英伟达为例GPU显卡构成包括TENSORCORECUDA和RT等部分TENSORCORE即张量核心是英伟达GPU上一块特殊区域针对AI矩阵计算设计可显著提高AI训练吞吐量和推理性能CUDA则是英伟达生态中的通用结构一般包括多个数据类型适用于视频制作图像处理三维渲染等常见图像处理和计算工作图表28英伟达GPU计算单元架构资料来源SEGMENT华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读15计算机2TOPS和TFLOPS是常见算力衡量单位1OPSOPSOperationsPerSecond指每秒执行的操作次数是整数运算的单位常在INT8INT4等计算精度下度量算力性能其中TOPSTeraOperationsPerSecond代表处理器每秒钟可进行一万亿次1012操作类似的单位还有诸如GOPSMOPS均代表每秒的操作次数2FLOPSFLOPSFloating-pointOperationsPerSecond指每秒所执行的浮点运算次数常在单精度FP32半精度FP16等计算精度下度量算力性能TFLOPSTeraFloating-pointOperationsPerSecond代表处理器每秒钟可进行一万亿次1012浮点运算虽然TOPS和TFLOPS数量级一样但前者是衡量操作次数后者是衡量浮点运算TOPS要结合数据类型精度如INT8FP16等才能与FLOPS转换3显存位宽带宽与容量显存的主要指标包括位宽带宽和容量显存本身与CPU的内存类似将数据在GPU核心与磁盘间传输显存位宽是显存在一个时钟周期内所能传送数据的位数决定了显存瞬时传输的数据量显存带宽是指显示芯片与显存之间的数据传输速率由显存频率和显存位宽共同决定体现了显卡的速度和性能显存容量决定了显存临时存储数据的多少目前主流AIGPU芯片包括英伟达H100A100以及V100等全球来看目前用于人工智能训练的AIGPU市场以英伟达为主导公司旗下先进算力产品主要包括H100A100以及V100对比双精度浮点计算性能FP64TensorCore来看H100A100V100计算速度分别为67TFLOPS195TFLOPS82TFLOPS从显存带宽来看H100A100V100传输速度分别为3TBs2TBs900GBs图表29英伟达H100A100以及V100显卡参数对比H100A100V100晶体管数量800亿542亿211亿CUDA核心数量1689669125120Tensor核心数量528432640显存位宽最高5120-bit5120-bit4096-bit显存带宽最高3TBs2TBs900GBs显存容量最高80GB80GB32GBFP64TensorCore67TFLOPS195TFLOPS82TFLOPSTF32TensorCore989TFLOPS156TFLOPS164TFLOPS首发售价元2399998759921999资料来源英伟达官网华泰研究先进算力芯片进口受限或为国产AI服务器的瓶颈之一2022年10月7日美国商务部工业与安全局BIS宣布了针对中国出口先进芯片的管制新规声明声明规定满足输入输出IO双向传输速度高于600GBs同时每次操作的比特长度乘以TOPS计算出的处理性能合计为4800或更多算力的产品将无法出口至中国以英伟达A100为例以TF32性能测算即1563249924800且传输速度为600GBs基于此我们可以推断性能大于等于A100GPU的先进算力芯片属于美国出口限制范围采用英伟达A800服务器或为当前可行替代方案以浪潮NF5688M6为例NF5688M6是为超大规模数据中心研发的NVLinkAI服务器支持2颗Intel最新的IceLakeCPU和8颗NVIDIA最新的NVSwitch全互联A800GPU单机可提供5PFlops的AI计算性能对比核心硬件来看NF5688M6采用英伟达中国特供版芯片A800在浮点计算能力显存带宽显存容量等性能指标上与先进算力芯片A100基本一致主要差异在于芯片的数据传输速度约为A100的三分之二免责声明和披露以及分析师声明是报告的一部分请务必一起阅读16计算机图表30浪潮NF5688M6服务器GPU性能与A100基本一致A100A800数据传输速率600GBs400GBs显存带宽最高2TBs2TBs显存容量最高80GB80GBFP6497TFLOPS97TFLOPSFP32195TFLOPS195TFLOPSTensorFloat32TF32156TFLOPS312TFLOPS156TFLOPS312TFLOPS资料来源英伟达官网华泰研究图表31英伟达A100性能参数图表32英伟达A800性能参数资料来源英伟达官网华泰研究资料来源英伟达官网华泰研究英伟达其他AIGPU芯片均不受出口限制影响考虑到目前美国GPU芯片限制主要集中在先进算力领域倘若未来进一步加大限制力度A800等大算力芯片可能出现进一步被限制的风险而从英伟达产品线布局来看除了前面讨论的A100A800V100H100等先进算力芯片外还有A2A10A30A40T4等这些芯片中浮点计算能力最强的型号为A30输出性能为823226244800因此不受出口限制影响图表33英伟达其他AIGPU对比A2A10A30A40T4CUDA核心数量128092163584107522560Tensor核心数量40288224336320TF32TensorCore18TFLOPS125TFLOPS165TFLOPS1496TFLOPS-FP16TensorCore36TFLOPS250TFLOPS330TFLOPS2994TFLOPS65TFLOPSINT8TensorCore72TOPS500TOPS661TOPS5986TOPS130TOPSINT4TensorCore144TOPS1000TOPS1321TOPS11974TOPS260TOPS显存位宽128-bit384-bit3072-bit384-bit256-bit显存带宽最高200GBs600GBs933GBs696GBs300GBs显存容量最高16GB24GB24GB48GB16GB数据传输速率-64GBs200GBs1125GBs32GBs资料来源英伟达官网华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读17计算机国产AIGPU性能持续升级国产替代未来可期目前国产AIGPU厂商主要包括阿里华为寒武纪天数智芯等随着国内厂商持续加强GPU研发产品力不断升级以华为昇腾910为例该款芯片采用7nm制程集成了超496亿个晶体管可以提供320TFLOPS的FP16计算速度或640TOPS的INT8算力略高于英伟达A100的FP16计算速度312TFLOPS不采用英伟达稀疏技术我们认为单纯从芯片算力性能来看部分国产芯片已经能够追赶海外主流芯片随着国产生态逐步打磨GPU性能提升有望推动国产化替代图表34国产主要AIGPU性能对比阿里平头哥寒武纪华为昇腾天数智芯型号含光800思元370思元290思元270昇腾310昇腾910天垓100智铠100架构平头哥自研架构MLUarch03MLUv02MLUv02HUAWEIDaVinciHUAWEIDaVinci通用GPU架构第二代通用GPU架构工艺12nm7nm7nm16nm12nm7nm7nm7nm晶体管数量170亿390亿460亿未披露未披露496亿未披露未披露算力INT16205TOPS128TOPS256TOPS64TOPS---INT8825TOPS256TOPS512TOPS128TOPS16TOPS640TOPS-384TOPSINT4---256TOPS----FP32-24TFLOPS-----24TFLOPSFP16-96TFLOPS--8TOPS320TFLOPS147TFLOPS96TFLOPS功耗155w150w350w70w8w310w--资料来源各公司官网华泰研究总结从ChatGPT到AI服务器1GPT模型需要什么样的算力ChatGPT采用单一大模型路线对底层算力的需求主要体现在训练和推理两个层面训练即使用大量数据集对模型做反复迭代计算推理即利用模型对输入信息进行处理并给出结果据IDC数据2021年中国人工智能服务器工作负载中576的负载用于推理424用于模型训练具体来看算力需求场景包括预训练Finetune以及日常运营根据我们的测算GPT-3175B模型需要的预训练算力约3640PFlops-dayChatGPT单月运营需要的算力约70347PFlops-day单月Finetune需要的算力至少为13504PFlops-day2GPT模型需要什么样的服务器我们认为服务器类型不断演化的动力来自计算架构的变化从服务器产业发展历程来看随着计算架构从单机到C-SC-E-S陆续演化出PC云计算边缘计算等服务器类型而在AI训练时代C-S架构的回归以及大规模并行计算需求又带来AI服务器的扩张对比传统服务器来看AI服务器由于采用GPU等加速卡更加擅长向量张量计算对于AI训练及推理场景的处理能力更强且采用多芯片组合架构单台服务器芯片成本也较高3GPT模型需要什么样的算力芯片GPT模型的训练和推理计算主要由AI服务器完成底层算力芯片主要包括CPUGPUFPGAASIC等常见的算力芯片组合如8xGPU2xCPU4xGPU2xCPU8xFPGA1xCPU4xFPGA1xCPU等据IDC2022年国内人工智能芯片市场中GPU芯片占据主要市场份额达890目前海外主流AIGPU芯片包括英伟达H100A100以及V100等4美国先进算力芯片出口限制对GPT产业的影响受美国先进算力芯片出口限制政策影响目前国内只能采购性能低于A100的AIGPU如英伟达A800系列等此外英伟达A系列T系列性能更低的前代版本尚且不受影响考虑到部分国产AIGPU如华为昇腾在FP16浮点计算性能上已经实现对英伟达A100的加速追赶未来随着国产生态打磨AIGPU国产替代有望加速免责声明和披露以及分析师声明是报告的一部分请务必一起阅读18计算机5AI服务器产业链相关公司有哪些1能够采购到海外高性能芯片的厂商浪潮信息等2采用海光寒武纪芯片的厂商中科曙光3采用华为昇腾芯片的厂商拓维信息等4底层芯片供应商海光信息寒武纪景嘉微等重点推荐公司浪潮信息000977CH买入目标价4406元随着国内各大互联网厂商相继布局ChatGPT类似产品对于大模型的训练需求或将带动底层算力需求快速增长我们认为算力需求逐步释放或将带动AI服务器放量公司作为国内AI服务器产业龙头有望凭借强大产品力实现23年营收高增长预计公司22-24年EPS为171216289元可比公司平均23E204xPEWind给予23E204xPE对应目标价4406元买入最新报告日期2023215风险提示宏观经济波动风险市场竞争加剧景嘉微300474CH买入目标价9674元随着ChatGPT在全球范围引发广泛讨论用户规模持续增长或将引领全球AI产业范式革命ChatGPT强大的底层语言能力来自AI大模型的加持而大模型训练又需要使用大量算力资源随着国内厂商相继布局或将带动国内GPU算力需求高增长国产替代背景下公司市场份额或将持续提升23年收入高增长可期预计公司22-24年EPS分别为070099139亿元采用分部估值法给予公司23年目标市值4397亿元对应目标价9674元买入最新报告日期2023210风险提示芯片原材料成本持续上涨下游景气度不及预期图表35重点推荐公司表收盘价目标价EPS元PE倍股票代码公司名称评级元元2022E2023E2024E2022E2023E2024E000977CH浪潮信息买入38254406171216289224177132300474CH景嘉微买入742396740700991391060750534注收盘价截至2023224表中预测及前文内容均来自华泰计算机团队最新报告资料来源Wind华泰研究预测免责声明和披露以及分析师声明是报告的一部分请务必一起阅读19计算机图表36提及公司表代码公司简称代码公司简称GOOGLUS谷歌300474CH景嘉微BIDUUS百度688256CH寒武纪BABAUS阿里巴巴002261CH拓维信息JDUS京东0092HK联想集团MSFTUS微软未上市新华三AMZNUS亚马逊未上市OpenAIINTCUS英特尔未上市华为NVDAUS英伟达未上市天数智芯688041CH海光信息资料来源Bloomberg华泰研究风险提示宏观经济波动若宏观经济波动产业变革及新技术的落地节奏或将受到影响宏观经济波动还可能对IT投资产生负面影响从而导致整体行业增长不及预期下游需求不及预期若下游数字化需求不及预期相关的数字化投入增长或慢于预期致使行业增长不及预期算力需求测算与实际不符目前ChatGPT所用模型相关数据披露较少基于模型体量进行的算力需求测算若低于实际需求可能导致AI服务器产业规模增速不及预期免责声明和披露以及分析师声明是报告的一部分请务必一起阅读20
 
Copyright © 2005 - 2021 Nxny.com All Rights Reserved 备案号:蜀ICP备15031742号-1