研报下载就选股票报告网
您好,欢迎来到股票分析报告网!登录   忘记密码   注册
>> 中信证券-半导体行业专题:ChatGPT对GPU算力的需求测算与相关分析-230216
上传日期:   2023/2/17 大小:   7839KB
格式:   pdf  共71页 来源:   中信证券
评级:   -- 作者:   徐涛,王子源,雷俊成
下载权限:   此报告为加密报告
技术差距:GPGPU的核心壁垒是高精度浮点计算及CUDA生态。从高精度浮点计算能力来看,国内GPU产品与国外产品的计算性能仍或有一代以上差距;在软件和生态层面与英伟达CUDA生态的差距则更为明显。
  AI计算GPU领域,国内壁仞科技发布的BR100产品在FP32单精度计算性能上实现超越NVIDIAA100芯片,但是不支持FP64双精度计算;天数智芯推出的天垓100的FP32单精度计算性能实现超越A100芯片,但是在INT8整数计算性能方面却低于A100;海光推出的DCU实现了FP64双精度浮点计算,但是其性能为A100的60%左右,大概相当于其4年前水平。因此,从高精度浮点计算能力来看,国内GPU产品与国外产品的计算性能仍或有一代以上差距。
  但是,GPU不仅在硬件上需要提升算力,软件层面对于GPU的应用和生态布局尤其重要,英伟达凭借CUDA构建生态壁垒占领全球GPU市场90%的份额。目前国内企业多采用开源的OpenCL进行自主生态建设,但这需要大量的时间进行布局;我们对比AMD从2013年开始建设GPU生态,近10年时间后用于通用计算的ROCm开放式软件平台才逐步有影响力,且还是在兼容CUDA的基础上。因此我们认为国内厂商在软件和生态层面与英伟达CUDA生态的差距较计算性能更为明显。
  虽然目前国内产品的计算性能和软件生态实力与国际厂商还有差距,但是,国内厂商依然在奋起直追,努力实现GPGPU的国产化突破。
  我们认为长久来看,美国对中国高端GPU的禁售令反而给国产GPGPU和AI芯片厂商带来快速发展的机会。
  短期来看,我们认为对高端通用计算GPU的禁令可能会影响英伟达和AMD的GPU产品在中国的销售,中国AI计算、超级计算和云计算产业进步受到一定的阻碍。可使用英伟达和AMD还没有被禁止的及国产厂商的中高计算性能CPU、GPU、ASIC芯片等替代。
  长期来看,国产CPU、GPU、AI芯片厂商受益于庞大的国内市场,叠加国内信创市场带来国产化需求增量,我们预期国内AI芯片的国产化比例将显著提升,借此机会进行产品升级,逐渐达到国际先进水平,突破封锁。
  对于国内厂商,建议重点关注实现自主创新,打造自主生态体系,打磨产品实现稳定供货的公司。
  重点关注能够实现GPU领域的自主创新,实现架构、计算核、指令集及基础软件栈的全自研的设计公司。
  同时,不止成功点亮,要能满足测试、客户适配、稳定供货等一系列要求,成功量产并实现规模应用,实现GPGPU的国产替代。
  建议关注:
  国内企业:1)芯片:龙芯中科(国内PCCPU龙头,自主研发GPGPU产品)、海光信息(国内服务器CPU龙头,推出深度计算处理器DCU)、景嘉微(国内图形渲染GPU龙头)、寒武纪(国内ASIC芯片龙头)、澜起科技(国内服务器内存接口芯片龙头);2)PCB:胜宏科技、兴森科技、沪电股份;3)先进封装:通富微电、甬矽电子、长电科技、长川科技等。
  海外企业:英伟达(全球GPU龙头)、AMD(全球CPU/GPU领先厂商)、英特尔(全球CPU龙头)、美光(全球存储芯片龙头)。
  风险因素:用户拓展不及预期风险,AI技术及新产品开发发展不及预期风险,外部制裁加剧风险,宏观经济需求下行风
研究报告全文:半导体行业专题ChatGPT对GPU算力的需求测算与相关分析中信证券研究部雷俊成王子源徐涛杨泽原2023年2月16日核心观点单个大模型可带来2万GPU销售量搜索引擎带来成倍空间市场规模相关参数假设核心观点1短期内GPU增量与市场规模参考OpenAI算法假设每日1亿用户每人进行10条交互每A100单卡算力195TFLOPSs个问题的回答长度为50词算力利用率30则单个大语言模型LLM的日常需求有望带日常算力利用率30依据经验来213万片A100的增量对应市场规模213亿美元假设有5家大企业推出此类LLM则总增量为107片A100对应市场规模107亿美元GPU单价1万美元A1002短期服务器增量与市场规模单个服务器包含8个GPU因此单个LLM带来2669台服务器需每台服务器搭载GPU数量8求对应市场规模339亿美元5家大企业共需要13345台对应市场规模20亿美元3长期市场空间参考谷歌若每日搜访问30亿次需要10674万张A100对应133万台服服务器单价15万美元DGXStationA100务器DGXA100带来市场空间200亿美元做LLM模型的企业数量5BAT华为字节关键中间变量GPU与服务器增量短期国内GPU服务器增量市场规模远期GPU增量空间1亿用户所需GPU数量21348A1001亿用户带来国内GPU总市场规模213亿美元谷歌LLM所需GPU数量1067415A100近期单日交互训练总算力108E10TFLOPS一个LLM模型所需GPU数量21348A100远期总算力需求54E11TFLOPSA100单卡算力195Ts算力利用率30GPU单价1万美元A100A100单卡算力195TFLOPSs算力利用率301亿用户所需服务器数量2669DGXA1001亿用户带来国内服务器市场规模339亿美元谷歌LLM所需服务器数量133427GPU8一个LLM模型所需GPU数量21348A100一个LLM所需服务器数量2669每台服务器搭载GPU数量8服务器单价15万美元A100注远期由于更高算力的GPU出现或更高效的计算5家企业对应107万片A100133万台服务器5家企业对应107亿美元GPU20亿美元服务器方式对应市场空间可能变化资料来源RaconteurOpenAILanguageModelsareFew-ShotLearnersNVIDIA官网Amazon中信证券研究部1核心观点技术差距GPGPU的核心壁垒是高精度浮点计算及CUDA生态从高精度浮点计算能力来看国内GPU产品与国外产品的计算性能仍或有一代以上差距在软件和生态层面与英伟达CUDA生态的差距则更为明显AI计算GPU领域国内壁仞科技发布的BR100产品在FP32单精度计算性能上实现超越NVIDIAA100芯片但是不支持FP64双精度计算天数智芯推出的天垓100的FP32单精度计算性能实现超越A100芯片但是在INT8整数计算性能方面却低于A100海光推出的DCU实现了FP64双精度浮点计算但是其性能为A100的60左右大概相当于其4年前水平因此从高精度浮点计算能力来看国内GPU产品与国外产品的计算性能仍或有一代以上差距但是GPU不仅在硬件上需要提升算力软件层面对于GPU的应用和生态布局尤其重要英伟达凭借CUDA构建生态壁垒占领全球GPU市场90的份额目前国内企业多采用开源的OpenCL进行自主生态建设但这需要大量的时间进行布局我们对比AMD从2013年开始建设GPU生态近10年时间后用于通用计算的ROCm开放式软件平台才逐步有影响力且还是在兼容CUDA的基础上因此我们认为国内厂商在软件和生态层面与英伟达CUDA生态的差距较计算性能更为明显虽然目前国内产品的计算性能和软件生态实力与国际厂商还有差距但是国内厂商依然在奋起直追努力实现GPGPU的国产化突破我们认为长久来看美国对中国高端GPU的禁售令反而给国产GPGPU和AI芯片厂商带来快速发展的机会短期来看我们认为对高端通用计算GPU的禁令可能会影响英伟达和AMD的GPU产品在中国的销售中国AI计算超级计算和云计算产业进步受到一定的阻碍可使用英伟达和AMD还没有被禁止的及国产厂商的中高计算性能CPUGPUASIC芯片等替代长期来看国产CPUGPUAI芯片厂商受益于庞大的国内市场叠加国内信创市场带来国产化需求增量我们预期国内AI芯片的国产化比例将显著提升借此机会进行产品升级逐渐达到国际先进水平突破封锁对于国内厂商建议重点关注实现自主创新打造自主生态体系打磨产品实现稳定供货的公司重点关注能够实现GPU领域的自主创新实现架构计算核指令集及基础软件栈的全自研的设计公司同时不止成功点亮要能满足测试客户适配稳定供货等一系列要求成功量产并实现规模应用实现GPGPU的国产替代建议关注国内企业1芯片龙芯中科国内PCCPU龙头自主研发GPGPU产品海光信息国内服务器CPU龙头推出深度计算处理器DCU景嘉微国内图形渲染GPU龙头寒武纪国内ASIC芯片龙头澜起科技国内服务器内存接口芯片龙头2PCB胜宏科技兴森科技沪电股份3先进封装通富微电甬矽电子长电科技长川科技等海外企业英伟达全球GPU龙头AMD全球CPUGPU领先厂商英特尔全球CPU龙头美光全球存储芯片龙头风险因素用户拓展不及预期风险AI技术及新产品开发发展不及预期风险外部制裁加剧风险宏观经济需求下行风险2相关上市公司ChatGPT相关上市公司及近期涨跌幅截至2023年2月14日市值2023年初分类公司名代码ChatGPT2022年11月30日上线至今涨跌幅亿元人民币至今涨跌幅龙芯中科688047SH488784943海光信息688041SH1235852833CPU中科曙光603019SH425882431英特尔INTCO804941-49AMDAMDO913463728景嘉微300474SZ381514554GPU英伟达NVDAO36527902949寒武纪-U688256SH342623557AI芯片澜起科技688008SH71346-70MobileyeMBLYO2343445022紫光国微002049SZ103270-8-8FPGA复旦微电688385SH44324-9-1安路科技-U688107SH283431310DPU左江科技300799SZ1362542IP芯原股份-U688521SH308663041瑞芯微603893SH368621428AISoC晶晨股份688099SH348411220富瀚微300613SZ152061832兴森科技002436SZ20511125胜宏科技300476SZ155632839PCB生益电子688183SH94001121沪电股份002463SZ294932331长电科技600584SH513581525通富微电002156SZ334582834先进封装甬矽电子688362SH11276-127华峰测控688200SH276322310长川科技300604SZ28965-178存储美光MUO4470815203资料来源Wind中信证券研究部CONTENTS目录1ChatGPT是什么OpenAI开发的聊天机器人拥有创造能力2GPGPU是什么3GPGPU的壁垒是什么4GPGPU主要应用场景5国内GPGPU发展水平411生成式AI实现创造部分领域的能力超越人类的基准水平不同于分析式AI只能做些分析型或机械式的认知计算生成式AI可以创造有意义并具备美感的东西而且在某些情况下其生成的结果可能比人类手工创造的还要好机器可以分析数据并针对不同用例需求找到相应的规律且在不断迭代变得越来越聪明这种机器被称为分析式人工智能AnalyticalAI或者传统AI机器并非如之前那样仅分析已有的数据而是创造了全新的东西这一新型的AI被称为生成式人工智能GenerativeAI2017年谷歌推出一种用于自然语言理解的新型神经网络架构Transformers模型不但能生成质量上乘的语言模型同时具有更高的可并行性大大降低了所需的训练时间这些小样本学习模型可以更容易地针对特定领域做定制修改2015-2020年用于训练这些模型的计算量增加了6个数量级其表现在手写语音和图像识别阅读理解和语言理解方面超过了人类的基准水平随着AI模型逐渐发展壮大已经开始超越人类的基准水平生成式AI的应用格局5资料来源机器学习三个时代的计算趋势Sevilla等人arXiv2022生成式AI充满创造力的资料来源生成式AI充满创造力的新世界红杉汇内参微信公众号新世界红杉汇内参微信公众号12预训练模型大模型提高准确率2018年开始步入快车道预训练模型使得模型的训练可以被复用大幅降低训练成本但是前期需要大量的数据进行预训练预训练模型是一种迁移学习的应用对句子每一个成员的上下文进行相关的表示通过隐式的方式完成了语法语义知识的学习预训练模型通过微调的方式具备很强的扩展性每次扩展到新场景时只需要针对这个场景的特定标注数据进行定向的学习便可以快速应用2018年以来国内外超大规模预训练模型参数指标不断创出新高大模型已成为行业巨头发力的一个方向谷歌百度微软等国内外科技巨头纷纷投入大量人力财力相继推出各自的巨量模型国外厂商自2021年开始进入军备竞赛阶段2018年谷歌提出3亿参数BERT模型大规模预训练模型开始逐渐走进人们的视野成为人工智能领域的一大焦点2019年OpenAI推出15亿参数的GPT-2能够生成连贯的文本段落做到初步的阅读理解机器翻译等紧接着英伟达推出83亿参数的Megatron-LM谷歌推出110亿参数的T5微软推出170亿参数的图灵Turing-NLG2020年OpenAI以1750亿参数的GPT-3直接将参数规模提高到千亿级别2021年1月谷歌推出的SwitchTransformer模型以高达16万亿的参数量打破了GPT-3作为最大AI模型的统治地位成为史上首个万亿级语言模型2020年10月微软和英伟达联手发布了5300亿参数的Megatron-Turing自然语言生成模型MT-NLG2021年12月谷歌还提出了12万亿参数的通用稀疏语言模型GLaM在7项小样本学习领域的性能超过GPT-32018年以来LLM算法大规模语言算法成长的时间线近年来超大规模预训练模型参数增长趋势6资料来源XavierAmatriain陈巍谈芯知乎资料来源LargeLanguageModelsANewMooresLawJulienSimonHuggingFace13ChatGPT基于OpenAI推出的深度学习模型GPT打造成为迄今增长最快的消费应用程序ChatGPTChatGenerativePre-trainedTransformer聊天生成式预训练器是OpenAI开发的聊天机器人于2022年11月推出它建立在OpenAI开发的GPT-3大型语言模型之上并使用监督学习和强化学习人类监督技术进行了微调虽然聊天机器人的核心功能是模仿人类谈话者但ChatGPT是多功能的例如它可以编写和调试计算机程序创作音乐电视剧童话故事和学生论文回答测试问题有时根据测试的不同答题水平要高于平均水平写诗和歌词模拟Linux系统模拟整个聊天室等ChatGPT背后的公司为OpenAI成立于2015年由特斯拉CEO埃隆马斯克PayPal联合创始人彼得蒂尔Linkedin创始人里德霍夫曼创业孵化器YCombinator总裁阿尔特曼SamAltman等人出资10亿美元创立OpenAI的诞生旨在开发通用人工智能AGI并造福人类ChatGPT中的GPTGenerativePre-trainedTransformer是OpenAI推出的深度学习模型ChatGPT就是基于GPT-35版本的聊天机器人截至2022年12月4日OpenAI估计ChatGPT用户已经超过100万2023年1月ChatGPT用户超过1亿成为迄今增长最快的消费应用程序2023年2月OpenAI开始接受美国客户注册一项名为ChatGPTPlus的高级服务每月收费20美元此外OpenAI正计划推出一个每月42美元的ChatGPT专业计划当需求较低时可以免费使用GPT系列模型的数据集训练规模ChatGPT与GPT1-3的技术对比7资料来源TheGPT-3languagemodelrevolutionorevolutionHelloFuture资料来源6个问题用专业视角带你全方位了解ChatGPT甲子光年微信公众号14算力需求计算资源每34个月翻一倍投入资金指数级增长OpenAI预计人工智能科学研究要想取得突破所需要消耗的计算资源每34个月就要翻一倍资金也需要通过指数级增长获得匹配在算力方面GPT-35在微软AzureAI超算基础设施由V100GPU组成的高带宽集群上进行训练总算力消耗约3640PF-days即每秒一千万亿次计算运行3640天在大数据方面GPT-2用于训练的数据取自于Reddit上高赞的文章数据集共有约800万篇文章累计体积约40GGPT-3模型的神经网络是在超过45TB的文本上进行训练的数据相当于整个维基百科英文版的160倍按照量子位给出的数据将一个大型语言模型LLM训练到GPT-3级的成本高达460万美元最新的GPT35在训练中使用了微软专门建设的AI计算系统由1万个英伟达V100GPU组成的高性能网络集群总算力消耗约3640PF-daysPD即假如每秒计算一千万亿1020次需要计算3640天采购一片英伟达顶级GPU成本为8万元GPU服务器成本通常超过40万元对于ChatGPT而言支撑其算力基础设施至少需要上万颗英伟达GPUA100一次模型训练成本超过1200万美元预训练模型参数及所需要的算力情况目前SOTA模型训练的浮点数运算量以FLOPs为衡量单位资料来源AI算力的阿喀琉斯之踵内存墙AmirGholamiOneFlow社区注蓝线上的是CV资料来源做AI做的事儿微信公众号6个问题用专业视角带你全方位了解ChatGPT甲子光年微NLP和语音模型模型运算量平均每两年翻15倍红线上的是Transformer的模型模型运算量平均8信公众号每两年翻750倍而灰线则标志摩尔定律下内存硬件大小的增长平均每两年翻2倍15产业竞争训练成本逐渐降低国内外科技巨头加速布局根据财富杂志报道的数据2022年OpenAI的收入为3000万美元但净亏损预计为5445亿美元公司预测其2023年收入2亿美元2024年收入预计超过10亿美元投入上公司CEO阿尔特曼在推特上回答马斯克的问题时表示在用户与ChatGPT的每次交互中OpenAI花费的计算成本为个位数美分随着ChatGPT变得流行每月的计算成本可能达到数百万美元创造价值上ARK认为AI工具的发展将不断提高生产力到2030年人工智能或将知识工作者的生产力提高4倍以上将软件工程师的效率提高10倍以上创造约200万亿美元的价值大模型高昂的训练成本让普通创业公司难以为继因此参与者基本都是科技巨头在国内科技公司中阿里巴巴达摩院在2020年推出了M6大模型百度在2021年推出了文心大模型腾讯在2022年推出了混元AI大模型这些模型不仅在参数量上达到了千亿级别而且数据集规模也高达TB级别想要完成这些大模型的训练就至少需要投入超过1000PetaFlops-day的计算资源大模型计算布局呈爆发增长态势目前全球大模型计算布局情况资料来源6个问题用专业视角带你全方位了解ChatGPT甲子光年微信公众号注1清华资料来源XavierAmatriain陈巍谈芯知乎大学和阿里达摩院等合作提出2上海人工智能实验室联合商汤科技香港中文大学上海交通大学9发布3Pflops-day为算力单位意为一天可以进行约1020运算16ChatGPT带来的算力GPU需求测算原理预训练需求分析算力消耗测算原理训练总计算训练总计算模型参数量训练词数单个词语消耗计算反向传播后正向计算时每个词模型核心原理量PF日量flops百万十亿的总计算次数的算力消耗倍数消耗浮点计算次数每个训练词都会导致模型所有参数的更新且每个训练词BERT-Base189164E20109250632都需要消耗固定的浮点算力因此BERT-Large616533E20355250632总算力需求模型参数量训练词数每个词的运算量RoBERTa-Base1736150E211252000632测算过程RoBERTa-Large4931426E213552000632表格从右向左计算1最基础的原子运算1个词更新1个参数需要计GPT-3Small260225E20125300632算1次乘法和1次加法共2次浮点运算GPT-3Medium742641E203563006322如果是训练则需要反向传播算法反向传播需要的GPT-3Large1583137E21760300632运算次数是正向传播2倍故训练时每个词的运算量GPT-3XL2750238E211320300632是推理情况的3倍需要消耗6次浮点运算2次运GPT-327B5521477E212650300632算算力消耗倍数3GPT-367B13875120E2266603006323按照核心公式求解GPT-3的总算力消耗为1746E11GPT-313B26771231E22128503006323E116314E23FLOPSGPT-3175B363750314E231746003006324进行单位换算314E23FLOPS3640PF日资料来源OpenAILanguageModelsareFew-ShotLearners附录D中信证券研究部注为简单起见本测算方法忽略了Attention计算的算力消耗该部分占总算力消耗的10以下3000亿训练词如何构成预训练算力消耗及GPU需求测算数据集词数十亿训练轮数权重占比假设1ChatGPT使用的数据集与GPT-3175B模型相同测算数据来源网页爬虫41004460假设2ChatGPT使用FP32数据格式完成训练1总计算量来自上表WebText2192922OpenAI论文2GPU算力来自NVIDIABooks112198总计算量GPU数量GPU算力计算用时Books2550438官网维基百科33433计算用时取决于语言模型开发者试图在多不同数据集的数据质量和重要度不一致因此长时间内完成训练重要度和质量更高的数据集会进行更多轮次的GPU数量总计算量GPU算力计算用时左侧求得GPU数量与右侧训练从而提升其权重占比计算用时一一对应例将每个数据集的词数乘以训练轮数加在一起1865387723314E23195TFLOPSs1天1个月如一个月完成训练需要即得到3000亿词的训练数据38612574FLOPSA100FP322个月3个月7723张A100GPU10资料来源OpenAILanguageModelsareFew-ShotLearnersNVIDIA官网中信证券研究部17ChatGPT带来的算力需求日常交互日常训练需求分析测算核心假设阶段1ChatGPTbing日常算力需求ChatGPT月度访问量百万次单个词语计算核心假设1-算力需求影响交互计算量总计算量参数量词数单个词计算量700次数616因素模型参数量175B600和单个词计算量训练6105E10T175B300亿2推理500次推理2次不变算单个词语计算400力需求变化主要取决于词训练计算量总计算量参数量词数单个词计算量次数266数变化300314E8T175B906亿6训练词数用户访问词数200每次访问的提问数量默阶段1假设100认10每个回答包含01527每日用户访问量1亿根据SimilarWeb统计2023年1月ChatGPT注册用0的词数默认50词数户1亿单月访问量616亿月底日访问2800万次bing日访问约4000Nov-22Dec-22Jan-23与用户访问数成正比万次二者结合后短期有望迅速增长资料来源SimilarWeb中信证券研究部核心假设2-算力需求分配阶段2LLMGoogle日常算力需求GoogleBing百度月度访问量亿次训练采用的数据占当日新单个词语计算交互计算量总计算量参数量词数单个词计算量GoogleBing百度生成数据的1次数1000假设依据根据OpenAI论524E11T15000亿2推理864883175B900851文LanguageModelsare800GPT-单个词语计算700Few-ShotLearners训练计算量总计算量参数量词数单个词计算量3采用的数据集清洗前大次数600500小45TB清洗后大小157E10T175B150亿6训练400570GB清洗前后存在2个300200数量级的差距因此可以阶段2假设100125012491149认为每天新生成的数据有Bing有望逐渐占据更多市场份额市场空间参考谷歌根据0Nov-22Dec-22Jan-231用于训练SimilarWeb谷歌月访问量约900亿次每日用户访问30亿次资料来源SimilarWeb中信证券研究部资料来源SimilarWebOpenAILanguageModelsareFew-ShotLearners中信证券研究部11CONTENTS目录1ChatGPT是什么2GPGPU是什么通用计算GPU算力强大应用于加速计算场景3GPGPU的壁垒是什么4GPGPU主要应用场景5国内GPGPU水平1221GPU是什么GPUGraphicsProcessingUnit图形处理器是一种专门在个人电脑工作站游戏机和一些移动设备如平板电脑智能手机等上做图像加速和通用计算工作的微处理器GPU是英伟达公司在1999年8月发表NVIDIAGeForce256GeForce256绘图处理芯片时首先提出的概念GPU应用场景图形加速此时GPU内部的顶点渲染像素渲染以及几何渲染操作都可以通过流处理器完成通用计算计算通常采用CPUGPU异构模式由CPU负责执行复杂逻辑处理和事务处理等不适合数据并行的计算由GPU负责计算密集型的大规模数据并行计算GPU与CPU对比CPU的逻辑运算单元较少控制器Control和缓存Cache占比较大GPU的逻辑运算单元小而多控制器功能简单缓存也较少GPU单个运算单元ALU处理能力弱于CPU但是数量众多的ALU可以同时工作当面对高强度并行计算时其性能要优于CPUGPU可以利用多个ALU来做并行计算而CPU只能按照顺序进行串行计算同样运行3000次的简单运算CPU需要3000个时钟周期而配有3000个ALU的GPU运行只需要1个时钟周期GPU的主要分类CPU与GPU的芯片资源分布示例类型应用场景特点代表产品封装在独立的电路独立性能高功耗NVIDIAGeforce系列板专用的显存显大系列GPU示储存器AMDRadeonIntelHD系列集成内嵌到主板上共享性能中等功AMDAPU系列GPU系统内存耗中等苹果M芯片GPU系列嵌在ImaginationPowerVR移动端SoCSystem高通系列中共享性能低功耗AdreonOnChip低系列GPU系统内存AMDMali苹果A芯片GPU13资料来源中信证券研究部资料来源CUDA编程手册系列第一章CUDA简介英伟达技术博客22从GPU到GPGPU的跨越英伟达CUDA降低开发门槛GPGPUgeneral-purposeGPU通用计算图形处理器利用图形处理器进行非图形渲染的高性能计算为了进一步专注通用计算GPGPU去掉或减弱GPU的图形显示部分能力将其余部分全部投入通用计算实现处理人工智能专业计算等加速应用2007年6月NVIDIA推出了CUDAComputerUnifiedDeviceArchitecture计算统一设备结构CUDA是一种将GPU作为数据并行计算设备的软硬件体系在CUDA的架构中不再像过去GPU架构那样将通用计算映射到图形API中对于开发者来说CUDA的开发门槛大大降低了CUDA的编程语言基于标准C因此任何有C语言基础的用户都很容易地开发CUDA的应用程序由于这些特性CUDA在推出后迅速发展被广泛应用于石油勘测天文计算流体力学模拟分子动力学仿真生物计算图像处理音视频编解码等领域GPU并不是一个独立运行的计算平台而是需要与CPU协同工作可以看成是CPU的协处理器GPU与CPU通过PCIe总线连接在一起来协同工作因此GPU并行计算实际上指的是基于CPUGPU的异构计算架构GPGPU的架构与生态基于CPUGPU的异构计算应用执行逻辑资料来源GPU与GPGPU泛淡夕阳叹CSDN资料来源PreofessionalCUDACProgramming14232020年GPU全球市场254亿美元独显市场英伟达份额约80根据VerifiedMarketResearch数据2020年全球GPU市场规模为2541亿美元约17172亿人民币随着需求的不断增长预计到2028年这一数据将达到24651亿美元约167万亿人民币年复合增长率为3282市场研究机构JonPeddieResearch的最新数据显示2022年二季度全球独立GPU市场出货量同比增长24至1040万台但是较一季度环比则下滑了226从市场份额来看英伟达的独立GPU的市场份额从22Q1的75增加到22Q2的796保持了与去年同期相当的份额AMD和Intel则分别占比201据VerifiedMarketResearch数据2020年中国大陆的独立GPU市场规模为4739亿美元预计2027年将超过34557亿美元GPU全球市场规模亿美元全球独显GPU市场各厂商份额占比2000NVIDIAINTELAMD18001001600179019201924201400801112007010006080050836004081808175793040020200100020202021E2022E2023E2024E2025E2026E2027E21Q121Q221Q321Q422Q122Q2资料来源VerifiedMarketResearch含预测中信证券研究部资料来源JonPeddieResearch中信证券研究部15232020年全球AI芯片市场规模约为175亿美元英伟达份额超80伴随着人工智能应用场景的多元化新算法新模型不断涌现模型中的参数数量呈指数级增长对算力的需求越来越大OpenAI预估算力需求每35个月翻一倍每年近10倍根据WSTS数据2020年全球人工智能芯片市场规模约为175亿美元随着人工智能技术日趋成熟数字化基础设施不断完善人工智能商业化应用将加落地推动AI芯片市场高速增长预计2025年全球人工智能芯片市场规模将达到726亿美元未来随着自动驾驶级别的不断提高对于AI芯片的需求正不断增长L2和L3级汽车都会用AI芯片来取代分立的MCU芯片进行自动驾驶相关的计算工作WSTS预计AI芯片的数量将从2020年的899万套增长至2025年的2380万套据IDC数据2021年中国加速卡出货量超过80万片其中英伟达占据超过80市场份额此外其他市场参与者还包括AMD百度寒武纪燧原科技新华三华为Intel和赛灵思等2020年的采购主要集中在搭载V100V100SA100和T4的加速服务器上此外英伟达的A10A30A40和Atlas系列加速卡在部分领域已经开始使用全球AI芯片GPUFPGAASIC等的市场规模全球AI芯片销售数量及预测万套全球AI芯片市场规模亿美元YoY全球AI芯片销售数量万套YoY2380800726702500407003483559163060188851920006001640304865105014332615001500253954012124002018229130100089930026014415115235175202001011015250010010500002019202020212022E2023E2024E2025E202020212022E2023E2024E2025E资料来源WSTS含预测中信证券研究部资料来源WSTS含预测中信证券研究部1623中国市场GPU服务器在AI服务器中占比92占主导地位据IDC数据2021年全球AI服务器市场规模达156亿美元同比增长391IDC预测2025年全球AI服务器市场规模将达3179亿美元年复合增长率为19IDC报告显示2021年中国加速服务器市场规模达到539亿美元约3503亿人民币同比686预计到2026年将达到1034亿美元年复合增长率为19占全球整体服务器市场近三成根据IDC数据2021年GPU服务器以919的份额占国内加速服务器市场的主导地位NPUASIC和FPGA等非GPU加速服务器占比81IDC预计2024年中国GPU服务器市场规模将达到64亿美元从行业的角度看互联网依然是最大的采购行业占整体加速服务器市场近60的份额2021年用于推理工作负载的加速服务器占比已经达到576预计到2026年将超过60全球及中国AI服务器市场规模2021年中国AI服务器芯片占比情况中国市场规模亿美元全球市场规模亿美元GPUNPUASICFPGA350156303300250CAGR19200150CAGR1910050919020212025E资料来源IDC含预测中信证券研究部注这里统计的AI服务器包括高性能计算资料来源IDC中信证券研究部1723预计2021年中国GPGPU市场规模为1498亿元其中AI推理AI训练高性能计算分别为93547191亿元市场研究机构VerifiedMarketResearch预测到2025年中国GPGPU芯片板卡的市场规模将达到458亿元是2019年86亿元的5倍多2019-2025年的年复合增长率为32其中按行业来分到2025年预计互联网及云数据中心需求为228亿元安防与政府数据中心为142亿元行业AI应用为37亿元高性能计算为28亿元按应用场景来分到2025年预计人工智能推理人工智能训练高性能计算需求分别为28614428亿元占比分别为62431461我们预计2021年中国GPGPU市场规模为1498亿元其中人工智能推理人工智能训练高性能计算分别为93547191亿元20222026年中国加速计算服务器市场预测单位百万美元GPGPU市场按应用场景拆分高性能计算6人工智能训练31人工智能推理63资料来源IDC预测2022-2026年均为预测资料来源VerifiedMarketResearch中信证券研究部1824GPGPU市场英伟达一家独大全球市场份额约90GPGPU是一个门槛极高的领域全球市场基本上被英伟达和AMD两家国际龙头掌控根据ArkInvest的数据2021年英伟达占据了全球数据加速器市场90的份额根据IDC数据2020年的GPGPU采购主要集中在搭载V100V100SA100和T4的加速服务器上此外Nvidia的A10A30A40和Atlas系列加速卡在部分领域已经开始使用2021年中国加速卡出货量超过80万片其中英伟达占据超过80市场份额根据天数智芯数据英伟达在2021年的中国的云端AI训练芯片市场份额达到90其中某一款产品占整个市场的50另一款产品占25英伟达历代GPGPU产品的详细信息英伟达历代GPGPU产品的FP32算力水平FP32算力GFLOPS70000600005000040000300002000010000020102011201220132014201520162017201820192020202120222023资料来源智东西资料来源英伟达官网中信证券研究部19
 
Copyright © 2005 - 2021 Nxny.com All Rights Reserved 备案号:蜀ICP备15031742号-1