>> 中信证券-计算机行业“构筑中国科技基石”系列报告25-GPU:研究框架(100页)-230213
| 上传日期: |
2023/2/13 |
大小: |
6570KB |
| 格式: |
pdf 共102页 |
来源: |
中信证券 |
| 评级: |
-- |
作者: |
杨泽原,丁奇 |
| 行业名称: |
计算机 |
| 下载权限: |
此报告为加密报告 |
|
|
核心结论:GPU的核心竞争力在于架构等因素决定的性能先进性和计算生态壁垒。国内GPU厂商纷纷大力投入研发快速迭代架构,推动产业开放构建自主生态,加速追赶全球头部企业。国产替代需求持续释放叠加国际局势不确定性加剧,AI&数据中心、智能汽车、游戏等GPU需求有望高增,国产GPU迎来发展黄金期,我们看好国产GPU公司的发展与投资机遇。 理解GPU的核心:性能先进性+生态计算壁垒 GPU物理性能取决于微架构、制程、流处理器数量、核心频率等,其中微架构是核心点。我们认为微架构的快速创新迭代是GPU性能领先的前提,其图形渲染单元和通用计算单元设计向着“更多、更专、更智能”的方向优化迭代。根据应用场景来划分,数据中心要求强算力、高并发吞吐量;游戏业务要求浮点运算能力强、访存速度快;图形显示要求图显专业化、精细化等。 生态:GPU生态构筑通用计算极深壁垒,CUDA生态占据大部分市场,类CUDA生态蓬勃发展。GPU生态由上层算法库,中层接口、驱动、编译器和底层硬件架构三大部分基本构成。GPU研发难度在图形渲染硬件层面和通用计算软件生态层面,在IP、软件栈方面研发门槛较高,需要较长的积累,先发优势明显。CUDA生态从2006年推出至今,经过不断发展完善,几乎已在行业生态内处于垄断地位,目前ROCm等兼容Cuda的类计算生态蓬勃发展并处于快速推广阶段。 海外复盘:NVIDIA与AMD(ATI)的竞争贯穿GPU发展历程,架构创新升级和新兴AI等领域前瞻探索是领跑的关键 NVIDIA长期居于GPU市场领导地位,近年AMD凭借RDNA架构在游戏市场强势崛起。Verified Market Research数据显示,2022年全球独立GPU市场规模约448.3亿美元,NVIDIA和AMD的市场份额占比约为8:2。根据JPR数据,NVIDIA凭借自身性能领先和CUDA生态优势性始终占有GPU领域超50%的市场份额,数据中心业务更是全面领先,在游戏显卡领域,近年AMD凭借RDNA系列架构强势崛起。 NVIDIA先后与AMD等企业在性能方面竞争博弈,架构创新升级和新兴领域前瞻探索是领跑GPU行业的关键。NVIDIA凭借性能领先长期占据超五成市场份额,AMD(ATI)也曾因架构出色、性能惊艳实现反超。同时NVIDIA早在2006年前瞻性布局通用计算、构建CUDA生态,为如今AI&数据中心领域的全面领先构筑牢固的壁垒。NVIDIA积极布局异构芯片、汽车、元宇宙等新市场,寻找新的强有力业务增长点。 国内GPU市场:各应用场景市场广阔,国内厂商大有可为 需求端1—AI:数据中心和终端场景不断落地对计算芯片提出更多更高需求。新一轮AI对算力需求远超以往:ChatGPT类语言大模型底层是2017年出现的Transformer架构,该架构相比传统的CNN/RNN为基础的AI模型,参数量达到数千亿,对算力消耗巨大,对算力硬件有大量需求。甲子光年预测,中国AI芯片市场规模2023年达到557亿元。AI芯片可进一步细分为云端和终端,中国云端芯片市场规模较大,甲子光年预计2023年增长至384.6亿元,对应复合年增速到52.8%;终端芯片市场规模甲子光年预计2023年增长至173亿元,对应年复合增长率达62.2%,伴随各AI终端落地预计将保持较快增长速度。 需求端2—汽车:汽车智能化浪潮下域控制器GPU市场前景广阔。自动驾驶和智能座舱是智能汽车中具有广阔前景的方向。盖世汽车数据预计,2025年自动驾驶域控制器出货量将达到432万台,每台自动驾驶域控制器配备1-4片高性能计算GPU;智能座舱域控制器出货量达到528万台,绝大多数智能座舱域控制器配备1片GPU。自动驾驶技术不断提高和座舱进一步智能化拉动汽车GPU市场规模快速扩张。 需求端3—游戏:游戏玩家人数持续增长,游戏GPU市场稳中有升。Newzoo Expert数据显示全球游戏玩家人数在2021年已达到30.57亿人,且预计2020-2025年全球游戏玩家人数复合年增率为4.2%;游戏市场内,游戏机和PC两大主体出货量再创新高,游戏机三大巨头2021年出货量高达4008万台;2021年Q4全球PCGPU出货量(包括集成和独立显卡)高达11000万片。 投资建议: 产业逻辑:GPU的核心竞争力在于架构先进性能和生态丰富性,国产厂商正持续大力投入研发实现GPU架构创新升级和快速迭代,力争赶超国际领先水平;同时构建与主流适配良好的生态环境,打造自主开放的软硬件生态和信息产业体系。 投资建议:外部不确定因素叠加内部加速自主创新背景下,国产GPU厂商有望加速崛起。伴随政策大力扶持、国际科技贸易政策影响、国产厂商产品性能提升及生态逐步完善,国产GPU龙头正迎来关键发展机遇。1)推荐:海光信息(CPU+GPGPU)。建议关注景嘉微、寒武纪(电子覆盖)。2)一级市场(排名不分先后):关注壁仞科技、摩尔线程、沐曦、天数智芯、登临科技、燧原科技等。 风险因素:产业链安全风险;市场竞争加剧风险;商业需求不及预期风险;产品研发不及预期风险;国产替代进程不及预期风险;宏观经济环境风险
研究报告全文:计算机行业构筑中国科技基石系列报告25GPU研究框架100页中信证券研究部计算机团队杨泽原丁奇2023年2月13日请务必阅读末页的免责条款和声明核心观点核心结论GPU的核心竞争力在于架构等因素决定的性能先进性和计算生态壁垒国内GPU厂商纷纷大力投入研发快速迭代架构推动产业开放构建自主生态加速追赶全球头部企业国产替代需求持续释放叠加国际局势不确定性加剧AI数据中心智能汽车游戏等GPU需求有望高增国产GPU迎来发展黄金期我们看好国产GPU公司的发展与投资机遇理解GPU的核心性能先进性生态计算壁垒GPU物理性能取决于微架构制程流处理器数量核心频率等其中微架构是核心点我们认为微架构的快速创新迭代是GPU性能领先的前提其图形渲染单元和通用计算单元设计向着更多更专更智能的方向优化迭代根据应用场景来划分数据中心要求强算力高并发吞吐量游戏业务要求浮点运算能力强访存速度快图形显示要求图显专业化精细化等生态GPU生态构筑通用计算极深壁垒CUDA生态占据大部分市场类CUDA生态蓬勃发展GPU生态由上层算法库中层接口驱动编译器和底层硬件架构三大部分基本构成GPU研发难度在图形渲染硬件层面和通用计算软件生态层面在IP软件栈方面研发门槛较高需要较长的积累先发优势明显CUDA生态从2006年推出至今经过不断发展完善几乎已在行业生态内处于垄断地位目前ROCm等兼容Cuda的类计算生态蓬勃发展并处于快速推广阶段海外复盘NVIDIA与AMDATI的竞争贯穿GPU发展历程架构创新升级和新兴AI等领域前瞻探索是领跑的关键NVIDIA长期居于GPU市场领导地位近年AMD凭借RDNA架构在游戏市场强势崛起VerifiedMarketResearch数据显示2022年全球独立GPU市场规模约4483亿美元NVIDIA和AMD的市场份额占比约为82根据JPR数据NVIDIA凭借自身性能领先和CUDA生态优势性始终占有GPU领域超50的市场份额数据中心业务更是全面领先在游戏显卡领域近年AMD凭借RDNA系列架构强势崛起NVIDIA先后与AMD等企业在性能方面竞争博弈架构创新升级和新兴领域前瞻探索是领跑GPU行业的关键NVIDIA凭借性能领先长期占据超五成市场份额AMDATI也曾因架构出色性能惊艳实现反超同时NVIDIA早在2006年前瞻性布局通用计算构建CUDA生态2为如今AI数据中心领域的全面领先构筑牢固的壁垒NVIDIA积极布局异构芯片汽车元宇宙等新市场寻找新的强有力业务增长点核心观点国内GPU市场各应用场景市场广阔国内厂商大有可为需求端1AI数据中心和终端场景不断落地对计算芯片提出更多更高需求新一轮AI对算力需求远超以往ChatGPT类语言大模型底层是2017年出现的Transformer架构该架构相比传统的CNNRNN为基础的AI模型参数量达到数千亿对算力消耗巨大对算力硬件有大量需求甲子光年预测中国AI芯片市场规模2023年达到557亿元AI芯片可进一步细分为云端和终端中国云端芯片市场规模较大甲子光年预计2023年增长至3846亿元对应复合年增速到528终端芯片市场规模甲子光年预计2023年增长至173亿元对应年复合增长率达622伴随各AI终端落地预计将保持较快增长速度需求端2汽车汽车智能化浪潮下域控制器GPU市场前景广阔自动驾驶和智能座舱是智能汽车中具有广阔前景的方向盖世汽车数据预计2025年自动驾驶域控制器出货量将达到432万台每台自动驾驶域控制器配备1-4片高性能计算GPU智能座舱域控制器出货量达到528万台绝大多数智能座舱域控制器配备1片GPU自动驾驶技术不断提高和座舱进一步智能化拉动汽车GPU市场规模快速扩张需求端3游戏游戏玩家人数持续增长游戏GPU市场稳中有升NewzooExpert数据显示全球游戏玩家人数在2021年已达到3057亿人且预计2020-2025年全球游戏玩家人数复合年增率为42游戏市场内游戏机和PC两大主体出货量再创新高游戏机三大巨头2021年出货量高达4008万台2021年Q4全球PCGPU出货量包括集成和独立显卡高达11000万片投资建议产业逻辑GPU的核心竞争力在于架构先进性能和生态丰富性国产厂商正持续大力投入研发实现GPU架构创新升级和快速迭代力争赶超国际领先水平同时构建与主流适配良好的生态环境打造自主开放的软硬件生态和信息产业体系投资建议外部不确定因素叠加内部加速自主创新背景下国产GPU厂商有望加速崛起伴随政策大力扶持国际科技贸易政策影响国产厂商产品性能提升及生态逐步完善国产GPU龙头正迎来关键发展机遇1推荐海光信息CPUGPGPU建议关注景嘉微寒武纪电子覆盖2一级市场排名不分先后关注壁仞科技摩尔线程沐曦天数智芯登临科技燧原科技等风险因素产业链安全风险市场竞争加剧风险商业需求不及预期风险产品研发不及预期风险国产替代进程不及预期风险宏观经济3环境风险报告亮点与创新之处第一我们从性能和生态2个维度构建了GPU完整的研究体系1性能决定GPU是否高效其中微架构制程是影响GPU性能的核心要素2生态CUDA构筑通用计算坚固壁垒第二提出在评估GPU性能的指标的重要性上微架构制程流处理器数量核心频率对GPU性能影响较大我们详细梳理了GPU的微架构制程显存容量位宽带宽频率核心频率等各类性能参数及重要性程度并利用核心数核心频率2公式对性能算力进行量化揭示可用3DMarkMLPerf等GPU软件跑分进行相关性能测试评估第三详细拆解了NVIDIAFermi和Hopper两大典型微架构的具体硬件实现在顶点处理光栅化计算纹理贴图像素处理的图形渲染流水线上对Fermi架构进行了拆分在指令接收调度分配计算执行的通用计算流水线上对Hopper架构进行了简单易懂的描述并指明更多更专更智能等未来架构升级迭代的方向第四明晰了生态是构建通用计算壁垒的基石提出GPU研发难度在图形渲染硬件和通用计算软件生态层面在IP软件栈方面研发门槛较高需要较长的积累先发者优势明显CUDA生态从2006年推出至今经过不断发展完善几乎已在行业生态内处于垄断地位第五深度复盘NvidiaAMDATI的产品迭代和竞争发展史通过对NVIDIA长期保持领先和AMDATI反超进行总结得出结论架构创新升级和新兴领域前瞻探索是领跑GPU行业的关键第六梳理和测算了国内GPU在AI数据中心智能汽车游戏行业的市场空间和发展趋势4CONTENTS目录1理解GPU的核心性能生态2他山之石NvidiaAMD竞争启示架构创新升级和新兴领域前瞻探索是主旋律3国内市场GPU细分市场前景广阔国内厂商大有可为4风险因素5投资建议51理解GPU的核心性能生态IGPU计算机图形处理以及并行计算的核心II性能决定GPU是否高效其中微架构是GPU性能领先的关键III生态构筑通用计算壁垒611GPU定位计算机图形处理以及并行计算的核心GPU全称是GraphicProcessingUnit即图形处理单元是计算机显卡的核心GPU是计算机的图形处理以及并行计算内核它的主要功能可以分为1图形图像渲染计算GPU2作为运算协作处理器GPGPUGPU的功能主要集中于执行高度线程化相对简单的并行任务处理GPUvsGPGPUGPGPU全称通用GPU运用CUDA及对应开放标准的OpenCL实现通用计算功能运算能够辅助CPU进行非图形相关程序执行由GPU性能拓展至计算密集领域将GPU强大的并行运算能力运用于通用计算领域多侧重科学计算AI领域大数据处理通用计算物理计算加密货币生成等领域GPU内部架构GPU与GPGPU对比GPUGPGPU主要执行任务图形渲染并行计算图形渲染图形计算对于游多进行AI领域相关计算科学计算和通功能戏性能有关键影响用计算景嘉微摩尔线程象帝先壁仞沫曦登临天数智芯红山微国内主要公司芯动科技格兰菲励算深电子瀚博流微芯瞳绘智微资料来源NVIDIA官网资料来源搜狐十一号组织中信证券研究部711GPU分类应用于PC服务器移动端依据接入方式不同分为独立GPU和集成GPU1独立GPU大部分封装于独立显卡电路板上使用PCIE接口和特定显存不受空间和供电限制性能相对更好渲染画质更佳主要厂商包括AMDRadeon系列NVIDIAGeforce系列2集成GPU通常未拥有独立显存集成于CPU内部与CPU共同使用Die和系统内存节省空间占位和制作难度价格较低兼容性更佳且供电量少主要厂商包括IntelHD系列AMDAPU系列依据应用端不同分为PCGPU服务器GPU和移动GPU1PC端集成GPU主要运用于提高轻办公效率对性能要求较低独立GPU主要运用于图形设计提高图片制作清晰度以及3A游戏绘图渲染能力对性能要求较高2服务器端主要进行专业可视化处理AI训练AI推断的深度学习提高计算运行能力以及视频编解码等功能以独立GPU为主3移动端提高游戏体验提升游戏处理性能应用场景包括AR桌面云计算数据中心等受移动端功耗和体积限制一般为集成GPU独立GPU集成GPU主要厂商及产品主要厂商产品系列PCGPUNVIDIAIntelAMDXeLPTITANV服务器GPUNVIDIAAMDTeslaFireStream高通Imagination系列系列公版系移动苹果三星PowerVRAdrenoMaliGPUARM列麒麟华为联发科Exynos资料来源NVIDIA官网CSDNFinovyCloud中信证券研究部资料来源微信公众号GPUandComputing资料来源微信公众号GPUandComputing811GPU产业链设计制造封装GPU产业链主要包括三大环节设计制造和封装GPU整体商业模式包括三种IDM和FabFabless和FoundryIDM模式指将GPU产业链的三个环节整体化充分结合自主研发和外部代工集设计制造封装为一体公司垂直整合GPU整体产业链FabFabless充分发挥各企业比较优势仅负责芯片电路设计将产业链其他环节外包分散了GPU研发和生产的风险Foundry公司仅负责芯片制造环节不负责上游设计和下游封装可以同时为多家上游企业服务GPU产业链供给模式代表厂商芯片设计芯片制造封装测试供给模式代表国外厂商IDM英特尔三星TINVIDIAAppleAMDARMQualcommFabFabless华为海思MTKBroadcomFoundry台积电SMICUMCGlobalFoundries资料来源华经情报网各公司官网中信证券研究部资料来源IT智库eefocus中信证券研究部912GPU性能衡量GPU高效的指标性能是衡量GPU运行执行命令高效的指标GPU物理性能评估主要在于比较各硬件的物理参数评估GPU物理性能的参数主要包括微架构制程图形处理器数量流处理器数量显存容量位宽带宽频率核心频率我们认为评估GPU性能的指标依次为微架构制程流处理器数量核心频率显存带宽容量其他GPU性能参数性能指标含义微架构GPU的硬件电路设计构造方式制程GPU的制造工艺和设计规则代表不同电路特性通常以生产精度nm表示图形处理器单元包含了光栅单元ROP纹理单元TMU的数量数量越多可执行指令越多数量CUDA核数CUDA是执行函数的重要部件CUDA核数越多性能运行越好Tensor核数指张量处理单元的数量TensorCore核数越多性能越好核心频率指显示核心的工作频率能反映显示核心的性能优良显存容量显存容量越大GPU能够处理的数据量越大显存位宽指显存在单位时钟周期内所传送数据的位数位数越大瞬间传送数据量越大显存带宽等于显存频率显存位宽8与显存频率位宽成正比显存频率反映显存速度以MHz为衡量单位越高端的显存频率越高资料来源CSDNCharlesRenNVIDIA官网中信证券研究部1012GPU性能影响因素微架构制程核心频率微架构又称为微处理器体系结构是硬件电路结构用以实现指令执行制程指GPU集成电路的密集度在晶体管硬件数量一定的情况下更精细的制程能够减少功耗和发热现阶段GPU主流最先进工艺制程为5nm核心频率代表GPU显示核心处理图像频率大小工作频率能够反映显示核心的性能GPU微架构GPU制程资料来源阿里云官网资料来源半导体行业观察微信公众号1112GPU性能影响因素图形处理器单元数量CUDA核数Tensor核数图形处理器单元数量指GPU内部图形处理单元涵盖光栅单元ROP和纹理单元TMU等数量光栅单元ROP进行光线反射计算负责游戏中高分辨率高画质的效果生成纹理单元TMU能够对二进制的图形进行一系列翻转缩放变化再将其纹理传输至3D平面模型中CUDA核数作为GPU内部的流处理器是主要的计算单元CUDA核数越多GPU性能等级越高Tensor核数能够进行张量核加速GEMM计算以及加速卷积和递归神经网络运行Tensor核数越多在人工智能深度学习领域的性能越强GPUCUDACoreGPUTensorCore资料来源SHERLOCK资料来源NVIDIAA100TensorCoreGPUArchitecture白皮书1212GPU性能影响因素显存容量显存位宽显存频率显存带宽显存容量显存作为GPU核心部件用以临时存储未处理数据显存容量的大小对于GPU存储临时数据的多少起决定性作用在GPU核心性能能够提供充足支撑前提下越大的显存容量能够减少数据读取次数减少延迟出现显存位宽是GPU在单位时钟周期内传送数据的最大位数位数越大GPU的吞吐量越大显存频率显存数据传输的速度即显存工作频率通常以MHz为显存频率计数单位显存带宽显存带宽显存频率X显存位宽8为显存与显卡芯片间数据传输量显存频率显存带宽资料来源EXPreview资料来源NVIDIA官网1312微架构的先进性GPU性能的抓手微架构MicroArchitectureGPU的硬件电路设计构造方式微架构又称为微处理器体系结构是在图形函数和指令集条件下处理器中的执行方法某一特定指令集可以在不同微架构中执行但在运行过程中因设计目的不同而存在技术效果不同GPU微架构包括流处理器渲染核双精度浮点运算单元特殊运算单元流式多处理器纹理处理器图形处理器流处理器阵列GPU架构工作流程为VertexShader定点着色器建立图形骨架再通过算法转化进行光栅化计算进而进行纹理映射再由PixelShader像素着色器像素处理最终由ROP光栅化引擎输出不同微架构决定了GPU各方面性能的不同NVIDIA等国际GPU厂商均加大投入研发新架构作为提升竞争力的重要抓手微架构中各单元简介微架构工作流程名称功能流处理器SPGPU最基本单元顶点着色光栅生成像素着色光栅操作渲染核shader升级版本的流处理器用于顶点处理像素处理器器器双精度浮点运算单元仅用于双精度浮点运算SFU流式多处理器SM基本计算单元由SPDPSFU等构成纹理单元纹理处理器簇TPC由SM控制器多个SM和L1缓存构成光栅化处理单元ROPs对3D图形进行几何设置纹理和光栅处理几何处理光栅处理张量单元TensorCore专门用于矩阵乘积累加的高性能计算核心资料来源厦门大学许少聪中信证券研究部资料来源搜狐爱玩客iVankr中信证券研究部绘制1412微架构的先进性以Fermi架构为例总览Fermi核心微架构Fermi架构共含4个GPC16个SM512个CUDACore每32个CUDACore组成1个SM每个SM为垂直矩形条带核心性能晶体管数高达30亿个引入缓存单元合计1MB可同时执行线程指令流24576个使用并行内核全局分配逻辑支持与CPU并行传输15资料来源NVIDIA官网12微架构的先进性以Fermi架构为例GPC架构拆分FermiGPC核心微架构GPC为图形处理团簇是Fermi架构的组成核心负责顶点几何光栅化纹理和像素处理组成部分包括1个光栅引擎RasterEngine上部黄色部分4个SM单元矩形部分SM之间彼此独立可各自调度多个ThreadWraps到内部的图形渲染计算执行单元上运行资料来源中关村在线1612微架构的先进性以Fermi架构为例SM架构拆分FermiSM核心微架构SM全称StreamingMultiprocessorFermi架构下每个SM具有32个CUDACore组成部分包括2个WarpSchedulerDispatchUnit橙色部分分别位于两条lane上的32个CUDACore绿色部分1个registerfile-寄存器文件和L1cache浅蓝色部分16个LoadStoreunitsLDSTUnit支持各线程同时从CacheDRAM存取数据4个SpecialFunctionUnitsSFU用于计算sincos这类特殊指令17资料来源NVIDIA官网12微架构的先进性以Fermi图形渲染流水线为例指令接收Fermi核心微架构HostInterfaceGigaThreadEngineHostInterface黑色部分为主机接口图形渲染流水线中负责接收指令通过PCI-Express将GPU和CPU相连接并读取CPU指令再通过FrontEnd前端处理指令GigaThreadEngine橙色部分为全局调度器图形渲染流水线中负责将特定的数据从HostMemory中复制到Framebuffer中创建ThreadBlocks线程块再分配给各个彼此独立的SM线程调度器18资料来源NVIDIA官网中信证券研究部12微架构的先进性以Fermi图形渲染流水线为例顶点处理Fermi核心微架构单个CUDACore组成部分包括1个DispatchPort和1个OperandCollector1个FPUnit和1个INTUnit和ResultQueue在图形渲染流水线中Vertex-shader执行单元对GPU前端读取的图形信息进行顶点数据确定通过Vertex-shader建立3D图形框架19资料来源NVIDIA官网中信证券研究部12微架构的先进性以Fermi图形渲染流水线为例顶点处理Fermi核心微架构PolyMorphEngineViewportVertexFetchTessellatorTransformAttributeSetupStreamOutputPolyMorphEngine黄色部分多形体引擎是全球首款实现了可扩展几何学流水线的重要元件主要负责顶点拾取VertexFetch细分曲面Tessellation视口转换ViewportTransform属性设定AttributeSetup流输出StreamOutput五个方面的处理工作在图形渲染流水线中VertexFetch通过三角形索引取出三角形数据ViewportTransform负责模块处理已完成vertex-shader的所有指令进行裁剪三角形准备栅格化AttributeSetup确保经过插值后的vertex-shader数据在pixel-shader中的可读性20资料来源NVIDIA官网中信证券研究部
|
|