数字经济建设框架下,AI与自动驾驶将贡献算力需求全新增量
数字经济建设、AI大模型、智能驾驶成为开启智能时代的确定性研究方向。其中,数字经济建设搭建数字化布局整体框架,并提供政策支持;AI大模型及智能驾驶率先落地,有望成为拉动算力需求的核心驱动力。 GPU凭借高并发计算能力及灵活拓展性成为当下算力主流解决方案 首先,神经网络算法数据要求量大,并行计算程度高,与GPU高并行计算能力、高内存带宽相适配。GPU较CPU具备更多的算术逻辑单元、控制单元与内存缓存,其SIMD架构与深度学习算法需求更吻合;其次GPU拥有相对较优的性能及灵活性。常用的计算平台包括CPU、FPGA、GPU、DSA以及ASIC,一般情况下随着芯片性能的提升,其灵活性会逐渐下降。ASIC、DSA设计成本高、周期长,其灵活性难以满足应用层及宏架构趋势的需求,而GPU拥有包括CUDA、OpenCL在内的平台技术持续赋能,性能提升潜力大、应用拓展力强。 边缘及终端设备有望开启AI智算元年,数据中心及车端持续拉升算力需求 GPU下游目前主要应用于移动端、数据中心服务器以及车规级芯片。其中,移动端应用又可以分为PCGPU、手机GPU,主要用于加速图形处理,以提高计算机游戏的图像质量及性能,随着深度学习及人工智能发展的需要,移动端GPU也可以用于手机端加速深度学习、计算机视觉和自然语言处理算法等;数据中心服务器又可以分为高性能计算服务器与智能计算服务器,由于GPU具有高并发的计算能力,因此被广泛的用于数据中心建设;在汽车领域,GPU主要应用于车端及其配套设施智能芯片,负责处理来自摄像头、普通雷达、激光雷达等传感器数据,实现智能驾驶。 供给驱动市场,产品技术及产能是核心竞争力 英伟达市场份额独占鳌头,国际呈现三强格局,国内厂商加速布局。英伟达凭借技术及产能优势,在移动端、AI服务器、自动驾驶领域具有较大话语权。我国厂商GPU市场份额较小,正处于技术追赶环节,目前国产GPU在数据中心、人工智能以及通用计算型GPU领域均实现产品布局,未来随着国内数据中心、智能驾驶及终端侧GPU市场需求的提升,国产GPU市场份额有望实现渗透。 风险提示 国内技术研发不及预期,产能不及预期,自动驾驶渗透不及预期,国际形势风险 研究报告全文:川财证券研究报告AI与自动驾驶打造GPU强力增长引擎GPU行业深度报告所属部门行业公司部报告类别行业研究报告报告时间2023年9月13日分析师孙灿执业证书S1100517100001联系方式suncancczqcom北京东城区建国门内大街28号民生金融中心A座6层100005深圳福田区福华一路6号免税商务大厦32层518000上海陆家嘴环路1000号恒生大厦11楼200120成都高新区交子大道177号中海国际中心B座17楼610041数字经济建设框架下AI与自动驾驶将贡献算力需求全新增量数字经济建设AI大模型智能驾驶成为开启智能时代的确定性研究方向其中数字经济建设搭建数字化布局整体框架并提供政策支持AI大模型及智能驾驶率先落地有望成为拉动算力需求的核心驱动力GPU凭借高并发计算能力及灵活拓展性成为当下算力主流解决方案首先神经网络算法数据要求量大并行计算程度高与GPU高并行计算能力高内存带宽相适配GPU较CPU具备更多的算术逻辑单元控制单元与内存缓存其SIMD架构与深度学习算法需求更吻合其次GPU拥有相对较优的性能及灵活性常用的计算平台包括CPUFPGAGPUDSA以及ASIC一般情况下随着芯片性能的提升其灵活性会逐渐下降ASICDSA设计成本高周期长其灵活性难以满足应用层及宏架构趋势的需求而GPU拥有包括CUDAOpenCL在内的平台技术持续赋能性能提升潜力大应用拓展力强边缘及终端设备有望开启AI智算元年数据中心及车端持续拉升算力需求GPU下游目前主要应用于移动端数据中心服务器以及车规级芯片其中移动端应用又可以分为PCGPU手机GPU主要用于加速图形处理以提高计算机游戏的图像质量及性能随着深度学习及人工智能发展的需要移动端GPU也可以用于手机端加速深度学习计算机视觉和自然语言处理算法等数据中心服务器又可以分为高性能计算服务器与智能计算服务器由于GPU具有高并发的计算能力因此被广泛的用于数据中心建设在汽车领域GPU主要应用于车端及其配套设施智能芯片负责处理来自摄像头普通雷达激光雷达等传感器数据实现智能驾驶供给驱动市场产品技术及产能是核心竞争力英伟达市场份额独占鳌头国际呈现三强格局国内厂商加速布局英伟达凭借技术及产能优势在移动端AI服务器自动驾驶领域具有较大话语权我国厂商GPU市场份额较小正处于技术追赶环节目前国产GPU在数据中心人工智能以及通用计算型GPU领域均实现产品布局未来随着国内数据中心智能驾驶及终端侧GPU市场需求的提升国产GPU市场份额有望实现渗透风险提示国内技术研发不及预期产能不及预期自动驾驶渗透不及预期国际形势风险本报告由川财证券有限责任公司编制谨请参阅本页的重要声明137川财证券研究报告正文目录一数字经济AI智能驾驶视角下看算力需求511演变趋势从通用计算到智能计算从分散独立到云网边协同512战略地位算力属于基础设施建设是智能时代发展的物理承载613应用驱动数字经济搭建整体框架AI大模型智能驾驶持续拉升714优化路径提升芯片性能及创新存算架构是研究主流10二算力需求视角下看GPU发展的必然趋势1221性能GPU技术发展迅速高并发计算能力契合算力需求1222灵活性GPU可编程优势明显通用灵活性适配AI应用端拓展15三GPU市场供给推动市场技术及产能是核心驱动力1831需求端移动端兜底自动驾驶及数据中心建设贡献增量1832供给端英伟达独占鳌头国内技术追赶空间广阔2433GPU产业链概况及国内重点公司介绍31风险提示35本报告由川财证券有限责任公司编制谨请参阅本页的重要声明237川财证券研究报告图表目录图1算力建设已成为经济发展的重要竞争策略5图2各类高性能计算智能计算可以通过云边端架构形成算力网络6图3人工智能三要素为算法算力数据6图4算力发展的核心要素产品及应用6图5全球数据产生量高速增长7图6全球算力规模将高速增长7图72017-2023年中国数字经济规模变化8图8我国在用数据中心机架规模保持增长8图9AI大模型尺寸快速增长9图10大模型时代的GPU算力快速增长9图11智能驾驶车辆的渗透率10图12L5智能驾驶算力需求超1000TOPS10图13我国智能驾驶市场算力需求测算10图14算力性能主要受处理器性能及数据传输制约11图152016-2018年CPU性能每年提升仅3512图16CPU架构13图17GPU架构拥有更多的逻辑核心13图18第一款以GPU命名的芯片GEFORCE25614图19GPU经典工作流程14图20V100混合精度运算速度提高了9倍15图21英伟达第四代FP8TENSORCORE15图22常用的主流计算平台灵活性及性能的比较16图23芯片研发成本17图24不同部署位置的AI芯片要求17图25英伟达CUDA-XAI生态支持多种框架云计算服务部署18图26GPU市场下游需求19图27PC市场处于下行周期含平板19图28PC端桌面显卡出销量及同比19图29全球移动游戏市场占比增加十亿美元20图30基于终端感知的混合AI21图31部分AI模型可从云端分流到终端21图32车载芯片的演变21图33中央计算平台须采用高算力芯片以进行整车功能算力存储等资源部署22图342025年芯片平均算力将超2000TOPS23图352025年全球高性能计算市场规模达199亿美元23图36TOP500超算中心56算力由GPU提供23图37AI服务器对于GPU需求更高24图382025年全球AI服务器市场规模激增至1350亿美元24图39全球GPU市场格局变化25图40国内部分GPU厂商市场布局25图41英伟达游戏产品矩阵25图42英伟达游戏业务营收增长26本报告由川财证券有限责任公司编制谨请参阅本页的重要声明337川财证券研究报告图432023Q2全球PC显卡市场份额26图44英伟达数据中心产品矩阵27图45英伟达第四代NVLINK能为H100提升15倍带宽28图46英伟达数据中心业务营收增长29图47高性能计算芯片下游需求29图48英伟达自动驾驶产品矩阵30图49英伟达THOR芯片计算性能提升30图50英伟达智能驾驶业务营收增长31图512023年度H1中国市场乘用车自动驾驶计算方案市场份额31图52GPU产业中下游分别为芯片设计制造封装与测试32图53公司营收及同比增速33图54公司归母净利润及同比增速33图55公司营收及同比增速34图56公司归母净利润及同比增速34表格1我国出台多项算力建设政策支持数字经济发展8表格2不同语言模型的算力需求及参数数量9表格3英伟达GPU架构调整演进方向14表格4GPUDSAASIC比较以CPU为基准17表格5SOC推动高性能GPU移动端应用20表格6目前主流的车规级芯片架构23表格7游戏产品增强技术25表格8国内厂商桌面级显卡产品参数对比26表格9英伟达H100产品技术27表格10国内厂商高性能计算GPU产品参数对比28表格11国内部分车型搭载芯片型号30表格12国内重点GPU公司及技术32表格13景嘉微定向增发拟建设项目33表格14相关公司可比估值34本报告由川财证券有限责任公司编制谨请参阅本页的重要声明437川财证券研究报告一数字经济AI智能驾驶视角下看算力需求11演变趋势从通用计算到智能计算从分散独立到云网边协同宏观角度下数字经济建设及人工智能发展掀起了新一代算力革命算力基建成为国家数字化转型和经济发展的重要竞争策略从1964年戈登摩尔提出著名的摩尔定律后CPU性能的发展便遵循这一规律但目前数字经济与人工智能的高速发展基于CPU的摩尔定律已经失效如何突破算力墙满足新时代各种算力需求成为各国主要的竞争焦点图1算力建设已成为经济发展的重要竞争策略资料来源数字电子技术川财证券研究所微观角度下算力形式逐渐由通用计算过渡为高性能计算从分散独立的端计算向云网边协同计算演变当前常见的高性能计算可以分为科学工程计算与智能计算算力资源服务可以分为云计算混合计算及算力网络1科学工程计算这类计算主要利用超级计算机实现并行计算是一种算法优化和硬件集群结合的计算模式高性能计算由于具有较高的性能效率及计算精度可以广泛的用于大规模复杂科学计算比如工程模拟仿真航空航天地震预测等同时也能支持人工智能智慧城市等新兴领域2智能计算智能计算以智能芯片为计算算力底座可以较好的满足AI领域模型训练所需的智能运算需求因此用于支持专一的人工智能应用场景基于智能计算搭建的人工智能计算中心通过将各种交叉技术集成广泛的应用于智能语音处理机器视觉自然语言文本处理等不用的领域3云计算混合计算算力网络属于新型算力资源服务模式云计算通过WorldWideWeb万维网向用户提供包括服务器存储数据库等在内的各项计算服务因为万本报告由川财证券有限责任公司编制谨请参阅本页的重要声明537川财证券研究报告维网以网页为核心因此云计算主要面向消费互联网而算力网络主要以算法及算力协同为核心通过协同联动云计算边缘计算端计算及通信网络能够实现对复杂计算任务的分解及高效调度图2各类高性能计算智能计算可以通过云边端架构形成算力网络资料来源华为官网金融界川财证券研究所12战略地位算力属于基础设施建设是智能时代发展的物理承载整体架构层面算法算力及数据是实现人工智能的三要素其中算力是构筑智能时代的物理基础人工智能离不开算力算法及数据其发展需要在建立在庞大的数据集优秀的深度学习算法及强大的计算能力基础之上而算力作为底层基础设施是开启智能时代的关键因素其核心于智能芯片的技术进步图3人工智能三要素为算法算力数据图4算力发展的核心要素产品及应用资料来源中国科普网川财证券研究所资料来源中国电子商会川财证券研究所本报告由川财证券有限责任公司编制谨请参阅本页的重要声明637川财证券研究报告实际发展层面全球数据量正以指数级速度增长算力荒问题日益凸显据IDC数据显示2018年至2019年全球大数据存储量分别为33ZB41ZB而2020年全球数据量达到了60ZB同比增长46庞大的数据集必然依赖强大的数据处理能力进而要求宏观算力快速发展NTCysd预计2021-2028年全球算力规模将以超过40的速度增长2028年将达到7510EFlops图5全球数据产生量高速增长图6全球算力规模将高速增长全球数据量变化趋势ZB左轴全球算力规模Eflops左轴同比增长右轴200100同比增速右轴800060160805060004012060400030804020200040201000002023E2024E2025E2026E2027E2028E2015201620172018201920202025E资料来源IDC川财证券研究所资料来源NTCysd川财证券研究所13应用驱动数字经济搭建整体框架AI大模型智能驾驶持续拉升市场方面数字经济建设AI大模型智能驾驶成为开启智能时代的确定性研究方向其中数字经济建设搭建数字化布局整体框架并提供政策支持AI大模型及智能驾驶率先落地成为拉动算力需求的核心驱动力1全球正加快数字经济建设算力发展成为主要战略竞争点之一目前全球正处于经济数字化转型阶段据中国信通院发布的全球数字经济白皮书显示数字经济已经成为各国发展GDP的核心战略具体数据来看2020年全球47个国家数字经济增加值达到326万亿美元占GDP比重为437同比名义增长3此外数字经济已经成为我国稳增长促转型的重要引擎出台多项政策支持算力发展截至2022年我国数字经济规模已达502亿元数字基础设施规模能级大幅提升在用数据中心算例总规模超180EFlops位居世界第二本报告由川财证券有限责任公司编制谨请参阅本页的重要声明737川财证券研究报告图72017-2023年中国数字经济规模变化图8我国在用数据中心机架规模保持增长市场规模万亿元左轴数量万架左轴同比增长右轴同比增长右轴60207005060050164050040124003030830020202004101010000002017201820192020202120222023E201720182019202020212022资料来源中国信通院国家网信办数字中国发展报告资料来源工信部川财证券研究所2022年中商产业研究院川财证券研究所表格1我国出台多项算力建设政策支持数字经济发展时间文件算力建设内容坚持新发展理念坚持改革创新先行先试推动数全国一体化大数据中心协同创据中心云服务数据流通与治理数据应用数据202105新体系算力枢纽实施方案安全等统筹协调一体设计加快打造一批算力高质量供给数据高效率流通的大数据发展高地用3年时间基本形成布局合理技术先进绿色低新型数据中心发展三年行动计202107碳算力规模与数字经济增长相适应的新型数据中划2021-2023年心发展格局十四五信息通信行业发展2025年数据中心算力每秒百亿亿次浮点运算达202111规划到300年均增速达到27推进云网协同和算网融合发展加快构建算力算十四五数字经济发展规202112法数据应用资源协同的全国一体化大数据中心划体系十四五智能制造发展规完善信息基础设施主要包括网络算力工业互联202112划网平台3类基础设施系统优化算力基础设施布局促进东西部算力高效202302数字中国建设整体布局规划互补和协同联动引导通用数据中心超算中心智能计算中心边缘数据中心等合理梯次布局资料来源国务院工信部川财证券研究所2AI大模型的快速扩张是算力需求的关键驱动力由于AI大模型通常需要在大规模无标注的数据集上进行重复的训练因此相比于传统的小模型在应用场景上更具有普适性但与此同时数据集的快速增长以及模型不断迭代优化使得AI大模型尺寸快速膨胀GPU算力也遵循着同样的增长规律据OpenAI数据显示GPT-3175B相比于GPT-3Small总计算力Flops及参数量增长了约1400倍而据Semianalysis最本报告由川财证券有限责任公司编制谨请参阅本页的重要声明837川财证券研究报告新分析指出GPT-4模型尺寸进一步扩张在其120层模型中总共包含了18万亿参数约GPT-3175B参数量的10倍图9AI大模型尺寸快速增长图10大模型时代的GPU算力快速增长资料来源ASurveyofLarge-ScaleDeepLearningServ资料来源ASurveyofLarge-ScaleDeepLearningServingSystemOptimizationChallengesandOpportunitiesingSystemOptimizationChallengesandOpportunities川财证券研究所川财证券研究所表格2不同语言模型的算力需求及参数数量总计算力PFlops-模型总计算力Flops参数量百万daySmall208E00180E2060Base764E00660E20220T5Large267E01231E217703B104E02900E21300011B382E02330E2211000Base189E00164E20109BERTLarge616E00533E20355Base174E01150E21125RoBERTaLarge493E01426E21355Small260E00225E20125Medium742E00641E20356GPT-3Large158E01137E21760XL275E01228E211320175B364E03314E23174600资料来源OpenAILanguageModelsareFew-ShotLearners川财证券研究所3汽车智能化功能升级智能驾驶将贡献算力需求的全新增量汽车正逐渐步入智能化时代传感器数量的增加及交互能力的提升将带来数据的几何式增长这必然要求车端拥有强大的数据分析和处理能力据华经产业研究院预测2025年我国L3L5级本报告由川财证券有限责任公司编制谨请参阅本页的重要声明937川财证券研究报告别智能驾驶渗透率将分别达到141到2030年两者将分别达到4012而L3级别及以上智能驾驶汽车不仅需要处理人机交互等指令还需要与外界环境云数据中心进行交互据分析L3L5级别智能驾驶算力需求将分别达到30-60TOPS100TOPS未来随着智能驾驶汽车渗透率的提升将会持续带动智能驾驶市场整体算力需求的增加预计20252030年智能驾驶市场算力需求达到19万19万TOPS2021-2025CAGR达112图11智能驾驶车辆的渗透率图12L5智能驾驶算力需求超1000TOPSL3L4L5406000400050003040002030002000101000320100010000L1L2L3L4L5202020212022E2023E2024E2025E2030E资料来源华经产业研究院川财证券研究所资料来源亿欧智库地平线官网川财证券研究所图13我国智能驾驶市场算力需求测算算力需求万TOPS同比增长250000350300200000250150000200100000150100500005000202020212022E2023E2024E2025E2030E资料来源中汽协华经产业研究院亿欧智库川财证券研究所14优化路径提升芯片性能及创新存算架构是研究主流系统算力主要受处理器性能与数据传输能力影响当数据处理能力与传输能力不匹配本报告由川财证券有限责任公司编制谨请参阅本页的重要声明1037川财证券研究报告时计算能力由两者中较低者决定处理性能主要与指令复杂程度频率并行度有关一般来说指令越复杂计算频率越高并行程度越大处理器性能就越好而数据传输的能力与处理器内部存算架构有关在计算机体系里根据访问延迟及容量大小将存储结构分为寄存器缓存内存外存与远程存储而这种存算分离的架构形式通常使得数据传输成为限制系统算力的因素图14算力性能主要受处理器性能及数据传输制约资料来源SDNLAB川财证券研究所1指令的复杂程度指令系统是连接计算机软件和硬件的桥梁一般来说指令的复杂程度于处理器运算性能有关指令越复杂其性能就越好典型的处理器平台大致可以分为CPU协处理器GPUFPGADSAASIC其中CPU为通用软件平台支持包括整形计算类浮点类数据传输类控制类等在内的通用指令而其余处理器为硬件加速平台用于执行各类复杂指令2计算频率一般来说处理器计算的速度于频率呈现正相关关系计算频率越高速度越快以CPU为例执行一条指令需要依次经过取址译码地址生成取操作数执行写回阶段每个阶段需要消耗一个时钟周期上个阶段执行完毕后才会进入到下个阶段在此基础上时钟周期的设定便取决于各阶段用时最大者而提高时钟频率大致有两种方法一是通过超流水线架构提高处理器主频通过增加多级流水从而细化每个阶段一是通过优化工艺技术降低各阶段逻辑门处理延迟本报告由川财证券有限责任公司编制谨请参阅本页的重要声明1137川财证券研究报告3并行度并行度是指在计算机体系中指令并行执行的最大数目并行度越大意味着系统能够同时处理更多指令其运算速度越快常用的并行设计包括指令并行处理器核并行芯片级并行及服务器并行4数据传输能力数据传输能力并不直接影响处理器性能但复杂的存储分层结构会使得系统功耗延迟及访问宽带增加从而限制算力的提升优秀的计算系统应使得处理器性能与数据传输能力尽可能匹配以减少木桶效应对于算力的限制目前数据传输能力的优化方向主要包括近存计算及存算一体化架构二算力需求视角下看GPU发展的必然趋势21性能GPU技术发展迅速高并发计算能力契合算力需求1横向比较GPU较CPU而言更符合深度学习算法的高度并行计算需求一方面CPU性能提升已达到瓶颈与高速增长的算力需求脱节CPU作为第一代高效计算平台目前无论从不管是从架构微架构设计工艺多核并行等各种角度出发其性能都难以提升2016年之后CPU性能每年提升仅35随着数字经济AI大模型智能驾驶等算力需求的推动CPU性能已无法满足上层软件算力需求图152016-2018年CPU性能每年提升仅35资料来源computerarchitectureAquantitativeapproach川财证券研究所另一方面GPU较CPU具备更多的算术逻辑单元控制单元与内存缓存其SIMD架构与深度学习算法需求更吻合CPU为线程级并行的MIMD架构其核心少但性能强本报告由川财证券有限责任公司编制谨请参阅本页的重要声明1237川财证券研究报告可以用来处理复杂的控制逻辑预测分支乱序执行多级流水等而GPU为数据级并行的SIMD架构其核心多但性能弱用于优化具有简单控制逻辑的数据并行任务而神经网络算法数据要求量大并行计算程度高与GPU高并行计算能力高内存带宽相适配神经网络的训练环节需要处理大量的数据并且其结构非常统一每一层成千上万个相同的人工神经元都在执行相同的计算操作具有高效并行计算能力与内存带宽的GPU不仅能够更快的完成数据的读取与写入还能实行多条指令并行计算图16CPU架构图17GPU架构拥有更多的逻辑核心资料来源Imagination官网川财证券研究所资料来源Imagination官网川财证券研究所2纵向比较GPU架构技术仍在演进其高性能计算与智能计算能力不断优化GPU最早作为显卡的核心零部件专用于图形渲染及处理GPUGraphicProcessingUnit即图形处理单元英伟达公司在1999年发布GeForce256图形处理芯片时首先提出GPU的概念GeForce256作为专门负责计算机图形显示的计算机零部件通过TL及其他多项技术引擎减少了显卡对于CPU的依赖GPU组成中通常包含一个显存一个主频一个VRAM一个显存速率以及一个显存位宽本报告由川财证券有限责任公司编制谨请参阅本页的重要声明1337川财证券研究报告图18第一款以GPU命名的芯片GeForce256图19GPU经典工作流程资料来源电动星球News川财证券研究所资料来源电子发烧友川财证券研究所GPU架构迭代频繁已从从专用图形处理器发展为高效的通用计算平台向外拓展人工智能计算及高性能计算领域当GPU引入可编程特性将图形硬件的流水线作为流处理器来解释基于GPU的通用计算也开始出现即GPGPU英伟达产品在2008-2022年内架构迭代调整了8次其在2010年推出具有完整GPU架构的Fermi在2017年Volta架构中首次推出Tensor内核以支持深度学习算法而目前Hopper架构的GPU已广泛的应用于AI大模型训练与推理环节表格3英伟达GPU架构调整演进方向构架代号时间纳米制程核心参数特点代表型号4028nm16个SM每个SM包括32Fermi2010完整GPU架构Quadro700030亿晶体管个Cuda内核28nm15个SM每个SM包括支持GPUDirect技K80Kepler201271亿晶体管192个FP32和64个FP64术K40M28nm24个SM每个SM包括M5000Maxwell2014-80亿晶体管128个FP32与4个FP64M4000P10016nm56个SM每个SM包括64Pascal2016NVlink一代GTX1080152亿晶体管个FP32与32个FP64P600080个SM每个SM包括32推出Tensor内核12nmV100Volta2017个FP6464个INT3264满足深度学习与AI211亿晶体管TiTanV个FP328个Tensor内核运算TU102有72个SM每个T412nmTuring2018SM包括64个INT3264二代Tensor内核2080TI186亿晶体管个FP328个Tensor内核RTX5000本报告由川财证券有限责任公司编制谨请参阅本页的重要声明1437川财证券研究报告A100有108个SM每个三代Tensor内核A1007nmSM包括32个FP6464个Ampere2020结构稀疏性A30283亿晶体管INT3264个FP324个MIG103090Tensor内核H100有132个SM每个台积电4nm工艺4nmSM包括64个FP6464个四代Tensor内核Hopper2022H100800亿晶体管INT32128个FP324个结构稀疏性矩阵Tensor内核MIG20资料来源英伟达官网历代架构白皮书川财证券研究所英伟达Tensor核心持续升级智能计算及高性能计算能力得到不断优化已成为AI模型推理的关键张量核心英伟达Tensor核心最初在Volta架构上推出在后续推出的TuringAmpereHopper上不断优化Tensor核心能够加速矩阵运算大幅增加浮点计算吞吐量具体来看拥有Tensor核心的V100相比于P100其混合精度运算速度提高了9倍而英伟达推出的第四代Tensor核心其FP8性能较AmpereFP6提高16倍而在AI大型语言模型推理方面性能比Ampere高出30倍图20V100混合精度运算速度提高了9倍图21英伟达第四代FP8Tensorcore资料来源微型计算机杂志川财证券研究所资料来源英伟达官网川财证券研究所22灵活性GPU可编程优势明显通用灵活性适配AI应用端拓展GPU拥有相对较优的性能及灵活性常用的计算平台包括CPUFPGAGPUDSA以及ASIC一般情况下随着芯片性能的提升其灵活性会逐渐下降CPU为软件加速平台通过标准化的指令集使得CPU平台的硬件实现与软件编程完全解耦灵活性最高ASIC为专用集成电路是一种为专门目的而设计的集成电路不支持硬件编程灵活性最差本报告由川财证券有限责任公司编制谨请参阅本页的重要声明1537川财证券研究报告图22常用的主流计算平台灵活性及性能的比较资料来源SDNLAB川财证券研究所1ASICDSA设计成本高周期长其灵活性难以满足应用层及宏架构趋势的需求DSA与ASIC属于专用领域定制类型芯片其中ASIC属于完全定制性化芯片其晶体管根据算法定制流片量产后算法便不可编辑DSA在ASIC基础上回调保留一定编程能力但其功能覆盖的领域成具有较大的局限性ASIC与DSA的通用性是限制其应用的关键因素首先通用性限制了ASIC与DSA的应用领域与芯片高企的研发成本相矛盾据估计5nm制程的芯片研发成本已经超5亿美元高企的研发成本需要具有充分量产能力芯片来摊薄而ASIC与DSA芯片均为面向特定领域专用芯片不同领域则面临重新设计的问题尤其是在AI应用领域ASIC与DSA的研发周期和成本并不能满足其AI应用及算法迭代优化的速度本报告由川财证券有限责任公司编制谨请参阅本页的重要声明1637川财证券研究报告图23芯片研发成本表格4GPUDSAASIC比较以CPU为基准通用性芯片算力特点研发成本百万美元600CPU基1001极度灵活的可编程能力500准40010性能与灵活性兼具应GPU10300倍用广泛200DSA100性能优一定的可编程5100TPU倍能力0100性能极致但无灵活性65nm40nm28nm22nm16nm10nm7nm5nmASIC1倍应用拓展力不强资料来源软硬件融合川财证券研究所资料来源腾讯云川财证券研究所其次专用性使得ASIC与DSA芯片与算力融合的宏架构趋势相矛盾数字经济的建设需用云网边各部分资源协同融合从而组成庞大的算力网络然而不同计算引擎平台设备以及数据中心的芯片应用场景具有较大的差异这使得DSAASIC芯片难以成为数字经济时代的整体解决方案图24不同部署位置的AI芯片要求资料来源集微咨询川财证券研究所本报告由川财证券有限责任公司编制谨请参阅本页的重要声明1737川财证券研究报告2CUDAOpenCL技术持续为GPU赋能GPU性能提升潜力大应用拓展力强一方面CUDA生态为GPU提供各种数据接口API算法库与工具跨平台支持以及大规模集群计算支持CUDA使得开发人员能够使用流行的编程语言对英伟达GPU进行编程同时还集成包括TensorFlowPyTorch和MXNet在内的所有深度学习框架另一方面随着深度学习算法和模型的收敛GPU可以通过对算法进行手工优化实现资源的高效调度充分释放出硬件的性能每一代CUDA升级都会带来约10-20的性能提升图25英伟达CUDA-XAI生态支持多种框架云计算服务部署资料来源英伟达官网川财证券研究所三GPU市场供给推动市场技术及产能是核心驱动力31需求端移动端兜底自动驾驶及数据中心建设贡献增量GPU下游目前主要应用于移动端数据中心服务器以及车规级芯片其中移动端应用又可以分为PCGPU手机GPU主要用于加速图形处理以提高计算机游戏的图像质量及性能目前随着深度学习及人工智能的发展移动端GPU也可以用于加速深度学习计算机视觉和自然语言处理等人工智能应用数据中心服务器又可以分为高性能计算服务器与智能计算服务器由于GPU具有高并发的计算能力因此被广泛的用于数据中心建设在汽车领域GPU主要应用于车端及其配套设施智能芯片负责处理来自摄像头普通雷达激光雷达等传感器数据实现智能驾驶本报告由川财证券有限责任公司编制谨请参阅本页的重要声明1837川财证券研究报告图26GPU市场下游需求资料来源英伟达官网高通官网中商产业研究院观研报告川财证券研究所1个人电脑为GPU移动端主要市场智能手机及可穿戴设备有望渗透GPU作为图形处理加速硬件其最常见的应用即为个人电脑智能手机等游戏设备不限于创建图像图像处理计算摄影手势识别的视觉处理需求但目前随着消费电子需求减弱尤其是个人电脑市场下滑的影响PC端显卡需求处于下行区间据JonPeddieResearch数据统计2023年第一季度全球PC桌面显卡销量约630万块同比下降529图27PC市场处于下行周期含平板图28PC端桌面显卡出销量及同比出货量百万台左轴销量百万块左轴同比增速右轴同比增速右轴60020600302500155001104004005-01300300-0220020-03-5-0410010-10-050-150-062017201920212023E20142016201820202022资料来源Canalys川财证券研究所资料来源JonPeddieResearch川财证券研究所本报告由川财证券有限责任公司编制谨请参阅本页的重要声明1937川财证券研究报告手机游戏图显需求及终端AI架构有望打造移动端GPU增长新引擎一方面手机端游戏市场规模逐渐增大NEWZOO数据显示2022年全球移动游戏市场规模已达1035亿美元约占游戏市场总规模53另一方面手机端GPU光线追踪技术尚未普及未来随着手机端游戏图形渲染需求的提升对GPU性能要求将逐渐增加目前高通联发科英伟达AMDARM等著名芯片厂商均开始布局手机GPU有望加速移动端GPU扩量图29全球移动游戏市场占比增加十表格5SoC推动高性能GPU移动端应用亿美元SoC联合主机游戏移动游戏品牌主要内容数字版盒装PC游戏网页游戏厂商GPU厂商专注于加强移动设备高250三星电子ExynosAMD级图形技术和解决方200案高通人工智能引擎150高通骁龙自研AdrenoGPU的性能提升100高达25能效提升45104937791双方合作将NVIDIA图形50联发科天玑英伟达解决方案引入安卓02020202120222023E海思麒麟--资料来源NEWZOO川财证券研究所资料来源福布斯中国中国日报网川财证券研究所移动端作为AI架构的终端设备有望承载部分AI计算功能随着AI技术的快速发展以及计算需求的提升AI处理须分布在云端及终端进行这种混合AI架构可以根据模型和查询需求的复杂度等因素选择不同方式在云端和终端侧之间分配处理负载未来随着终端侧AI处理需求的提升将对终端设备包括手机电脑汽车XR等便携设备以及物联网设备的AI计算及推理性能提出新的需求有望带动移动端GPU需求的提升本报告由川财证券有限责任公司编制谨请参阅本页的重要声明2037
|
相关研报
|
||||||||||||||||||||||
