研报下载就选股票报告网
您好,欢迎来到股票分析报告网!登录   忘记密码   注册
>> 申万宏源-计算机行业AIGC系列之二十三:算力网络再讨论!从Dojo架构到算法的硬件延伸-230925
上传日期:   2023/9/26 大小:   3085KB
格式:   pdf  共39页 来源:   申万宏源
评级:   -- 作者:   黄忠煌,李国盛,杨海晏
行业名称:   计算机
下载权限:   此报告为加密报告
投资案件
  结论
  Tesla Dojo的革新,启发我们进一步思考算力和网络的关系。硬件架构服从于算法设计,硬件需求的判断也不能与软件和应用层面脱钩。算力网络主线新一阶段的重要机会,应核心关注海外爆款应用或模型侧重大更新(Tesla是代表样本),以及国内新一轮的模型与应用开发。我们判断,随着国内科技大厂的网络演进至400G以上、运营商400G全光网推进建设、本土模型训练组网等加速,国内市场的高速网络需求将显著提升。算力网络与流量环节、AI服务器计算环节、华为产业链以及特斯拉与智能车产业链相关标的应重点关注。
  原因及逻辑
  1)带宽与连接架构是决定算力性能的因素;2)芯片层面的高速chip-to-chip连接方案是高速网络、光通信需求的底层逻辑;3)单SoC性能提升+芯片“堆量”,不意味着算力集群整体性能的线性提升,网络设计是瓶颈。
  有别于大众的认识
  市场担心Tesla Dojo架构是否具有颠覆性,及对光通信/传统AI架构的冲击。我们认为,硬件架构服从于算法设计。与当前AI算力算法领域其他巨头不同,Tesla的AI方案根植于其能源/车/具身智能等垂直场景,具有独特性和难复制性。Dojo的发展历程与技术特征反而启示我们,对于算力网络硬件需求的判断,要结合特定场景;或者说,下一阶段的算力网络投资,重点应关注场景应用的催化。
  市场对国内算力网络的需求有预期差。我们基于对Dojo架构的思考,延伸至Google TPU系列以及华为链的重要变化,包括星河AI网络白皮书、昇腾AI计算集群Atlas 900 SuperCluster等。我们认为,本土RoCE等网络及400G以上光通信演进,是进一步重要趋势。英伟达解决集群性能瓶颈的方式是引入InfiniBand网络,并将C2C场景下应用的NVLink延伸至设备间互联;Dojo是2D mesh到3D组网,解决数据存取瓶颈;TPU则明显从算法到硬件矩阵化。结合本土产业实际,未来“普适化”的RoCE等网络以及400G以上速率的光通信是重要方向。
  风险提示
  信息技术迭代产生新的网络通信方案,可能颠覆已有路径或格局。
  GPU/DSA、智联汽车、机器人领域一向的风险依然是研究竞争、产业链地位与管理。若难以相对准确地把握,可能会选中了次好的公司,对投资产生不良的结果。
  
研究报告全文:算力网络再讨论从Dojo架构到算法的硬件延伸AIGC系列之二十三证券分析师李国盛A0230521080003ligsswsresearchcom杨海晏A0230518070003黄忠煌A0230519110001林起贤A0230519060002刘洋A0230513050006刘菁菁A0230522080003王珂A0230521120002戴文杰A0230522100006联系人李国盛ligsswsresearchcom2023925投资案件结论TeslaDojo的革新启发我们进一步思考算力和网络的关系硬件架构服从于算法设计硬件需求的判断也不能与软件和应用层面脱钩算力网络主线新一阶段的重要机会应核心关注海外爆款应用或模型侧重大更新Tesla是代表样本以及国内新一轮的模型与应用开发我们判断随着国内科技大厂的网络演进至400G以上运营商400G全光网推进建设本土模型训练组网等加速国内市场的高速网络需求将显著提升算力网络与流量环节AI服务器计算环节华为产业链以及特斯拉与智能车产业链相关标的应重点关注原因及逻辑1带宽与连接架构是决定算力性能的因素2芯片层面的高速chip-to-chip连接方案是高速网络光通信需求的底层逻辑3单SoC性能提升芯片堆量不意味着算力集群整体性能的线性提升网络设计是瓶颈有别于大众的认识市场担心TeslaDojo架构是否具有颠覆性及对光通信传统AI架构的冲击我们认为硬件架构服从于算法设计与当前AI算力算法领域其他巨头不同Tesla的AI方案根植于其能源车具身智能等垂直场景具有独特性和难复制性Dojo的发展历程与技术特征反而启示我们对于算力网络硬件需求的判断要结合特定场景或者说下一阶段的算力网络投资重点应关注场景应用的催化市场对国内算力网络的需求有预期差我们基于对Dojo架构的思考延伸至GoogleTPU系列以及华为链的重要变化包括星河AI网络白皮书昇腾AI计算集群Atlas900SuperCluster等我们认为本土RoCE等网络及400G以上光通信演进是进一步重要趋势英伟达解决集群性能瓶颈的方式是引入InfiniBand网络并将C2C场景下应用的NVLink延伸至设备间互联Dojo是2Dmesh到3D组网解决数据存取瓶颈TPU则明显从算法到硬件矩阵化结合本土产业实际未来普适化的RoCE等网络以及400G以上速率的光通信是重要方向风险提示信息技术迭代产生新的网络通信方案可能颠覆已有路径或格局GPUDSA智联汽车机器人领域一向的风险依然是研究竞争产业链地位与管理若难以相对准确地把握可能会选中了次好的公司对投资产生不良的结果wwwswsresearchcom2主要内容1算力视角网络三规律映射Dojo架构拆解2算法视角路径的差异性实际巨大3从TPU到华为星河AI网络通信与算力同行4结论相关标的与风险提示311Dojo第一性原理是数据存取从自动驾驶到机器人等Tesla的AI应用场景丰富并基于内部研发需求布局了Dojo算力网络系统据Tesla相关会议马斯克社交媒体等披露信息Dojo演进路径如下201904TeslaAutonomyInvestorDay马斯克官宣特斯拉正在研发superpowerfultrainingcomputer基于视频数据202008马斯克推特表示大概一年左右推出Dojov10版本难点是电源和散热202108TeslaAIDay正式官宣Dojo技术细节202110Tesla发布DojoTechnology白皮书阐述浮点运算情况202208-09HotChips34进一步披露Dojo细节TeslaAIDay架构更新已经完成第一个DojoCabinet验证测试预计产能可达1Tile天202306Dojo初步应用输出官宣23年7月正式推出exaPOD特斯拉将会在2024年1月前拥有全球top5算力2024年10月100exaFLOPs算力202307后Dojo正式上线回顾前期报告通信网络延续基础算力的摩尔定律AIGC系列之二十提出算力网络三大规律1带宽与连接架构是决定算力性能的因素2芯片层面的高速chip-to-chip连接方案如NVLinkCXL等是高速网络光通信需求的底层逻辑3单SoC性能提升芯片堆量不意味着算力集群整体性能的线性提升网络设计是瓶颈我们认为TeslaDojo的系统架构是上述规律的进一步映射wwwswsresearchcom411Dojo第一性原理是数据存取TeslaDojo系统拆解如下相关数据均引自Tesla官方披露内容维度1最小计算单元是D1ComputeDie其中354个Trainingnodes大致类比为GPU核心1个Trainingnodes拥有125MB的片上SRAM1TFlop的FP16CFP8算力并包含了南-北-东-西四个方向的NOC网络连接直接与相邻的4个nodes相互连接nodes间双向带宽达到256GBsD1片上SRAM共440MB算力性能362TFlopsBF16CFP822TFlopsFP322GHzD1基于TSMC7nm工艺645mm2面积400W功耗片上总带宽达5TBs354个标准化程度极高的node构成1片D1DieTrainingnode354DojoD1chip资料来源TeslaHotChips申万宏源研究wwwswsresearchcom511Dojo第一性原理是数据存取维度225个D1芯片以55矩形阵列的形状通过40个IODie相互连接组成1个TrainingTileTile是供电散热液冷对外连接的核心单元每个Tile提供15kW的功率其中D1dies共10kW预计其他为IO等每个D1die在垂直方向的下面提供单独的供电共18000A52VDC自研电源模块55矩阵每个边提供9TBs带宽自研连接器通过高速线缆与相邻Tile串联TSMCinfosow工艺Tesla组装调试产能1个Tile天2022年Tesla数据据Tesla测算1Tile性能媲美6个8GPUA100server系统差异大实际可比性后续讨论散热与供电反而很关键解决热膨胀系数和高密度负载测试阶段单机柜22MW相当于6台ModelY双电机全力输出体现Tesla一体化制造电力管理等能力25个D1Die构成一张DojoTrainingTileD1Die25Tilewwwswsresearchcom资料来源TeslaIEEEHotChips申万宏源研究611Dojo第一性原理是数据存取DojoTrainingTile是解决供电散热对外连接的最小单元Heatout液冷模组核心算力单元18000Amps电源管理DCinwwwswsresearchcom资料来源TeslaHotChips申万宏源研究711Dojo第一性原理是数据存取维度3每6个Tile搭配了20张DojoInterfaceProcessorDIP用于内存扩容PCIe扩展网络连接DIP部署在6个Tile组成的阵列的边缘20个DIP分为4组每组5个DIP其作用包括1提供HBM扩展形成共享的DRAM和单独的D1核心SRAM2提供对外连接例如通过每组DIP通过PCIeGen4去连接1个HostSystem以及通过TTPoE和外部以太网交换机连接其他的DIP6个Tile20个DIP等组成一个Tray单元wwwswsresearchcom资料来源TeslaHotChips申万宏源研究811Dojo第一性原理是数据存取DIP是Dojo组网的核心可以类比Nvidia的DPUNVSwitchInfiniBandNICDIP为TrainingTile提供了800GBps的内存带宽32GB的HBM内存TeslaTransportProtocolTTP类似地可以对应于CXLNVLink等TTP带宽达到900GBps与NvidiaH100NVLinkAMDMI300InfinityFabric等目前主流芯片的连接带宽一致每个DIP提供了50GBps的TTPoverEthernetTTPoE基于以太网TTP接口用于对外连接以太网交换机及32GBps的PCIeGen4的连接也就是说每6个Tile对应20个DIP卡每个DIP卡又对应了1个50GBps接口也就是400Gb的网络接口即每6个Tile对应了20个400Gb接口以及总共3220640GB的HBM可共享内存6个Tile20个DIP等组成一个Tray单元02wwwswsresearchcom资料来源TeslaHotChips申万宏源研究911Dojo第一性原理是数据存取23的Tiles连接wwwswsresearchcom资料来源TeslaAIDay视频申万宏源研究1012网络架构视角从2D到3D每2个Tray构成1个机柜进而按不同规模组成POD承上维度42个SystemTray以及CPU为核心的Host组成1个机柜最小的集群单元Tile通过搭配的DIP和TTPoE对外形成400Gb连接每1个机柜有62个Tile因此每机柜对外的400Gb连接数量为22040个11个Dojo机柜机柜侧的400Gb模块数量为40个交换机侧配对40个400Gb模块共80个光模块资料来源TeslaHotChips申万宏源研究210个机柜假设fat-tree的2层交换架构组网那么Dojo机柜侧的400Gb模块数量为1040400个机柜到L1交换机之间的模块数量是4002800个L1和L2交换机之间假设不收敛同样也需要800个模块因此总共需要80021600个光模块对应10个机柜中的120个tile3000个D1芯片但由于D1不能等效为GPU的核心且华为昇腾英伟达H100谷歌TPU与特斯拉Dojo的设计思想迥异这仅证明训练芯片越来越多样化延展化适配更多的AI场景实际上对网络的重视整体利好光模块投入3另外Host系统预计也需要若干光模块通过DojoNetworkInterfaceCard和TTPoE协议进行RDMA预计也是400G网络体系wwwswsresearchcom1112网络架构视角从2D到3DDojo的物理架构实际上是均一化的算力单元组成的SeaofnodesHostHostHostHostHostHostCPUDRAMCPUDRAMCPUDRAMCPUDRAMCPUDRAMCPUDRAM9TBsTileD1900GBsDIPs50GBs400GbsHostHostHostHostHostHostCPUDRAMCPUDRAMCPUDRAMCPUDRAMCPUDRAMCPUDRAMCabinet01Cabinet10资料来源申万宏源研究wwwswsresearchcom1212网络架构视角从2D到3D外部交换机和Host系统辅助数据Ingest和Memory必要时形成全局3D网络HostSystemCPUDRAMDNICsSwitchSwitchwwwswsresearchcom资料来源申万宏源研究1312网络架构视角从2D到3DDojo试图打破冯诺依曼瓶颈借助软件与网络平衡系统中的时延带宽资源消耗量和传输距离实际上Node-Die-Tile之间的网络带宽随着传输路径长度的增加而递减如D1Die之间的直连带宽远大于Tile之间且越长的传输路径就越消耗系统资源例如Tile内dietodie带宽2TBs100ns而Tile之外的dietodie带宽下降至900GBs系统边缘PCIe到Host的带宽仅160GBs伴随传输路径长度增加系统的资源消耗也显著增加资料来源HotChips申万宏源研究注横轴单位是路径相对长度纵轴单位是资源利用水平因此Dojo通过软件与网络设计把大量的数据通信范围控制在本地较短的距离上而长距离的全局通信则聚焦在同步synchronizationAllReduce等环节Dojo系统的多数数据处理可以在Tile或数个Tiles的层级上完成因此主要的数据传输通过相邻D1Die之间的片上直连经过多跳完成Die之间的IO通道资源被充分利用而在数据传输路径太长时例如横跨两个机柜则可以通过外部TTPoE平衡时延和带宽wwwswsresearchcom14主要内容1算力视角网络三规律映射Dojo架构拆解2算法视角路径的差异性实际巨大3从TPU到华为星河AI网络通信与算力同行4结论相关标的与风险提示1521硬件架构服从于算法设计与当前AI算力算法领域其他巨头不同Tesla的AI方案根植于其能源车具身智能等垂直场景具有独特性和难复制性理由如下1应用的指向性或专用性据上文Dojo研发时间线其技术信息首次公开披露大致在2019-2020年左右2020年时TeslaAI算法已经应用了BEV且对ADAS场景和拓展性有明确需求这点区别于GPUNPUTesla场景的独特性也是研发Dojo这款DSA的客观条件例如公司存量算力资源的较大比例分配于AutolabelingOccupancynetwork等2场景的局限性Tesla的云与数据中心场景并非业务重心智能终端才是因而复杂的大集群并非其算力方案最优解对于内部成本中心而言资源利用率和成本优先于商业化和绝对性能据TeslaAIDay测算各种假设约束下1个DojoTile综合性能可比6台A100Server成本结构也很关键因而Dojo重视IO的优化与资源调配的灵活度3技术兼容难度不同处理器的设计架构一般向后兼容英伟达的Hopper当前H100H800仍然与费米架构有相似之处例如核心是SM和CudaCores共享内存改为存算一体等的难度仍较大谷歌TPU亦设计用于大型数据中心发布前芯片软件AI的工业界水平决定了当时的架构而此后版本大多向后兼容很难再大幅度改变谷歌TPUv1发布于2015-2016年向前推测芯片立项大约为2013年英伟达Pascal架构发布于2016年特斯拉Dojo发布于2020年wwwswsresearchcom1621硬件架构服从于算法设计D1核心结构与NvidiaGA100下图对比架构思路截然不同我们认为Dojo最鲜明的设计语言是标准化分布式指向性专用性强极简设计上文我们提到Dojo的第一性原理是解决数据存取瓶颈例如所有nodes核心的结构均一致884的矩阵乘法器片内无HBM片内SRAM大小类似L2cache低寻址带宽此外标准化的IC成本也更低例如maskcost等而对比同等功耗算力水平的方案例如NvidiaA100微观层面上首先SM囊括了INT32FP32FP64TensorCore等不同的计算核心嵌套了L0L1L2多层cache以及片外HBM树状组网结构等相似之处是都追求更高的互联带宽更优的时延提升矩阵乘的性能等也是行业趋势网络和算力性能要同步提升wwwswsresearchcom资料来源TeslaNvidia申万宏源研究1721硬件架构服从于算法设计2010年以来英伟达GPU主要架构可以推测行业趋势注重互联对AI支持与时俱进从CudaCore到TensorCore增加对INTBF16等AI新趋势的支持结构稀疏矩阵支持注重带宽和扩展性而非核心数量等时间2010201220142016中文名费米开普勒麦克斯韦帕斯卡英文名FermiKeplerMaxwellPascal每SM128CudaCores32核心参数512CudaCores每SMX192FP3264FP64每SM64CudaCores32DPLDST32SFU16SM15SMX16SM60SM关键核心单元CudaCoresCudaCoresCudaCoresCudaCores特点1首个完整GPU首次GPUDirectSM单元精简192到128NVLink第一代特点2共享内存性能双向带宽160Gbps特点3ECCGPUP10056SMHBM制程4028nm28nm28nm16nm代表型号Quadro7000K80K40MM5000P100时间2017201820202022中文名伏特图灵安培赫伯英文名VoltaTuringAmpereHopper每SM每SM32FP6464Int3264FP328每SM64FP3264Int328每SM128FP3264Int3264FP644核心参数64FP3264Int322FP64TensorCoresTensorCoresTensorCores4TensorCores80SM102核心92SM108SM132SM关键核心单元TensorCoreTensorCoreTensorCoreTensorCore特点1NVLink第二代NVLink第三代NVLink第四代特点2TensorCores第一代TensorCore第二代TensorCore第三代TensorCore第四代特点3支持AI运算RTCore第一代RTCore第二代特点4结构稀疏矩阵MIG10结构稀疏矩阵MIG20制程12nm12nm7nm4nm代表型号V100T4RTX20A100A30H100注1CUDACUDAComputeUnifiedDeviceArchitecture是显卡厂商NVIDIA推出的运算平台下文同注2Nvidia的SMstreamingmultiprocessorSPstreamingprocessor是其最基本的处理单元也称为CUDAcore多个SP加上其他的一些资源组成一个SM也叫GPU大核注3NVLink是英伟达NVIDIA开发并推出的一种总线及其通信协议其采用点对点结构串列传输用于中央处理器CPU与图形处理器GPU之间的连接也可用于多个图形处理器之间的相互连接2016年4月发布帕斯卡架构是NVLink第一代注4SFU特殊函数单元Specialfunctionunits注5LDST读取单元loadstoreunits注6SMX可以理解为大号的SMKepler中每个SMX单元中的Register较Fermi的SM单元放大一倍注7浮点精度对应不同AI训练要点如安培架构对稀疏矩阵支持利于CV分割对象检测通信编码等训练推理任务常用FP16BF16TF32INT8FP16中的不同种类wwwswsresearchcom资料来源Nvidia官方网站NvidiaA100datasheet等申万宏源研究1822Dojo的资源池可编程架构可编程的前提是带宽与时延性能Dojo借助Complier编译实现软件优化由于最底层的nodes和D1dies是标准化的因而Seaofnodes可以以俄罗斯方块的形式根据模型规模算法要求等不同任意调用计算资源Tesla的训练数据通常是视频数据加载视频处理的难度高不同模型对计算存储带宽的要求不同传统的GPU服务器最小算力单元的颗粒度太高而1机8卡的主流结构使得算力资源的灵活调配存在局限性而Dojo系统类似俄罗斯方块每个DieTile标准化程度高且无缝高带宽连接因此可以在资源池中随意切出一块用于某项任务的训练提高资源利用率在训练过程中D1只负责计算而x86CPU核心的Host系统则通过Dojocomplier编译器将不同的D1组合起来甚至不同D1之间的通信路径策略也由Host优化这与目前已有LLM等模型的性质不同Dojo系统可以类似俄罗斯方块的方式调配资源Dojo的计算存储带宽资源可分解重组资料来源Tesla申万宏源研究wwwswsresearchcom资料来源申万宏源研究1923提升性能的思路众多大厂各有异同如何进一步提升性能模型训练的算力难点之一是解决并行Parallelism问题AI大模型训练相比通用计算需要更多运算单元的同时参与产业主流的并行方式包括1数据并行dataparallelism数据集分解成众多子集并行训练2流水线并行pipelineparallelism模型分层至不同处理器进行训练减少对内存的需求3张量并行tensorparallelism通过模型分解减少每个处理器上的参数处理量此外神经网络训练中的BatchNormalization也很关键因此数据模型在不同运算单元中的分发计算汇集模式影响了性能也决定了其网络架构的选择谷歌TPU通过脉动网络增强矩阵乘法解决算力和IO的瓶颈其TPU架构也是矩阵乘法优化的体现资料来源TPUv4AnOpticallyReconfigurableSupercomputerforMachineLearningwithHardwareSupportforEmbeddings申万宏源研究wwwswsresearchcom20
 
Copyright © 2005 - 2021 Nxny.com All Rights Reserved 备案号:蜀ICP备15031742号-1