研报下载就选股票报告网
您好,欢迎来到股票分析报告网!登录   忘记密码   注册
>> 广发证券-电子行业“AI的裂变时刻”系列13:计算集群规模提升趋势明确,以太网交换机市场空间广阔-240704
上传日期:   2024/7/4 大小:   1133KB
格式:   pdf  共7页 来源:   广发证券
评级:   -- 作者:   王亮,耿正,张大伟
行业名称:   电子
下载权限:   此报告为加密报告
GPU集群规模增长趋势显著。在大模型Scaling Laws持续有效的背景下,以集群形式的分布式并行训练能够有效节省训练时间与提升GPU使用效率,面对不断膨胀的模型参数和训练数据,为尽可能缩短模型训练时间,提升模型迭代效率,集群规模有望实现指数级增长。以英伟达为例,根据其在COMPUTEX 2024上发布的升级规划:(1)2024年互联超一万颗GPU;(2)2025年互联超十万颗GPU;(3)2026年互联超百万颗GPU。
  集群规模扩张推动网络层数增加,进而提升交换机配比。集群内网络搭建需要满足高带宽和低延迟的需求,因此,使用Fat-Tree(胖树)架构的CLOS网络正被广泛应用于计算集群中。随着计算集群规模的持续扩大,交换机网络层数将随之提升。根据英伟达官网,以SPECTRUM-X以太网交换机为例,主流型号SN5600拥有64个800Gbps端口。根据论文《AScalable, Commodity Data Center Network Architecture》中的测算,在不考虑网络收敛和光模块拆分的情况下,不同层数的CLOS胖树架构互联GPU的上限分别为:(1)2层架构:计算网络最多使用96个交换机,最多互联2,048个GPU,GPU与计算网络交换机配比为64:3;(2)3层架构:计算网络最多使用5,120个交换机,最多互联65,536个GPU,GPU与计算网络交换机配比为64:5;(3)4层架构:计算网络最多使用229,376个交换机,最多互联2,097,152个GPU,GPU与交计算网络机的配比为64:7。
  GPU集群规模扩张触发InfiniBand互联上限,RoCE协议有望在大集群中更多被应用。InfiniBand协议中优先考虑尽可能降低网络延迟,而RoCE协议则优先考虑网络的兼容性与分布式。在数据交互中,IB协议中每个GPU都有自己的LID(Local ID),两两GPU之间交互路径由路由表提前算好,以此实现低延时效果。但根据IB协议中的报文结构,LID由一个16位的二进制编码组成,因此在IB网络协议下,互联的GPU上限为2^16=65,536个。随着集群规模向十万卡级别升级,RoCE协议组网方案有望在大集群中更多被应用。
  互联速率提升趋势加速,数据中心以太网交换机迎来量价齐升机遇。在千亿级参数的大模型训练中,单次计算迭代内梯度同步需要的通信量就达到了百GB量级,随模型参数以及单GPU算力持续提升,为充分发挥GPU计算资源的利用率,对于集群中计算单元的通信速率需要持续升级。Marvell在24年AIDay上表示,互联速率在AI的催化下,从之前的每四年翻一倍加速至每两年翻一倍;根据博通官网,其Tomahawk 5交换芯片容量已达51.2Tb/s,可支持64个800Gbps端口的数据交换,而下一代Tomahawk 6芯片交换容量将提升至102.4Tb/s。在集群互联规模&互联带宽持续提升的背景下,根据Arista官网预测,26年数据中心以太网交换机市场规模有望从23年的200亿美元出头提升至接近300亿美元,市场规模提升显著,产业链公司有望深度受益。
  建议关注。(1)交换机PCB龙头:沪电股份。根据沪电股份年报,公司基于112Gbps速率51.2T的盒式800G交换机已批量交付,224Gbps产品开始预研。(2)本土交换机ODM:华勤技术。根据公司24年一月投资者关系活动记录表23年三季度,公司实现头部互联网客户TH5主流交换机中标,成功突破交换机大客户。
  风险提示。大语言模型技术变化,大模型开发或AI应用进展不及预期,云计算厂商CapEx不及预期。
  
 
Copyright © 2005 - 2021 Nxny.com All Rights Reserved 备案号:蜀ICP备15031742号-1