>> 新华三集团-计算机行业:2026超节点技术白皮书-260922
| 上传日期: |
2026/9/22 |
大小: |
19320KB |
| 格式: |
pdf 共360页 |
来源: |
|
| 评级: |
-- |
作者: |
-- |
| 下载权限: |
无限制-登录即可下载 |
|
|
当前,大模型训练已从单机计算演进为超大规模集群的协同工程。随着模型参数量向万亿级迈进,万卡级集群已成为头部算法厂商的标配。在这一演进过程中,底座架构的瓶颈正在从单卡的算力峰值(TFLOPS)转向集群维度的通信效率(MFU-Model FLOPs Utilization)。当训练任务分布在数千甚至上万个加速节点上时,All-to-All、All-Reduce等集合通信操作产生的流量呈几何倍数增长,如何降低长尾延迟、提升有效算力利用率(MFU),成为大规模工程落地中首要解决的硬核课题。 传统的服务器架构在应对超大规模并发训练时,正面临严重的扩展性挑战。受限于标准机架的物理空间与功耗限制,单机内部的互联带宽虽高,但跨机通信仍主要依赖于RDMA网络。在万卡规模下,多级交换机带来的跳数增加(Hops)以及网络拥塞,会导致计算单元在等待参数、数据的同步时出现严重的“气泡”。传统“1机8卡”的结构,机内TB级总线与机间Gbps网络存在量级带宽差,且协议转换引入微秒级延迟。这种内存共享空间(HBMP2P)和互联带宽之间明显的物理断层,难以支撑千亿级以上参数模型对低延迟数据对撞的苛刻要求,制约了集群算力扩展。 “超节点”架构的出现,本质上是对计算、网络与存储边界的一次系统性重构。它不再局限于传统的单机物理框限制,而是通过高密度的背板互联或高速互联协议(如高性能NVLink扩展或自研互联架构),将多个计算单元在逻辑上整合成一个超大规模的计算实例。超节点的技术核心在于将“Scale-up”域从单机扩展至机柜级甚至更大规模,利用拓扑结构设计和统一的内存寻址能力,显著缩短通信路径。这种架构在保持高吞吐的同时,有效缓解了大规模线性扩展时的性能损耗。 本白皮书旨在通过对超节点产品的系统性拆解,从硬件拓扑、互联协议、系统工程以及软件栈协同等维度,探讨如何构建下一代AI算力底座。我们希望通过对技术细节的深入剖析,为构建高性能、高可靠的AI基础设施提供切实可行的参考路径,支撑大模型走向超大规模生产化应用。
|
|