>> 广发证券-半导体行业专题研究-“AI的iPhone时刻”系列8:如何初步理解GPU算力?-230403
| 上传日期: |
2023/4/3 |
大小: |
2126KB |
| 格式: |
pdf 共18页 |
来源: |
广发证券 |
| 评级: |
-- |
作者: |
王亮,耿正,栾玉民 |
| 下载权限: |
此报告为加密报告 |
|
|
结论。GPU峰值算力反映GPU的主频和相应核心的硬件配置,如FP32的核心的个数,FP64的核心的个数以及Tensor core的计算能力等峰值参数,并非其实际计算性能。GPU峰值算力参数可用来初步区分其适用的应用场景,如在某GPU内,其FP64算力显著高于FP32等算力,其可能更适用于科学计算等场景,如FP32、TF32、FP16、INT8等算力较为均衡,其可能更适用于AI训练和推理环节。 首先我们引入数据类型。计算机运行必须考虑计算资源的分配,不同场景下使用不同的数据类型是必要的,数据类型即标定数据的正负、数据的范围大小、数据的精度大小。AI芯片的主要应用场景包括训练、推理与高性能计算,根据英伟达官网的表述,AI训练为缩短训练时间,主要使用FP8、TF32和FP16;AI推理为在低延迟下实现高吞吐量,主要使用TF32、BF16、FP16、FP8和INT8;HPC(高性能计算)为实现在所需的高准确性下进行科学计算的功能,主要使用FP64。 GPU算力参数从哪里来。NVIDIAGA100 GPU由多个GPU处理群集(GPC),纹理处理群集(TPC),流式多处理器(SM)和HBM2显存控制器等组成。A100中总共有108个SM,每个SM有64个FP32 CUDA核,64个INT32 CUDA核,32个FP64 CUDA核,以及4个第三代Tensor Core,其中Tensor Core专注于矩阵运算,在模型训练与推理的过程中,Tensor Core将是主要的计算内核。GPU峰值算力的测算公式为:峰值计算能力= GPUCore的运行频率*GPUSM数量*单个SM对应的特定数据类型的指令吞吐量*2。根据该公式,可以得到A100 FP16(Tensor Core加速)峰值算力为312TFLOPS,FP32(Cuda Core)峰值算力=19.5TFLOPS,与英伟达官方披露的性能参数一致。由此可见,GPU峰值算力与主频和硬件配置数量等参数相关。 模型训练&推理算力需求测算。根据我们的测算:在训练侧,训练一个GPT-3.5175B模型的NVIDIAA100需求为1080个、AI服务器需求为135台;训练一个万亿参数量AI大模型对A100、AI服务器的需求分别为8521个、1065台。在推理侧,一个谷歌级应用使用GPT-3.5175B进行推理,对NVIDIAA100需求为72万个、对AI服务器需求为9万台;一个谷歌级应用使用万亿参数大模型进行推理,对NVIDIAA100需求为378万个、对AI服务器需求为47.3万台。据Trendforce数据,预估2022年搭载GPGPU的AI服务器年出货量占整体服务器比重近1%,即约14万台。我们以14万台为基数测算训练、推理侧算力需求对AI服务器出货量的拉动。根据测算,训练100个GPT-3.5175B模型对AI服务器出货量的拉动为9.6%,10个使用GPT3.5175B模型的谷歌级推理应用对全球AI服务器出货量的拉动为643%。 投资建议。建议关注算力芯片厂商:海光信息(与计算机组联合覆盖)、寒武纪(计算机组覆盖)、芯原股份、龙芯中科等;连接芯片厂商:源杰科技、澜起科技、裕太微、聚辰股份、帝奥微等;存储芯片厂商:深科技、兆易创新、东芯股份等;服务器硬件厂商:工业富联、沪电股份、胜宏科技等。AIGC应用:海康威视、大华股份等。 风险提示:AIGC发展不及预期,AI服务器出货量不及预期,国产厂商技术和产品进展不及预期。
|
|