>> 国盛证券-计算机行业点评:为什么训练需要如此多算力-240713
| 上传日期: |
2024/7/14 |
大小: |
1368KB |
| 格式: |
pdf 共12页 |
来源: |
国盛证券 |
| 评级: |
增持 |
作者: |
刘高畅,陈芷婧 |
| 行业名称: |
计算机 |
| 下载权限: |
无限制-登录即可下载 |
|
|
Scaling-law仍为基础定律,大模型量级快速扩张。1)7月8日,Anthropic表示,其目前正在开发的人工智能模型的训练成本高达10亿美元,且未来三年内,AI模型的训练成本将上升到100亿美元甚至1000亿美元,引起广泛关注。2)我们认为,大模型训练成本的快速扩张仍然反映了Scaling-law的基础原理,即当增加模型大小、数据集大小以及用于训练的计算量时,语言模型的性能会逐渐提升,且提升效果遵循幂律关系。3)而幂律关系也意味着,增加模型参数量、数据集或计算资源,其边际回报会不断降低。即便如此,Scaling-law仍为当前技术路径下的基础定律,全球各大模型规模持续扩张,GPT4参数量或已到万亿级别,相比GPT3.5提升一个量级。4)我们认为,对Scaling-law的坚持尝试、部分优化,均反映大语言模型仍处于快速发展的过程中,模型参数量、数据量、计算资源的扩张,都将成为推动大模型实现更高知识水平的基石。 大模型进步空间仍大,训练算力成本或超百亿美元。1)在定量的算力估算上,我们参考《Scaling Laws for Neural Language Models》、《TrainingCompute-Optimal Large Language Models》等大模型领域的代表论文,给出大致测算。2)训练算力需求方面,以单个token所需的计算资源C约等于6N为基础,我们估算,为了达到类似人类的水平,大模型或至少需要11万亿参数、228万亿token数、1.55*10^28次的浮点运算。3)在硬件成本方面,以英伟达B200及H100为主流GPU,在FP8精度下,大约需要投建63亿美元的B200或127亿美元的H100;在FP16精度下,大约需要投建254亿美元的H100。若大模型效果进一步优化,伴随参数量迈向大几十亿或百万亿级别,参考计算量C=6N的类线性关系,其算力成本或达到千亿美元。3)需要指出的是,本测算暂未考虑各类针对算力的优化措施,例如硬件计算效率的不断提升、MoE或已超越Dense架构成为大语言模型的主要选择、TTT等RNN新架构陆续推出等。另一方面,多模态引入了语音、图片、视频等更丰富的输入输出方式,或对大模型的训练提出更高要求。 训练攀升、推理加速,算力或仍是确定性最高的方向之一。1)Scaling-law助推参数量、数据量高速扩张,训练需求仍在攀升;同时,应用广泛开放,临近规模化时刻,推理需求加速释放。近期,全球科技大厂均对2024年资本开支表示乐观。2)我们认为,算力在AIGC大浪潮中的基石地位不言而喻,以英伟达、台积电等为代表的供应商可核心受益,算力或仍是确定性最高的方向之一,产业链共创共赢局面将持续打开。 相关标的: 1)算力侧:寒武纪、浪潮信息、中际旭创、新易盛、工业富联、海光信息、中科曙光、软通动力、协创数据、云赛智联、神州数码、高新发展、利通电子、烽火通信等。 2)AI相关:海康威视、中科创达、立讯精密、鹏鼎控股、金山办公、大华股份、拓尔思、润达医疗、漫步者、云天励飞、虹软科技、昆仑万维、中广天择、同花顺、科大讯飞、万兴科技、用友网络、赛意信息等。 风险提示:AI迭代不及预期风险;经济下行超预期风险;行业竞争加剧风险。
|
|