>> 方正证券-计算机行业研究:AI算力的几个关键问题解析-230419
| 上传日期: |
2023/4/20 |
大小: |
879KB |
| 格式: |
pdf 共5页 |
来源: |
方正证券 |
| 评级: |
推荐 |
作者: |
方闻千 |
| 行业名称: |
计算机 |
| 下载权限: |
此报告为加密报告 |
|
|
近期微软自研AI芯片以及开源DeepSpeed Chat等事件引发市场关注,我们针对这几个关键事件对算力未来的市场需求以及竞争格局的影响进行了重点解析,观点如下: 问题一:微软推出自研AI芯片将对GPU产业格局的影响? 根据The Information等媒体报道,微软当前正在加速开发自研AI芯片,而早在2019年微软已经在内部开始针对人工智能(AI)芯片进行开发,内部代号为Athena,预计微软的自研AI芯片最早可在明年开始在微软及OpenAI内部广泛使用。 我们认为微软自研芯片的主要目的更多在于对自身AI模型训练成本以及供应链安全的考虑。随着ChatGPT引领的生成式AI和大模型产业浪潮的到来,当前英伟达的主力AI芯片A100和H100面临供货紧张及价格上涨等问题,且目前未看到放缓迹象。根据John Peddie Research的数据,英伟达占据了GPU市场约86%的份额。由于GPU对于AI模型的训练至关重要,此前微软已经投入数亿美元购买了数万颗A100芯片用于开发ChatGPT和GPT-4,未来面临下一代模型开发,对芯片的需求量将进一步提升。因此微软推进自研芯片的计划主要是出于模型训练成本以及供应链安全的考虑,而对于英伟达在AI/ML领域的地位短期内则难以构成太大威胁。此外,微软在云算力平台中也需要为不想要高成本的Nvidia芯片的客户提供更多的低成本选择。 从产业格局来看,目前全球科技巨头均在加速算力侧的布局,软件厂商开始自研芯片,而硬件厂商则在搭建算力平台。一方面,包括微软、亚马逊、谷歌和Facebook等软件及互联网巨头均在加大自研AI芯片的投入,同样国内头部互联网厂商阿里、腾讯、百度等也均披露了AI芯片的自研计划,而另一方面,以英特尔为代表的芯片厂商则开始搭建算力平台,发力软件和云服务。在今年GTC(英伟达开发者大会)上,英伟达正式推出了AI云服务DGXCloud,使企业能够即时接入用于训练生成式AI等开创性应用的高级模型所需的基础设施和软件,DGXCloud可提供NVIDIADGXAI超级计算专用集群,并配以NVIDIAAI软件。DGXCloud能够让每个企业都可以通过的网络浏览器来访问NVIDIA的AI超级计算机,免除了购置、部署和管理本地基础设施的复杂性。DGXCloud每月最低的订阅价格为3.7万美元。 问题二:微软的DeepSpeed Chat等技术是否会大幅降低算力需求? 微软宣布开源DeepSpeed Chat,能够以更低的成本、更快的速度训练类似于ChatGPT的高质量大模型。DeepSpeed Chat基于微软的DeepSpeed深度学习优化库开发而成,具备训练、强化推理等功能,针对模型训练的RLHF(基于人类反馈的强化学习)过程,可以将训练速度提升15倍以上,同时大幅降低成本。具体来看:基于DeepSpeed Chat,在Azure上只需9小时即可训练一个13亿参数模型,只需18小时即可训练一个30亿参数模型,且两种训练花费不到300美元和600美元。同时,对于拥有1750亿参数的超大模型,DeepSpeed Chat能够并行多节点多GPU系统,仅需约20小时,花费约5120美元的成本就能实现模型的训练。 DeepSpeed Chat从原理来讲是针对模型训练中的RLHF过程来进行加速。ChatGPT的训练通常包含了三个常规步骤:1)监督微调(SFT),2)训练奖励模型(RW),3)基于人类反馈的强化学习(RLHF),使用RW模型来训练SFT模型。DeepSpeed Chat流程的前两步与模型训练中的常规微调过程相似,仅是在规模和速度上有所提升。而在第三步RLHF,则是训练过程最耗时和最消耗算力资源的一步,因为:1)内存成本较高,在第三阶段的整个过程中需要运行多个SFT和RW模型;2)生成回答阶段的速度较慢,如果没有正确加速,将显著拖慢整个第三阶段。而DeepSpeed Chat主要是针对第三步进行加速,一方面是将训练能力和推理能力整合到一个统一的混合引擎,使得模型能够无缝地在推理和训练模式之间切换,能够快速更新模型的权重;另一方面采用多种并行计算和内存管理的优化技术,如使用张量并行计算和高性能CUDA算子进行语言生成,同时使用轻量级内存管理系统来处理KV缓存和中间结果,进而大幅提升了模型的吞吐量。 虽然DeepSpeed Chat能显著降低RLHF的算力需求,但是对通用大模型训练的总算力需求影响不大(预计5%以内)。从一个通用大模型的训练过程来看,一般分为Pre-training(预训练)和Fine-tuning(微调)两个阶段,其中Pre-training(预训练)对于算力资源的消耗要远大于Fine-tuning(微调),特别是在轻量化微调技术应用之后,两个阶段对算力资源消耗的比例通常会大于100:1。虽然ChatGPT模型的训练采取的RLHF方式,与常见的大语言模型的预训练和微调环节存在较大差别,更复杂且算力消耗更大,但是本质上更接近于模型微调。因此DeepSpeed Chat虽然能显著降低RLHF的算力需求,但无法对预训练环节的算力消耗产生直接影响,因此对大模型训练的总算力需求影响不大。 问题三:LLaMA等开源模型的广泛应用是否会降低对算力的需求? 短期来看,LLaMA会降低对训练侧的算力
|
|