研报下载就选股票报告网
您好,欢迎来到股票分析报告网!登录   忘记密码   注册
>> 中信证券-英伟达(NVDA.US)深度跟踪报告:从ChatGPT看英伟达AI业务的短期弹性、中期空间-230228
上传日期:   2023/3/1 大小:   2338KB
格式:   pdf  共29页 来源:   中信证券
评级:   -- 作者:   许英博,陈俊云
下载权限:   此报告为加密报告
ChatGPT料将显著加速全球AI产业化进程,并推动大模型成为中短期主流技术路线,相应会带来底层算力消耗的持续、显著增长。依托产品性能、芯片组合、网络技术、软件全栈等层面综合优势,英伟达有望在AI训练、推理(云端)环节持续保持主导性地位。基于简化模型,我们静态估算ChatGPT及相关生成式AI在中短期对英伟达潜在业绩贡献为:训练端12.3亿美元、云端推理104.5亿美元。考虑到短期量化测算准确性相对有限,启发性思考、方向性判断可能更为重要,我们暂不计入ChatGPT及AI相关算力消耗给公司中期带来的新增业绩贡献。我们维持公司FY2024/25/26年收入预测为318.7/372.3/435.0亿美元、净利润(Non-GAAP)预测为115.9/146.7/177.1亿美元,公司当前股价对应FY2024/25/26年PE(Non-GAAP)估值分别为50/40/29x。作为典型的成长&周期股,目前公司正逐步进入业绩上行通道,公司股价亦有望获得来自业绩增长、估值扩张的双重支撑,我们持续看好公司的短期、中长期投资价值。
  ▍ChatGPT对AI产业可能影响:军备竞赛、AIGC、大模型、产业化运作等。ChatGPT在工程实践层面的创新,以及在全球市场流行带来的鲶鱼效应,有望在技术、产业层面对全球AI产业带来显著影响:1)ChatGPT推动科技巨头仓促应战,谷歌、微软、百度等科技巨头在大语言模型等领域积极投入,有望形成行业示范效应,中短期推升全球AI领域军备竞赛可能;2)ChatGPT等产品作为人类在内容生成领域的理想助手,有望实现内容生产从“人类为主”向“机器+人类协同”过渡,并推动AIGC时代全面到来;3)大模型虽可能不是AI终极答案,但却大概率是中短期最可能的技术方向,同时大模型涌现、泛化能力等,本身需要模型足够“大”,亦对应海量的底层算力消耗。相较于过去CV、推荐系统等小模型时代的“小作坊”模式,大模型良好的问题泛化能力,以及由此带来的“底层算力设施、算法模型、应用场景”的产业链结构,亦客观上推动AI产业形成更为高效的产业分工协作安排,加速AI产业化进程。
  ▍英伟达AI芯片:有望在AI训练、推理(云端)环节实现持续引领。在AI领域产品布局,英伟达基本遵从:端到端、训练推理一体、软件全栈的业务思路,产品主要包括:AI芯片(训练、推理)、网络(芯片互联、设备互联)、基础软件框架&应用软件等。
  1)芯片产品,英伟达芯片架构保持每两年一次更新迭代节奏,并通过制程升级、DSA设计、新的数据精度引入等系列手段提升芯片的综合计算性能,在AI训练、推理环节,均在若干主流的基准测试中实现性能参数遥遥领先主要竞争对手。同时数据中心市场,英伟达亦逐步形成GPU+CPU+DPU的产品组合,产品丰富度不断向英特尔、AMD看齐;
  2)网络互联,面向复杂AI模型的训练、推理,需要低延时&高速的芯片、设备互联。目前英伟达NVlink技术已进化到第四代,芯片间能够实现超过800GB/S的数据吞吐,Mellanox(英伟达2020年收购)作为全球InfiniBand网络的领导者,相关产品能够在数据中心内部实现设备间的高速、低延时互联,是HPC的最理想承载者;
  3)软件堆栈,从最底层的驱动程序,到最上层的行业应用程序、算法库等,英伟达一应俱全,CUDA生态优势,以及从训练到推理的端到端软件产品解决方案,预计中短期仍将持续构成英伟达最为主要的护城河之一。
  4)市场份额,据Liftr Insights数据,目前在最为前沿的北美数据中心AI芯片市场,英伟达份额占比超过80%。依托产品性能、芯片组合、网络技术、软件产品等层面的综合优势,我们判断英伟达有望在AI训练、推理(云端)环节持续保持主导性地位。
  ▍英伟达业绩弹性量化测算:ChatGPT作为典型的LLM模型,对于当下以大模型为主的AI产业,本身亦具有较好的代表和参考意义,我们聚焦于ChatGPT、生成式AI,并相应测算训练、推理环节的算力需求。以英伟达HGX服务器(含8张A100卡)为算力载体并假定服务器成本为8美元/小时,我们测算结果及说明如下:
  1) ChatGPT:a)训练环节,假设参数量为175B、训练数据500BTokens的情况下,我们使用256个英伟达HGXA100服务器,并假设模型FLOPsUtilization(MFU)为Megatron-LM的51.04%,推测单次训练时长约为30.7天,对应服务器端成本约为151万美元;b)推理环节,我们假定模型使用了96层、12288 Hidden Dimension、FP16和INT8混合精度并使用最大4096的Sequence Length,并假设每次用户请求生成的长度平均为200个tokens,问题长度小于500tokens,我们推算每次生成耗费算力成本约为2.7美分,当然2.7美分是理论情况下最高成本,我们估算实际成本视优化手段可能在理论最高成本10%-60%之间浮动。我们假设用户访问ChatGPT的单次成本为理论最高成本(2.7美分/次)的30%(0,8美分/次),服务器实际使用率为70%,则我们估算每天算力成本为160万美元,对应英伟达A100卡需求9.5万张,假定每张A100卡售价1.5万美元,对应英伟达潜在收入14.3亿美元,加上训练端成本,约为14.6亿美元。
  2)生成式AI
研究报告全文:从ChatGPT看英伟达AI业务的短期弹性中期空间英伟达NVDAOQ深度跟踪报告2023228中信证券研究部核心观点ChatGPT料将显著加速全球AI产业化进程并推动大模型成为中短期主流技术路线相应会带来底层算力消耗的持续显著增长依托产品性能芯片组合网络技术软件全栈等层面综合优势英伟达有望在AI训练推理云端环节持续保持主导性地位基于简化模型我们静态估算ChatGPT及相关生成式AI在中短期对英伟达潜在业绩贡献为训练端123亿美元云端推理1045亿美元考虑到短期量化测算准确性相对有限启发性思考方向性陈俊云判断可能更为重要我们暂不计入ChatGPT及AI相关算力消耗给公司中期带前瞻研究首席来的新增业绩贡献我们维持公司FY20242526年收入预测为分析师318737234350亿美元净利润Non-GAAP预测为115914671771S1010517080001亿美元公司当前股价对应FY20242526年PENon-GAAP估值分别为504029x作为典型的成长周期股目前公司正逐步进入业绩上行通道公司股价亦有望获得来自业绩增长估值扩张的双重支撑我们持续看好公司的短期中长期投资价值ChatGPT对AI产业可能影响军备竞赛AIGC大模型产业化运作等ChatGPT在工程实践层面的创新以及在全球市场流行带来的鲶鱼效应有望许英博在技术产业层面对全球AI产业带来显著影响1ChatGPT推动科技巨头仓科技产业首席促应战谷歌微软百度等科技巨头在大语言模型等领域积极投入有望形分析师成行业示范效应中短期推升全球AI领域军备竞赛可能2ChatGPT等产品S1010510120041作为人类在内容生成领域的理想助手有望实现内容生产从人类为主向机器人类协同过渡并推动AIGC时代全面到来3大模型虽可能不是AI终极答案但却大概率是中短期最可能的技术方向同时大模型涌现泛化能力等本身需要模型足够大亦对应海量的底层算力消耗相较于过去CV推荐系统等小模型时代的小作坊模式大模型良好的问题泛化能力以及由此带来的底层算力设施算法模型应用场景的产业链结构亦客观上推动AI产业形成更为高效的产业分工协作安排加速AI产业化进程英伟达AI芯片有望在AI训练推理云端环节实现持续引领在AI领域产品布局英伟达基本遵从端到端训练推理一体软件全栈的业务思路产品主要包括AI芯片训练推理网络芯片互联设备互联基础软件框架应用软件等1芯片产品英伟达芯片架构保持每两年一次更新迭代节奏并通过制程升级DSA设计新的数据精度引入等系列手段提升芯片的综合计算性能在AI训练推理环节均在若干主流的基准测试中实现性能参数遥遥领先主要竞争对手同时数据中心市场英伟达亦逐步形成GPUCPUDPU的产品组合产品丰富度不断向英特尔AMD看齐2网络互联面向复杂AI模型的训练推理需要低延时高速的芯片设备互联目前英伟达NVlink技术已进化到第四代芯片间能够实现超过800GBS的数据吞吐Mellanox英伟达2020年收购作为全球InfiniBand网络的领导者相关产品能够在数据中心内部实现设备间的高速低延时互联是HPC的最理想承载者3软件堆栈从最底层的驱动程序到最上层的行业应用程序算法库等英伟达一应俱全CUDA生态优势以及从训练到推理的端到端软件产品解决方案预计中短期仍将持续构成英伟达最为主要的护城河之一4市场份额据LiftrInsights数据目前在最为前沿的北美数据中心AI芯证券研究报告请务必阅读正文之后第28页起的免责条款和声明英伟达深度跟踪报告NVDAOQ2023228片市场英伟达份额占比超过80依托产品性能芯片组合网络技术软件产品等层面的综合优势我们判断英伟达有望在AI训练推理云端环节持续保持主导性地位英伟达业绩弹性量化测算ChatGPT作为典型的LLM模型对于当下以大模型为主的AI产业本身亦具有较好的代表和参考意义我们聚焦于ChatGPT生成式AI并相应测算训练推理环节的算力需求以英伟达HGX服务器含8张A100卡为算力载体并假定服务器成本为8美元小时我们测算结果及说明如下1ChatGPTa训练环节假设参数量为175B训练数据500BTokens的情况下我们使用256个英伟达HGXA100服务器并假设模型FLOPsUtilizationMFU为Megatron-LM的5104推测单次训练时长约为307天对应服务器端成本约为151万美元b推理环节我们假定模型使用了96层12288HiddenDimensionFP16和INT8混合精度并使用最大4096的SequenceLength并假设每次用户请求生成的长度平均为200个tokens问题长度小于500tokens我们推算每次生成耗费算力成本约为27美分当然27美分是理论情况下最高成本我们估算实际成本视优化手段可能在理论最高成本10-60之间浮动我们假设用户访问ChatGPT的单次成本为理论最高成本27美分次的3008美分次服务器实际使用率为70则我们估算每天算力成本为160万美元对应英伟达A100卡需求95万张假定每张A100卡售价15万美元对应英伟达潜在收入143亿美元加上训练端成本约为146亿美元2生成式AI我们假设所有的生成式AI大模型算力成本遵从类似于LLM的逻辑且模型训练成本推理环节单次用户请求成本和ChatGPT完全一致理想化假设a训练环节假设大模型的构建维护将主要由少数科技巨头科研机构主导考虑到底层大模型在AI领域的重要性我们相信每个具有相关技术资金能力的国家地区企业机构基本都倾向于构建一套自己的大模型我们保守估算全球范围内同时维护的大模型数量为50个则对应英伟达A100卡需求为1024万张对应收入154亿美元b推理环节为简化讨论我们主要聚焦于文字生成归纳代码编写商用搜索聊天机器人等几种主要应用场景我们静态测算上述场景合计收入为1742亿美元c市场份额目前英伟达数据中心GPU收入中我们判断训练环节占比90推理环节占比10左右我们假定英伟达能够在训练云端推理环节分别获得8060市场份额静态估算ChatGPT及相关生成式AI对英伟达潜在业绩贡献为训练端123亿美元推理端1045亿美元3补充说明我们的测算更多出于实际可操作性考虑并在前置条件做了较多简化处理且更多基于当前芯片算力模型参数应用场景等静态情形但全球AI产业是一个快速变化的领域动态的视角模型参数规模训练数据集规模模型架构工程实践优化以及芯片软件等层面的进步都可能导致模型对算力需求的急剧增长以及单次调用成本的大幅降低等风险因素公司核心产品技术演进速度不及预期风险地缘政治冲突导致公司产品难以在全球市场自由流动风险下游AI应用场景扩展不及预期风险全球宏观经济波动导致企业个人用户IT支出不及预期风险公司核心技术人员流失风险全球游戏市场创新不及预期风险全球自动驾驶进度不及预期风险地缘政治冲突导致公司产品全球流通受阻风险等投资建议考虑到短期量化测算准确性相对有限启发性思考方向性判断可能更为重要我们暂不计入ChatGPT及AI相关算力消耗给公司中期带来的新请务必阅读正文之后的免责条款和声明2英伟达深度跟踪报告NVDAOQ2023228增业绩贡献我们维持公司FY20242526年收入预测为318737234350亿美元净利润Non-GAAP预测为115914671771亿美元公司当前股价对应FY20242526年PENon-GAAP估值分别为504029x作为典型的成长周期股目前公司正逐步进入业绩上行通道公司股价亦有望获得来自业绩增长估值扩张的双重支撑ChatGPT及AI则有望在现有财务模型基础上贡献显著的业绩弹性我们持续看好公司的短期中长期投资价值项目年度FY2022FY2023FY2024EFY2025EFY2026E营业收入百万美元2691426974318653723243500YoY61402181168168毛利率649569644660660GAAP净利润9752436887151213113826YoY1251-552995392140Non-GAAP净利润112598366115861467417714YoY794-257385267207PS2222181612PEGAAP60133674837PENon-GAAP5269504029资料来源彭博中信证券研究部预测注股价为2023年2月27日收盘价请务必阅读正文之后的免责条款和声明3英伟达深度跟踪报告NVDAOQ2023228目录报告缘起7关于AI产业的几个关键判断8英伟达AI芯片竞争力分析12ChatGPT及生成式AI对英伟达业绩贡献分析19风险因素25盈利预测估值26请务必阅读正文之后的免责条款和声明4英伟达深度跟踪报告NVDAOQ2023228插图目录图1ChatGPT网站DAU用户数据7图2AI生成内容的典型应用场景及变化9图3AI算法模型的演进路径10图4大模型涌现能力10图5大模型的泛化能力11图6AI的产业链结构以AIGC应用为例12图7英伟达数据中心产品布局13图8AI模型和硬件的发展曲线以及供需情况14图9英伟达H100较A100性能提升表现15图10英伟达GPU单芯片推理性能Int8Tops15图11英伟达NVlink技术芯片互联16图12英伟达软件产品组合17图13英伟达CUDA架构17图14英伟达AI推理平台18图15北美数据中心AI加速器市占率202219图16北美云厂商市场英伟达加速芯片型号分布202219图17我们从ScalingLaws论文中给出的公式出发进行推算20图18HGXA100在FP16精度下的峰值算力为5PFLOPS20图19LLM模型的训练推理成本测算逻辑22图20LLM大语言模型主要应用场景22图21斯坦福大学讲师Mourri曾在2020年推算使用TeslaV100显卡训练GPT-3需要460万美元25图22Hopper架构在算力上理论可以将延时提升5倍25图23Hopper架构在内存带宽上理论可以将延时提升2-3倍25表格目录表1Chat-GPT发布以来各科技巨头行动8表2部分科技企业LLM大语言模型列表9表3部分GPU厂商产品参数对比14表4部分CPU和英伟达GPU的传输速度对比15表5英伟达部分DPU产品列表16表6数据中心内部主要网络结构类型16表7英伟达在AI训练推理环节优劣势分析18表8ChatGPT算法主要计算步骤19表9参考英伟达Megatron-LM175B的HGX实际算力理论峰值数据20表10ChatGPT推理任务测算表21表11ChatGPT每2000万日活跃用户对英伟达的收入影响推理环节21表12大模型训练环节对英伟达业绩拉动测算22表13文字生成归纳代码编写需求拉动量化测算23表14商用搜索需求拉动量化测算23请务必阅读正文之后的免责条款和声明5英伟达深度跟踪报告NVDAOQ2023228表15英伟达FY2023收入结构24表16Hopper架构在Flops与Bandwidth上均有明显提升25表17英伟达盈利预测估值数据26请务必阅读正文之后的免责条款和声明6英伟达深度跟踪报告NVDAOQ2023228报告缘起OpenAI团队最新公布的语言模型ChatGPT于2022年11月30日向社区发布测试并迅速在全球市场获得了极高的关注度根据Similarweb统计数据ChatGPT在上线两个月不到的时间内就拥有了超过1000万DAU近日来该数据更是逼近4000万ChatGPT的出现带来的对AI产业可能的影响和改变以及背后算力消耗规模英伟达可能受益逻辑等亦是近期资本市场讨论最为热烈的话题和内容之一在本篇内容中我们将基于对一系列相关问题进行依次深入分析的基础上尝试量化测算ChatGPT以及全球AI产业的发展对英伟达短期中期的可能业绩贡献1ChatGPT将为全球AI产业的技术发展底层算力需求产业化进程等带来何种影响2英伟达在AI加速训练推理领域的竞争力如何如何看待其在该领域的短期中期竞争优势以及相对份额变化3基于上述问题AI产业英伟达综合竞争力的综合分析如何量化测算英伟达在AI领域的短期中期可能业绩表现图1ChatGPT网站DAU用户数据资料来源similarweb网请务必阅读正文之后的免责条款和声明7英伟达深度跟踪报告NVDAOQ2023228关于AI产业的几个关键判断ChatGPT在工程实践高质量小数据集人类反馈强化学习等领域的创新以及在产业领域带来的鲶鱼效应有望在技术产业化等层面对全球AI产业带来显著的影响而这些产业层面的分析和判断将是我们形成一系列细粒度分析和判断的基础和前提AI产业宏观层面我们主要有如下几个核心判断1ChatGPT带来了AI领域的军备竞赛过去数年受制于AI带来的潜在伦理道德风险以及商业化成本等因素考虑科技巨头在AI领域的诸多理论技术创新更多停留于实验室阶段在商业化推广过程中亦保持非常谨慎的态度OpenAI作为科技领域的初创企业相对较小的AI伦理道德包袱以及极强的产品工程化思维推动了ChatGPT在全球市场的快速流行亦给科技巨头带来了显著的压力逼迫他们不得不仓促应战谷歌百度Meta阿里巴巴等科技巨头的近期动作便是较好的证明科技巨头在大语言模型等AI领域的大幅积极投入以及由此形成的示范效应料短期将带来全球AI领域的军备竞赛表1Chat-GPT发布以来各科技巨头行动公司时间事件2023110将于3月在中国推出生成式搜索人工智能机器人百度202327发布类似于ChatGPT的语言大模型文心一言2023128发布生成式AI音乐模型MusicLM2023130向人工智能初创公司AnthropicAI投资约3亿美元谷歌202323未来几周或几个月推出类似ChatGPT的基于人工智能的大型语言模型202327发布基于LaMDA的聊天机器人Bard2023123开启对OpenAI的第三轮投资微软202322宣布将OpenAI相关产品导入旗下云计算OfficeBingVivaSales等产品中202327发布集成ChatGPT功能的新版Bing搜索引擎与浏览器Edge资料来源各公司官网季度财务报告中信证券研究部2ChatGPT大幅加速AI产业化落地推动AIGC时代的全面到来以ChatGPT为代表的生成式AI具有广泛的应用场景可被广泛应用于文字归纳生成代码编写智能客服图像音视频合成等领域目前微软正将openAI的能力全面导入自身的软件产品当中以推动用户办公效率的改善我们判断科技巨头在AI领域的军备竞赛以及生成式AI本身清晰的下游应用场景将使得全球范围内AI产业化进程大幅加快而以ChatGPT为代表的相关产品作为人类在内容生成领域的理想助手有望实现内容生产从人类为主向机器人类协同过渡从而推动AIGC时代的全面到来请务必阅读正文之后的免责条款和声明8英伟达深度跟踪报告NVDAOQ2023228图2AI生成内容的典型应用场景及变化资料来源红杉资本表2部分科技企业LLM大语言模型列表公司模型模型参数OpenAIGPT31750亿谷歌LaMDA1370亿MetaLLaMA6500亿华为盘古2000亿微软英伟达Megatron-LM5300亿阿里巴巴M610万亿百度文心2600亿腾讯混元1000亿DeepmindSparrow700亿资料来源各公司官网中信证券研究部3大模型大概率为中短期主流技术路线带来更多底层算力消耗同时亦推动形成更为高效的产业分工协作安排全球AI技术的发展先后经历小模型大模型等主要发展阶段小模型主要在早期用于解决计算机视觉推荐系统等分析型AI工作而自2017年谷歌在论文中提出transformer架构以来研究人员持续通过模型参数增加更大的训练数据集等方式在NLP等生成式AI领域取得了不断的进步而基于transformer的CV计算机视觉也在不断成为市场研究的重点大模型是否代表着AI产业的未来产业学术界本身存在极大分歧当前亦很难做出判断但我们认为中短期维度大模型大概率是中短期AI主流技术方向目前大模型在NLP等生成式AI问题领域的求解能力很难被取代同时借助模型参数规模训练数据规模的持续扩展叠加模型架构优化工程方法改进等层面的配合在可见的技术范畴内大模型仍将是我们不断逼近通用人工智能的最理想技术路线著名学者RishiBommasaniDrewAHudson李飞飞等人在2021年的学术论文OntheOpportunitiesandRisksofFoundationModels中亦对所谓的基础模型理想的大模型进行了展望文章观点认为基础模型具有五个关键特性包括表现能力expressivity可扩展性scalability多模态multimodality记请务必阅读正文之后的免责条款和声明9英伟达深度跟踪报告NVDAOQ2023228忆能力memorystorage组合性compositionality等同时能够灵活地捕获和表示各种信息连接各种模式和领域的知识和数据可以储存大量积累的知识并可以很好地泛化到新的环境任务和环境中图3AI算法模型的演进路径资料来源中信证券研究部绘制大模型涌现泛化能力等本身需要模型足够大依赖于大模型参数体量训练数据集的不断扩大大模型的泛化问题求解能力能够持续提升同时目前研究表明在NLP领域大模型具有涌现能力但涌现能力无法使用scalinglaw来从较小模型上进行预测模型尺寸在某个阈值之前的效果接近随机但是超过该阈值后效果将大大高于随机大规模语言模型的涌现能力可以简单表述为在小模型上没有但是会出现在大模型上的能力这也意味着该能力不能通过简单的对小规模模型的改善获得虽然我们可以通过模型架构优化工程方法等方式不断改善模型的效果但更大的模型参数训练数据仍可能是最为根本的办法更大的模型带来更好的问题求解能力同时本身也意味着更多的算力消耗图4大模型涌现能力资料来源Weietal2022Chain-of-ThoughtPromptingElicitsReasoninginLargeLanguageModels注X轴代表模型大小请务必阅读正文之后的免责条款和声明10英伟达深度跟踪报告NVDAOQ2023228图5大模型的泛化能力资料来源RishiBommasaniDrewAHudson李飞飞等学术论文OntheOpportunitiesandRiskofFoundationModels大模型推动形成AI产业更为高效的分工协作安排在过去的小模型阶段研究人员需要承担从数据采集标注模型训练优化到模型部署的完整阶段同时小模型主要针对于特定问题的求解更多为小作坊模式产业各环节之前紧密耦合缺乏有效的分工协作安排大模型带来更好的问题泛化求解能力底层算力设施模型算法理论创新模型工程实践应用部署等主要环节之间可实现有效解耦比如少数科技巨头科研机构专注于算法理论创新大多数技术公司则聚焦于基础模型之上的fine-tune以及和特定应用场景的适配高效的产业分工协作安排亦将推动AI产业化进程的大幅加速请务必阅读正文之后的免责条款和声明11英伟达深度跟踪报告NVDAOQ2023228图6AI的产业链结构以AIGC应用为例资料来源AndreessenHorowitz英伟达AI芯片竞争力分析产品布局端到端训练推理一体软件全栈目前在AI领域英伟达的对应业务主要包括数据中心自动驾驶两个领域自动驾驶属于针对特定应用场景的边缘推理范畴我们暂不做讨论我们主要聚焦于英伟达的数据中心业务而在数据中心的业务布局英伟达基本遵从端到端训练推理一体软件全栈的业务布局思路相关产品从底层向上主要包括AI芯片训练推理网络芯片互联设备互联基础软件框架应用软件等在完成了行业层面的分析之后在本部分内容中我们将主要对英伟达在AI芯片领域的综合竞争力进行系统分析和探讨请务必阅读正文之后的免责条款和声明12英伟达深度跟踪报告NVDAOQ2023228图7英伟达数据中心产品布局资料来源英伟达官网AI芯片工艺DSA新数据精度类型等实现系统级最优目前AI模型对算力的需求增速远远高于摩尔定律以及芯片自身的性能提升速度芯片的设计是一个系统性工程需要算法模型软件和硬件层面的共同协同以实现系统效率的最大化目前英伟达GPU产品从2018年的图灵到2020年的安培以及2022年的霍普芯片架构保持每两年一次的更新迭代节奏并通过制程DSA新的数据精度引入等系列手段提升芯片的计算性能以英伟达Hopper架构为例1工艺提升带来计算频率提升以及同等Die面积下计算单元数增加2领域专用架构DSA设计带来性能提升Hopper架构引入Transformer计算单元3引入新数据精度类型用低精度来代替高精度单元比如Hopper引入FP8等系列的举措亦使得英伟达芯片无论是在训练抑或是推理环节均在若干主流的基准测试中性能参数持续领先主要竞争对手请务必阅读正文之后的免责条款和声明13英伟达深度跟踪报告NVDAOQ2023228图8AI模型和硬件的发展曲线以及供需情况资料来源RishiBommasaniDrewAHudson李飞飞等学术论文OntheOpportunitiesandRiskofFoundationModels表3部分GPU厂商产品参数对比品牌AMDAMDNVIDIANVIDIANVIDIANVIDIANVIDIAINSTINCTINSTINCTA10080GB产品P100V100SXM2T4H100PCIeMI100MI250PCIe发布日期2020202120162017201820202022工艺7nm6nm16nm12nm12nm7nm4nm212312半精度FP161846TFLOPS3621TFLOPS125TFLOPS65TFLOPSNATFLOPSTFLOPS半精度FP161600NANA不支持不支持不支持不支持TensorCoreTFLOPS106157195单精度FP32231TFLOPS453TFLOPSNA48TFLOPSTFLOPSTFLOPSTFLOPS461TFLOPS905TFLOPS单精度FP32AMD为MatrixAMD为Matrix不支持不支持不支持156TFLOPS800TFLOPSTensorFloatCoreCore双精度FP64115TFLOPS453TFLOPS53TFLOPS78TFLOPS81TFLOPS97TFLOPS24TFLOPS905TFLOPS双精度FP64195不支持AMD为Matrix不支持不支持不支持48TFLOPSTensorCoreTFLOPSCoreINT81846TOPs3621TOPsNANA130TOPs624TOPsNAINT8Tensor不支持NA不支持不支持不支持不支持3200TOPsCoreCUDA兼容否否是是是是是资料来源AMD英伟达官网中信证券研究部请务必阅读正文之后的免责条款和声明14英伟达深度跟踪报告NVDAOQ2023228图9英伟达H100较A100性能提升表现资料来源英伟达GTC图10英伟达GPU单芯片推理性能Int8Tops资料来源英伟达官网中信证券研究部计算芯片组合GPUCPUDPUGPU本身并非图灵完备的产品需要依赖于和CPU等计算芯片的配合目前全球主要逻辑芯片厂商英特尔AMD等均倾向于在数据中心领域提供一体化的芯片解决方案英伟达亦不例外目前英伟达整合Mellanox技术之后形成的网络芯片DPU已经量产上市同时基于ARM架构的高性能计算CPU主要和GPU配合使用也有望在2023H2大规模量产上市CPUGPUDPU的产品组合叠加英伟达在网络软件层面的突出优势有望进一步强化英伟达在数据中心HPC领域的竞争优势表4部分CPU和英伟达GPU的传输速度对比芯片组合英伟达GraceEPYC2A100EPYC1V100GPU-to-CPUInterface900GBsec64GBsec32GBsecCummulativeBothDirectionsNVLink4PCIe4x16PCIe3x16请务必阅读正文之后的免责条款和声明15英伟达深度跟踪报告NVDAOQ2023228芯片组合英伟达GraceEPYC2A100EPYC1V100CPU-to-CPUInterface600GBsec304GBsec152GBsecCummulativeBothDirectionsNVLink4InfinityFabric2InfinityFabric资料来源anandtech中信证券研究部表5英伟达部分DPU产品列表DPU产品名称计划上市时间是否集成GPU是否为SOC芯片BlueField-22021年上市否否BlueField-2x2021年上市是否BlueField-32022年上市是否BlueField-3x2022年上市是否BlueField-42023年上市是是资料来源英伟达2020GTC大会中信证券研究部网络技术NVLinkInfiniBand面向复杂AI模型的训练推理需要更多依赖于GPU卡硬件集群因此低延时高速的芯片互联设备互联显得尤为重要在芯片互联环节英伟达具有引以为傲的NVlink技术目前该技术已经进化到第四代芯片间能够实现超过800GBS的数据吞吐设备间互联部分英伟达2020年完成对网络芯片技术提供商Mellanox的收购Mellanox作为全球InfiniBand网络的领导者相较于以太网IB网络能够在数据中心内部实现设备间的高速低延时互联是HPC的最理想承载者图11英伟达NVlink技术芯片互联资料来源英伟达官网表6数据中心内部主要网络结构类型类别承载业务典型特征InfiniBand高性能计算HPC业务低延时FiberChannel存储业务网络0丢包以太网通用计算业务低成本易扩展资料来源中信证券研究部整理请务必阅读正文之后的免责条款和声明16英伟达深度跟踪报告NVDAOQ2023228软件堆栈从底层框架到应用场景训练推理一体目前英伟达在软件领域中的产品布局相对较广涵盖了从最底层的驱动程序到最上层的行业应用程序算法库等可简单分类为底层套件应用工具应用框架两大部分1底层套件主要用于帮助用户降低芯片硬件使用门槛提升易用性通用性等主要产品包括面向GPU领域的CUDA面向DPU领域的DOCA等本身旨在提升芯片本身的通用性易用性同时在推理环节英伟达亦具有tensorRT等框架实现训练推理的端到端部署2应用工具为英伟达面向各细分领域应用场景推出的应用解决方案包括Omniverse元宇宙AIEnterprise企业AI框架Drive自动驾驶等CUDA等构建的生态优势以及从训练到推理的端到端软件产品解决方案预计中短期仍将持续构成英伟达最为主要的护城河之一图12英伟达软件产品组合资料来源英伟达GTC中信证券研究部图13英伟达CUDA架构资料来源英伟达官网请务必阅读正文之后的免责条款和声明17英伟达深度跟踪报告NVDAOQ2023228图14英伟达AI推理平台资料来源英伟达官网小结英伟达有望在AI训练推理云端环节持续保持主导性地位依托产品性能芯片组合网络技术软件产品等层面的综合优势以及由此形成的端到端训练推理一体全栈式的解决方案使得英伟达持续引领全球AI市场据LiftrInsights数据目前在AI技术进展最为前沿的北美数据中心AI芯片市场英伟达份额占比超过80且在训练推理环节均保持持续领先英伟达在训练环节的综合优势市场本身没有太多分歧市场当前分歧主要在于推理环节主要理由在于1推理环节相较于训练环节更低的门槛主要体现在计算精度算力消耗量等方面2英伟达GPU本身在功耗延时等层面并不占优AI推理主要包括云端推理边缘推理边缘节点或终端两种情形英伟达在边缘推理环节的确不具备压倒性优势但在云端推理环节从基本的认知逻辑出发英伟达大概率仍将是最具有竞争力的参与者同时我们看到在商业操作上英伟达亦在采用更为务实的策略即通过和云计算厂商的合作为企业客户提供AI算力服务该种合作模式类似于数据仓库领域的Snowflake和AWS等云计算平台的合作表7英伟达在AI训练推理环节优劣势分析AI训练AI推理判断芯片性能软件堆栈等支撑英伟达持续领先判断训练推理一体灵活性优势延迟功耗为主要约束外部服务谷歌微软亚马逊Facebook谷歌微软亚马逊FacebookTPUv23NANANATPUv23BrainwaveInferentiaNA判断英伟达强大芯片性能能在一定程度上降低成本端劣势判断延迟功耗为主要约束但面临着内部解决方案和ASIC的竞争内部使用谷歌微软亚马逊Facebook谷歌微软亚马逊FacebookTPUv23NANANATPUv123BrainwaveNANA资料来源各公司官网中信证券研究部请务必阅读正文之后的免责条款和声明18英伟达深度跟踪报告NVDAOQ2023228图15北美数据中心AI加速器市占率2022图16北美云厂商市场英伟达加速芯片型号分布2022英伟达AWSxilinxGCP其他AMD英特尔V100T4A100P100A10K80M60P4A10GP40T4GK52086资料来源LiftrInsights中信证券研究部资料来源LiftrInsights中信证券研究部ChatGPT及生成式AI对英伟达业绩贡献分析在上文内容中我们对AI产业的一些关键趋势英伟达在AI芯片领域的竞争力等进行了分析探讨为我们进一步探讨AI对英伟达业务的业绩弹性建立了一般基础ChatGPT以及AI产业的发展如何通过对算力需求的拉动而影响英伟达自身的业绩弹性本身是一个非常较为复杂的问题同时受到技术产业等层面诸多因素的影响在本部分内容中我们尝试从ChatGPT出发并基于若干简化的假设量化测算英伟达的业绩弹性当然ChatGPT作为一个典型的LLM模型对于当下以大模型为主的AI产业本身亦具有较好的代表和参考意义ChatGPT的计算过程主要涉及模型Pre-training模型fine-tune模型推理等三个环节其中模型fine-tune环节算力消耗相对有限否则直接把大模型推倒重来就可以了我们不做展开讨论我们主要聚焦于模型预训练模型推理两个环节表8ChatGPT算法主要计算步骤STEP内容描述1模型pre-training搭建算法架构基于大数据集对模型进行自监督训练生成大模型2模型fine-tune基于小数据集RLHF等对模型进行调优和对齐3模型推理响应用户调用需求并输出计算结果资料来源OpenAI中信证券研究部ChatGPT模型训练成本预计单次成本约151万美元因为单次模型训练耗时较长一般情况下不太会反复预训练大语言模型因此我们在测算训练环节成本时假定预训练单次且训练过程中没有出现错误时的成本实际情形中考虑到训练过程中出现工程类错误的可能性实际成本会高于我们计算的理想情况成本假设参数量为175B训练数据500BTokens的情况下根据OpenAI公司发表的论文ScalingLawsforNeuralLanguageModels我们在使用256个英伟达HGXA100服务器包含2048个A100GPU卡的情况下模型FLOPsUtilizationMFU假设为Megatron-LM的5104我们推测单次训练时长约为307天对应约151万GPU小时假设训练使用成本价约为1美元GPU小时的情况下耗费服务器端成本约为151万美元请务必阅读正文之后的免责条款和声明19英伟达深度跟踪报告NVDAOQ2023228图17我们从ScalingLaws论文中给出的公式出发进行推算图18HGXA100在FP16精度下的峰值算力为5PFLOPS资料来源openAIScalingLawsforNeuralLanguageModels资料来源openAIScalingLawsforNeuralLanguageModels表9参考英伟达Megatron-LM175B的HGX实际算力理论峰值数据模型大小MFUHFU22B41504370175B51405280530B560057001T56305700资料来源英伟达官网中信证券研究部Chatgpt模型推理成本综合成本远高于训练环节预计目前单次用户调用成本理论最高27美分用户每请求一次ChatGPT的生成都需要耗费大量的算力资源这是目前ChatGPT的主要成本项关于推理端成本测算的参考内容较少主要是因为模型构成的细节变化会较大程度的改变模型推理每一个TokenToken可以理解为单词的一部分常用的单词一个词即为一个token而复杂的单词可能由几个token共同组成所需要的时间继承上部分在训练端测算所做的假设ChatGPT基于GPT35DenseDavinci模型此外对于模型细节我们做进一步假设模型使用了96层12288HiddenDimensionFP16和INT8混合精度并使用最大4096的SequenceLength实际推理速度主要由两部分组成一部分是通信延迟另一部分是硬件内存带宽考虑到实际推理时Batch一般较小以及会做相应的优化我们寻求简便忽略掉通信延迟的影响根据OpenAI的ScalingLawsforNeuralLanguageModels论文中的公式我们可以推算出模型生成每一个Token总共需要的GPU内存约为025TB考虑到HGXA100服务器8A100进行推理时的性能参数ChatGPT推理在小BatchSize的情况下是一个访存限制的任务而在大BatchSize的情况下是算力限制任务这里我们假设极端情况认为ChatGPT推理是一个完全访存限制的任务且不对存储做额外优化并行优化等假设每次生成的长度平均为200个tokens问题长度小于500tokens我们推算每次生成的成本约为27美分而在现实情况下执行推理任务时会对存储方式以及硬件并行进行额外的优化以降低带宽延迟影响但具体优化程度缺少对实现细节的了解时难以量化因此单次生成27美分是理论情况下最高成本实际成本视优化手段可能在理论最高成本10-60之间浮动请务必阅读正文之后的免责条款和声明20
 
Copyright © 2005 - 2021 Nxny.com All Rights Reserved 备案号:蜀ICP备15031742号-1