>> 浙商证券-计算机行业AIGC算力时代系列报告-ChatGPT芯片算力:研究框架-230210
| 上传日期: |
2023/2/11 |
大小: |
2032KB |
| 格式: |
pdf 共29页 |
来源: |
浙商证券 |
| 评级: |
看好 |
作者: |
陈杭 |
| 行业名称: |
计算机 |
| 下载权限: |
此报告为加密报告 |
|
|
ChatGPT热潮席卷全球。ChatGPT(Chat Generative Pre-trained Transformer)是由OpenAI于2022年12月推出的对话AI模型,一经面世便受到广泛关注,其2023年1月月活跃用户达到1亿,是史上月活用户增长最快的消费者应用。在问答模式的基础上ChatGPT可以进行推理、编写代码、文本创作等等,这样的特殊优势和用户体验使得应用场景流量大幅增加。 1、▲芯片需求=量↑ x价↑,AIGC拉动芯片产业量价齐升 1)量:AIGC带来的全新场景+原场景流量大幅提高。①技术原理角度:ChatGPT基于Transformer技术,随着模型不断迭代,层数也越来越多,对算力的需求也就越来越大;②运行条件角度:ChatGPT完美运行的三个条件:训练数据+模型算法+算力,需要在基础模型上进行大规模预训练,存储知识的能力来源于1750亿参数,需要大量算力。 2)价:对高端芯片的需求将拉动芯片均价。采购一片英伟达顶级GPU成本为8万元,GPU服务器成本通常超过40万元。支撑ChatGPT的算力基础设施至少需要上万颗英伟达GPUA100,高端芯片需求的快速增加会进一步拉高芯片均价。 2、ChatGPT的“背后英雄”:芯片,看好国内GPU、CPU、FPGA、AI芯片及光模块产业链 1)GPU:支撑强大算力需求。由于具备并行计算能力,可兼容训练和推理,目前GPU被广泛应用于加速芯片。看好海光信息、景嘉微; 2)CPU:可用于推理/预测。AI服务器利用CPU与加速芯片的组合可以满足高吞吐量互联的需求。看好龙芯中科、中国长城; 3)FPGA:可通过深度学习+分布集群数据传输赋能大模型。FPGA具备灵活性高、开发周期短、低延时、并行计算等优势。看好安路科技、复旦微电、紫光国微; 4)ASIC:极致性能和功耗表现。AIASIC芯片通常针对AI应用专门设计了特定架构,在功耗、可靠性和集成度上具有优势。看好寒武纪、澜起科技; 5)光模块:容易被忽略的算力瓶颈。伴随数据传输量的增长,光模块作为数据中心内设备互联的载体,需求量随之增长。看好德科立、天孚通信、中际旭创。 风险提示 1、AI技术发展不及预期 2、版权、伦理和监管风险 3、半导体下游需求不及预期
研究报告全文:证券研究报告ChatGPT芯片算力研究框架AIGC算力时代系列报告行业评级看好2023年2月10日分析师陈杭研究助理安子超邮箱chenhangstockecomcn邮箱anzichaostockecomcn证书编号S1230522110004算力需求爆发拉动芯片量价齐升光模块和光芯片通过AI服务器实现Transformer技术模型迭代芯片需求快速增加GPU算力需求增加芯片均价大幅提升CPU量价芯片需求AI训练计算需求FPGA模型训练成本预计每35个月翻一番1200万美元模型算法训练数据算力AI英伟达GPUA100ChatGPT完美运行1万颗光模块AI芯片加速器2资料来源浙商证券研究所摘要ChatGPT热潮席卷全球ChatGPTChatGenerativePre-trainedTransformer是由OpenAI于2022年12月推出的对话AI模型一经面世便受到广泛关注其2023年1月月活跃用户达到1亿是史上月活用户增长最快的消费者应用在问答模式的基础上ChatGPT可以进行推理编写代码文本创作等等这样的特殊优势和用户体验使得应用场景流量大幅增加1芯片需求量x价AIGC拉动芯片产业量价齐升1量AIGC带来的全新场景原场景流量大幅提高技术原理角度ChatGPT基于Transformer技术随着模型不断迭代层数也越来越多对算力的需求也就越来越大运行条件角度ChatGPT完美运行的三个条件训练数据模型算法算力需要在基础模型上进行大规模预训练存储知识的能力来源于1750亿参数需要大量算力952价对高端芯片的需求将拉动芯片均价采购一片英伟达顶级GPU成本为8万元GPU服务器成本通常超过40万元支撑ChatGPT的算力基础设施至少需要上万颗英伟达GPUA100高端芯片需求的快速增加会进一步拉高芯片均价添加标题2ChatGPT的背后英雄芯片看好国内GPUCPUFPGAAI芯片及光模块产业链1GPU支撑强大算力需求由于具备并行计算能力可兼容训练和推理目前GPU被广泛应用于加速芯片看好海光信息景嘉微2CPU可用于推理预测AI服务器利用CPU与加速芯片的组合可以满足高吞吐量互联的需求看好龙芯中科中国长城3FPGA可通过深度学习分布集群数据传输赋能大模型FPGA具备灵活性高开发周期短低延时并行计算等优势看好安路科技复旦微电紫光国微4ASIC极致性能和功耗表现AIASIC芯片通常针对AI应用专门设计了特定架构在功耗可靠性和集成度上具有优势看好寒武纪澜起科技5光模块容易被忽略的算力瓶颈伴随数据传输量的增长光模块作为数据中心内设备互联的载体需求量随之增长看好德科立天孚通信中际旭创3风险提示1AI技术发展不及预期2版权伦理和监管风险3半导体下游需求不及预期401ChatGPT带动算力芯片量价齐升目录02CPUGPUFPGAAI芯片提CONTENTS供底层算力支持03光模块支撑数据传输5AI计算需要各类芯片支撑算力需求爆发芯片量价算力需求爆发拉动齐升01芯片量价齐升AI服务器为算力载体CPUGPUFPGAPartoneASIC光模块各司其职601人工智能四层架构芯片为底层支撑AI绘画盗梦师AI写作弈写AIGCAI音乐DeepMusic上层应用ChatGPT百度文心大模型谷歌PaLM华为盘古大模型大模型OpenAIGPT35百度PaddlePaddleMetaPyTorch华为MindSpore深度学习框架谷歌TensorFlowCPUGPU底层芯片FPGAASIC7资料来源澜舟科技IDC量子位电子发烧友等浙商证券研究所01人工智能不同计算任务需要各类芯片实现强大的调度管理并行架构低延时成本低协调能力计算单元多开发周期短能耗低应用范围广适合大量逻辑确定硬件可根据需求调整性能强开发方便灵活的重复计算成本和壁垒高针对AI设定特定架构通用CPU性GPU强应用方FPGA便AI用ASIC研发阶段逻辑判断数据中心任务调度与控制模型训练AI推理成熟量产阶段性能更优能效更高8资料来源Huaweiforum浙商证券研究所01ChatGPT流量激增为AI服务器带来重要发展机遇原场景流量提升新应用场景服务器算力要求提升AI服务器需求增加达成1亿月活跃用户耗时传统CPU服务器史上用户增速最终端用户使用频率提高通用性较强专用性较弱快消费级应用数据流量暴涨对服务器的数据处理能力可靠性及安全性等要求相应提升算力无法满足78个月60个月54个月30个月数据的质和量发生变化9个月非结构化数据占比激增AI服务器需求2个月应用288亿美元ChatGPT在问答模式的基础上进行推理编写代码CAGR188原场景流量提升文本创作等用户人数及使用次数均提升全球AI服122亿美元智能客服智能音箱内容生产务器市场规模创造新应用场景游戏NPC陪伴型机器人920202025资料来源SensorTowerWorldofEngineering头豹研究院华经产业研究院浙商证券研究所01AI服务器快速增长大力拉动芯片需求中国人工智能服务器工作负载预测中国人工智能芯片市场规模占比AI服务器训练推理ASIC10FPGA04100NPU969080异构形式7060504030CPU201002020202120222023202420252026GPU8902021年全球服务器市场格局2021年中国服务器市场格局GPU其他171新华三HPE156其他218或浪潮307戴尔154FPGAODM85或ODM联想66355浪潮8974新华三HPEASIC联想64华为华为11戴尔7517510资料来源IDC2022-2023中国人工智能计算力发展评估报告芯八哥wind浙商证券研究所整理AI服务器芯片构成CPU加速芯片AI服务器应用领域应用场景CPU加速芯片通常搭载GPU计算机视觉机器学习FPGAASIC等加速芯片利用CPU与加速芯片的组合可以满足训练算力30TOPS高吞吐量互联的需求自然语言处理芯片种类优点缺点提供了多核并行计算的基础结构核心管理控制能力弱功高度GPU数多可支撑大量数据的并行计算拥推理耗高适配有更高浮点运算能力算力30TOPS可以无限次编程延时性较低拥有流开发难度大只适合FPGA水线并行GPU只有数据并行实时定点运算价格比较性最强灵活性最高昂贵计算与通用集成电路相比体积更小重量更灵活性不够价格高530TOPSASIC轻功耗更低可靠性提高性能提高于FPGA保密性增强成本降低11资料来源华经产业研究院亿欧智库浙商证券研究所01CPU擅长逻辑控制可用于推理预测整个CPU的指挥控制中心由指CPU运行原理令寄存器IR指令译码器ID和操修改指令作控制器OC等组成取指令指令译码执行指令计数器暂时存控制单元作为计算机系统的运算和控制核心放数据是信息处理程序运行的最终执行单元的区域控制指令控制指令保存等CPU待处理有大量的缓存和复杂的逻辑控制单元优势或已经数据擅长逻辑控制串行的运算处理过存储单元运算单元的数据计算量较小且不擅长复杂算法运算和劣势处理并行重复的操作执行部件运算器的核心可以执行算术运算和逻辑运算运算单元所进行的全部操作都是由控制单元发出的控制信号来指挥在深度学习中可用于推理预测12资料来源CSDN浙商证券研究所整理01服务器CPU向多核心发展满足处理能力和速度提升需要单核心CPU多核心CPU系统性能优劣不能只考虑CPU核心数量还要考虑操作系统调度算串行单任务处理分时多任务处理处理的任务更多分时多任务处理法应用和驱动程序等处理速度更快一心一用一心多用多心多用20052010201720202023英特尔Sapphire奔腾D系列酷睿i7-980X酷睿i9Lakefield从单核到多核Rapids史上第一个双核首款6核处理器18核处理器首款采用混合架构拥有56个核心处理器的x865核处理器20052007201820202023AMD第二代锐龙锐龙Threadripper96Athlon64X2Phenom9500霄龙9004从双核到核Threadripper3990X同一块芯片内整首款原生4核处最大核心数量已拥有64核核心数量最多可合两个K8核心理器达到32核达96个13资料来源芯论语半导体产业纵横AMD官网浙商证券研究所01GPU高度适配AI模型构建AI模型构建以英伟达A100为例ChatGPT引发GPU热潮训练过程推理过程百度即将推出文心一言ERNIEBotGPU的并行计算高度适配神经网络多实例GPUMIG技术允许多个网络同时苹果引入AI加速器设计的M2系基于单个A100运行从而优化计算资源的列芯片M2pro和M2max将被利用率95搭载于新款电脑在A100其他推理性能增益的基础之上仅结构稀疏支持一项就能带来高达两倍的性能OpenAIChatGPT提升随着的使用量在BERT等先进的对话式AI模型上A100激增OpenAI需要更强的计算能GPU帮助高速解决问题2048个A100可将推理吞吐量提升到高达CPU的249倍力来响应百万级别的用户需求因GPU可在一分钟内成规模地处理BERT249X此增加了对英伟达GPU的需求之类的训练工作负载3X245XAMD计划推出与苹果M2系列芯片竞争的台积电4nm工艺1XPhoenix系列芯片以及使用07XChiplet工艺设计的AlveoV70AI芯片这两款芯片均计划在今年推1X向市场分别面向消费电子市场以V100A10040GBA10080GBCPUOnlyA10040GBA10080GBAIFP16FP16FP16及推理领域14资料来源英伟达官网镁客网腾讯网浙商证券研究所01FPGA可通过深度学习分布集群数据传输赋能大模型可编程灵活性高半定制电路理论上可以实现任意ASIC和DSP的逻辑功能开发周期短可通过设计软件处理布线布局及时序等问题现场可重编功能可以远程通过软件FPGA实现自定义硬件功能低延时逻辑门通过硬件线连接不需要时钟信号方便并行计算集成了大量基本门电路一次可执行多个指令算法推理IntelAMDXilinx亚马逊深度学习异构计算并行计算AMDXilinx微软百度阿里腾讯训练IntelAMDXilinx通信接口数据高速收发交换数据中心边缘端15资料来源ofweek摩尔星球C114知识产权课堂亿欧智库浙商证券研究所01ASIC可进一步优化性能与功耗全球巨头纷纷布局国内外ASIC芯片龙头布局随着机器学习边缘计算自动驾驶的发展大量数据处理任务的产生对于芯片计算效率计算能力和计能耗比的要求也越来越高ASIC通过与CPU结合的方式被广泛关注国内外龙头厂商纷纷布局迎战AI时代的到来谷歌张量处理器TPU阿里巴巴含光800AI芯片最新的TPUv4集群被称为Pod包含4096个硬件自研芯片架构v4芯片可提供超过1exaflops的浮点性能软件集成达摩院先进算法可实现大网络模型在一颗NPU上完成计算英伟达GPUCUDA百度昆仑2代AI芯片国主要面向大型数据密集型HPC和AI应用国外基于Grace的系统与NVIDIAGPU紧密结内采用全球领先的7nm制程搭载自研的第二合性能比NVIDIADGX系统高出10倍代XPU架构相比一代性能提升2-3倍昆仑芯3代将于2024年初量产HabanaIntel收购华为昇腾910AIGaudiAI已推出云端训练芯片和云端业界算力最强的AI处理器基于自研华为推理芯片Goya达芬奇架构3DCube技术16资料来源机器之心华为官网半导体产业纵横公开资料整理浙商证券研究所01数据传输速率容易被忽略的算力瓶颈算力需求超摩尔发展算力供给芯片提升并行计算并行瓶颈数据传输速率AI时代模型算力需求以超过摩尔定律增长数据中心通过交换机网络实现设备互联通信延时导致加速放缓算力FLPOs加速理论加速比5-6个月翻倍远超摩尔定律比实际加速比深深度度大学学模习习型之20个月翻倍近似摩尔定律时时前代代模型发布时间并行计算节点数17资料来源GoogleScholar并行处理中节点间通信对加速比的影响浙商证券研究所01数据传输核心器件光模块光模块包含发射器件和接收器件光纤通信时的光电转换数据中心占光模块一半以上市场2021Q4326发射器件接收器件骨干电信城域驱电放电动激光器内含探测器内含信大信接入电光芯片光芯片光模块号器号路674光纤传输数据中心内部数通电信号光信号电信号数据中心互联光模块向高速传输发展以顺应数据传输量增长趋势1x9GBIC10GSFPXFP40GQSFPCFPCOBO400GQSFP-DDOSFP-XD80016T硅光技术相干技术1995-20002000-20102010-20202020之后光电共封装技术CPO18资料来源中际旭创年报光纤在线电子发烧友华经情报网浙商证券研究所国产服务器CPU发展之路技术创新引领本土通过CHIPLET布局先进制程服务器芯片广泛应用02产业链弯道突围存算一体打破存储墙Partone限制实现降本增效1902服务器CPU需求增长国化产三条发展路线中国服务器市场规模国产服务器CPU发展之路中国加速计算服务器市场预测自主化程度低未12000百万美元上海兆芯来扩充指令集难度较10000大但生态迁移成本8000IP内核授权CISCX86架构小性能高6000海光信息缺点安全基础不牢4000靠20000自主化程度较高20222023202420252026华为鲲鹏安全基础相对牢靠指令集架服务器CPU市场格局ARM架构拥有自主发展权构授权缺点生态构建较为服务器CPUX86架构厂商份额天津飞腾困难AMD980RISCMIPS架构龙芯中科自主化程度极高申威科技已基本实现授权自主完全自主可控研制指令集英特尔缺点生态构建极其9020MIPS架构申威科技困难20资料来源IDCwind浙商证券研究所整理
|
|