本期投资提示:
AI芯片是大模型的基础。AI芯片主要分为训练和推理两类芯片,云和端对训练和推理芯片要求不同,目前主流架构包括GPU、FPGA和ASIC三类,通用性GPU>FPGA>ASIC,性能功耗比GPU<FPGA<ASIC。 四大AI芯片技术路线,均围绕打破英伟达CUDA生态垄断展开。英伟达凭借CUDA、cuDNN和TensorRT等软件工具链以及和Tensorflow的深度绑定构筑了极高的生态壁垒,2021年GPU市占率超80%,高性能AI芯片A100、H100被禁止向中国出口后,快速推出800系列合法出口中国;寒武纪复制英伟达成长之路。 GPT-4参数量高达100万亿,是GPT-3的500倍以上!即使考虑到AI芯片能力的提升(从当前主流的A100升级至H100),仍然需要巨量的额外增量投资。 AI芯片+AI服务器,受益于AIGC+类GPT等应用的“鲶鱼效应”。原有英伟达等供给有限,所以国产AI芯片有理论上的爆发弹性,AI服务器有成长空间。由于AIGC、类GPT有“鲶鱼效应”,带来约百倍算力需求。而英伟达等供给解决需求有瓶颈(根据IDC咨询,预测2025年AI服务器市场空间仅仅318亿美元,21-25年预计CAGR仅仅19.5%),因此国产AI芯片在逻辑上有爆发弹性,此外AI服务器也有成长空间。 寒武纪思元590将是最早实现商业应用的接近英伟达A100性能的国产AI训练芯片。目前华为昇腾910性能超越英伟达V100,但未达到A100水平,壁仞科技7nm通用GPU芯片BR100称其可与被禁售的英伟达H100一较高下,但尚未量产上市。寒武纪思源590芯片面积800mm^2,和A100一样。内存带宽2.7T,是A1001.8T的1.5倍。HBM2使用海力士,功耗达350W-550W,FP32算力到80TFLops,目前已经客户送样测试阶段,在高性能国产AI芯片中进程最快,最有机会承接国内AI算法商对英伟达A100、H100的需求。 重点推荐:1)直接受益AI芯片需求崛起的寒武纪(思元590将是最早实现商业应用的接近英伟达A100性能的国产AI训练芯片)、海光信息(预计2023年底量产的DCU3性能与NVDIAH100性能持平)。2)AI服务器供应商:浪潮信息、中科曙光、中兴通讯(通讯)、工业富联(电子)。 TMT领域算力基建逻辑,也建议关注通信、电子相关公司。 通信——天孚通信、中际旭创、紫光股份、锐捷网络、新易盛等。此外也持续关注流量基建主线的数据中心等环节供需变化,包括奥飞数据、润泽科技等,以及伴随算力增长的温控散热环节,英维克等。 电子——GPU:景嘉微、好利科技;视觉芯片及IP:思特威、富瀚微、芯原股份;服务器存储及接口芯片:澜起科技、聚辰股份;CPU:海光信息、龙芯中科;FPGA芯片:复旦微、安路科技;数通/服务器PCB:沪电股份、深南电路、生益科技、胜宏科技;光通信芯片:源杰科技。 风险提示:AI芯片迅速迭代,开启价格战;AIGC行业落地需求不及预期;供应链不稳定。 研究报告全文:行业及产计算机业2023年03月24日行国产AI芯片的百倍算力需求业研究看好AIGC系列之七行业深度相关研究本期投资提示一层是AIGC狂潮深层是数字经济出海-计算机行业周报AI芯片是大模型的基础AI芯片主要分为训练和推理两类芯片云和端对训练和推理芯证20230313-201303172023年3月18片要求不同目前主流架构包括GPUFPGA和ASIC三类通用性GPUFPGAASIC券日研性能功耗比GPUFPGAASIC究百度文心一个符合预期的起点-AIGC系列之六2023年3月17日报四大AI芯片技术路线均围绕打破英伟达CUDA生态垄断展开英伟达凭借CUDA告cuDNN和TensorRT等软件工具链以及和Tensorflow的深度绑定构筑了极高的生态壁垒2021年GPU市占率超80高性能AI芯片A100H100被禁止向中国出口后快证券分析师黄忠煌A0230519110001速推出800系列合法出口中国寒武纪复制英伟达成长之路huangzhswsresearchcom洪依真A0230519060003GPT-4参数量高达100万亿是GPT-3的500倍以上即使考虑到AI芯片能力的提升hongyzswsresearchcom从当前主流的A100升级至H100仍然需要巨量的额外增量投资李国盛A0230521080003ligsswsresearchcomAI芯片AI服务器受益于AIGC类GPT等应用的鲶鱼效应原有英伟达等供给有刘洋A0230513050006liuyang2swsresearchcom限所以国产AI芯片有理论上的爆发弹性AI服务器有成长空间由于AIGC类GPT联系人有鲶鱼效应带来约百倍算力需求而英伟达等供给解决需求有瓶颈根据IDC咨询崔航预测2025年AI服务器市场空间仅仅318亿美元21-25年预计CAGR仅仅195862123297818因此国产AI芯片在逻辑上有爆发弹性此外AI服务器也有成长空间cuihangswsresearchcom寒武纪思元590将是最早实现商业应用的接近英伟达A100性能的国产AI训练芯片目前华为昇腾910性能超越英伟达V100但未达到A100水平壁仞科技7nm通用GPU芯片BR100称其可与被禁售的英伟达H100一较高下但尚未量产上市寒武纪思源590芯片面积800mm2和A100一样内存带宽27T是A10018T的15倍HBM2使用海力士功耗达350W-550WFP32算力到80TFLops目前已经客户送样测试阶段在高性能国产AI芯片中进程最快最有机会承接国内AI算法商对英伟达A100H100的需求重点推荐1直接受益AI芯片需求崛起的寒武纪思元590将是最早实现商业应用的接近英伟达A100性能的国产AI训练芯片海光信息预计2023年底量产的DCU3性能与NVDIAH100性能持平2AI服务器供应商浪潮信息中科曙光中兴通讯通讯工业富联电子TMT领域算力基建逻辑也建议关注通信电子相关公司通信天孚通信中际旭创紫光股份锐捷网络新易盛等此外也持续关注流量基建主线的数据中心等环节供需变化包括奥飞数据润泽科技等以及伴随算力增长的温控散热环节英维克等电子GPU景嘉微好利科技视觉芯片及IP思特威富瀚微芯原股份服务器存储及接口芯片澜起科技聚辰股份CPU海光信息龙芯中科FPGA芯片复旦微安路科技数通服务器PCB沪电股份深南电路生益科技胜宏科技光通信芯片源杰科技风险提示AI芯片迅速迭代开启价格战AIGC行业落地需求不及预期供应链不稳定请务必仔细阅读正文之后的各项信息披露与声明行业深度投资案件结论和投资分析意见预计中国互联网大厂即将进入大模型军备竞赛期国产AI芯片需求进入爆发期带动AI服务器进入快速成长期原因及逻辑AI芯片AI服务器受益于AIGC类GPT等应用的鲶鱼效应原有英伟达等供给有限所以国产AI芯片有理论上的爆发弹性AI服务器有成长空间由于AIGC类GPT有鲶鱼效应带来约百倍算力需求而英伟达等供给解决需求有瓶颈根据IDC咨询预测2025年AI服务器市场空间仅仅318亿美元预计21-25年CAGR仅仅195因此国产AI芯片在逻辑上有爆发弹性此外AI服务器也有成长空间有别于大众的认识市场认为英伟达GPU生态难以突破我们认为国产AIAISC性能在主流大模型算法中已能毕竟英伟达主流GPU计算能力水平市场认为国产AIASIC水平竞争格局较差我们认为当前AIASIC芯片供应商较多但主要互联网产商AI芯片采购较为集中请务必仔细阅读正文之后的各项信息披露与声明第2页共23页简单金融成就梦想行业深度目录1AI芯片大模型的基础52AI芯片四大技术路线寒武纪复制英伟达721英伟达通用芯片GPU822寒武纪复制英伟达成长之路1023AMD部分兼容英伟达CUDA1124谷歌华为深度学习框架AI芯片自研123中国ASIC芯片格局寒武纪卡位最优154AIGC传导至潜在的百倍算力需求175重点关注公司206风险提示21请务必仔细阅读正文之后的各项信息披露与声明第3页共23页简单金融成就梦想行业深度图表目录图1云端训练云端推理设备端推理三个细分市场的AI芯片竞争格局7图2寒武纪针对原生TensorFlow的修改深灰色部分10图3寒武纪的端云一体软件栈架构10图4AMD的ROCm是和英伟达CUDA对等的智能编程语言11图5AMD的HIPify工具可以将英伟达CUDA代码转换为ROCm代码11图6英伟达的CUDA栈12图7AMD的ROCm栈12图8华为在AI领域全栈自研从底层芯片到智能编程语言再到深度学习框架14图9MindSpore和Pytorch结合各类芯片训练速度单位张秒14图10OpenAI首席执行官SamAltman谈ChatGPT每次聊天的成本18图11GPT-3训练成本估算18图12主流LLM模型训练成本估算19图13LLM训练推理成本测算框架19图14过去5年中LLM模型参数呈指数增长20表1端-边-云对AI芯片的算力和功耗延时性有不同的要求5表2国内外主流深度学习框架以及支持的硬件设备8表3英伟达发布A800H800实现向中国合法出口9表4英伟达AI推理芯片参数一览9表5寒武纪AI芯片性能参数10表6谷歌历代推理和训练芯片性能参数13表7华为主流推理和训练芯片性能参数14表8训练端芯片已有较多参与者16表9推理端芯片华为阿里寒武纪等布局较早16表10重点公司估值表单位亿元22请务必仔细阅读正文之后的各项信息披露与声明第4页共23页简单金融成就梦想行业深度1AI芯片大模型的基础人工智能芯片主要分为训练Training芯片和推理Inference芯片训练芯片主要用于人工智能算法训练即在云端将一系列经过标记的数据输入算法模型进行计算不断调整优化算法参数直至算法识别准确率达到较高水平推理芯片主要用于人工智能算法推理即将在云端训练好的算法模型进行裁剪优化变轻之后进入实战阶段输入数据直接得出准确的识别结果不同用途训练or推理不同应用场景端-边-云对AI芯片有着不同的要求首先训练芯片追求的是高计算性能高吞吐率低功耗但是推理芯片主要追求的是低延时完成推理过程所需要的时间尽可能短低功耗其次端-边-云三个环节对AI芯片的不同要求见下表其中端和边上进行的大部分是AI推理因此用于端和边的AI芯片性能要求和上述推理芯片一致大部分的训练过程是在云和数据中心进行训练过程对时延没有什么要求因此需要保证AI芯片在尽可能保证较高算力的情况下功耗尽可能低另外许多推理过程也是在云端进行表1端-边-云对AI芯片的算力和功耗延时性有不同的要求端边云耳机电话智能手机个人电脑网络摄像机IPC边缘服务器数据中心算力20MOPS100GOPS1-10TOPS10-20TOPS10-20TOPS10-500TOPS200TOPS功耗1mW10mW1-2W3-10W3-10W10-300W200W模型大小10KB100KB10MB10-100MB10-100MB100MB300MB延时10ms10ms10-100ms10-500ms10-500msmssmss是否推理YYYYYYY是否训练NNYYYYY昇腾系列NanoTinyLiteMiniMiniMulti-MiniorMaxMaxorMultiMini资料来源ofweek电子工程网华为全联接大会申万宏源研究目前用于人工智能深度机器学习的芯片主要有GPUFPGAASIC三类芯片三类芯片用于深度学习时各有优缺点1通用性GPUFPGAASIC通用性越低代表其适合支持的算法类型约少2性能功耗比GPUFPGAASIC性能功耗比越高越好意味着相同功耗下运算次数越多训练相同算法所需要的时间越短在不同的应用场景之下已经形成了不同的AI芯片竞争格局1在云和数据中心AI芯片市场训练和推理两个环节都是英伟达GPU一家独大几乎占据90以上份额包括AWS微软Azure谷歌云阿里云华为云腾讯云在内的大部分公有云厂商上线的AI加速计算公有云服务绝大部分都是基于英伟达Tesla系列GPU请务必仔细阅读正文之后的各项信息披露与声明第5页共23页简单金融成就梦想行业深度1云端训练用的几乎全部是英伟达GPU公有云厂商中仅谷歌云一家除了提供以英伟达GPU为主的云计算加速服务之外还推出了基于自研AI芯片TPU的深度学习训练服务2云端推理目前出现了基于GPUFPGAASIC三种不同芯片云计算服务但是市场份额仍然以英伟达GPU为主其中AWS阿里云腾讯云华为云等公有云厂商均推出了FPGA加速计算云服务另外AWS推出了基于自研AI芯片Inferentia的ASIC加速计算服务华为云推出了基于自研AI芯片昇腾310的ASIC加速计算服务2在设备端和边缘计算推理市场各类型芯片各自为阵尚无绝对优势地位的芯片厂商出现手机市场以高通华为苹果原主控芯片厂商为主自动驾驶安防IPC领域英伟达暂时领先1手机高通从骁龙820开始就已经具备第一代人工智能引擎AIEngine高通从第三代AIEngine开始引入异构计算CPUGPU和DSP的异构并行计算目前高通已经迭代至第四代骁龙855是第一个搭载第四代AIEngine的SoC华为麒麟970980分别引入寒武纪IP1A1H使得手机SoC开始具备AI能力在2019年6月华为发布麒麟810华为与寒武纪合作终止华为采用了自研AI芯片达芬奇架构华为在2018年推出了达芬奇架构对标寒武纪智能处理器IPCambricon-1A1H1M苹果2017年发布的A11芯片也具备了AI能力附带NeuralEngine和开发平台CoreML用于机器学习2安防IPC仍然以采用英伟达Jetson系列GPU为主例如海康采用了英伟达JetsonTX1大华睿智系列人脸网络摄像机采用的是英伟达TeslaP4GPU另外国内三大安防厂商也在陆续采用ASIC芯片例如海康大华宇视在前端智能化摄像机中采用Movidious的Myriad系列芯片大华自研AI芯片用于新款睿智人脸摄像机3智能驾驶L3级别以上自动驾驶芯片以英伟达Drive平台为主包括Xavier和Orin两款SoC华为将昇腾310用于自动驾驶域控制器MDC上2020年已经通过车规级认证英特尔Mobileye的EyeQ4-5被用在L3-5智能驾驶但是目前整车厂和Tier1实际采用得最多仍然是以英伟达GPU为主在低级别的L1-L2辅助驾驶上采用的是NXP瑞萨等厂商的MCU芯片不涉及深度学习4智能音箱目前智能音箱的语音语义识别均在云端完成推理计算终端上没有AI专用处理单元请务必仔细阅读正文之后的各项信息披露与声明第6页共23页简单金融成就梦想行业深度图1云端训练云端推理设备端推理三个细分市场的AI芯片竞争格局资料来源雷锋网申万宏源研究2AI芯片四大技术路线寒武纪复制英伟达由于AIGC类GPT应用有鲶鱼效应带来约百倍算力需求下文而英伟达等供给解决需求有瓶颈因此国产AI芯片有逻辑上需求弹性AI服务器也有空间根据IDC数据2021年全球AI服务器市场规模为156亿美元预计到2025年全球AI服务器市场将达到318亿美元预计21-25年CAGR仅仅195AI服务器的增长和规模总额恐怕无法满足类GPT类应用的百倍需求例如生产地域供应商产能工人等限制因此AI芯片可能会大量爆发其次是AI服务器近期的行业领袖创业潮会加速这种趋势2012-2014年AI创业潮造就2015-2017年AI机会2022H2-2023新一轮AI大模型创业潮目前AI芯片主要玩家应对英伟达塑造的AI生态壁垒选取了不同的商业策略1英伟达AI芯片依然是AI训练和推理最佳选择2寒武纪在走英伟达的路线3AMD在走部分兼容CUDA的路线4谷歌华为百度走的是深度学习框架AI芯片自研路线请务必仔细阅读正文之后的各项信息披露与声明第7页共23页简单金融成就梦想行业深度21英伟达通用芯片GPU英伟达目前在深度学习训练芯片市场占据绝对垄断地位凭借的是1CUDA及cuDNNTensorRT等一系列专为深度学习打造的软件工具链CUDA是实现CPU和GPU分工的编程工具cuDNN针对深度学习训练将深度学习模型中对各层Layer的常见的操作例如卷积convolution池化pooling以方便理解和使用的接口暴露给开发人员从而使得开发人员可以快速搭建training的库TensorRT针对推理环节帮助模型自动减值和优化由于开发者对于这些工具已经非常熟悉由于学习成本的存在不会轻易迁移2深度学习框架和英伟达AI芯片的高度耦合由于各家AI芯片厂商编程语言无法兼容而深度学习框架厂商仅支持一家AI芯片就要投入巨大工程量因此导致其最终只选择市占率最大的1-2家进行深度支持英伟达在AI训练和推理上实现了软硬件高度耦合而构筑了极高的生态壁垒表2国内外主流深度学习框架以及支持的硬件设备深度学习框架公司机构发布时间支持的AI芯片国外Tensorflow谷歌2015年CPUGPU英伟达CUDATPU谷歌PytorchFacebook2016年CPUGPU英伟达CUDA中国PaddlePaddle飞桨百度2016年CPUGPU英伟达CUDAAMDROCm昆仑XPU百度海光DCU华为昇腾Jittor计图清华2020年CPUGPU英伟达CUDA寒武纪Mindspore华为2020年CPUGPU英伟达CUDA华为昇腾MegEngine天元旷视2020年CPUARMx86GPU英伟达CUDA资料来源PaddlePaddle官网旷视天元官网申万宏源研究英伟达高性能训练和推理芯片产品主要包括V100A100H100以及3月21日GTC2023发布的H100NVL2张H100通过外部接口以600GBs的速度连接每张卡显存为94GB合计为188GB预计2024年将推出基于下代Blackwell架构的B100产品除上文提到的软件及生态壁垒外英伟达芯片的主要优势在于大片上内存高显存带宽以及片间互联方案大片上内存是支撑最高达上千亿参数GPT-31750亿GPT-352000亿的大模型在芯片上运行的必需高显存带宽能够实现更高的数据传输速率从而减少训练时间提升效率NVSwitch片间互联方案则大大提升多GPU互联的运行效率由于大模型的训练对算力要求非常高chatGPT模型训练一次消耗算力达3640p需要上万张A100芯片支持英伟达NVSwitch能够实现高速多对多全GPU通信能够更大程度发挥GPU集群的算力潜力22年9月起美国禁止峰值性能等于或大于A100阈值的英伟达芯片向中国出口合法版本A800H800已在国内应用由于中国高性能计算市场对英伟达来说是一个不可放请务必仔细阅读正文之后的各项信息披露与声明第8页共23页简单金融成就梦想行业深度弃的巨大市场英伟达分别于22年11月23年3月发布A100H100的阉割版本A800H800通过降低数据传输速率显存带宽至400GBs450GBs避开美国限制从而合法出口到中国根据CEO黄仁勋在GTC2023演讲H800已在国内BAT的云计算业务中应用表3英伟达发布A800H800实现向中国合法出口型号H100NVLA800H100A100V100NVLiV100PCIEV100ST4nk功耗700W300W700W400W300W250W250W70W显存96GBHBM3e80GBHBM2e80GBHBM340GBHBM23216GB3216GB32GB16GBHBM2HBM2HBM2HBM2带宽78TBs1935GBs3TBs1555GBs900GBs900GBs1134320GBsGBs上市时间2023年下半年2022年12月2022年3月2020年5月2017年5月2017年5月2019年112018年3预计月月INT8TOPS7916TFOPs624TFOPS4000TFOPs624TFOPS1248130TOPTOPSSFP162990TFLOPS312TFLOPS2000TFLOPS624TFLOPSFP32267195TFLOPS60TFLOPs195TFLOPs15714TFLOPs16481TFLOTFLOPSTFLOPsTFLOPSPSFP6423497TLOPS30TFLOPS97TFLOPS787TFLOPS82TFLOPSTFLOPSTFLOPSTF322495156TFLoPs312TF1000TFLoPs312TFLOPSTFLOPSLOPSFP64Tensor26497TFLOPS60TFLoPs195TFLOPsCoreTFLOPS工艺4nm7nm4nm7nm2nml2nm2nm2nm中国供应情况还未发行正常销售限制销售须获限制销售须获许正常销售正常销售正常销售正常销售许可可资料来源英伟达官网NVIDIAGTC2023申万宏源研究表4英伟达AI推理芯片参数一览型号A10A16A30A40L40制程8nm4nm7nm8nm4nm算力INT8Tensor核250TFLOPS5004x330TOPS6612993TOPS362TOPS心TFLOPS359TFLOPSTOPS5986TOPS724TOPSFP16Tensor125TFLOPS2504x165TF330TF1497TF2994TF18105TF核心TFLOPS179TFLOPS3621TF功耗150W250W165W300W300W显存带宽24GBGDDR6显4个16G的24GBHBM2显存48GB显存696GBs带纠错码的48GB存600GBs带宽GDDR6显存带宽933GBs带宽GDDR6864GBs4200GBs带宽售价2208024150324303657052440资料来源英伟达官网英国硬件设备销售商Thinkmate申万宏源研究请务必仔细阅读正文之后的各项信息披露与声明第9页共23页简单金融成就梦想行业深度22寒武纪复制英伟达成长之路我们认为寒武纪芯片硬件性能相比于英伟达还有追赶空间上层软件堆栈与英伟达相似全自研不是兼容路线不同之处在于寒武纪需要自己对原生深度学习框架进行修改以支持思元芯片而英伟达有谷歌原厂支持硬件方面从一些表观的性能参数对比来看寒武纪训练芯片思元290和英伟达A100昇腾910相比性能还有追赶的空间软件方面寒武纪是自己对原生的Tensorflow和Pytorch深度学习框架去针对自己的思元芯片去做修改而非像华为一样自研深度学习框架去进行优化也不想英伟达一样因为芯片市占率高有PytorchTensorflow原厂去做GPU算子的优化和设备的支持另外寒武纪相比英伟达的算子库丰富程度以及软件工具链的完善程度还有一定差距需要时间去追赶表5寒武纪AI芯片性能参数型号思元590思元370思元290思元270思元100思元220发布年份2023年2021年2021年2019年2018年2019年场景训练推理训练推理推理边缘计算架构MLUarch03MLUv02MLUv02MLUv01MLUv02制程7nm7nm7nm16nm16nm16nm性能256TOPSINT8512TOPSINT8128TOPSINT832TOPSINT88TOPSINT880TFLOSFP32256TOPSINT1664TOPSINT1616TOPSFP164TOPSINT1664TOPSCINT32功耗350-550W75W350W70W75W825W内存带宽27TBs1228GBs102GBs1024GBs-芯片面积800mm2-3696mm23265mm2948mm2资料来源寒武纪官网申万宏源研究图2寒武纪针对原生TensorFlow的修改深图3寒武纪的端云一体软件栈架构灰色部分资料来源寒武纪申万宏源研究资料来源寒武纪申万宏源研究请务必仔细阅读正文之后的各项信息披露与声明第10页共23页简单金融成就梦想行业深度23AMD部分兼容英伟达CUDAAMD选择了部分兼容英伟达CUDA借力英伟达生态的路线AMD在2016年全球超算大会上推出了ROCm也就是对标英伟达CUDA一样的智能编程语言ROCm软件堆栈的结构设计与CUDA相似度很高对标英伟达深度学习库cuDNNAMD推出了MIOpen对标英伟达深度学习推理框架TensorRTAMD推出了Tensile对标英伟达编译器NVCCAMD推出了HCCROCm中包含的HIPify工具可以把CUDA代码一键转换成ROCm栈的API减少用户移植成本我们认为走兼容英伟达CUDA的路线其难点在于其更新迭代速度永远跟不上CUDA并且很难做到完全兼容1迭代永远慢一步英伟达GPU在微架构和指令集上迭代很快在上层软件堆栈上很多地方也要做相应的功能更新但是AMD不可能知道英伟达的产品路线图软件更新永远会慢英伟达一步例如AMD有可能刚宣布支持了CUDA11但是英伟达已经推出CUDA12了2难以完全兼容反而会增加开发者的工作量像CUDA这样的大型软件本身架构很复杂AMD需要投入大量人力物力用几年甚至十几年才能追赶上因为难免存在功能差异如果兼容做不好反而会影响性能虽然99相似了但是解决剩下来的1不同之处可能会消耗开发者99的时间图4AMD的ROCm是和英伟达CUDA对等的智图5AMD的HIPify工具可以将英伟达CUDA代能编程语言码转换为ROCm代码资料来源CSDNAMDROCm平台简介申万宏源资料来源CSDNAMDROCm平台简介申万宏源研究研究请务必仔细阅读正文之后的各项信息披露与声明第11页共23页简单金融成就梦想行业深度图6英伟达的CUDA栈图7AMD的ROCm栈资料来源CSDNAMDROCm平台简介申万宏源资料来源CSDNAMDROCm平台简介申万宏源研究研究24谷歌华为深度学习框架AI芯片自研谷歌凭借Tensorflow去做TPU相对而言不存在太多生态壁垒问题但是仍然无法撼动英伟达我们认为其原因在于TPU本身性能还有进一步提升空间以及过于专用的问题理论上谷歌凭借Tensorflow在深度学习框架领域实现了垄断地位是具备绝对的生态掌控力的会投入大量的Tensorflow工程师针对自家TPU去做支持和优化因此TPU去挑战英伟达GPU其实不存在所谓生态壁垒的问题但是自谷歌自2016年推出第一代TPUv1至今已经到第四代TPUv42021年5月发布仍然无法从英伟达手中抢走明显份额其原因主要在于TPU本身性能相比于英伟达同时期GPU而言还有一定差距另外其芯片设计过于专用所以在卷积之外的算法表现上并不算好1谷歌在芯片设计上的实力和英伟达相比还有一定差距谷歌在TPU论文中也明确提到由于项目时间比较紧所以很多优化只能放弃从性能参数来看谷歌TPUv2和英伟达同年推出的V100相比性能功耗比显存带宽等指标有着明着差距即使是谷歌在2018年推出了第三代TPU其性能FP32功耗等指标仍然和英伟达V100相比存在一定差距2谷歌采用的是传统脉动阵列机架构芯片设计上过于专用TPU的主要创新在于三点大规模片上内存脉动式内存访问8位低精度运算脉动阵列机做卷积时效果不错但是做其他类型神经网络运算效果不是很好在一定程度上牺牲了通用性来换取特定场景的高性能TPU在芯片设计上只能完成乘加乘加规则的运算无法高效实现复数乘法求倒求平方根倒数等常见算法现在AI芯片的行业趋势是GPU在通用性的基础上逐渐增加专用计算单元而类似TPU的ASIC芯片在专用性的基础上逐渐增加通用计算单元两类芯片有逐渐收敛的趋势英伟达在用于深度学习领域的GPU上的设计思路是在通用的基础上增加专用运算单元例如在Volta架构上开始增加TensorCore专门用于深度学习加速在Turing架构上开始增加RTCore专门用于光线追踪加速牺牲通用性为特殊的计算或者算法实现特殊架构的硬件以达到更快的速度而AI芯片一开始走专用路线但是现在在专用性之请务必仔细阅读正文之后的各项信息披露与声明第12页共23页简单金融成就梦想行业深度外也在架构设计上也增加了通用计算单元例如谷歌TPUv1主要是矩阵乘法运算单元占了24芯片面积但是TPUv2也开始增加浮点ALU做SIMD表6谷歌历代推理和训练芯片性能参数型号TPUv1TPUv2TPUv3TPUv4发布年份2016年2017年2018年2021年场景推理推理训练推理训练训练制程28nm20nm估计16nm12nm估计7nm估计性能92TOPSINT845TOPSFP16123TOPSFP16TPUv3性能的两倍23TOPSINT163TOPSFP324TOPSFP32功耗75W280W450W500W估计显存带宽34GBs700GBs900GBs不详芯片面积331611648不详资料来源nextplatformcomblogintento申万宏源研究备注是否能做推理尚不确定华为在2019年8月发布的昇腾910与英伟达在2020年5月发布的A100性能相当但是我们认为华为的主要问题在于不具备深度学习框架生态掌控力即使其芯片性能与英伟达水平差不多但是由于TensorflowPytorch两大主流深度学习训练框架没有基于华为昇腾910做特定的优化所以算法结合上述两大训练框架在昇腾910上实际跑出来的性能其实不如英伟达A100目前仅华为自研的深度学习框架MindSpore对昇腾910和昇腾310做了特别优化由于华为MindSpore大部分精力都是放在对昇腾芯片的算子支持和优化上对英伟达GPU的支持还不够见下图英伟达的GTX2080Ti结合MindSpore的训练速度明显不如GTX2080Ti结合Pytorch15的训练速度所以只有同时使用华为的深度学习框架和昇腾芯片才能同时发挥出两者的最佳性能上述我们提到要想在深度学习训练框架要想打破Tensorflow和Pytorch的垄断必须要靠原始创新而目前包括华为MindSpore在内的国产深度学习框架尚未很好解决上述两大训练框架的痛点Caffe之所以能够在早期获得开发者欢迎是因为解决了深度学习框架从0到1的过程Tensorflow之所以可以取代Caffe是因为解决了其不够灵活不能自动求导对非计算机视觉任务支持不好等问题Pytorch之所以明显抢夺Tensorflow的份额是因为Pytorch引入了动态图解决了Tensorflow是静态图设计调试困难的问题但是目前国产的三个深度学习框架百度PaddlePaddle旷视Megengine华为MindSpore还没有完美解决开发者在用Tensorflow和Pytorch所遇到的痛点我们认为Tensorflow和Pytorch目前共同的痛点在于对海量算子和各种AI芯片支持的难度华为正在探索靠AI编译器的技术来解决上述问题但是目前编译技术仍然还达不到人工优化的效果华为全面布局了三个层次的AI编译器包括图灵完备的图层IR设计使用poly技术的图算融合算子自动生成技术以TVM编译器的设计思想推出算子开发工具TBE来解决算子开发自动优化的问题请务必仔细阅读正文之后的各项信息披露与声明第13页共23页简单金融成就梦想行业深度表7华为主流推理和训练芯片性能参数型号昇腾310昇腾910昇腾610发布年份2018年2019年2020年研发中场景边缘计算训练推理架构达芬奇达芬奇-制程12nm7nm-性能16TOPSINT8640TOPSINT8100TOPSINT88TOPSFP16320TOPSFP1650TOPSFP16功耗8W310W-显存带宽-1200GBs-芯片面积-456-资料来源知乎海思官网申万宏源研究图8华为在AI领域全栈自研从底层芯片到智能编程语言再到深度学习框架资料来源华为官网申万宏源研究图9MindSpore和Pytorch结合各类芯片训练速度单位张秒资料来源知乎申万宏源研究请务必仔细阅读正文之后的各项信息披露与声明第14页共23页简单金融成就梦想行业深度3中国ASIC芯片格局寒武纪卡位最优算力精度门槛下ASIC和GPGPU是最适合大模型的架构大模型云端训练多数情况下都在FP32计算精度上推理端则以FP16和混合精度为主算力越强模型效率越高FPGA和GPU对比虽然FPGA吞吐率性能功耗比优于GPU但是FPGA存在两个天然缺陷FPGA只适合做定点运算不适合做浮点运算如果用来做浮点运算耗费逻辑很大而且有些FPGA不能直接对浮点数进行操作的只能采用定点数进行数值运算其二FPGA可以理解成某种芯片半成品需要开发人员做大量二次开发设计芯片因此开发使用门槛较高ASIC和GPU则能够满足大模型的入门门槛国内视角下华为百度昆仑芯阿里寒武纪海光信息及一众初创企业燧原天数壁仞沐曦均推出云端训练和推理芯片架构选择上华为百度阿里寒武纪选择ASIC路线华为百度阿里自家业务场景对AI芯片存在天然需求选择ASIC在量产制造供应链上的难度显著低于GPU初创企业则押注通用型GPGPU架构壁仞沐曦等初创企业多创立于2018年前后团队一般来自出走英伟达AMD的技术专家因此技术路线多选择他们所熟悉的通用型GPUAI大模型让ASIC和GPU之间的边界愈发模糊国内GPU初创企业或在竞争中落后英伟达在过去很长的一段时间内坚持用统一的硬件即通用型GPU同时支持DeepLearning和图像需求但高性能计算迭代到H100产品后其计算卡和图像卡分开在技术路线上也愈发靠近ASIC初创企业为了实现通用性选择了在芯片设计和制造供应链存在较多困难的GPU路线暂未推出真正具备量产成熟度的产品国产ASIC厂商中寒武纪是为数不多能够较为开放支持中游AI算法和模型商1华为选择部署端到端的完整生态例如使用昇腾910必须搭配华为的大模型支持框架MindSpore盘古大模型第三方开源模型无法在华为上运行若要运营必须依赖华为提供的工具做深度定制和优化开放程度低2阿里在该方面的定位是系统集成商和服务商运用自身芯片产品搭建加速平台中对外输出服务3百度昆仑芯主要在自身智算集群和服务器上用以及国内企业研究所政府中使用且由于百度自身AI算法商的商业定位与其他AI厂商之间存在竞争关系昆仑芯未必能够在其他AI算法商中铺开请务必仔细阅读正文之后的各项信息披露与声明第15页共23页简单金融成就梦想行业深度表8训练端芯片已有较多参与者训练型号功耗显存带宽上市时间INT8TOPSFP1FP3FP6TF3FP64Tensor工艺6242Core华为昇腾9106403207nm寒武纪思元290350W32GBHBM21228GB2021年5127nms思元570350-5502023年807nmW壁仞科BR100300W32GB819GBs预计2023年10282567nm技HBM2E海光深算一号DCU隧原T21300W32GB300GBs256128300300HBM2E百度昆仑1150W16GBHBM2512GBs2019年11256641614n月m昆仑212oW32GB2021年8月2561287nm资料来源华为官网寒武纪官网壁仞科技官网百度昆仑芯官网阿里平头哥官网申万宏源研究表9推理端芯片华为阿里寒武纪等布局较早推理型号功耗显存带宽上市时间INT8TOPFP16FP3FP6TF3FP64Tensor工艺S242Core华为昇腾8TOPS4LPDDR4x264bit37332019年16812nm310WMTsFFC16TOPS8W阿里含光2019年982012nm800月寒武思元75W8GB16GB102GBs2018年53216TFLoTonm纪100月Ps思元70W16GB102GBs2019年61281Gnm270月思元75W24GB3012GBs2021年1192187nm370LPDDR5月资料来源华为官网寒武纪官网壁仞科技官网百度昆仑芯官网阿里平头哥官网申万宏源研究英伟达A800H800对国产厂商存在一定的威胁但在大模型趋势下英伟达的优势有所弱化过去机器学习训练时间的主导因素是计算时间等待矩阵乘法通过张量核心和降低浮点精度这个问题很快被解决现在大型模型训练推理中的大部分时间都是在等待数据到达计算资源内存带宽和容量的限制不断出现在NvidiaA100GPU如果不进行大量优化A100往往具有非常低的FLOPS利用率而800系列降低了数据传输速率弱化了英伟达高算力的优势此外大模型AI芯片更需要片间互联HBM英伟达CUDA这种标准化平台的优势同样有所弱化请务必仔细阅读正文之后的各项信息披露与声明第16页共23页简单金融成就梦想行业深度寒武纪的优势在于各种深度学习框架合作经验丰富寒武纪思元系列产品适配TensorFlowPytorchCaffe深度学习框架2019年开始适配海康峰值时刻合作开发团队有70-80人公司派出20-30人思元290与商汤在CV层面深度合作NLP领域在讯飞百度语音都有出货寒武纪思元590将是最早实现商业应用的接近英伟达A100性能的国产AI训练芯片目前华为昇腾910性能超越英伟达V100但未达到A100水平壁仞科技7nm通用GPU芯片BR100称其可与被禁售的英伟达H100一较高下但尚未量产上市寒武纪思源590芯片面积800mm2和A100一样内存带宽27T是A10018T的15倍HBM2使用海力士功耗达350W-550WFP32算力到80TFLops目前已经客户送样测试阶段在高性能国产AI芯片中进程最快最有机会承接国内AI算法商对英伟达A100H100的需求4AIGC传导至潜在的百倍算力需求当前市场关注AIGC所拉动的增量算力需求及相应投资机会此前我们指出AI必然伴随海量计算算力是完成数据运算的基础chatGPT一共有1750亿个参数训练过程中消耗大量算力其训练模型中就已导入至少1万颗英伟达GPUAI发展的基础是算力提升AI应用的拓展反向推动算力基建的部署此前ChatGPT宣布因满负荷运行暂停服务算力基建部署值得关注推理侧ChatGPT海量的访问需求带来了巨大的计算成本我们根据公开数据对此进行估计根据OpenAI首席执行官SamAltman提供的信息ChatGPT单次聊天的成本约为001美元ChatGPT目前有超过2000万日活且在持续上行假设未来日活数量达到5000万平均每个日活进行10条对话则每日消耗的成本为500万美元推测其中大部分为AI服务器成本折旧维护等及对应的电费请务必仔细阅读正文之后的各项信息披露与声明第17页共23页简单金融成就梦想行业深度图10OpenAI首席执行官SamAltman谈ChatGPT每次聊天的成本资料来源Twitter申万宏源研究训练侧由于大型语言模型LLM参数量极高训练成本与参数量正相关因此大模型路线势必带动大量额外的算力需求参考海外最新研究TheEconomicsofLargeLanguageModels1可以有如下估计每个token1000token约等于750个单词的训练成本通常约为6N而推理成本约为2N其中N是LLM的参数数量假设在训练过程中模型的FLOPS利用率为462与在TPUv4芯片上进行训练的PaLM模型拥有5400亿参数一致1750亿参数模型的GPT-3是在3000亿token上进行训练的成本参考谷歌在GCPTPUv4芯片上训练PaLM模型计算结果GPT-3训练成本为140万美元左右图11GPT-3训练成本估算资料来源TheEconomicsofLargeLanguageModels申万宏源研究将上述计算框架应用于其他的LLM模型中可以估算出对应的训练成本其中参数量最大的谷歌PaLM模型训练成本超过1000万美元1httpssunyansubstackcompthe-economics-of-large-language-models请务必仔细阅读正文之后的各项信息披露与声明第18页共23页简单金融成就梦想行业深度图12主流LLM模型训练成本估算资料来源TheEconomicsofLargeLanguageModels申万宏源研究考虑到未来LLM不断升级演进训练推理成本将持续上行相应的成本估算框架如下图所示可见成本与模型参数数量模型训练数据集大小CostFLOP效率成正比并与计算资源和硬件利用率成反比图13LLM训练推理成本测算框架资料来源TheEconomicsofLargeLanguageModels申万宏源研究超越安迪-比尔定律2的算力需求爆发模型参数量每年10倍增长即使AI芯片的性能提升仍然遵从摩尔定律3计算资源仍然可能难以满足需求过去5年中LLM模型参数呈现指数增长态势2018年OpenAI推出了117亿参数的GPT-1谷歌推出了3亿参数的BERT接下来的两年20192020年OpenAI陆续推出参数更大的迭代版本GPT-2GPT-3前者有15亿参数后者有1750亿参数GPT-4参数量高达100万亿是GPT-3的500倍以上即使考虑到AI芯片能力的提升从当前主流的A100升级至H100仍然需要巨量的额外增量投资2原话是AndygivesBilltakesaway安迪提供什么比尔拿走什么安迪指英特尔前CEO安迪格鲁夫比尔指微软前任CEO比尔盖茨这句话的意思是硬件提高的性能很快被软件消耗掉了3集成电路上可以容纳的晶体管数目在大约每经过18个月到24个月便会增加一倍请务必仔细阅读正文之后的各项信息披露与声明第19页共23页简单金融成就梦想行业深度图14过去5年中LLM模型参数呈指数增长资料来源TheEconomicsofLargeLanguageModels申万宏源研究5重点关注公司目前国内BAT字节京东等大厂均投入AIGC大模型研发模型的应用场景也从文字对话进一步扩展至绘画视频等多玩家多场景丰富的下游应用带来百倍的增量AI算力需求算力基建直接受益计算机行业核心关注AI芯片服务器等环节AI芯片建议关注寒武纪寒武纪思元系列产品适配TensorFlowPytorchCaffe深度学习框架2019年开始适配海康峰值时刻合作开发团队有70-80人公司派出20-30人思元290与商汤在CV层面深度合作NLP领域在讯飞百度语音都有出货寒武纪思元590将是最早实现商业应用的接近英伟达A100性能的国产AI训练芯片海光信息作为AI服务器中的核心海光的DCU是GPGPU的一种根据公司公开发布会海光DCU同时支持全精度和半精度训练有稀缺性预计2023年底量产的DCU3性能与NVDIAH100性能持平已量产的DCU2约等于70NVDIAA100双方在模拟效率和精度都处于同一代际算力需求提升叠加国产替代要求共同构成催化AI服务器建议关注浪潮信息国内最大的AI边缘和云服务器供货商根据IDC数据浪潮AI服务器出货量基本占据国内一半的市场份额并且多年稳定chatGPT为代表的AIGC大模型风靡对于算力的要求会明显提升AI服务器作为算力的基础核心基建深度受益浪潮信息的主要客户也是互联网和AI巨头在经历弱周期后大厂算力竞争有望带来AI服务器投入显著回升此外根据国家信息中心和浪潮信息联合发布的报告目前我国有超过30个城市正在或提出建设智算中心提供增量请务必仔细阅读正文之后的各项信息披露与声明第20页共23页简单金融成就梦想
|
相关行业报告
|
||||||||||||||||||||||||||
