研报下载就选股票报告网
您好,欢迎来到股票分析报告网!登录   忘记密码   注册
>> 广发证券-计算机行业:独立自主的AI系统级计算平台是国产AI芯片构建生态壁垒的关键-230822
上传日期:   2023/8/23 大小:   2311KB
格式:   pdf  共32页 来源:   广发证券
评级:   中性 作者:   刘雪峰,周源
行业名称:   计算机
下载权限:   此报告为加密报告
核心观点:
  系统级AI计算平台是提升AI芯片算力利用率,培养用户生态的关键。影响AI芯片计算能力的因素除了硬件层面的芯片制程、内存、带宽等,还包括调用各硬件资源的系统级软件计算平台。AI芯片厂商开发的系统计算平台不仅仅有效提升各家AI芯片产品的算力利用率,还为各类AI应用开发提供了丰富的函数库,提供开发者简便易用的开发环境。
  英伟达的CUDA计算平台是主流AI应用开发平台。通过对比各公司开发的AI计算平台,我们发现英伟达的CUDA开发时间最早,积累的开发者数量最多。英伟达一方面依靠AI芯片优异的硬件性能快速获客,另一方面持续拓展CUDA的算法覆盖面,不断巩固客户群体。英伟达通过“滚雪球”式的软硬件协同创新,将其AI芯片的市场份额不断扩大,并构建起了深厚的生态壁垒。
  寒武纪的Neuware对AI算法覆盖面全面,兼容性强。Neuware不仅支持CV、NLP、智能推荐等主流商用AI算法,还兼容第三方的训练框架(例如百度飞桨Paddle Lite),在向互联网公司等商业客户拓展用户生态时更具优势。依托于Neuware,开发者可完成从云端到边缘端、从模型训练到推理部署的全部流程,提升AI芯片的算力利用率。
  在中美科技领域竞争日益激烈的背景下,自主研发架构更具优势。在英伟达AI芯片对中国出口前景具有不确定性的背景下,以互联网为代表的AI计算下游厂商适配和采用国产化的系统软件(寒武纪的Neuware,华为的CANN)的动力将大大增加。我们认为,独立于CUDA的自研计算平台对于我国芯片产业的长远发展至关重要。国产AI芯片厂商独立研发、自主迭代的AI计算平台更加具备长久的持续发展能力。
  寒武纪的中立属性在行业格局中具有独特价值,更有利于其用户生态的拓展。寒武纪提供的产品以AI算力基础设施为主,不涉足AI应用领域,与行业参与者更多构成的是互补关系而不是竞争关系。寒武纪的中立属性使其保持智能化升级中赋能者的定位,与产业链上下游形成合作共赢的关系,这更加有利于其Neuware计算平台用户生态的拓展。
  投资建议:推荐拥有自研AI计算平台的寒武纪,长期生态壁垒较高。
  风险提示:科技巨头在AI计算平台领域长期积累,生态壁垒较高,国产AI芯片公司中短期突破难度较大;AI计算平台对于AI算法覆盖面要求较高,前期投入较大与生态培育不及预期的风险;AI芯片存在供应链不稳定的风险。
  
研究报告全文:TablePage深度分析计算机证券研究报告计算机行业TableTitleTableGrade行业评级买入前次评级买入独立自主的AI系统级计算平台是国产AI报告日期2023-08-22芯片构建生态壁垒的关键相对市场表现TablePicQuoteTableSummary43核心观点31系统级AI计算平台是提升AI芯片算力利用率培养用户生态的关键19影响AI芯片计算能力的因素除了硬件层面的芯片制程内存带宽等8还包括调用各硬件资源的系统级软件计算平台AI芯片厂商开发的系-4082210221222022304230623统计算平台不仅仅有效提升各家AI芯片产品的算力利用率还为各类-16AI应用开发提供了丰富的函数库提供开发者简便易用的开发环境计算机沪深300英伟达的计算平台是主流应用开发平台通过对比各公司CUDAAI开发的AI计算平台我们发现英伟达的CUDA开发时间最早积累的分析师TableAuthor刘雪峰开发者数量最多英伟达一方面依靠AI芯片优异的硬件性能快速获客SAC执证号S0260514030002另一方面持续拓展CUDA的算法覆盖面不断巩固客户群体英伟达SFCCENoBNX004通过滚雪球式的软硬件协同创新将其AI芯片的市场份额不断扩021-38003675大并构建起了深厚的生态壁垒gfliuxuefenggfcomcn寒武纪的Neuware对AI算法覆盖面全面兼容性强Neuware不仅分析师周源支持CVNLP智能推荐等主流商用AI算法还兼容第三方的训练SAC执证号S0260523040001框架例如百度飞桨PaddleLite在向互联网公司等商业客户拓展0755-23948351用户生态时更具优势依托于Neuware开发者可完成从云端到边缘shzhouyuangfcomcn端从模型训练到推理部署的全部流程提升AI芯片的算力利用率请注意周源并非香港证券及期货事务监察委员会的注册在中美科技领域竞争日益激烈的背景下自主研发架构更具优势在持牌人不可在香港从事受监管活动英伟达AI芯片对中国出口前景具有不确定性的背景下以互联网为代相关研究TableDocReport表的AI计算下游厂商适配和采用国产化的系统软件寒武纪的Neuware华为的CANN的动力将大大增加我们认为独立于CUDA计算机行业积极配置正当时2023-08-20的自研计算平台对于我国芯片产业的长远发展至关重要国产AI芯片计算机行业积极配置穿越下2023-08-13厂商独立研发自主迭代的AI计算平台更加具备长久的持续发展能力游景气度周期的优质板块个寒武纪的中立属性在行业格局中具有独特价值更有利于其用户生态股的拓展寒武纪提供的产品以AI算力基础设施为主不涉足AI应用计算机行业金融IT只是开2023-08-06领域与行业参与者更多构成的是互补关系而不是竞争关系寒武纪始基本面托底迭加外部环境的中立属性使其保持智能化升级中赋能者的定位与产业链上下游形因素催化将持续推动行业表成合作共赢的关系这更加有利于其Neuware计算平台用户生态的拓现展投资建议推荐拥有自研AI计算平台的寒武纪长期生态壁垒较高联系人TableContacts许晟榕021-38003800风险提示科技巨头在计算平台领域长期积累生态壁垒较高国xushengronggfcomcnAI产AI芯片公司中短期突破难度较大AI计算平台对于AI算法覆盖面要求较高前期投入较大与生态培育不及预期的风险AI芯片存在供应链不稳定的风险识别风险发现价值请务必阅读末页的免责声明132TablePageText深度分析计算机重点公司估值和财务分析表Tableimpcom最新最近合理价值EPS元PExEVEBITDAxROE股票简称股票代码货币评级收盘价报告日期元股2023E2024E2023E2024E2023E2024E2023E2024E寒武纪-U688256SHCNY1514020230502增持25175-170-100-----1590-1040数据来源Wind广发证券发展研究中心备注表中估值指标按照最新收盘价计算识别风险发现价值请务必阅读末页的免责声明232TablePageText深度分析计算机目录索引投资要点5一AI芯片的系统计算平台是用户生态培育的关键7一CUDA释放英伟达GPU算力的系统级AI计算平台7二CANN华为拓展昇腾AI芯片生态的关键11三NEUWARE寒武纪实现训练推理一体化的AI计算平台15四ROCM为海光DCU提供高兼容性的AI计算平台18二自主研发的AI计算平台有利于长期生态的构建21一短期来看兼容CUDA的AI计算平台在产品推广上具有便利性21二长期来看自主研发的AI计算平台有利于长期生态的构建24三风险提示30识别风险发现价值请务必阅读末页的免责声明332TablePageText深度分析计算机图表索引图1英伟达CUDA在IT系统中的功能定位7图2基于CUDA函数库的C语言界面对比7图3CANN架构图11图4CANN算子的编译逻辑架构14图5CANN算子的运行逻辑架构14图6CANN的多层级API15图7寒武纪基础软件平台CambriconNeuware在IT系统中的定位16图8寒武纪基础软件平台CambriconNeuware架构图16图9寒武纪训推一体开发和部署流程17图10寒武纪MagicMind推理引擎的架构18图11AMDROCm5平台架构18图12CUDA和ROCm技术栈对比19图13华为盘古大模型产品矩阵29表1各公司系统级AI计算平台发展历史对比7表2英伟达CUDA对于硬件资源加速的扩展功能8表3英伟达CUDA-X的函数库9表4英伟达不同版本的CUDA支持历代架构AI芯片的对应关系10表5CANN各层级功能介绍12表6CANN逻辑层以及各层级组件功能介绍13表7CANN自定义算子开发对比分析14表8CANN算子编译运行中的推理和训练场景14表9CUDA和ROCm各项对比19表10各公司系统级AI计算平台兼容性和算法覆盖面对比20表11兼容CUDA架构的计算平台的优势21表12兼容CUDA架构的计算平台的潜在问题22表13独立开发框架的优势22表14CUDA与OpenCL对比23表15独立开发框架的劣势23表16各类型AI芯片优劣势对比25表172021-2023年华为中标的人工智能计算中心项目26表182019-2023年寒武纪中标的人工智能计算中心项目27表19华为CANN和寒武纪Neuware计算平台对比28识别风险发现价值请务必阅读末页的免责声明432TablePageText深度分析计算机投资要点系统级AI计算平台是提升AI芯片算力利用率培养用户生态的关键影响AI芯片计算能力的因素除了硬件层面的芯片制程内存带宽等还包括调用各硬件资源的系统级软件计算平台AI芯片厂商开发的系统计算平台不仅仅有效提升各家AI芯片产品的算力利用率还为各类AI应用开发提供了丰富的函数库提供开发者简便易用的开发环境英伟达的CUDA计算平台是主流AI应用开发平台通过对比各公司开发的AI计算平台我们发现英伟达的CUDA开发时间最早积累的开发者数量最多英伟达一方面依靠AI芯片优异的硬件性能快速获客另一方面持续拓展CUDA的算法覆盖面不断巩固客户群体英伟达通过滚雪球式的软硬件协同创新将其AI芯片的市场份额不断扩大并构建起了深厚的生态壁垒CANNComputeArchitectureforNeuralNetworks是华为针对AI场景推出的异构计算架构CANN构建了从上层深度学习框架到底层AI芯片的桥梁提供多层次的编程接口全面支持昇思MindSpore飞桨PaddlePaddlePyTorchTensorFlowCaffe等主流AI框架提供900多种优选模型覆盖众多典型场景应用兼容多种底层硬件设备提供异构计算能力支持用户快速构建基于昇腾平台的AI应用寒武纪CambriconNeuware是针对其云边端的AI芯片打造的软件开发平台为了加快用户端到端业务落地的速度减少模型训练研发到模型部署之间的繁琐流程Neuware整合了训练和推理的全部底层软件栈包括底层驱动运行时库CNRT算子库CNNL以及工具链等将Neuware和深度学习框架TensorflowPytorch深度融合实现训推一体依托于CambriconNeuware开发者可完成从云端到边缘端从模型训练到推理部署的全部流程提升AI芯片的算力利用率海光全面兼容计算生态DCUROCmGPUROCmRadeonOpenComputePlatform是AMD基于开源项目的GPU计算生态系统支持多种编程语言编译器库和工具以加速科学计算人工智能和机器学习等领域的应用ROCm还支持多种加速器厂商和架构提供了开放的可移植性和互操作性选择兼容CUDA平台的AI芯片虽然短期在产品推广方面具有一定便利性但是难以形成长期的生态壁垒CUDA作为英伟达AI计算平台已经得到广泛应用兼容CUDA平台的AI芯片具有强大的生态系统并且可获得社区支持利用现有的AI平台和共享计算资源有利于其AI芯片产品的推广但是长期来看仍然存在以下问题1软硬件适配度不够兼容CUDA的AI计算平台存在与其自研的AI芯片适配度不够导致AI芯片算力利用率不足甚至性能衰减的问题迭代速度较慢更新节奏较快选择兼容的计算平台存在由于投2CUDACUDAAI入研发资源不充足导致其迭代跟不上CUDA的更新节奏从而影响芯片性能的问题3客户粘性不足等问题由于其开发环境与CUDA的相似度较高开发者难以通过长期使用形成对其的粘性识别风险发现价值请务必阅读末页的免责声明532TablePageText深度分析计算机在中美科技领域竞争日益激烈的背景下自主研发架构更具优势在英伟达AI芯片对中国出口前景具有不确定性的背景下以互联网为代表的AI计算下游厂商适配和采用国产化的系统软件寒武纪的Neuware华为的CANN的动力将大大增加我们认为独立于CUDA的自研计算平台对于我国芯片产业的长远发展至关重要国产AI芯片厂商独立研发自主迭代的AI计算平台更加具备长久的持续发展能力自主研发的计算平台具有选择AI芯片技术路线的灵活性长期发展空间更宽广选择兼容CUDA的AI芯片虽然在短期内可以获得产品快速推广的机会但在长期却失去了可以自由选择其他技术路线实现性能突破的机会我们认为在以英伟达为代表的GPU在国内市场受到限制的情况下各厂商或加快探索除了GPU以外的其他技术路线在此背景下不依赖于GPU技术路线的自主研发的AI计算平台具有自由探索和选择其他技术路线的灵活性长期发展空间更宽广国产AI计算平台持续迭代和推广用户生态建设已具有一定基础华为的昇腾芯片和寒武纪的思元系列芯片是国内较早开始推广并在商业落地上取得一定领先优势的产品国产AI芯片的计算平台正在依托各地AIDC的算力在各行业的应用而实现用户生态的快速拓展各地建成的人工智能计算中心的AI算力租用给当地企业使用在这一过程中华为的CANN和寒武纪的Neuware的用户生态得到快速拓展我们认为最先成功商业化的公司将会扩大对追赶者的优势因为最终用户不大会接受同时采用诸如四五种以上不同的芯片计算平台体系我们看好此前有相关经验的华为昇腾CANN和寒武纪Neuware生态的发展前景华为提供全栈AI解决方案在部分场景与AI应用公司构成竞争关系华为在AI产业链中扮演的角色不仅仅作为底层软硬件基础设施提供商还针对部分场景开发了具体的AI应用以AI大模型为例华为不仅提供底层算力昇腾AI芯片训练框架Mindspore昇思和基础大模型盘古大模型还开发了行业级大模型盘古金融大模型盘古制造大模型等以及针对场景的AI应用先导药物筛选传送带异物检测等这与部分AI应用提供商构成同业竞争的关系其发展会受到一定限制我们认为华为在各场景中提供全栈AI解决方案的战略会影响其基础AI算力产品以及计算平台CANN的商业拓展寒武纪的中立属性在行业格局中具有独特价值更有利于其用户生态的拓展寒武纪提供的产品以AI算力基础设施为主不涉足AI应用领域与行业参与者更多构成的是互补关系而不是竞争关系Neuware不仅支持CVNLP智能推荐等主流商用AI算法还兼容第三方的训练框架例如百度飞桨PaddleLite在向互联网公司等商业客户拓展用户生态时更具优势寒武纪的中立属性使其保持智能化升级中赋能者的定位与产业链上下游形成合作共赢的关系这更加有利于其Neuware计算平台用户生态的拓展投资建议推荐拥有自研AI计算平台的寒武纪长期生态壁垒较高风险提示科技巨头在AI计算平台领域长期积累生态壁垒较高国产AI芯片公司中短期突破难度较大AI计算平台对于AI算法覆盖面要求较高前期投入较大与生态培育不及预期的风险AI芯片存在供应链不稳定的风险识别风险发现价值请务必阅读末页的免责声明632TablePageText深度分析计算机一AI芯片的系统计算平台是用户生态培育的关键系统级AI计算平台是提升AI芯片算力利用率培养用户生态的关键影响AI芯片计算能力的因素除了硬件层面的芯片制程内存带宽等还包括调用各硬件资源的系统级软件计算平台AI芯片厂商开发的系统计算平台不仅仅有效提升各家AI芯片产品的算力利用率还为各类AI应用开发提供了丰富的函数库提供开发者简便易用的开发环境以英伟达为例其开发的CUDA平台自2007年推出后持续更新已吸引了大量AI应用开发者使用形成了庞大的用户生态此篇报告将深入分析各厂商开发的AI计算平台的功能效果并前瞻分析未来的发展趋势表1各公司系统级AI计算平台发展历史对比名称开发厂商推出时间截止2023年8月的版本号主要函数库并行计算库深度学习库图像CUDA英伟达200702V122视频库70RC1alpha002社区运行时库视觉预处理和人工智CANN华为201809版CANN63RC2商用版能预处理库华为集合通信库等Neuware寒武纪201711-AI加速库通信库视觉库数学库并行计算库图像视频ROCmAMD201611AMDROCmPlatform560库深度学习库通信库数据来源各公司官网广发证券发展研究中心一CUDA释放英伟达GPU算力的系统级AI计算平台英伟达开发的CUDA系统计算框架构建了GPU和开发者之间的桥梁CUDAComputeUnifiedDeviceArchitecture是英伟达公司于2007年推出用于释放GPU并行计算能力和增强通用性的系统级计算平台CUDA直接对接GPU的物理层将海量数据分配给多个线程上分别处理再调用GPU的多核心计算单元进行并行计算为方便开发者更好的调用GPU的计算能力CUDA也提供了一系列封装好的函数库和API可在芯片物理层上实现指令级和算子的直接调用总体而言CUDA一方面可高效利用底层AI芯片的算力另一方面给予开发者便捷的开发环境满足了开发者高效利用AI底层算力的需求图1英伟达CUDA在IT系统中的功能定位图2基于CUDA函数库的C语言界面对比数据来源英伟达官网广发证券发展研究中心数据来源英伟达官网广发证券发展研究中心识别风险发现价值请务必阅读末页的免责声明732TablePageText深度分析计算机CUDA不仅仅是AI算法开发的工具链还是调用底层计算资源的系统平台与一般的软件工具不同CUDA是更加贴近芯片物理层的系统平台其提供的封装函数可以实现对于内存计算单元算术逻辑单元数据传输速率带宽等底层算力资源的调用因此CUDA在设计之初的产品定位是给程序员提供对于硬件性能优化和调试的功能后续随着CUDA版本的升级迭代其对于底层硬件资源调用能力持续增强例如CUDA50版本中新增的动态并行技术可以根据数据处理量在内核中动态调用多条线程减少单一线程上的工作负载从而保证了不同线程上的负载均衡表2英伟达CUDA对于硬件资源加速的扩展功能计算能力版本功能支持101112132x303235375x6x7072758x90线程束表决函数否是线程束表决函数内存栅栏函数同步函数否是曲面函数线程块的三维网格线程束统筹函数否是统一内存编程线程访问通道转换否是动态并行性否是统一数据路径否是硬件加速异步复制硬件加速异步到达同步等待栅栏否是对缩减操作的线程束级支持二级高速缓冲存储器驻留管理用于加速动态编程的DPX指令分布式共享内存否是线程块群集张量储存加速器TMA单元数据来源英伟达官网广发证券发展研究中心CUDA提供了易用友好的开发环境CUDA提供了丰富的库函数和工具方便程序员对于各类AI算法进行开发经过多年的拓展CUDA不仅兼容主流的AI训练框架TensorflowPytorch等对各类AI算法DLRMResnet-50BERT等的覆盖面也更加广阔通过CUDA程序员可以高效利用GPU的大规模并行计算能力来加速各种计算密集型任务包括图像和视频处理物理模拟金融分析生命科学等领域我们认为CUDA经过长期积累可提供对于各类AI算法开发的函数库和工具链更加丰富对各类算法覆盖面更加广泛在易用性方面具有一定优势识别风险发现价值请务必阅读末页的免责声明832TablePageText深度分析计算机表3英伟达CUDA-X的函数库函数库类型函数库功能介绍cuBLAS基本线性代数库cuFFT用于快速傅里叶变换的GPU加速库CUDAMathLibrary标准数学函数库cuRAND随机数生成函数库数学库cuSOLVER密集和稀疏求解器cuSPARSE稀疏矩阵函数库cuTENSOR张量线性代数库AmgX用于模拟和隐式非结构化方法的线性求解器并行算法库Thrust该库包含常用的C并行算法和数据结构nvJPEG用于JPEG格式数据解码的函数库NVIDIAPerformancePrimitives提供GPU加速的图像视频和信号处理功能图像和视频库NVIDIAVideoCodecSDK一套完整的API示例和文档用于执行硬件加速的视频编码和解码NVIDIAOpticalFlowSDK用于计算图像之间像素的相对运动NVSHMEM根据OpenSHMEM标准的并行计算扩展包可有效扩展多个GPU互联时的内存通信库NCCL用于多GPU多节点通信的开源代码库可在保持低延迟的同时更大限度地增加带宽NVIDIAcuDNN针对常用深度神经网络算法的标准函数库和工具NVIDIATensorRT用于生产部署的高性能深度学习推理优化器和运行时深度学习库NVIDIARiva用于各种情景下互动性强的AI对话应用的函数库NVIDIADeepStreamSDK实时流分析工具包用于基于AI的视频数据和多传感器数据的处理NVIDIADALI开源代码库用于解码和增强图像和视频数据并加速相关深度学习应用OpenCV开源代码库用于计算机视觉图像处理和机器学习FFmpeg开源代码多媒体框架包含用于音频和视频处理的插件库ArrayFire开源代码库用于矩阵信号和图像处理MAGMA在异构的环境中提供线性代数相关算法处理工具合作开发的库IMSLFortranNumericalLibrary开源代码库包含数学信号和图像处理以及统计专用的函数Gunrock图形处理函数库CHOLMOD稀疏求解器函数库TritonOceanSDK在游戏仿真等应用中应用于海洋与水体仿真的函数库CUVIlib用于加速医学工业等领域成像应用的函数库数据来源英伟达官网广发证券发展研究中心CUDA与英伟达AI芯片强绑定随着AI芯片迭代而持续升级英伟达在每一代芯片架构升级的过程中添加了一些新的特性来提升对于AI算法的计算效率针对这些新的特性CUDA也不断丰富SDK中的函数库从软件层面进一步对AI算法进行加速例如英伟达在2017年推出Volta架构AI芯片产品的时候首次引入了TensorCore其将单一维度的数字运算扩展到二维度的矩阵运算从而提升单次运算能力在软件层面CUDA90版本则新增了各类矩阵运算操作符对于矩阵的加载相乘累加都有很好的处理效果因此用户可以通过CUDA更好的发挥硬件层面的新特性从而扩展产品的应用场景识别风险发现价值请务必阅读末页的免责声明932TablePageText深度分析计算机表4英伟达不同版本的CUDA支持历代架构AI芯片的对应关系CUDASDK版KeplerKeplerAdaTeslaFermiMaxwellPascalVoltaTuringAmpereHopper本earlylateLovelace101011111011x201011x21-231101330-31102032102140-421021x50-55103560103565115x70-75205x80206x90-923070100-10230751103580111-1143586115-117135871183590120-1225090数据来源英伟达官网广发证券发展研究中心CUDA构建了英伟达长而深的生态护城河英伟达针对数据中心场景的大数据和AI功能的开发起步早积累深厚自2007年英伟达推出CUDA以来至今已迭代了12个版本在多年市场推广下CUDA已成为AI算法开发主流的系统平台具有较高的生态壁垒截止2023年4月海内外主要科技公司超过百万的开发人员都是基于CUDA开发AI算法硬件层面的架构升级吸引用户采购新一代AI芯片更新换代软件层面丰富的工具和易用的开发环境则培养了用户粘性在长期的积累下CUDA形成的生态壁垒较好的巩固英伟达的市场份额和龙头地位识别风险发现价值请务必阅读末页的免责声明1032TablePageText深度分析计算机二CANN华为拓展昇腾AI芯片生态的关键CANNComputeArchitectureforNeuralNetworks是华为针对AI场景推出的异构计算架构CANN构建了从上层深度学习框架到底层AI芯片的桥梁提供多层次的编程接口全面支持昇思MindSpore飞桨PaddlePaddlePyTorchTensorFlowCaffe等主流AI框架提供900多种优选模型覆盖众多典型场景应用兼容多种底层硬件设备提供异构计算能力支持用户快速构建基于昇腾平台的AI应用图3CANN架构图数据来源昇腾社区智能计算芯世界广发证券发展研究中心计算架构方面CANN被抽象为五大层级分别为计算语言接口计算服务层计算编译引擎计算执行引擎和计算基础层共同构建高效而简捷的计算平台CANN的优势是兼容性较强可在不同的硬件OS和AI开发框架的异构环境中发挥较好的计算性能实现端边云多设备的协同赋能各场景的AI开发识别风险发现价值请务必阅读末页的免责声明1132TablePageText深度分析计算机表5CANN各层级功能介绍架构层功能昇腾计算语言AscendComputingLanguageAscendCL接口是昇腾计算开放编程框架是对低层昇腾计算服务接口的昇腾计算语言接口封装它提供Device设备管理Context上下文管理Stream流管理内存管理模型加载与执行算子加载与执行媒体数据处理Graph图管理等API库供用户开发人工智能应用调用本层主要提供昇腾计算库例如神经网络NeuralNetworkNN库线性代数计算库BasicLinearAlgebraSubprograms昇腾计算服务层BLAS等昇腾计算调优引擎库例如算子调优子图调优梯度调优模型压缩以及AI框架适配器要提供图编译器GraphCompiler和TBETensorBoostEngine算子开发支持前者将用户输入中间表达Intermediate昇腾计算编译引擎RepresentationIR的计算图编译成NPU运行的模型后者提供用户开发自定义算子所需的工具本层负责模型和算子的执行提供如运行时Runtime库执行内存分配模型管理数据收发等图执行器Graph昇腾计算执行引擎Executor数字视觉预处理DigitalVisionPre-ProcessingDVPP人工智能预处理ArtificialIntelligencePre-ProcessingAIPP华为集合通信库HuaweiCollectiveCommunicationLibraryHCCL等功能单元本层主要为其上各层提供基础服务如共享虚拟内存SharedVirtualMemorySVM设备虚拟化VirtualMachine昇腾计算基础层VM主机-设备通信HostDeviceCommunicationHDC等数据来源华为昇腾官网广发证券发展研究中心CANN是系统级计算平台位于物理层和基础软件层之间CANN根据应用于不同场景中具体的算法需求为开发者提供了可调用的计算资源以及可操作的功能模块具体包括超过1200个算子统一编程接口AscendCLModelZoo模型库以及图编译器等CANN提供了从底层算子模型开发再到上层应用全流程的开发工具可覆盖全场景应用方便开发者快速开发各类算法作为华为昇腾AI基础软硬件平台的核心CANN在面向底层硬件资源的调用面向开发者的工具模块以及面向生态伙伴的接口等方面都有较好设计和提升其具体特点包括1简便开发针对多样化应用场景统一编程接口AscendCL适配全系列硬件助力开发者快速构建基于昇腾平台的AI应用和业务2性能优化通过自动流水算子深度融合智能计算调优自适应梯度切分等核心技术软硬件协同优化提升AI芯片的算力利用率3开放生态丰富的高性能算子库和优选ModelZoo模型库吸引各领域的开发者共建生态识别风险发现价值请务必阅读末页的免责声明1232TablePageText深度分析计算机表6CANN逻辑层以及各层级组件功能介绍抽象层作用组件组件功能推理应用基于AscendCL捉供的APl构建推理应用Al框架包括TensorflowCaffeMindspore以及第三方框架模型小型化工具实现对模型进行量化加速模型基于MindSpore自动学习工具根据昇腾芯片特点进行搜索生AutoML工具包括基于Ascend平台开发的各种应用以及成亲和性网络充分发挥昇腾性能应用层Ascend提供给用户进行算法开发调优的应加速库基于AscendCL构建的加速库当前支持Blas加速库用类工具提供给开发者的集成开发环境和调试工具可以通过MindStudio进行离线模型转换离线推理算法应用开发调试MindStudio算法调试自定义算子开发和调试日志查看性能调优系统故障查看等开放编程框架提供DeviceContextStream內存等的管理AscendCL昇腾计算实现解决方案对外能力开放模型及算子的加载与执行媒体数据处理Graph管理等语言库API库供用户开发深度神经网络应用图优化和编译统一的IR接口对接不同前端GraphEngine图编译和运行的控制中心支持TensorFlowCaffeMindSpore表达的计FusionEngine管理算子融合规则算图的解析优化编译提供对后端计算引最AICPUEngineAICPU算子信息管理芯片使能层优化部署能力HCCLHCCL算子信息管理TBE编译生成算子及算子开发工具算子编译和算子库算子库神经网络加速库实现视频编解码VENCDECJPEG编解JPEGDEPNG数字视觉预处理解码PNGDVPC预处理基于计算图的业务流的控制和运行Runtime为神经网络的任务分配提供资源管理通道TaskScheduler计算图Task序列的管理和调度执行AlCore执行NN类算子计算设备AICPU执行CPU算子DVPP视频图像编解码预处理计算资源层PCle芯片间或芯片与CPU间高速互联通信链路HCCS实现芯片间缓存一致性功能RoCE实现芯片内存RDMA功能数据来源华为昇腾官网广发证券发展研究中心CANN提供算子层面多种开发方式开发者对AI芯片功能拓展更具灵活性算子通常是AI芯片的核心部件其包含各种不同类型的运算操作符如矩阵乘法卷积池化非线性激活等CANN提供开发者在算子层面可编程的能力针对不同算法特点开发者可以从更加底层修改资源调度方式从而降低神经网络的计算复杂度和时间开销提高模型的训练速度和精度识别风险发现价值请务必阅读末页的免责声明1332TablePageText深度分析计算机表7CANN自定义算子开发对比分析算子开发方式语言计算单元优点适用场景接口高度封装开发者无需感知硬件内部逻辑入门适用于通用场景下的逻辑运算开发DSLPythonAICore较快效率较高对于特殊场景支持度不足开发者可自行控制数据搬运和调度过呈熟悉AI处适用各类算子的开发对复杂计算场TIKPythonAICore理器架构的开发者可以快速开发出高效的算子景支持度好AICPU算子性能较低算子无法通过提供原生C接口具备C程序开发能力的开发AICPUCAICPUAICore方式实现或者需要临时快速者入门较快无需感知硬件内部复杂逻辑打通网络的场景下使用数据来源华为昇腾官网广发证券发展研究中心CANN提供的高性能算子库有效提高训练和推理阶段的计算效率算子库在AI模型的训练和推理阶段都有重要功能和作用在AI训练过程中卷积算子全连接算子批量归一化算子等对于神经网络的训练过程需要大量的矩阵乘法和复杂的数学运算有很好性能满足可以显著提高训练速度和效率在AI推理过程中卷积算子池化算子激活算子等则可用于加速神经网络的推断减少响应时间开发者基于CANN提供的支持包括TensorFlowPytorchMindsporeOnnx框架在内超过1200个高性能算子帮助开发者有效提升训练和推理的计算效率图4CANN算子的编译逻辑架构图5CANN算子的运行逻辑架构数据来源华为昇腾官网广发证券发展研究中心数据来源华为昇腾官网广发证券发展研究中心表8CANN算子编译运行中的推理和训练场景推理场景训练场景使用ATC模型转换工具将原始网络模型转换为适配腾AI处昇CANN内部实现逻辑会先将开源框架网络模型下发给GraphEngine进算子编译理器的离线模型行图编译使用ATC模型转换工具将原始网络模型转换为适配昇腾AI处内部实现逻辑将开源框架网络模型下发给GraphEngine进行图编译算子运行理器的离线模型后开发AscendCL应用程序加载转换好的后后续的训练流程会进行算子的调用执行离线模型文件进行模型推理数据来源华为昇腾官网广发证券发展研究中心识别风险发现价值请务必阅读末页的免责声明1432TablePageText深度分析计算机CANN为开发者提供的可调用的API更加灵活针对场景复杂度不同CANN提供的API接口分为多个层级多层级的API的设计使得开发者在高效和易用之间有可选择的灵活度API级数越低自由度越高更易于表达复杂场景所需功能级数越高接口的封装度越高更易于表达常用语义使用更简单此外华为针对算子开发场景自研了AscendC编程语言通过多层接口抽象使得算子的开发过程更加简洁和高效自动并行计算则充分利用了硬件的并行计算能力提升了算子的计算性能而孪生调试技术为开发者提供了方便的调试环境帮助用户更快地发现和解决问题通过这些关键技术AscendC助力AI开发者在低成本下完成算子开发和模型调优部署它使得算子开发过程更加高效和便捷为AI开发者提供了强有力的工具和支持让他们能够更专注于算法和模型的优化从而取得更好的成果图6CANN的多层级API数据来源昇腾官网广发证券发展研究中心三Neuware寒武纪实现训练推理一体化的AI计算平台寒武纪CambriconNeuware是针对其云边端的AI芯片打造的软件开发平台为了加快用户端到端业务落地的速度减少模型训练研发到模型部署之间的繁琐流程Neuware整合了训练和推理的全部底层软件栈包括底层驱动运行时库CNRT算子库CNNL以及工具链等将Neuware和深度学习框架TensorflowPytorch深度融合实现训推一体依托于CambriconNeuware开发者可完成从云端到边缘端从模型训练到推理部署的全部流程提升AI芯片的算力利用率识别风险发现价值请务必阅读末页的免责声明1532TablePageText深度分析计算机图7寒武纪基础软件平台CambriconNeuware在IT系统中的定位数据来源寒武纪官网广发证券发展研究中心Neuware提供了全面的AI算法开发工具Neuware包括编程框架适配包智能芯片高性能数学库智能芯片编程语言智能芯片编译器智能芯片核心驱动应用开发调试工具包和智能芯片虚拟化软件等关键组件在开发应用时用户既可以基于TensorFlow和PyTorch等主流编程框架接口编写代码也可以通过公司自研的BANG编程语言对算子进行扩展或直接编写代码智能芯片编译器可以完成BANG语言到指令的编译使得算法各项指令高效地运行于思元系列芯片上在MLUAIAI开发过程中用户还可以通过应用开发调试工具包所提供的调试工具性能剖析工具和系统监测工具等高效地进行应用程序的功能调试和性能调优此外Neuware也可以通过智能芯片虚拟化软件为云计算与数据中心场景提供关键支撑图8寒武纪基础软件平台CambriconNeuware架构图数据来源寒武纪招股说明书广发证券发展研究中心训练任务方面Neware的训练软件平台拥有多项强大特性为用户提供高效且灵活的训练环境1首先平台支持主流开源框架原生分布式通信方式以及Horovod开源分布式通信框架使用户能够轻松实现从单卡到集群的分布式训练任务多种网络拓扑组织方式的支持使得用户可以根据需求灵活地选择适合的分布式训练方式包括数据并行模型并行和混合并行的训练方法识别风险发现价值请务必阅读末页的免责声明1632TablePageText深度分析计算机2其次训练软件平台提供丰富的训练任务支持涵盖图形图像语音推荐以及NLP等多个领域用户可以在一个统一的平台上完成各类训练任务极大地简化了训练流程提高了开发效率另外通过底层算子库CNNL和通信库CNCL训练软件平台在实际训练业务中达到了业界领先的硬件计算效率和通信效率这意味着用户可以获得更快的训练速度和更高的计算性能从而加速模型的训练过程3最后训练软件平台提供了模型快速迁移方法帮助用户快速完成现有业务模型的迁移这为用户节省了大量的时间和工作让他们能够更快地将已有模型应用到新的平台上提高了平台的易用性和适配性图9寒武纪训推一体开发和部署流程数据来源寒武纪官网广发证券发展研究中心推理任务方面寒武纪自研的MagicMind推理引擎对主流推理场景应用加速效果较好2021年底公司将Neuware架构升级了一个新的模块MagicMind推理引擎MagicMind推理引擎支持跨框架的模型解析自动后端代码生成及优化可帮助用户在MLUGPUCPU训练好的算法模型上降低用户的研发成本减少将推理业务部署到寒武纪AI加速卡产品上此外MagicMind和深度学习框架TensorflowPytorch深度融合使得用户可以无缝地完成从模型训练到推理部署的全部流程进行灵活的训练推理业务混布和潮汐式的业务切换可快速响应业务变化降低运营成本MagicMind的特点包括1训练到推理的无缝衔接MagicMind和人工智能框架TensorFlowPyTorch深度融合模型训练到推理一键部署2多种计算精度支持支持FP32FP16INT16INT8等多种计算精度支持用户指定不同层级计算精度以及定义量化方法细节3原生支持动态张量输入具有完备动态张量表达能力原生支持任意数据规模的动态张量输入4丰富的调试调优工具丰富的调试调优工具以及相应的文档和指引便利的调试调优体验识别风险发现价值请务必阅读末页的免责声明1732TablePageText深度分析计算机图10寒武纪MagicMind推理引擎的架构数据来源寒武纪官网广发证券发展研究中心四ROCm为海光DCU提供高兼容性的AI计算平台海光DCU全面兼容ROCmGPU计算生态ROCmRadeonOpenComputePlatform是AMD基于开源项目的GPU计算生态系统支持多种编程语言编译器库和工具以加速科学计算人工智能和机器学习等领域的应用ROCm还支持多种加速器厂商和架构提供了开放的可移植性和互操作性海光的DCU兼容ROCm生态的特性使得其得到国际主流商业计算平台生态系统和社区的支持可以利用现有的AI平台和共享计算资源快速实现模型训练和推理的性能提升短期内有利于其DCU产品的推广图11AMDROCm5平台架构数据来源AMD官网广发证券发展研究中心在架构层面ROCm与CUDA相似度较高ROCm和CUDA在生态编程环境等方面具有高度的相似性两者能很好地兼容兼容因此ROCm也被称为类CUDA识别风险发现价值请务必阅读末页的免责声明1832TablePageText深度分析计算机ROCm为了更好的兼容CUDA其实现了源码级的对CUDA程序的支持AMD团队不仅推出了与CUDAAPI高度类似的HIP工具集Heterogeneous-computeInterfaceforPortability使得AI算法工程师在编写ROCm的代码风格上与CUDA尽量贴近还提供了Rocblas类似于CublasHcsparse类似于Cusparse等一系列CUDA生态函数库的替代版本CUDA用户可以以较低代价快速迁移至ROCm平台图12CUDA和ROCm技术栈对比数据来源CSDN广发证券发展研究中心ROCm已实现包括函数接口编译器和函数库等各方面对CUDA的兼容API函数接口方面开发者可以在HIP里得到与CUDA类似的编程语法和大量API指令集以类似CUDA的风格为AMDGPU编程函数库方面ROC库提供了实现常用AI算法的功能允许开发人员使用类似于CUDA的函数便捷开发支持ROCm的AI应用最后在编译环节HCCHeterogeneousComputeCompiler也是对应CUDA的NVCC的编译器ROCm实现了对CUDA的全面兼容使得原本为CUDA编写的代码可以在ROCm平台上重新编译和运行从而在AMDGPU上实现GPU加速计算表9CUDA和ROCm各项对比结构CUDAROCm备注API函数接口CUDAAPIHIPC扩展语法编译器NVCCHCC编译器函数库CUDA函数库ROC库HC库并行算法执行ThrustParallelSTLHCC原生支持性能测试工具ProfilerROCmProfilerdebug工具CUDA-GDBROCm-GDB总线接口nvidia-smirocm-smi远程内存访问DirectGPURDMAROCnRDMApeer2peerSDK软件开发工具包TensorRTTensile张量计算库软件集成CUDA-DockerROCm-Docker数据来源CSDN广发证券发展研究中心英伟达的CUDA计算平台是主流AI应用开发平台通过对比各公司开发的AI计算平识别风险发现价值请务必阅读末页的免责声明1932TablePageText深度分析计算机台我们发现英伟达的CUDA开发时间最早积累的开发者数量最多CUDA推出的的时间是2007年相较于其他厂商早了十年左右2012年以Alexnet为代表的识别类AI技术取得突破后带来的AI算法开发的初期阶段CUDA即取得了先发优势在AI算法开发群体中快速推广使用之后英伟达一方面依靠AI芯片优异的硬件性能快速获客另一方面持续拓展CUDA的算法覆盖面不断巩固客户群体英伟达通过滚雪球式的软硬件协同创新将其AI芯片的市场份额不断扩大并构建起了深厚的生态壁垒表10各公司系统级AI计算平台兼容性和算法覆盖面对比名称开发厂商硬件兼容性软件兼容性支持的编程语言算法覆盖面仅兼容英伟达兼容包括Caffe2ChainerKerasAI芯片随着支持CCCMATLABMxNetPaddlePaddle支持CCCFortranJavaCUDA英伟达英伟达AI芯片FortranJavaPythonPyTorchandTensorFlow等主流AIPython等主要编程语言的迭代而持续等主要编程语言开发框架升级具有图编译技术以及超过1200个高主要兼容昇腾兼容Pytorch和TensorFlow自研AscendC语言性能算子其中Ascend神经网络加速CANN华为310P910ONNX飞桨JittorOpenLab主要支持CC原生库内置丰富算子用于支撑神经网络910PAI处理器OpenCV等主流AI开发框架编程训练和推理加速兼容TensorFlowCaffeCaffe2构建常见的前向和反向算子包括神MXNetONNX等编程接口间接经网络算子数值运算算子图像增主要兼容MLU自研Bang语言提供Neuware寒武纪通过CNML调用CNRT进行软件编强融合算子NLP算子和自定义算子云端一体芯片CC语言编程接口程也可以直接调用CNRT运行接口满足调用和自定义算子开发需上述过程所生成的离线模型求ROCm优化的库目前包括BLAS兼容包括Caffe2CNTKTorchFFTRNGSparseNCCLRCCL利用可移植异构计算接主要兼容AMDCaffeMxNetPaddlePaddle和Eigen并不断改进和扩展这些ROCmAMD口HIP全面兼容RadeonGPUPyTorchandTensorFlow等主流AI库以帮助在AMD加速器上运行功CUDA编程语言开发框架能更出色的高性能计算程序代码从而不断提升性能数据来源各公司官网广发证券发展研究中心识别风险发现价值请务必阅读末页的免责声明2032
 
Copyright © 2005 - 2021 Nxny.com All Rights Reserved 备案号:蜀ICP备15031742号-1