事件:
英伟达GTC开发者大会于3月20-23日举办,英伟达CEO黄仁勋于3月21日发表主题演讲,介绍AI的最新进展,以及AI技术如何影响每个行业和日常生活。综合演讲及材料信息,总结要点如下: 评论: 1、Grace打造超低功耗计算利器,H100助力DGX创造AI的iPhone时刻。Grace CPU:擅长单线程执行和内存处理,包含72个Arm核心,可提供3.2TB/s的带宽,Grace Superchip通过900GB/s的接口连接两个CPU,可提供1TB/s的带宽,是目前系统的2.5倍,功耗仅是其1/8,采用风冷即可,适合云计算和科学计算应用。DGX(AI超级计算机):LLM实现突破的引擎,创造AI的iPhone时刻,配备8个H100 GPU模组,通过NVLINKSwitch相连,H100配备Transformer引擎,旨在处理ChatGPT模型。四大推理芯片平台:1)L4:针对AI视频工作负载,优化视频编解码、内容审核和通话功能;2)L40:针对Omniverse、图形渲染以及文本转图像和文本转视频等生成式AI;3)HopperGPU:配备双GPUNVLINK的PCIEH100,目前云上唯一可以处理ChatGPT的GPU是A100,一台搭载4对H100及双NVLINK的标准服务器速度要快10倍,H100可将LLM的处理成本降低一个数量级;4)Grace Hopper:新的超级芯片,通过900GB/s的芯片接口连接Grace CPU和Hopper GPU,适合处理大型数据集,例如推荐系统和LLM的AI数据库。 2、完善多应用领域加速库建设,台积电预计23M6将对cuLitho进行生产认证。加速库:加速计算的核心。cuQuantum对量子计算机进行加速;Spark-RAPIDS可加速云数据处理平台;cuOpt用于运筹学领域解决组合优化问题;CV-CUDA和VPF是用于计算机视觉和视频处理的云规模加速库;Parabricks可用于基因组分析;cuLitho计算光刻库,与台积电、ASML和Synopsys合作将计算光刻加速了40倍以上,台积电在500个DGXH100系统上将功率从35MW降至5MW,替代用于计算光刻的4万台CPU服务器,为2nm等生产做准备,台积电将于6月对cuLitho进行生产资格认证。软件SDK构成的推理平台:NVIDIATensorRT用于推理运行时针对指定GPU进行性能优化。NVIDIATriton用于数据中心的推理服务,支持多种深度学习框架,支持GPU和CPU。NVIDIABlueField:高效管理数据中心操作系统和软件。 3、云服务为全球各类公司普及生成式AI机会,推出语言/视觉/药物研发模型。NVIDIADGXCloud:为客户提供出色的NVIDIAAI服务,通过与MicrosoftAzure、Google GCP和Oracle OCI合作,通过浏览器即可将NVIDIADGXAI超级计算机即时地接入每家公司,为迫切需要使用生成式AI的客户提供了在全球云端即时访问NVIDIAAI的机会。NVIDIAAIFoundations:面向需要构建、优化和运营定制LLM和生成式AI的云服务,包括语言、视觉和生物学模型制作服务。NVIDIANemo用于构建定制的语言文本转文本生成式模型,可便捷地采用预训练模型借助NeMo进行快速模型设计。Picasso是一项视觉语言模型制作服务,面向希望使用许可内容或专有内容来训练自定义模型的客户。NVIDIABioNeMo服务提供先进的用于药物研发的生成式AI模型。 4、Omniverse数字化平台构建虚拟化场景,提升工厂建造效率并节约资金。工业化数字平台,旨在搭建数字化和物理实体之间的桥梁,让各个行业先以数字方式设计、构建、运营和优化实体产品和工厂,然后再投入实际生产,以提高效率和速度,最终节省资金。一个用途是以虚拟方式构建工厂,在真正的实体工厂建成之前,以数字方式整合工厂的所有机械设备,减少在最后时刻出现意外、变更订单和工厂延迟开工等情况,虚拟工厂整合可以为全球工厂节省数十亿美元,可用于半导体晶圆厂、汽车制造商、电池制造商和物流仓库等。 投资建议:英伟达是全球领先的GPU厂商,逐步完成服务器核心CPU布局,在AI技术领域为客户提供完善的软硬件支持,与全球领军云服务厂商合作助力云计算应用普及,用AI的方式为各行业赋能增效。考虑到英伟达作为全球领先的AI技术风向标之一,我们认为此次GTC大会再次展现了生成式AI应用的巨大潜力,建议关注英伟达以及直接参与其GPU产业链的全球优质公司以及国内同类对标公司,包括全球具备高端芯片制造、封测和软件支持的半导体生产厂商,同时关注核心主芯片成品到终端应用涉及到的芯片原厂、PCB、云服务硬件、AI模型应用和各类终端厂商。 风险提示:竞争加剧风险;贸易摩擦风险;行业景气度变化风险;宏观经济及政策风险。 研究报告全文:证券研究报告行业简评报告2023年03月23日AI的iPhone时刻到来英伟达全力加速生成式AI发展英伟达GTC2023跟踪报告TMT及中小盘电子事件行业规模占比英伟达GTC开发者大会于3月20-23日举办英伟达CEO黄仁勋于3月21股票家数只45492日发表主题演讲介绍AI的最新进展以及AI技术如何影响每个行业和日常生总市值亿元7441289流通市值亿元5602879活综合演讲及材料信息总结要点如下评论行业指数1m6m12m打造超低功耗计算利器助力创造的时刻1GraceH100DGXAIiPhone绝对表现5924GraceCPU擅长单线程执行和内存处理包含72个Arm核心可提供32TBs相对表现3889的带宽GraceSuperchip通过900GBs的接口连接两个CPU可提供1TBs电子沪深30020的带宽是目前系统的25倍功耗仅是其18采用风冷即可适合云计算和10科学计算应用DGXAI超级计算机LLM实现突破的引擎创造AI的iPhone0时刻配备8个H100GPU模组通过NVLINKSwitch相连H100配备-10Transformer引擎旨在处理ChatGPT模型四大推理芯片平台1L4针-20对AI视频工作负载优化视频编解码内容审核和通话功能2L40针对-30Mar22Jul22Nov22Feb23Omniverse图形渲染以及文本转图像和文本转视频等生成式AI3Hopper资料来源公司数据招商证券GPU配备双GPUNVLINK的PCIEH100目前云上唯一可以处理ChatGPT相关报告的GPU是A100一台搭载4对H100及双NVLINK的标准服务器速度要快10倍H100可将LLM的处理成本降低一个数量级4GraceHopper新的超1英伟达FY23Q4跟踪报告本级芯片通过900GBs的芯片接口连接GraceCPU和HopperGPU适合处季业绩符合预期数据中心和游戏业务增长展望乐观2023-02-24理大型数据集例如推荐系统和LLM的AI数据库2海外电子跟踪报告英伟达季报总结及业绩说明会纪2完善多应用领域加速库建设台积电预计23M6将对cuLitho进行生产认证FY2023Q1要2022-05-27加速库加速计算的核心cuQuantum对量子计算机进行加速Spark-RAPIDS3海外电子跟踪报告英伟达可加速云数据处理平台cuOpt用于运筹学领域解决组合优化问题CV-CUDAFY2022Q3季报总结及法说会纪要2021-11-19和VPF是用于计算机视觉和视频处理的云规模加速库Parabricks可用于基因组分析cuLitho计算光刻库与台积电ASML和Synopsys合作将计算光刻鄢凡S1090511060002加速了40倍以上台积电在500个DGXH100系统上将功率从35MW降至yanfancmschinacomcn5MW替代用于计算光刻的4万台CPU服务器为2nm等生产做准备台积曹辉S1090521060001电将于6月对cuLitho进行生产资格认证软件SDK构成的推理平台NVIDIAcaohuicmschinacomcnTensorRT用于推理运行时针对指定GPU进行性能优化NVIDIATriton用于数王恬S1090522090002据中心的推理服务支持多种深度学习框架支持GPU和CPUNVIDIAwangtian2cmschinacomcnBlueField高效管理数据中心操作系统和软件程鑫研究助理chengxin2cmschinacomcn3云服务为全球各类公司普及生成式AI机会推出语言视觉药物研发模型NVIDIADGXCloud为客户提供出色的NVIDIAAI服务通过与MicrosoftAzureGoogleGCP和OracleOCI合作通过浏览器即可将NVIDIADGXAI超级计算机即时地接入每家公司为迫切需要使用生成式AI的客户提供了在全球云端即时访问NVIDIAAI的机会NVIDIAAIFoundations面向需要构建优化和运营定制LLM和生成式AI的云服务包括语言视觉和生物学模型制作服务NVIDIANemo用于构建定制的语言文本转文本生成式模型可便捷地采用预训练模型借助NeMo进行快速模型设计Picasso是一项视觉语言模型制作服务面向希望使用许可内容或专有内容来训练自定义模型的客户NVIDIA敬请阅读末页的重要说明行业简评报告BioNeMo服务提供先进的用于药物研发的生成式AI模型4Omniverse数字化平台构建虚拟化场景提升工厂建造效率并节约资金工业化数字平台旨在搭建数字化和物理实体之间的桥梁让各个行业先以数字方式设计构建运营和优化实体产品和工厂然后再投入实际生产以提高效率和速度最终节省资金一个用途是以虚拟方式构建工厂在真正的实体工厂建成之前以数字方式整合工厂的所有机械设备减少在最后时刻出现意外变更订单和工厂延迟开工等情况虚拟工厂整合可以为全球工厂节省数十亿美元可用于半导体晶圆厂汽车制造商电池制造商和物流仓库等投资建议英伟达是全球领先的GPU厂商逐步完成服务器核心CPU布局在AI技术领域为客户提供完善的软硬件支持与全球领军云服务厂商合作助力云计算应用普及用AI的方式为各行业赋能增效考虑到英伟达作为全球领先的AI技术风向标之一我们认为此次GTC大会再次展现了生成式AI应用的巨大潜力建议关注英伟达以及直接参与其GPU产业链的全球优质公司以及国内同类对标公司包括全球具备高端芯片制造封测和软件支持的半导体生产厂商同时关注核心主芯片成品到终端应用涉及到的芯片原厂PCB云服务硬件AI模型应用和各类终端厂商风险提示竞争加剧风险贸易摩擦风险行业景气度变化风险宏观经济及政策风险表1大算力相关电子产业链公司板块领域公司晶圆厂台积电中芯国际等芯片制造封测通富微电长电科技伟测科技甬矽电子等EDAIP华大九天概伦电子广立微芯原股份等云端算力芯片寒武纪海光信息龙芯中科景嘉微等边缘端算力芯片瑞芯微晶晨股份全志科技乐鑫科技中科蓝讯炬芯科技恒玄科技富瀚微等芯片相关主芯片外围芯片杰华特澜起科技聚辰股份晶丰明源裕太微龙迅股份等存储江波龙佰维存储兆易创新北京君正聚辰股份等高多层板深南电路沪电股份生益电子胜宏科技东山精密鹏鼎控股等PCBIC载板深南电路兴森科技等载板材料生益科技华正新材南亚新材等服务器整机工业富联浪潮信息中科曙光广达英业达仁宝纬颖等云服务硬件高速连接热管理等立讯精密等模型应用端AI大模型应用端海康威视大华股份萤石网络等XR立讯精密高伟电子兆威机电长盈精密等终端智能音箱漫步者国光电器百度阿里小米等可穿戴立讯精密漫步者歌尔股份佳禾智能等资料来源招商证券整理后附英伟达GTC2023黄仁勋主题演讲纪要全文敬请阅读末页的重要说明2行业简评报告附录英伟达GTC2023开发者大会主题演讲纪要时间2023年3月21日主讲人英伟达创始人黄仁勋背景介绍近四十年来摩尔定律一直是引领计算机行业动态发展的重要规律而计算机行业又影响着各行各业的发展在成本和功耗不变的情况下性能的指数级增长已经放缓然而计算技术的发展日新月异曲速引擎是加速计算动力来源就是AI各行各业正在应对可持续发展生成式AI和数字化等强大的动态挑战因此加速计算和AI的到来恰逢其时如果没有摩尔定律随着计算量的激增数据中心的能耗飙升企业将难以实现净零排放生成式AI的非凡能力使得企业产生了紧迫感他们需要重新构思他们的产品和商业模式产业内各企业正在竞相实现数字化转型成为软件驱动的科技公司要成为颠覆者而不是被颠覆者今天将讨论加速计算和AI如何成为强大的工具帮人们应对这些挑战和把握未来的巨大机遇我们将分享NVIDIA的数据中心级全栈加速计算平台的新进展我们将展示新的芯片和系统加速库云服务AI服务以及助力我们拓展新市场的合作伙伴关系1加速库包括cuQuantumcuOptculitho等平台用于量子计算运筹规划视频处理医疗光刻等各个领域背景介绍从图形成像粒子或流体动力学量子物理学到数据处理和机器学习每个经过优化的堆栈都会加速对应应用领域加速后应用可以获得令人难以置信的速度还可以扩展到许多台计算机在过去十年中加速和纵向扩展的结合使我们能够为许多应用实现百万倍的性能提升进而有助于解决以前无法解决的问题例如2012年AlexKerchevskyIlyaSuskever和GeoffHinton需要一台速度超快的计算机来训练AlexNet计算机视觉模型研究人员在GeForceGTX580上使用1400万张图像训练了AlexNet可处理262千万亿次浮点运算经过训练的模型以压倒性优势赢得了ImageNet挑战赛并触发了AI的大爆炸十年后Transformer模型面世了现在任职于OpenAI的Ilya训练了GPT-3大型语言模型来预测下一个单词训练GPT-3需要进行323x10e21次浮点运算浮点运算量比训练AlexNet多一百万倍结果创造出了ChatGPT这个震惊全世界的AI崭新的计算平台已经诞生AI的iPhone时刻已经到来加速计算和AI技术已经走进现实加速库是加速计算的核心这些加速库连接到了各种应用中进而再连接到遍布世界的各行各业形成了网络中的网络经过30年的开发已经有数千款应用被NVIDIA的库加速几乎涉及科学和工业的每个领域所有NVIDIAGPU都兼容CUDA为开发者提供了庞大的安装基础和广泛的覆盖范围大量加速应用吸引了终端用户为云服务提供商和计算机制造商创造了一个庞大的市场这个市场大到足以投入数十亿的研发费用来推动其增长汽车和航空航天行业使用CFD进行湍流和空气动力学仿真电子行业使用CFD进行热管理设计由CUDA加速的新CFD求解器在同等系统成本下NVIDIAA100的吞吐量是CPU服务器的9倍或者在同等仿真吞吐量下NVIDIA的成本降低了9倍能耗降低了17倍AnsysSiemensCadence和其他先进的CFD求解器现已采用CUDA加速在全球范围内工业CAE每年使用近1000亿CPU核心小时加速计算是减少功耗实现可持续发展和净零排放的最好方式敬请阅读末页的重要说明3行业简评报告图1由CUDA加速的新CFD求解资料来源英伟达招商证券cuQuantum量子加速英伟达宣布推出量子控制链路cuQuantum对量子计算机进行加速NVIDIA正在与全球量子计算研究社区合作NVIDIAQuantum平台由库和系统组成可供研究人员推进量子编程模型系统架构和算法cuQuantum是用于量子电路仿真的加速库IBMQiskitGoogleCirq百度量易伏QMWareQuEraXanaduPennylaneAgnostiq和AWSBracket已将cuQuantum集成到他们的仿真框架中OpenQuantumCUDA是我们的混合GPU-Quantum编程模型IonQORCAComputingAtomQuEraOxfordQuantumCircuitsIQMPasqalQuantumBrillianceQuantinuumRigettiXanadu和Anyon已经集成OpenQuantumCUDA要从量子噪声和退相干中恢复数据需要对大量量子比特进行纠错cuQuantum这是与QuantumMachines合作开发的它可将NVIDIAGPU连接到量子计算机以极快的速度进行纠错虽然商用量子计算机还有十到二十年的时间才能实现但我们很高兴能通过NVIDIAQuantum为这个充满活力的大型研究社区提供支持全球企业使用ApacheSpark处理数据湖和存储SQL查询图分析和推荐系统图2用于量子电路仿真的加速库cuQuantum资料来源英伟达招商证券敬请阅读末页的重要说明4行业简评报告Spark-RAPIDS是NVIDIA加速的ApacheSpark数据处理引擎可加速主要云数据处理平台数据处理是全球5000亿美元云计算支出的主要工作负载现在Spark-RAPIDS可加速主要云数据处理平台包括GCPDataprocAmazonEMRDatabricks和Cloudera推荐系统使用向量数据库来存储索引搜索和检索非结构化数据的大型数据集向量数据库的一个新型重要用例是大型语言模型在文本生成过程中可用于检索领域特定事实或专有事实我们将推出一个新的库即RAFT用于加速索引数据加载和近邻检索我们正在将RAFT的加速引入到Meta的开源FAISSAI相似性搜索超过1000家组织使用的Milvus开源向量数据库以及Docker镜像下载次数超过40亿次的Redis对于构建专有大型语言模型的组织而言向量数据库至关重要图3Spark-RAPIDS数据处理引擎资料来源英伟达招商证券cuOpt运筹规划加速英伟达cuOpt加速库用于运筹学领域解决组合优化问题22年前运筹学研究科学家Li和Lim发布了一系列具有挑战性的拣取和配送问题PDPPDP出现在制造运输零售和物流甚至救灾领域PDP是旅行商问题的泛化同时也是NP-hard问题这意味着不存在有效算法来找到精确解随着问题规模的增加求解时间会呈阶乘增长NVIDIAcuOpt使用进化算法和加速计算每秒分析300亿次动作打破了世界纪录并为Li和Lim的挑战找到了合适的解决方案ATT定期派遣3万名技术人员为700个地理区域的1300万客户提供服务如今如果在CPU上运行ATT的调度优化需要一整夜的时间ATT希望找到一个实时调度解决方案能不断优化紧急客户需求和整体客户满意度同时能针对延误和出现的新事件进行调整借助cuOptATT可以将查找解决方案的速度加快100倍并实时更新其调度方案ATT已采用全套NVIDIAAI库除了Spark-RAPIDS和cuOPT之外他们还将Riva用于对话式AI并将Omniverse用于数字人ATT正在利用NVIDIA加速计算和AI来实现高可持续性成本节约和新的服务cuOpt还可以优化物流服务每年有4000亿个包裹被投递到3770亿个站点德勤CapgeminiSoftserve埃森哲和Quantiphi正在使用NVIDIAcuOpt来帮助客户优化运营敬请阅读末页的重要说明5行业简评报告图4英伟达cuOpt及客户资料来源英伟达招商证券NVIDIA的推理平台由三个软件SDK组成NVIDIATensorRT用于推理运行时针对指定GPU进行性能优化NVIDIATriton用于数据中心的推理服务支持多种深度学习框架支持GPU和CPUTensorRT和Triton已有4万余客户其中包括MicrosoftOffice和TeamsAmazon美国运通和美国邮政署Uber使用Triton每秒为数十万车辆预测到达时间Roblox拥有超6000万的日活用户它使用Triton来部署包括游戏推荐构建虚拟形象审核内容和市场广告的模型我们将发布一些强大的新功能支持集成模型的模型分析器并发多模型服务以及适用于GPT-3大语言模型的多GPU多节点推理NVIDIATritonManagementService是我们的新软件可在整个数据中心自动扩展和编排Triton推理实例50-80的云视频管线运行在CPU上这增加了功耗和成本并增加了延迟TritonManagementService将帮助您提高部署模型的吞吐量和成本效率图5TensorRT和Triton推理平台资料来源英伟达招商证券CV-CUDA视频处理加速用于计算机视觉的CV-CUDA和用于视频处理的VPF是新的云规模加速库CV-CUDA包括30个计算机视觉算子可用于检测分割和分类VPF是一个Python视频编解码加速库腾讯使用CV-CUDA和VPF每天处理30万个视敬请阅读末页的重要说明6行业简评报告频Microsoft使用CV-CUDA和VPF来处理视觉搜索Runway公司使用CV-CUDA和VPF为其云生成式AI视频编辑服务处理视频视频已经占据了80的互联网流量用户生成的视频内容正在显著增长并消耗大量能源我们应该加速所有视频处理服务并减少能源消耗CV-CUDA和VPF处于抢先体验阶段图6CV-CUDA平台资料来源英伟达招商证券Parabricks医疗加速NVIDIA加速计算帮助基因组学实现了里程碑式发展现在医生可以在同一次就诊中抽取患者的血液并对其DNA进行测序另一个里程碑是使用NVIDIA助力的仪器设备将整个基因组测序的成本降低至仅需100美元基因组学是合成生物学的重要工具从药物研发农业到能源生产其应用范围非常广泛NVIDIAParabricks是一套AI加速库可用于云端或仪器设备内的端到端基因组分析NVIDIAParabricks适用于各种公有云和基因组学平台例如TerraDNAnexus和FormBio今天我们宣布推出Parabricks41并将会在PacBioOxfordNanoporeUltimaSingularBioNano和Nanostring的第四代NVIDIA加速基因组学设备上运行全球价值2500亿美元的医疗设备市场正在发生变革医疗设备将由软件定义并且由AI进行赋能NVIDIAHoloscan是一个适用于实时传感器处理系统的软件库超过75家公司正在通过Holoscan开发医疗设备今天我们宣布全球医疗设备行业领导者Medtronic将与NVIDIA携手为软件定义的医疗设备构建其AI平台此次合作将为Medtronic系统打造一个通用平台从手术导航到机器人辅助手术皆包含在内今天Medtronic宣布基于NVIDIAHoloscan构建新一代GIGenius系统将AI用于早期检测结肠癌并将于今年年底推出敬请阅读末页的重要说明7行业简评报告图7Parabricks加速库资料来源英伟达招商证券cuLitho光刻加速背景介绍芯片行业几乎是各行各业的基础芯片制造要求极高的精确度生产出的特征比细菌小1000倍大小约为一个金原子或一条人类DNA链的尺寸光刻即在晶圆上创建图案的过程是芯片制造过程的起始阶段包括两个阶段-光掩模制作和图案投影从根本上来说这是一个物理极限下的成像问题光掩模如同芯片中的模板光线被阻挡或穿过掩模到达晶片以形成图案光线由ASMLEUV极紫外线光刻系统产生每个系统的价值超过25亿美元ASMLEUV采用一种颠覆性的方式来制造光线激光脉冲每秒向一滴锡发射5万次使其汽化产生一种能发射135纳米EUV光的等离子体几乎是X射线随后多层镜面引导光线至光掩膜光掩膜板中的多层反射器利用135纳米光的干涉图案实现更精细特征精细度可达到3纳米晶圆的定位精度达到四分之一纳米并且每秒对准2万次以消除任何振动的影响光刻之前的步骤计算光刻应用逆物理算法来预测掩膜板上的图案以便在晶圆上生成最终图案事实上掩膜上的图案与最终特征完全不相似计算光刻模拟了光通过光学元件并与光刻胶相互作用时的行为这些行为是根据麦克斯韦方程描述的计算光刻是芯片设计和制造领域中最大的计算工作负载每年消耗数百亿CPU小时大型数据中心24x7全天候运行以便创建用于光刻系统的掩膜板这些数据中心是芯片制造商每年投资近2000亿美元的资本支出的一部分随着算法越来越复杂计算光刻技术也在快速发展使整个行业能够达到2纳米及以上敬请阅读末页的重要说明8行业简评报告图8cuLitho加速库合作客户资料来源英伟达招商证券NVIDIA今天宣布推出cuLitho一个计算光刻库cuLitho是一项历时近四年的庞大任务我们与台积电ASML和Synopsys密切合作将计算光刻加速了40倍以上NVIDIAH100需要89块掩膜板在CPU上运行时处理单个掩膜板当前需要两周时间如果在GPU上运行cuLitho只需8小时即可处理完一个掩膜板台积电可以通过在500个DGXH100系统上使用cuLitho加速将功率从35MW降至5MW从而替代用于计算光刻的4万台CPU服务器借助cuLitho台积电可以缩短原型周期时间提高产量减少制造过程中的碳足迹并为2纳米及以上的生产做好准备台积电将于6月开始对cuLitho进行生产资格认证2加速芯片推出全新GraceCPUSuperchip模组及BlueField技术面向AI云服务数据中心等背景介绍所有行业都需要加速各种工作负载以便我们能减少功耗达到事半功倍的效果在过去十年中云计算每年增长20成为了价值1万亿美元的巨大行业大约3000万台CPU服务器完成大部分处理工作而挑战即将到来随着摩尔定律的终结CPU性能的提高也会伴随着功耗的增加另外减少碳排放这一任务从根本上与增加数据中心的需求相悖云计算的发展受功耗限制首先数据中心必须加速各种工作负载加速将会减少功耗节省的能源可以促进新的增长未经过加速的工作负载都将会在CPU上进行处理加速云数据中心的CPU侧重点与过去有着根本性的不同在AI和云服务中加速计算卸载可并行的工作负载而CPU可处理其他工作负载比如WebRPC和数据库查询英伟达推出面向AI和云的GraceCPU其中AI工作负载由GPU加速单线程执行和内存处理则是Grace的擅长之处但这不仅仅是CPU芯片的问题数据中心管理员负责对整个数据中心的吞吐量和TCO进行优化为了在云数据中心规模下实现高能效我们设计了GraceGrace包含72个Arm核心由超高速片内可扩展的缓存一致的网络连接可提供32TBs的截面带宽敬请阅读末页的重要说明9行业简评报告图9GraceCPU资料来源英伟达招商证券GraceSuperchip模组是云数据中心的基础通过900GBs的低功耗芯片到芯片缓存一致接口连接两个CPU芯片之间的144个核内存系统由LPDDR低功耗内存构成与手机上使用的相似我们专门对此进行了增强以便在数据中心中使用它提供1TBs的带宽是目前系统的25倍而功耗只是其18整个144核GraceSuperchip模组的大小仅为5x8英寸而内存高达1TB该模组的功耗超低风冷即可带有被动冷却功能的计算模组两台GraceSuperchip计算机可以安装进一台1U风冷服务器即可正常运行Grace的性能和能效非常适合云计算应用和科学计算应用我们使用热门的Google基准测试测试云微服务的通信速度和Hi-Bench套件测试ApacheSpark内存密集型数据处理测试了Grace此类工作负载是云数据中心的基础图10GraceSuperchip资料来源英伟达招商证券敬请阅读末页的重要说明10行业简评报告Grace处理速度大大提升目前正在进行样品调测在微服务方面Grace的速度比最新一代x86CPU的平均速度快13倍而在数据处理中则快12倍而达到如此高性能整机功耗仅为原来服务器的60云服务提供商可以为功率受限的数据中心配备超过17倍的Grace服务器每台服务器的吞吐量提高25在功耗相同的情况下Grace使云服务提供商获得了两倍的增长机会Grace正在进行样品调测华硕AtosGBHPEQCTSupermicroWistron和ZT目前正在构建系统图11GraceCPU和NEXT-GENx86性能对比资料来源英伟达招商证券英伟达BlueField能高效管理数据中心操作系统和软件在现代软件定义的数据中心中操作系统在执行虚拟化网络存储和安全任务时会消耗近一半的数据中心CPU核心和相关功耗数据中心必须加速每个工作负载从而降低功耗并释放CPU给可创造收入的工作负载NVIDIABlueField卸载并加速数据中心操作系统和基础设施软件CheckPoint思科DDNDellEMCJuniperPaloAltoNetworksRedHat和VMWare等超过二十个生态系统合作伙伴使用BlueField的数据中心加速技术来更高效地运行其软件平台BlueField-3已投入生产并被领先的云服务提供商所采用以加速其云计算平台比如百度CoreWeave京东MicrosoftAzureOracleOCI和腾讯游戏图12BlueField-3资料来源英伟达招商证券敬请阅读末页的重要说明11行业简评报告3AI超级计算机及云计算平台基于DGXCloud为全球主要云服务商提供AI技术背景介绍NVIDIA加速计算始于DGXAI超级计算机这是大语言模型实现突破背后的引擎我亲手将全球首款DGX交给了OpenAI自此之后财富100强企业中有一半安装了DGXAI超级计算机DGX已成为AI领域的必备工具英伟达DGXH100AI超级计算机全面投入生产不断扩展应用版图DGX配有8个H100GPU模组H100配有Transformer引擎旨在处理类似令人惊叹的ChatGPT模型ChatGPT是生成式预训练Transformer模型的代表这8个H100模组通过NVLINKSwitch彼此相连以实现全面无阻塞通信8个H100协同工作就像一个巨型GPU计算网络是AI超级计算机的重要系统之一400Gbps超低延迟的NVIDIAQuantumInfiniBand具有网络内计算功能可将成千上万个DGX节点连接成一台AI超级计算机NVIDIADGXH100是全球客户构建AI基础设施的蓝图现在已全面投入生产微软宣布Azure将向其H100AI超级计算机开放私人预览版AtosAWSCirrascaleCoreWeave戴尔Gigabyte谷歌HPELambdaLabs联想OracleQuanta和SuperMicro也将很快开放系统和云服务DGXAI超级计算机的市场获得了显著增长从最初被用作AI研究工具DGXAI超级计算机正在不断扩展其应用范围能够全天候运行以优化数据和处理AIDGX超级计算机是现代AI工厂图13DGX超级计算机组装全流程资料来源英伟达招商证券我们正处于AI的iPhone时刻DGXCloud为全球主要云服务商提供AI技术生成式AI引发了全球企业制定AI战略的紧迫感客户需要更简单快捷地访问NVIDIAAI我们宣布推出NVIDIADGXCloud通过与MicrosoftAzureGoogleGCP和OracleOCI合作通过一个浏览器就可以将NVIDIADGXAI超级计算机即时地接入每家公司DGXCloud经过优化可运行NVIDIAAIEnterprise这是一款全球领先的加速库套件用于AI端到端开发和部署DGXCloud为客户提供出色的NVIDIAAI以及全球主要的云服务提供商这一合作将NVIDIA的生态系统引入到了云服务提供商NVIDIA触及的范围得以扩展这种双赢的合作伙伴关系为迫切需要使用生成式AI的客户提供了在全球云端即时访问NVIDIAAI的机会我们很高兴我们的业务模式以这种速度规模和覆盖范围在云上扩展敬请阅读末页的重要说明12行业简评报告图14NVIDIADGXCloud资料来源英伟达招商证券OracleCloudInfrastructureOCI将成为首个NVIDIADGXCloudOCI具有出色的性能它拥有两层计算网络和管理网络具有业界最佳RDMA功能的NVIDIACX-7提供了计算网络而BlueField-3将成为管理网络的基础设施处理器这种组合是一款先进的DGXAI超级计算机可提供多租户云服务我们拥有50家EA企业客户涵盖消费互联网和软件医疗健康媒体和娱乐以及金融服务图15OracleCloudInfrastructureDGXCloud资料来源英伟达招商证券4云代工厂面向生成式AI技术用于文本转换图像视频生成药物模型创建等背景介绍ChatGPTStableDiffusionDALL-E和Midjourney唤醒了世界对生成式AI的认知这些应用的易用性和令人印象深刻的功能短短几个月内就吸引了超过一亿的用户ChatGPT是迄今历史上用户数量增长最快的应用无需训练只需给这些模型下指令即可您可以使用精确提示也可以使用模糊提示如果提示不够清晰ChatGPT会根据对话了解您的意图生成的文本令人赞叹ChatGPT可以撰写备忘录和诗歌改写研究论文解决数学问题突出合同敬请阅读末页的重要说明13行业简评报告的关键点甚至编写软件程序ChatGPT是一台计算机它不仅可以运行软件还能编写软件众多突破性成果造就了生成式AITransformers能以大规模并行的方式从数据的关系和依赖性中学习上下文和含义这使得大型语言模型能够利用海量数据进行学习他们可以在没有明确训练的情况下执行下游任务受物理学启发的扩散模型通过无监督学习来生成图像在短短十几年的时间里我们经历了从试图识别猫到生成穿着太空服在月球上行走的的逼真猫图像的过程生成式AI是一种新型计算机一种我们可以用人类语言进行编程的计算机这种能力影响深远每个人都可以命令计算机来解决问题而之前这是只有计算机程序员才能接触的领域现在每个人都可以是程序员生成式AI是一种新型计算平台与PC互联网移动设备和云类似与之前的计算时代类似先行者正在打造新的应用并成立新公司以利用生成式AI的自动化和协同创作能力英伟达宣布推出NVIDIAAIFoundations这是一项云服务面向需要构建优化和运营定制LLM大型语言模型和生成式AI使用其专有数据进行训练用于处理特定领域的任务NVIDIAAIFoundations包括语言视觉和生物学模型制作服务图16NVIDIAAIFoundations资料来源英伟达招商证券NVIDIANeMo用于构建定制的语言文本转文本生成式模型客户可以引入自己的模型或从NeMo涵盖了GPT-8GPT-43到GPT-530等数十亿参数的预训练模型入手生成式模型比如NVIDIA的43B基础模型通过基于数十亿个句子和数万亿个单词进行训练来学习随着模型的收敛它开始理解单词与其基本概念之间的关系这些关系通过模型嵌入空间中的权重进行捕获Transformer模型使用一种名为自注意力的技术一种旨在学习一系列单词中的依赖性和关系的机制其结果是得到一种模型该模型可为类似ChatGPT的体验奠定基础这些生成式模型需要大量数据数据处理和分布式训练方面深厚的AI专业知识以及大规模计算以跟上创新的步伐进行训练部署和维护企业可以通过在NVIDIADGXCloud上的NVIDIANeMo服务快速采用生成式AI最快捷的方法是从NVIDIA的某项先进预训练基础模型开始入手借助NeMo服务人们可以轻松自定义一个模型并进行参数调优以教授其专业技能比如汇总财务文档创建特定品牌的内容以及以个性化的写作风格撰写电子邮件将模型连接到专有知识库可确保响应是准确的最新的并为其业务所引用接下来可以通过添加逻辑以及监控输入输出毒性和偏差阈值来提供防护栏以便模型在指定的领域内运行并防止出现意外响应模型投入使用后可以根据用户交互通过强化学习不断改进在迁移到云API进行更大规模的评估和应用集成之前可以使用NeMo进行快速原型设计敬请阅读末页的重要说明14行业简评报告图17Nemo语言模型资料来源NVIDIAGTC招商证券Picasso是一项视觉语言模型制作服务面向希望使用许可内容或专有内容来训练自定义模型的客户要充分发挥其潜力企业需要大量版权许可的数据AI专家和AI超级计算机NVIDIAPicasso是一项云服务用于构建和部署生成式AI赋能的图像视频和3D应用借助此服务企业ISV和服务提供商可以部署自己的模型公司正在与主要合作伙伴合作力求为各行各业提供生成式AI功能另外人们还可以从NVIDIAEdify模型入手使用自己的数据训练这些模型以创建产品或服务这些模型可生成图像视频和3D素材要访问生成式AI模型应用需向Picasso发送带有文本提示和元数据的API调用Picasso使用在NVIDIADGXCloud上运行的适当模型将生成的素材发送回应用这些素材可以是逼真的图像高分辨率视频或详细的3D几何图形可将生成的素材导入编辑工具或NVIDIAOmniverse以构建逼真的虚拟世界元宇宙应用和数字孪生仿真NVIDIAPicasso服务可以简化构建自定义生成式AI应用所需的训练优化和推理GettyImages将使用Picasso服务构建Edify图片和Edify视频生成式模型这些模型以其丰富的内容库为基础进行训练其中包含大量以负责任授权的方式获得许可的专业图像和视频素材企业将能够使用简单的文本或图像提示创建自定义的图像和视频Shutterstock正在开发一款以其专业的图像3D和视频素材库进行训练的Edify-3D生成式模型Shutterstock将帮助简化用于创意制作数字孪生和虚拟协作的3D素材的创建过程使企业能够更快更轻松地实现这些工作流公司与Adobe之间的长期合作将迎来重要扩展公司将共同构建一系列新一代AI功能打造创意领域的未来将生成式AI融入营销人员和创意专业人士的日常工作流新的生成式AI模型将针对图像视频3D和动画制作进行优化为了保护艺术家的权利Adobe正在开发以商业可行性和正确内容归属为重点的方案该方案由Adobe的内容真实性倡议提供支持敬请阅读末页的重要说明15行业简评报告图18Picasso视觉语言模型资料来源NVIDIAGTC招商证券NVIDIAAIFoundations的第三个领域应用是生物学药物研发是一个价值近2万亿美元的行业研发投入高达2500亿美元NVIDIAClara是一款医疗健康应用框架用于影像仪器基因组学分析和药物研发目前该行业正在转向利用生成式AI来发现疾病靶因设计新型分子或蛋白质类药物以及预测药物对机体的作用数百家新型AI药物研发初创公司相继涌现InsilicoMedicineExscientiaAbsci和Evozyme就位列其中有些公司已经发现了新型靶标或候选药物并开始了人体临床试验BioNeMo可帮助研究人员使用专有数据创建微调和提供自定义模型药物研发包括3个关键阶段发现引发疾病的机理设计新分子无论是小分子蛋白质还是抗体以及最后就这些分子之间相互作用的方式进行筛选如今生成式AI正在改变药物研发过程的每一步NVIDIABioNeMo服务提供先进的用于药物研发的生成式AI模型它可作为云服务提供让用户即时轻松地访问加速的药物研发工作流BioNeMo包括AlphaFoldESMFold和OpenFold等用于三维蛋白质结构预测的模型ProtGPT用于蛋白质生成ESM1和ESM2用于蛋白质特性预测MegaMolBART和MoFlow用于分子生成DiffDock则用于分子对接药物研发团队可以通过BioNeMo的Web界面或云API使用这些模型BioNeMo在药物研发领域的应用以下是一个使用NVIDIABioNeMo进行药物研发虚拟筛选的示例生成式模型可以读取蛋白质氨基酸序列并在几秒钟内准确预测目标蛋白质的结构它们还可生成具有理想ADME特性的分子从而优化药物在体内的作用方式生成式模型甚至可以预测蛋白质和分子的三维相互作用加速最佳候选药物的研发借助NVIDIADGXCloudBioNeMo还可提供按需超级计算基础设施以进一步优化和训练模型进而为团队节省宝贵的时间和资金使其专注于研发挽救生命的药物敬请阅读末页的重要说明16行业简评报告图19BioNeMo模型资料来源NVIDIAGTC招商证券NVIDIAAIFoundations是一个云服务代工厂用于构建自定义语言模型和生成式AI自十年前AlexNet面市以来深度学习就开辟了巨大的新市场包括自动驾驶机器人智能音箱并重塑了购物了解新闻和享受音乐的方式这只是冰山一角随着生成式AI掀起新一波机遇浪潮AI正处于转折点使得推理工作负载呈阶梯函数式增长AI现在可以生成多种数据从语音文本图像视频和3D图形到蛋白质和化学物质不一而足设计一个云数据中心来处理生成式AI是一项巨大挑战一方面理想情况下最好使用一种加速器因为这可以使得数据中心具有弹性能够应对不可预测的流量峰值和低谷但另一方面没有一个加速器能以最优的方式处理在算法模型数据类型和数据大小方面的多样性NVIDIA的OneArchitecture平台兼具加速功能和弹性5推理芯片平台面向AI视频Omniverse和图形渲染ChatGPT等大型语言模型等应用公司宣布推出全新的推理平台四种配置一个体系架构一个软件栈每种配置都针对某一类工作负载进行了优化图20NVIDIA全新推理平台资料来源NVIDIAGTC招商证券敬请阅读末页的重要说明17行业简评报告1针对AI视频工作负载公司推出了L4它针对以下方面进行了优化视频解码和转码视频内容审核以及视频通话功能例如背景替换重新打光眼神交流转录和实时翻译如今大多数云端视频都在CPU上处理一台8-GPUL4服务器将取代一百多台用于处理AI视频的双插槽CPU服务器Snap是NVIDIAAI在计算机视觉和推荐系统领域领先的用户NVIDIA和GoogleCloud正在努力加速在L4上部署主要工作负载首先公司正在加速针对Wombo和Descript等云服务的生成式AI模型的推理其次公司会将Triton推理服务器与GoogleKubernetesEngine和VertexAI集成第三公司将使用NVIDIASpark-RAPIDS加速GoogleDataproc第四公司将加速AlphaFoldUL2和T5大型语言模型第五公司将加速GoogleCloud的沉浸式流以渲染3D和AR体验2针对Omniverse图形渲染以及文本转图像和文本转视频等生成式AI公司推出L40L40的性能是NVIDIA最受欢迎的云推理GPUT4的10倍Runway是生成式AI领域的先驱他们正在发明用于创作和编辑内容的生成式AI模型借助30多种来自云端的AIMagicTools他们的服务将彻底改变创作过程在本地或云端运行的最新一代NVIDIAGPU的助力下Runway让用户只需简单几笔即可从视频中移除一个对象或仅使用一个输入图像就可以对视频应用不同的样式或更改视频的背景或前景过去使用传统工具需要数小时才能完成的工作现在只需短短几分钟就可以获得专业广播级质量的结果在实现这一点的过程中Runway采用了CV-CUDA它是一个开源项目使开发者能够构建GPU加速的高效计算机视觉工作负载预处理和后处理流程并将其扩展到云借助NVIDIA技术Runway得以行不可能之事让内容创作者获得最佳体验以前受限的专业工作现在可以由您来完成事实上Runway在奥斯卡提名的好莱坞电影中得到了应用而公司正在致力将这项技术提供给全世界的创作者3针对ChatGPT等大型语言模型的推理公司推出一款新的HopperGPU配备双GPUNVLINK的PCIEH100这一款H100配备94GBHBM3显存H100可以处理拥有1750亿参数的GPT-3同时还可支持商用PCIE服务器轻松扩展目前在云上唯一可以实际处理ChatGPT的GPU是HGXA100与适用于GPT-3处理的HGXA100相比一台搭载四对H100及双GPUNVLINK的标准服务器的速度要快10倍H100可将大型语言模型的处理成本降低一个数量级4GraceHopper是新的超级芯片通过900GB秒的高速一致性芯片到芯片接口连接GraceCPU和HopperGPUGraceHopper非常适合处理大型数据集例如适用于推荐系统和大型语言模型的AI数据库如今利用大容量内存CPU会存储和查询巨型嵌入表然后将结果传输到GPU进行推理借助Grace-HopperGrace可以查询嵌入表并将结果直接传输到Hopper速度比PCIE快7倍客户希望构建规模大几个数量级的AI数据库Grace-Hopper是理想的引擎以上就是NVIDIA的推理平台一个为适用于多种AI负载最大化的数据中心加速和弹性而设计的架构6Omniverse虚拟工厂沟通数字和实体帮助工业仓储汽车等领域快速搭建工厂Omniverse是一个工业数字化平台旨在搭建数字化和物理实体之间的桥梁该平台让各个行业先以数字方式设计构建运营和优化实体产品和工厂然后再投入实际生产数字化提高了效率和速度并节省了资金Omniverse其中一个用途是以虚拟方式构建工厂在真正的实体工厂建成之前以数字方式整合工厂的所有机械设备这样可以减少在最后时刻出现意外变更订单和工厂延迟开工等情况虚拟工厂整合可以为全球工厂节省数十亿美元半导体行业正在投资5000亿美元来建造84个新晶圆厂到2030年汽车制造商将建造300家工厂生产2亿辆电动汽车电池制造商正在建造100多家特大型工厂数字化也在改变物流行业在全球数十亿平方英尺的仓库之间辗转运输货物Omniverse在仓储领域的应用我们来看看Amazon如何使用Omniverse自动化优化和规划其自动仓库AmazonRobotics制造并部署了非常庞大的移动工业机器人机群此机器人机群的最新成员是Proteus这是Amazon首个完全自主的仓库机器人Proteus可利用先进的安全感知和导航技术在公司的设施中移动Proteus具有多个传感器其中包括摄像头激光雷达和超声传感器用于为其自主软件系统提供支持Proteus团队需要提高神经网络的性能该神经网络能够读取基准标记并帮助机器人确定其在地图上的位置训练由机器人传感器输入驱动的ML模型需要大量正确的数据通过IsaacSim中的OmniverseReplicatorAmazonRobotics成功生成了大型逼真合成数据集将标记检测成功率从886提高到了98此外使用OmniverseReplicator生成的合成数据还加快了开发速度将所需时间从几个月缩短到了几天因为与仅使用真实数据相比公司能够以更快的速度迭代测试和训练模型为了敬请阅读末页的重要说明18行业简评报告给不断壮大的Proteus机器机群提供新的自主功能AmazonRobotics正在努力缩小仿真与现实之间的差距构建大规模的多传感器多机器人仿真借助OmniverseAmazonRobotics将通过全保真仓库数字孪生优化运营无论是生成合成数据还是开发更高水平的自主功能基于Omniverse的IsaacSim都可帮助AmazonRobotics团队在设施中部署Proteus之时节省时间和资金图21Proteus机器人图22仓储应用示例资料来源NVIDIAGTC招商证券资料来源NVIDIAGTC招商证券Omniverse具备独特的数字化技术是USD的首要开发平台帮助团队协作创建虚拟世界和数字孪生Omniverse基于物理性质反映物理定律它可以连接到机器人系统并使用环路中的硬件进行操作它采用生成式AI来加速创建虚拟世界Omniverse可以管理大型数据集公司在每个领域都对Omniverse进行了重大更新已有近30万名创作者和设计师下载了OmniverseOmniverse不是一种工具而是一个USD网络和共享数据库也是一种与各行各业使用的设计工具相连接的基础结构它可以连接合成和模拟使用行业领先工具创建的3D资产公司很高兴看到Omniverse生态连接的发展壮大每个连接都会将一个平台的生态系统与所有其他平台的生态系统连接到一起Omniverse网络中的网络正在呈指数级增长现已连接BentleySystemsLumenRT还连接了SiemensTeamcenterNX和ProcessSimulateRockwellAutomationEmulate3DCesiumUnity等许多应用图23Omniverse连接的应用资料来源NVIDIAGTC招商证券Omniverse在汽车领域的应用我们来看看价值3万亿美元的汽车行业的数字化了解汽车公司如何在其工作流中评估Omniverse沃尔沃汽车公司和通用汽车使用OmniverseUSDComposer连接和统一其资产工作流通用汽车使用AliasSiemensNXUnrealMaya和3dsMax将设计师雕塑家和艺术家连接到一起并将汽车零部件在虚拟环境中组装成数字孪生汽车在工程和仿真中他们在Omniverse中将Powerflow空气动力学可视化对于新一代梅赛德斯奔驰和捷豹路虎汽车工程师在Omniverse中使用DriveSim生成合成数据来训练AI模型通过虚拟NCAP驾驶测试验证主动安全系统并模拟真实驾驶场景Omniverse的生成式AI将以前驾驶的路线重构为3D以敬请阅读末页的重要说明19行业简评报告便重现或修改过去的体验借助Idealworks宝马在Omniverse中使用IsaacSim生成合成数据和场景用来训练工厂机器人Lotus正在使用Omniverse以虚拟方式组装焊接站丰田公司正在使用Omniverse构建自己工厂的数字孪生梅赛德斯-奔驰使用Omniverse为新车型构建优化和规划组装流水线Rimac和LucidMotors使用Omniverse根据真实的设计数据构建数字商店这些数据准确地反映他们的汽车的状况宝马正在使用Omniverse规划全球近三十家工厂的运营在实际工厂开业两年之前他们会在Omniverse中完整建造一间新的电动汽车工厂全球各行各业都在加速数字化发展未来三年该领域的投资金额将超过34万亿美元宝马努力在汽车数字化领域处于领先地位图24汽车工厂应用示例资料来源NVIDIAGTC招商证券借助NVIDIAOmniverse和AI公司能够更快地建立新工厂并更高效地进行生产节省大量成本这一切都要从规划开始这是一个复杂的过程在此过程中公司需要将许多工具数据集和遍布全球的专家串联起来传统上公司受到限制因为数据在各种系统和工具中单独管理如今这种局面已经实现了全方位的改变公司正在开发自定义Omniverse应用以将现有的工具专门知识和团队联系在一起使其处在统一视图中Omniverse是云原生同时不限平台可让团队随时随地在虚拟工厂中开展协作Omniverse是实现工业数字化的数字到物理操作系统今天公司要宣布推出三款专为运行Omniverse而设计的系统首先公司将推出由NVIDIAAdaRTXGPU和英特尔的最新款CPU提供动力支持的新一代工作站这款新工作站非常适合用于光线追踪物理仿真神经图形和生成式AI从3月开始Boxx戴尔惠普和联想将提供这款工作站其次针对Omniverse优化的新型NVIDIAOVX服务器OVX由服务器GPUAdaRTXL40和公司的新款BlueField-3组成OVX服务器将由戴尔HPEQuanta技嘉联想和Supermicro提供每一层Omniverse的堆栈包括芯片系统网络和软件在内都是新发明构建和操作Omniverse计算机需要一个成熟的IT团队公司将快速轻松地扩展和运用Omniverse敬请阅读末页的重要说明20
|
相关研报
|
||||||||||||||||||||||
