研报下载就选股票报告网
您好,欢迎来到股票分析报告网!登录   忘记密码   注册
>> 华泰证券-科技行业再谈NV的下一个Mellanox:Groq LPU的整合-260306
上传日期:   2026/3/6 大小:   1017KB
格式:   pdf  共12页 来源:   华泰证券
评级:   增持 作者:   何翩翩
下载权限:   此报告为加密报告
本报告延续我们2026年1月12日发布的《英伟达吸收Groq定义AI下半场》观点。彼时我们指出,英伟达整合Groq的战略,与其2020年收购Mellanox一脉相承,核心在于吸收人才及将领先的底层IP内生化,以补齐架构层面的结构性短板。尽管市场普遍预期英伟达可能在GTC 2026上发布一款独立的LPU机架,但我们认为仅为权宜之计。从长期战略视角看,我们预计,自Feynman架构起,Groq的LPU将被纳入英伟达GPU路线图,并将确定性、低时延计算能力以架构级方式嵌入CUDA及GPU软件栈之中,为正在崛起的Agentic AI时代铺垫。我们认为,2026年或为Agentic AI的元年。英伟达与Groq的整合,恰逢产业范式从以吞吐为核心的模型训练阶段,转向以低时延为核心的代理AI部署阶段。我们认为,在确立大模型训练阶段的领先地位后,英伟达正进一步定义AI下半场的架构规则。随着产业重心由吞吐驱动的训练转向时延驱动的代理AI部署,英伟达已同时掌握两种范式下的核心架构能力,建立双重平台的技术壁垒。
  Feynman:顺应Agentic AI演进,与Groq恰逢其时的架构融合
  我们认为,此次整合在时间维度上具有明显的前瞻布局。我们预计Feynman将以Chiplet形式,将LPU通过TSV与SoIC混合键合技术,与计算Die面对面集成,并在HBM之外引入一层高速SRAM存储层,专为代理AIChain-of-Thought推理场景优化。同时,Feynman采用台积电A16制程亦具关键意义。其背面供电设计释放芯片正面空间,为垂直堆叠与高密度集成创造条件,但与此同时也将对热管理与功率管理提出更高要求。我们预计Feynman有望于2028年推出,时间节点与代理AI商业化拐点大致重合。在互连层面,Groq的RealScale架构在约576颗芯片规模时将面临确定性性能的物理上限。若将LPU封装于Feynman构架内部,英伟达有望绕开这一规模扩展的约束,使确定性执行层直接继承NVLink的扩展能力,而无需承受Groq独立拓扑结构所带来的规模限制。
  CUDA:吸收GroqWare,强化Agentic AI时代的生态锁定
  我们认为,软件层整合同样至关重要。GroqWare采用以编译器静态调度为核心的执行模型,而CUDA则以运行时动态调度为基础,两者在执行哲学上存在根本差异。如何在不破坏现有生态的前提下实现融合,是此次整合的关键所在。我们预计英伟达将从三层架构推进整合:1)在编译器层面,将GroqWare的静态调度能力纳入CUDA编译流程,使确定性执行能力成为底层编译能力的一部分;2)在运行时层面,通过TensorRT作为调度桥梁,自动识别低批次、低时延、代理AI推理类负载,并将其分发至LPU执行;3)在生态层面,以标准CUDA纳入LPU能力,使现有深度学习框架无需修改即可调用相关算力资源。
  LPU:聚焦低时延推理场景,而非全部推理负载
  我们认为LPU并非面向所有推理任务,其结构性优势主要体现在低时延或具有人机交互属性的代理AI场景。在此类场景中,核心瓶颈在于低时延约束下的内存带宽,而非计算吞吐能力本身。以大模型推理中的自回归解码阶段为例,尽管所有推理流程均包含解码,但在低批次、强时延约束的在线服务场景中,请求难以进行高效并行聚合,GPU并行计算能力无法充分发挥,系统瓶颈随之转向内存带宽。我们认为,这类以低时延为核心约束的负载,正是LPU发挥优势的典型场景。在多步代理AI任务中,该特征或进一步放大。每一步推理的时延都会累积为端到端响应时间,并被用户直接感知。我们也认为,在这种高度顺序化的执行链条中,LPU所提供的确定性、无资源争用的执行机制,相较传统GPU的动态调度体系,更具优势。
  风险提示:技术落地缓慢、需求不及预期等。
  
 
Copyright © 2005 - 2021 Nxny.com All Rights Reserved 备案号:蜀ICP备15031742号-1