>> 华泰证券-科技行业再谈NV的下一个Mellanox:Groq LPU的整合-260306
| 上传日期: |
2026/3/6 |
大小: |
1017KB |
| 格式: |
pdf 共12页 |
来源: |
华泰证券 |
| 评级: |
增持 |
作者: |
何翩翩 |
| 下载权限: |
此报告为加密报告 |
|
|
本报告延续我们2026年1月12日发布的《英伟达吸收Groq定义AI下半场》观点。彼时我们指出,英伟达整合Groq的战略,与其2020年收购Mellanox一脉相承,核心在于吸收人才及将领先的底层IP内生化,以补齐架构层面的结构性短板。尽管市场普遍预期英伟达可能在GTC 2026上发布一款独立的LPU机架,但我们认为仅为权宜之计。从长期战略视角看,我们预计,自Feynman架构起,Groq的LPU将被纳入英伟达GPU路线图,并将确定性、低时延计算能力以架构级方式嵌入CUDA及GPU软件栈之中,为正在崛起的Agentic AI时代铺垫。我们认为,2026年或为Agentic AI的元年。英伟达与Groq的整合,恰逢产业范式从以吞吐为核心的模型训练阶段,转向以低时延为核心的代理AI部署阶段。我们认为,在确立大模型训练阶段的领先地位后,英伟达正进一步定义AI下半场的架构规则。随着产业重心由吞吐驱动的训练转向时延驱动的代理AI部署,英伟达已同时掌握两种范式下的核心架构能力,建立双重平台的技术壁垒。 Feynman:顺应Agentic AI演进,与Groq恰逢其时的架构融合 我们认为,此次整合在时间维度上具有明显的前瞻布局。我们预计Feynman将以Chiplet形式,将LPU通过TSV与SoIC混合键合技术,与计算Die面对面集成,并在HBM之外引入一层高速SRAM存储层,专为代理AIChain-of-Thought推理场景优化。同时,Feynman采用台积电A16制程亦具关键意义。其背面供电设计释放芯片正面空间,为垂直堆叠与高密度集成创造条件,但与此同时也将对热管理与功率管理提出更高要求。我们预计Feynman有望于2028年推出,时间节点与代理AI商业化拐点大致重合。在互连层面,Groq的RealScale架构在约576颗芯片规模时将面临确定性性能的物理上限。若将LPU封装于Feynman构架内部,英伟达有望绕开这一规模扩展的约束,使确定性执行层直接继承NVLink的扩展能力,而无需承受Groq独立拓扑结构所带来的规模限制。 CUDA:吸收GroqWare,强化Agentic AI时代的生态锁定 我们认为,软件层整合同样至关重要。GroqWare采用以编译器静态调度为核心的执行模型,而CUDA则以运行时动态调度为基础,两者在执行哲学上存在根本差异。如何在不破坏现有生态的前提下实现融合,是此次整合的关键所在。我们预计英伟达将从三层架构推进整合:1)在编译器层面,将GroqWare的静态调度能力纳入CUDA编译流程,使确定性执行能力成为底层编译能力的一部分;2)在运行时层面,通过TensorRT作为调度桥梁,自动识别低批次、低时延、代理AI推理类负载,并将其分发至LPU执行;3)在生态层面,以标准CUDA纳入LPU能力,使现有深度学习框架无需修改即可调用相关算力资源。 LPU:聚焦低时延推理场景,而非全部推理负载 我们认为LPU并非面向所有推理任务,其结构性优势主要体现在低时延或具有人机交互属性的代理AI场景。在此类场景中,核心瓶颈在于低时延约束下的内存带宽,而非计算吞吐能力本身。以大模型推理中的自回归解码阶段为例,尽管所有推理流程均包含解码,但在低批次、强时延约束的在线服务场景中,请求难以进行高效并行聚合,GPU并行计算能力无法充分发挥,系统瓶颈随之转向内存带宽。我们认为,这类以低时延为核心约束的负载,正是LPU发挥优势的典型场景。在多步代理AI任务中,该特征或进一步放大。每一步推理的时延都会累积为端到端响应时间,并被用户直接感知。我们也认为,在这种高度顺序化的执行链条中,LPU所提供的确定性、无资源争用的执行机制,相较传统GPU的动态调度体系,更具优势。 风险提示:技术落地缓慢、需求不及预期等。
|
|