研报下载就选股票报告网
您好,欢迎来到股票分析报告网!登录   忘记密码   注册
>> 国信证券-智微智能(001339)战略投资元川微,加码边缘及端侧AI推理赛道-260315
上传日期:   2026/3/15 大小:   1029KB
格式:   pdf  共11页 来源:   国信证券
评级:   优于大市 作者:   熊莉,艾宪
下载权限:   此报告为加密报告
事项:
  智微智能全资控股曜腾投资,2026年3月2日,杭州元川微科技有限公司完成工商变更,深圳市曜腾投资成为其新进股东。
  国信计算机观点:1)元川微是国内LPU架构先行者:国内首家专注于AI实时推理算力芯片的初创企业,技术路线上回归AI推理的第一性原理,产品精准满足行业对确定性超低时延、高吞吐算力、极致能效比及高性价比的核心诉求,为边端智能提供高效、可落地的算力基础设施。2)LPU(Language ProcessingUnit,语言处理单元)专为推理设计的AI芯片:其核心是张量流处理器(TSP)的设计和实现,TSP将功能单元转移到核心之外,以2D网络方式排列,每一列只包含特定类型的功能单元(称为切片Slice)。指令流沿着垂直方向(南北方向)运行,数据流沿着水平方向(东西方向)运行,TSP可以确定在每一个时间点,X轴流动的数据和Y轴流动的指令恰好交叉,进行运算,运算结果会向东或向西传送到下一个切片进行下一步处理,而指令控制单元(ICU)同时在最底部的切片发出新的指令。3)LPU具备高输出、低时延、低能耗优势:根据Artificial Analysisi披露数据,以Llama 3.3 Instruct 70B为测试对象,Groq的输出速度(Output Speed)为306 Token/s,业内领先;Groq的端到端响应时间(End-to-End ResponseTime)为2.4s(输出500个Token),业内领先。根据Thunder Said Energy披露数据,推理领域,LPU的每Token能耗不到GPU的1/4,能耗优势明显。4)投资建议:基于Token出海、国内大模型快速发展,智算需求快速增长,公司2026年智算业务有望快速增长;此外,27年LPU服务器产品有望开始放量,打开第二增长曲线,上调盈利预测,预计2025-2027年收入44.96/58.24/71.62亿元(前值为46.93/53.27/59.60亿元),归母净利润1.99/6.14/7.30亿元(前值为2.21/2.69/3.29亿元),当前股价对应PE=92/30/25x,维持“优于大市”评级。5)风险提示:传统主业所处行业下行的风险、产品价格下行及毛利率下降的风险、部分产品依赖单一大客户的风险、贸易保护主义和贸易摩擦风险等。
  评论:智微智能战略投资元川微,加码边缘及端侧AI推理赛道
  2026年3月2日,杭州元川微科技有限公司完成工商变更,深圳市曜腾投资成为其新进股东。元川微是国内LPU架构先行者,亦是国内首家专注于AI实时推理算力芯片的初创企业,技术路线上回归AI推理的第一性原理,产品精准满足行业对确定性超低时延、高吞吐算力、极致能效比及高性价比的核心诉求,为边端智能提供高效、可落地的算力基础设施。
   LPU(Language Processing Unit,语言处理单元):专为推理设计的AI芯片
  发展历史:2016年初创公司Groq成立,率先提出LPU概念;2023年Groq LPU开始小规模商用,2024年GroqCloud正式上线,开始大规模商用;2025年12月24日,英伟达以200亿美金收购Groq,为英伟达历史上最大规模的收购。
  硬件架构:LPU的核心是张量流处理器(TSP)的设计和实现,传统的多核芯片平铺结构(每一个小方块Tile代表一个处理核心),核心由一组功能单元组成,负责不同类型的计算(算术运算、内存运算、逻辑运算、指令控制等),而TSP将功能单元转移到核心之外,以2D网络方式排列,每一列只包含特定类型的功能单元(称为切片Slice)。
  数据流和指令流:TSP以SIMD(单指令多数据)方式执行指令,此处每个切片由20个Tile(方块)构成,且单个Tile可处理16个数,则其共可处理320(=20*16)个元素的向量。指令流沿着垂直方向(南北方向)运行,数据流沿着水平方向(东西方向)运行,TSP可以确定在每一个时间点,X轴流动的数据和Y轴流动的指令恰好交叉,进行运算,运算结果会向东或向西传送到下一个切片进行下一步处理,而指令控制单元(ICU)同时在最底部的切片发出新的指令。
  LPU设计原则:LPU设计包含四大原则,分别是以软件为先、可编程流水线架构、确定性的计算和网络、片上(On-Chip)存储。
  原则一:软件为先。同传统的GPU/CPU的调度器相比(采用动态调度),LPU采用静态调度方案,核心在于编译器,可以把每一条指令、每一条数据规划精确到纳米级;
  原则二:可编程流水线架构。同传统GPU的Hub and Spoke架构不同,LPU采用可编程流水线架构,不需要等待计算、内存资源,亦无需额外的控制器,流水线运行平稳高效,完全同步;
  原则三:确定性的计算和网络。为了使流水线高效运行,必须对每一步所需时间进行高度把控,则LPU每个执行步骤的时钟周期是可预测的。
  原则四:片上(On-Chip)存储。LPU在片上同时包含计算单元和存储单元,大幅提升数据读存速度,以Groq LPU为例,SRAM的内存带宽高达80TB/s。
  LPU在Token输出速度、时延、能耗等领域具备优势
  根据Artificial Analysisi披露数据,以Llama 3.3 Instruct 70B为测试对象,Groq的输出速度(OutputSpeed)为3
 
Copyright © 2005 - 2021 Nxny.com All Rights Reserved 备案号:蜀ICP备15031742号-1