研报下载就选股票报告网
您好,欢迎来到股票分析报告网!登录   忘记密码   注册
>> 长江证券-软件与服务行业AI产业速递:DeepSeek开源FlashMLA解码内核,持续提升LLM推理效率-250226
上传日期:   2025/2/27 大小:   549KB
格式:   pdf  共5页 来源:   长江证券
评级:   看好 作者:   宗建树
下载权限:   此报告为加密报告
事件描述
  2025年2月24日,DeepSeek开源了FlashMLA解码内核。FlashMLA解码内核是专为英伟达Hopper架构GPU打造的高效推理引擎,已实际应用在DeepSeek中。FlashMLA通过压缩KV缓存和优化GPU计算能力,显著提升了LLM的推理效率。
  事件评论
  FlashMLA内核使用分页的KV缓存,Batch大小为64。在LLM中,随着序列长度的增加,KV缓存的内存占用和计算成本会显著上升,成为性能瓶颈。Multi-head LatentAttention (MLA)将键和值投影到低维潜空间中,使用潜向量表示缓存,并通过上投影矩阵增强表达能力。这种方法显著减少了KV缓存的大小,同时保持模型性能,从而加速推理过程。
  使用分页的KV缓存进一步提升了DeepSeek推理效率。分页方法允许FlashMLA将数据分成可管理的batch,提高了内存效率并减少了解码期间的延迟,便于在边缘设备上部署。在H800 SXM5算力芯片上运行CUDA 12.6,FlashMLA在受内存带宽限制的配置下可达3000 GB/s,在受计算能力限制的配置下可达580 TFLOPS。
  FlashMLA支持BF16(Brain Float 16)精度。与FP32(32位浮点)等更高精度的格式相比,BF16精度可减少内存使用量并加快计算速度,同时保持大多数AI任务所需的足够精度,有助于在硬件资源受限情况下上部署大模型。
  支持BF16精度拓宽了DeepSeek落地场景。支持BF16精度提升了DeepSeek长序列的语言推理性能,使得DeepSeek更加适用于文档分析或长对话。
  新一轮技术供给革命,国内AI产业迎来价值重估。DeepSeek带来AI平权,有望大幅度提升应用端落地速度,并扩容AI算力需求。建议关注:1)中国推理算力产业链,重点推荐国内AI芯片领军寒武纪;2)云服务厂商,重点关注与DeepSeek合作的相关云厂商;3)IDC,重点关注与腾讯、阿里、字节等大厂合作的IDC;4)AI应用相关标的,重点关注AI+政务、AI+金融、AI+医疗、AI+教育等方向。
  风险提示
  1、AI技术发展不及预期;
  2、下游应用需求不及预期。
  
 
Copyright © 2005 - 2021 Nxny.com All Rights Reserved 备案号:蜀ICP备15031742号-1