研报下载就选股票报告网
您好,欢迎来到股票分析报告网!登录   忘记密码   注册
>> 五矿证券-机械设备行业高端制造产业跟踪(1月):DeepSeek爆火预示着投资方向的何种变化?-250207
上传日期:   2025/2/8 大小:   2834KB
格式:   pdf  共32页 来源:   五矿证券
评级:   看好 作者:   祁岩
行业名称:   机械
下载权限:   此报告为加密报告
板块观点
  DeepSeek系列为什么爆火?
  DeepSeek实现行业领先模型能力,并且对代码开源。在AIME2024、Codeforces、GPQADiamond、Math-500、MMLU等多个测试中,DeepSeek-R1展现出媲美OpenAI-o1的模型能力。
   DeepSeek的模型成本大幅下降。在成本方面,DeepSeek-R1的API服务输出定价为16元/1MTokens,相较于openAI-o1下降96%。对2024年12月发布的DeepSeek-V3,其API服务输出订单仅为8元(活动优惠期内为2元)/1MTokens。
  DeepSeek系列有哪些关键的技术突破?
  DeepSeek系列模型有2个核心的模型,DeepSeek V3和DeepSeek R1/R1-zero。
  DeepSeek V3在传统专家混合模型(MoE)上改进,实现了超低的训练成本。传统MoE模型存在负载均衡问题,在低精度训练方面也容易受到异常值影响。DeepSeek V3通过动态调整专家负载,避免了传统方案的性能损失,并且通过FP8混合精度训练框架验证了FP8在超大规模模型上的可行性。通过优化算法、框架和硬件协同,DeepSeek V3的训练需要180KH800 GPU hours(2048块H800上训练50-60天),训练成本仅557.6万美元。相比之下,OpenAI训练GPT-4使用了2万块A100显卡训练90-100天,训练成本约6300万美元。
   DeepSeek R1/R1-zero通过大规模强化学习训练,涌现出强大推理能力。DeepSeek R1/R1-zero都是是通过大规模强化学习训练而来的模型,其中R1-zero没有将有监督微调(supervised fine-tuning ,SFT)作为初始步骤。最早采用强化学习方法进行训练的模型是OpenAI o1。OpenAI研究科学家、o1核心贡献者Hyung Won Chung在MIT进行过一次名为“Don’t teach. Incentivize(不要教,要激励)”的演讲,就论述了这一理念。Hyung WonChung认为AI领域正处于一次范式转变,即从传统的直接教授技能转向激励模型自我学习和发展通用技能。AGI所需要的技能太多,我们无法列举出每一项技能去teach,因此唯一可行的方法就是incentivize激励,让模型自己的思考、去涌现新的能力。在训练中,R1/R1-zero的推理能力通过强化学习自然涌现,思考时间随着模型的进行持续提升,自然而然地获得了解决越来越复杂推理任务的能力。
  相比R1,R1-zero省略了监督有监督微调SFT环节,完全依赖于强化学习,进一步减少了人工干预,引起了更多的关注。这对于那些难以获取大量高质量标注数据的领域来说,具有重要的意义。
  风险提示
  1、人形机器人技术进展不及预期,成本下降不及预期。
  2、需求不及预期风险。
  3、受制于电池成本及补能便捷性,设备电动化渗透率不及预期。
 
Copyright © 2005 - 2021 Nxny.com All Rights Reserved 备案号:蜀ICP备15031742号-1