>> 五矿证券-机械设备行业高端制造产业跟踪(1月):DeepSeek爆火预示着投资方向的何种变化?-250207
| 上传日期: |
2025/2/8 |
大小: |
2834KB |
| 格式: |
pdf 共32页 |
来源: |
五矿证券 |
| 评级: |
看好 |
作者: |
祁岩 |
| 行业名称: |
机械 |
| 下载权限: |
此报告为加密报告 |
|
|
板块观点 DeepSeek系列为什么爆火? DeepSeek实现行业领先模型能力,并且对代码开源。在AIME2024、Codeforces、GPQADiamond、Math-500、MMLU等多个测试中,DeepSeek-R1展现出媲美OpenAI-o1的模型能力。 DeepSeek的模型成本大幅下降。在成本方面,DeepSeek-R1的API服务输出定价为16元/1MTokens,相较于openAI-o1下降96%。对2024年12月发布的DeepSeek-V3,其API服务输出订单仅为8元(活动优惠期内为2元)/1MTokens。 DeepSeek系列有哪些关键的技术突破? DeepSeek系列模型有2个核心的模型,DeepSeek V3和DeepSeek R1/R1-zero。 DeepSeek V3在传统专家混合模型(MoE)上改进,实现了超低的训练成本。传统MoE模型存在负载均衡问题,在低精度训练方面也容易受到异常值影响。DeepSeek V3通过动态调整专家负载,避免了传统方案的性能损失,并且通过FP8混合精度训练框架验证了FP8在超大规模模型上的可行性。通过优化算法、框架和硬件协同,DeepSeek V3的训练需要180KH800 GPU hours(2048块H800上训练50-60天),训练成本仅557.6万美元。相比之下,OpenAI训练GPT-4使用了2万块A100显卡训练90-100天,训练成本约6300万美元。 DeepSeek R1/R1-zero通过大规模强化学习训练,涌现出强大推理能力。DeepSeek R1/R1-zero都是是通过大规模强化学习训练而来的模型,其中R1-zero没有将有监督微调(supervised fine-tuning ,SFT)作为初始步骤。最早采用强化学习方法进行训练的模型是OpenAI o1。OpenAI研究科学家、o1核心贡献者Hyung Won Chung在MIT进行过一次名为“Don’t teach. Incentivize(不要教,要激励)”的演讲,就论述了这一理念。Hyung WonChung认为AI领域正处于一次范式转变,即从传统的直接教授技能转向激励模型自我学习和发展通用技能。AGI所需要的技能太多,我们无法列举出每一项技能去teach,因此唯一可行的方法就是incentivize激励,让模型自己的思考、去涌现新的能力。在训练中,R1/R1-zero的推理能力通过强化学习自然涌现,思考时间随着模型的进行持续提升,自然而然地获得了解决越来越复杂推理任务的能力。 相比R1,R1-zero省略了监督有监督微调SFT环节,完全依赖于强化学习,进一步减少了人工干预,引起了更多的关注。这对于那些难以获取大量高质量标注数据的领域来说,具有重要的意义。 风险提示 1、人形机器人技术进展不及预期,成本下降不及预期。 2、需求不及预期风险。 3、受制于电池成本及补能便捷性,设备电动化渗透率不及预期。
|
|