>> 长江证券-科技行业:AI范式重构,基础资源先行-250307
| 上传日期: |
2025/3/7 |
大小: |
3764KB |
| 格式: |
pdf 共23页 |
来源: |
长江证券 |
| 评级: |
看好 |
作者: |
宗建树 |
| 下载权限: |
此报告为加密报告 |
|
|
AI范式重构,从预训练到强化学习 Transform框架大力出奇迹的成功是本轮AI大模型革命的起源。Scaling Law(伸缩法则):当参数规模增加、数据集规模增加并延长模型训练时间,大模型的性能就会提升,以及当模型训练参数和数据量超过一定数值之后,模型突然出现意想不到的能力(涌现现象)。 GPTo1引领Post-Training Scaling Law新范式变革。2024年9月OpenAI正式发布GPTo1模型,GPTo1一方面引入新的Post-Training训练机制,另一方面在推理端引入思维链,通过分步推理提升模型生成质量。Post-Training Scaling Laws训练的计算量不再只是和参数量上升,同时也会包含RL探索时LLMInference的计算量,随着更多的强化学习(训练时计算)和更多的思考时间(测试时计算), o1的性能也在不断提升。 o1的技术突破何在:基于强化学习的reward model方式不断提升推理性能。过往推理端进展受限的一大核心原因在于相关训练数据占比太低,此外大部分推理数据形式为<问题--正确答案>,缺少中间详细推理步骤。而o1的核心突破便在于合成数据+“反思”,基于强化学习的reward model方式不断完善思路链、提升性能,进而在模型推理能力上实现巨大提升。 风险提示 1、AI技术发展不及预期,本次大模型创新伴随参数量及模态的增速能力天花板尚未达到,但模型效果本身仍存瓶颈及问题,倘若AI技术发展不及预期,投入厂商仍然存在失败风险。 2、下游应用需求不及预期,人工智能本质是通过供给创新催生需求扩容,目前大模型仍处于商业模式摸索期,倘若本轮技术变革无法真实带动下游需求,投入厂商将受到影响。
|
|