>> 中信证券-前瞻研究全球人工智能AI产业研究手册:从算法演进到产业逻辑构建-230503
| 上传日期: |
2023/5/3 |
大小: |
22775KB |
| 格式: |
pdf 共258页 |
来源: |
中信证券 |
| 评级: |
-- |
作者: |
陈俊云,许英博,贾凯方 |
| 下载权限: |
此报告为加密报告 |
|
|
核心要点 人工智能:ChatGPT推动产业迎来iPhone时刻,并从“小作坊”走向工业化时代。ChatGPT在全球市场的爆发,正将AI产业推到过去70年以来前所未有的高度,科技巨头纷纷入局,继微软、谷歌之后,国内企业百度、阿里巴巴等先后发布大模型,并进行用户测试和企业应用接入。全球一线科技巨头在AI领域的军备竞赛,以及在大模型方向的持续下注,必将极大加速全球AI产业的发展进程,并推动产业从过去的“小作坊”式发展快速进入“工业化”时代。 算法模型:AI发展的灵魂,技术路线料将快速向GPT方向收敛,并有望在中期形成少数大模型(底层)+若干垂类模型(应用层)的格局。ChatGPT的成功证明了高质量数据+反馈激励(大模型预训练+小数据微调)的有效性。GPT在自然语言理解、生成方面的整体优势,有望驱动AI大模型技术路线快速向GPT方向收敛,同时少数科技巨头&机构专注于基础大模型的研发,更多企业则发挥各自在垂类数据、场景理解等层面优势,并最终构建少数大模型+若干应用模型的生态格局。 芯片&算力:算法快速迭代,以及对算力的巨大需求,料推动通用AI芯片(GPU)、云厂商早期高确定性受益。目前AI大模型领域的创新正在以月、周为单位快速向前推进,短期维度,预计通用AI芯片仍将是底层算法快速迭代的核心受益者。同时当前大模型在训练、推理环节仍需要巨大的算力承载,云厂商在算力基础设施、基础软件框架等层面综合优势明显,AI带来的算力增量料将主要向云计算平台转移,云厂商有望充分受益。但若后续算法迭代速度放缓,以及针对部分应用场景的专门优化,ASIC芯片需求料将快速展开,AI单位算力成本有望快速下降,但亦同时带来应用需求的进一步增长。 数据:AI的粮食和血液。当前AI算法的发展正转向以大模型为主的数据依赖,丰富、高质量数据集是AI产业持续向前的核心基础。伴随公开数据集的逐步耗尽,借助算法实现数据合成,以及垂类领域专有数据集将是企业后续差异化优势主要来源,同时数据使用合规、用户隐私保护等亦将成为持续监管领域。 算法模型: 技术路线:以大语言模型为主导,向GPT方案靠拢:ChatGPT的成功证明了GPT模型的Prompting道路的正确性,同时也强调了数据质量的重要性。ChatGPT最重要的成功是在产品化上更进一步:ChatGPT在模型精度上并没有飞跃性的突破,但从Few Shot prompt(需要输入范例示范)转换到Instruct(用人类语言描述想做什么)更加贴合用户的习惯。5)展望未来3-5年的人工智能模型技术路线,我们认为人工智能将继续沿着大语言模型的道路前景发展,并快速向GPT路线收敛。GPT路线已经表现出了其不可替代的产品化能力,这也将推动更多厂商想这个方向投入资源。随着多模态的不断成熟以及新模态的持续加入,我们预计将会看到通用求解能力更强的GPT类基础模型。 竞争壁垒:数据质量、资本投入、核心人才、工程实践能力等。1)从Bert开始到GPT-3再到谷歌的PALM,网络中的公开语言数据源已经在被尽可能地利用(论坛、新闻、维基百科等),而模型的进一步优化对数据质量要求也越来越高。我们认为优质的私有数据源将在未来3-5年里人工智能模型的精度优化上发挥更重要的作用。2)随着模型体量仍然在成倍数增加,大量的前期资本投入是阻碍新入者的重要因素。在过去五年内,我们看到人工智能模型的独角兽都在寻找互联网科技大厂作为其背后的依靠,主要因为能够得到充足而短时间内不求产出的资金支持并获取互联网大厂长期以来所积累的优质数据源。这也是我们看到为什么在过去五年内人工智能头部厂商逐渐从开源走向闭源,利用其资源优势来打造差异化的AI模型,而落后者更希望通过开源的模式以求缩小与头部厂商的距离。3)研发团队的工程能力是决定公司在大语言模型竞争力的另一个重要因素。随着语言模型的体积不断增加,在研究方法上现今千亿量级的模型与之前几十亿量级的小模型发生了本质变化,个体工程师没有能力通过自有资源积累对大模型的学习经验。一个合格的大模型研发团队需要依靠大公司的资源支持才能积累对模型调试、优化、实际部署等各个环节足够的经验。大厂商对大语言模型的底层研究构建了极高竞争壁垒,因此底层架构的研发与实践应用的分离将是必然趋势,前者由少部分大型企业机构主导,而中小型企业专注于后者。 数据: 数据:AI的血液与粮食。按照当前LLM的技术范式,数据集主要应用于预训练、模型调优阶段。预训练阶段需要大规模、多类别、高质量的训练数据,在模型调优阶段,垂类小数据集、提示词工程同样重要。近年来全球数据量呈现爆发式增长,据IDC统计,2019年全球产生的数据量为41ZB,过去十年的CAGR接近50%,预计到2025年全球数据量或高达175ZB,2019-2025年仍将维持近30%的复合增速,其中超过80%的数据都将是处理难度较大的文本、图像、音视频等非结构化数据。从Bert开始到GPT-3再到谷歌的PALM,网络中的公开语言数据源已经在被尽可能地利用(论坛、新闻、维基百科等),但模
|
|