>> 国信证券-人工智能行业专题报告:生成式人工智能产业全梳理-230328
| 上传日期: |
2023/3/28 |
大小: |
7274KB |
| 格式: |
pdf 共80页 |
来源: |
国信证券 |
| 评级: |
看好 |
作者: |
熊莉,库宏垚,朱松 |
| 下载权限: |
此报告为加密报告 |
|
|
人工智能作为第四次科技革命,已经进入2.0时代。人工智能概念于1956年被提出,AI产业的第一轮爆发源自2012年,2012年AlexNet模型问世开启了CNN在图像识别的应用,2015年机器识别图像的准确率首次超过人(错误率低于4%),开启了计算机视觉技术在各行各业的应用。但是,人工智能1.0时代面临着模型碎片化,AI泛化能力不足等问题。2017年Google Brain团队提出Transformer架构,奠定了大模型领域的主流算法基础,从2018年开始大模型迅速流行,2018年谷歌团队的模型参数首次过亿,到2022年模型参数达到5400亿,模型参数呈现指数级增长,“预训练+微调”的大模型有效解决了1.0时代AI泛化能力不足的问题。新一代AI技术有望开始全新一轮的技术创新周期。 自18年起大模型快速流行,有望重新定义生产力。2018年以来,预训练语言模型(PLM)及其“预训练-微调”方法已成为自然语言处理(NLP)任务的主流范式,该范式先利用大规模无标注数据通过自监督学习预训练语言大模型,得到基础模型,再利用下游任务的有标注数据进行有监督学习微调模型参数,实现下游任务的适配。在AI的1.0时代:存在模型碎片化明显、AI泛化能力不足等问题。“预训练+微调”大模型能显著降低AI工程化门槛,预训练大模型在海量数据的学习训练后具有良好的通用性和泛化性,细分场景的应用厂商能够基于大模型通过零样本、小样本学习即可获得显著的效果,使得人工智能有望构建成统一的智能底座,AI+赋能各行各业。本轮的生成式AI有望从简单的内容生成,逐步达到具有预测、决策、探索等更高的认知智能。 OpenAI当前已迭代五代模型,GPT-4开始布局多模态。OpenAI于2015年成立,微软于2019年开始与OpenAI建立战略合作伙伴关系,GPT共发布五代模型GPT-1、GPT-2、GPT-3、ChatGPT以及GPT4。GPT-1于2018年6月发布,首次将transformer与无监督的预训练技术相结合。2020年5月发布GPT-3,模型参数量为1750亿。2022年11月,OpenAI正式推出了对话交互式的ChatGPT。相比于GPT-3,ChatGPT引入了基于人类反馈的强化学习(RLHF)技术以及奖励机制。2023年3月,OpenAI正式推出GPT-4,成为目前较先进的多模态大模型。GPT-4主要在识别理解能力、创作写作能力、处理文本量以及自定义身份属性迭代方面取得进展。 百度于2023年3月正式推出大模型文心一言。文心一言主要由文心大模型提供支持,文心一言拥有有监督精调、RLHF、提示构建、知识增强、检索增强和对话增强六大核心技术。其中前三项与ChatGPT的技术十分类似,知识增强包括知识内化和知识外用;检索增强指基于百度搜索引擎,先对内容进行检索,再筛选出有用的部分整合输出结果;对话增强指记忆机制、上下文理解和对话规划等技术。 投资建议:建议关注基础层与应用层AI龙头。应用层建议关注:科大讯飞、金山办公、同花顺、广联达、凌志软件、彩讯股份、拓尔思、福昕软件、税友股份等。基础层建议关注海光信息、浪潮信息、景嘉微等。 风险提示:AI技术商业化落地不及预期;行业竞争加剧,技术迭代风险;数据安全等政策不确定性;贸易摩擦风险。
研究报告全文:证券研究报告2023年03月28日人工智能专题报告生成式人工智能产业全梳理行业研究深度报告投资评级超配维持评级证券分析师熊莉证券分析师库宏垚证券分析师朱松证券分析师张伦可xiongli1guosencomcnkuhongyaoguosencomcnzhusongguosencomcnzhanglunkeguosencomcnS0980519030002S0980520010001S0980520070001S0980521120004请务必阅读正文之后的免责声明及其项下所有内容报告摘要人工智能作为第四次科技革命已经进入20时代人工智能概念于1956年被提出AI产业的第一轮爆发源自2012年2012年AlexNet模型问世开启了CNN在图像识别的应用2015年机器识别图像的准确率首次超过人错误率低于4开启了计算机视觉技术在各行各业的应用但是人工智能10时代面临着模型碎片化AI泛化能力不足等问题2017年GoogleBrain团队提出Transformer架构奠定了大模型领域的主流算法基础从2018年开始大模型迅速流行2018年谷歌团队的模型参数首次过亿到2022年模型参数达到5400亿模型参数呈现指数级增长预训练微调的大模型有效解决了10时代AI泛化能力不足的问题新一代AI技术有望开始全新一轮的技术创新周期自18年起大模型快速流行有望重新定义生产力2018年以来预训练语言模型PLM及其预训练-微调方法已成为自然语言处理NLP任务的主流范式该范式先利用大规模无标注数据通过自监督学习预训练语言大模型得到基础模型再利用下游任务的有标注数据进行有监督学习微调模型参数实现下游任务的适配在AI的10时代存在模型碎片化明显AI泛化能力不足等问题预训练微调大模型能显著降低AI工程化门槛预训练大模型在海量数据的学习训练后具有良好的通用性和泛化性细分场景的应用厂商能够基于大模型通过零样本小样本学习即可获得显著的效果使得人工智能有望构建成统一的智能底座AI赋能各行各业本轮的生成式AI有望从简单的内容生成逐步达到具有预测决策探索等更高的认知智能OpenAI当前已迭代五代模型GPT-4开始布局多模态OpenAI于2015年成立微软于2019年开始与OpenAI建立战略合作伙伴关系GPT共发布五代模型GPT-1GPT-2GPT-3ChatGPT以及GPT4GPT-1于2018年6月发布首次将transformer与无监督的预训练技术相结合2020年5月发布GPT-3模型参数量为1750亿2022年11月OpenAI正式推出了对话交互式的ChatGPT相比于GPT-3ChatGPT引入了基于人类反馈的强化学习RLHF技术以及奖励机制2023年3月OpenAI正式推出GPT-4成为目前较先进的多模态大模型GPT-4主要在识别理解能力创作写作能力处理文本量以及自定义身份属性迭代方面取得进展百度于2023年3月正式推出大模型文心一言文心一言主要由文心大模型提供支持文心一言拥有有监督精调RLHF提示构建知识增强检索增强和对话增强六大核心技术其中前三项与ChatGPT的技术十分类似知识增强包括知识内化和知识外用检索增强指基于百度搜索引擎先对内容进行检索再筛选出有用的部分整合输出结果对话增强指记忆机制上下文理解和对话规划等技术投资建议建议关注基础层与应用层AI龙头应用层建议关注科大讯飞金山办公同花顺广联达凌志软件彩讯股份拓尔思福昕软件税友股份等基础层建议关注海光信息浪潮信息景嘉微等风险提示AI技术商业化落地不及预期行业竞争加剧技术迭代风险数据安全等政策不确定性贸易摩擦风险请务必阅读正文之后的免责声明及其项下所有内容目录01行业梳理生成式AI有望带动新一轮技术创新周期02海外玩家OpenAI持续领先谷歌等巨头纷纷布局03中国玩家百度发布文心一言中国玩家快速追赶04市场规模模型参数不断增加算力需求快速增长05商业模式开启订阅制收费不断开放API接口06应用场景GPT走向多模态下游应用场景不断打开07投资建议建议关注基础层与应用层AI龙头请务必阅读正文之后的免责声明及其项下所有内容1行业梳理生成式AI有望带动新一轮技术创新周期请务必阅读正文之后的免责声明及其项下所有内容11人工智能产业自2012年开始迎来蓬勃发展2012年至今属于人工智能的蓬勃发展期人工智能是研究开发用于模拟延伸和扩展人的智能的理论方法技术及应用系统的一门新的技术科学人工智能的发展历史大致可以被划分为5个阶段2012年至今处于人工智能的蓬勃发展期其分界点就是2012年前后IBM开发的人工智能程序沃森参加了一档智力问答节目并战胜了两位人类冠军以及AlexNet在ImageNet竞赛中取得胜利以深度神经网络为代表的信息技术的发展推动了人工智能领域的进步与拓展2006年Hinton等人利用单层的RBM自编码预训练使得深层的神经网络训练得以实现2012年Hinton和AlexKrizhevsky设计的AlexNet神经网络模型在ImageNet竞赛中实现图像识别分类成为新一轮人工智能发展的起点神经网络发展里程标志性事件AlexNet神经网络结构资料来源CSDN国信证券经济研究所整理资料来源CSDN国信证券经济研究所整理5请务必阅读正文之后的免责声明及其项下所有内容11人工智能作为第四次科技革命已经进入20时代人工智能10时代2012年-2018年人工智能概念于1956年被提出AI产业的第一轮爆发源自2012年2012年AlexNet模型问世开启了CNN在图像识别的应用2015年机器识别图像的准确率首次超过人错误率低于4开启了计算机视觉技术在各行各业的应用带动了人工智能10时代的创新周期AI开始赋能各行各业带动效率提升但是人工智能10时代面临着模型碎片化AI泛化能力不足等问题人工智能20时代2017年-至今2017年GoogleBrain团队提出Transformer架构奠定了大模型领域的主流算法基础从2018年开始大模型迅速流行2018年谷歌团队的模型参数首次过亿到2022年模型参数达到5400亿模型参数呈现指数级增长预训练微调的大模型有效解决了10时代AI泛化能力不足的问题新一代AI技术有望开始全新一轮的技术创新周期2022年Gartner人工智能商业化曲线人工智能有望迎来第四次科技革命资料来源Gartner国信证券经济研究所整理资料来源ScalePartners国信证券经济研究所整理请务必阅读正文之后的免责声明及其项下所有内容11大模型快速爆发重新定义人工智能产业自18年起大模型快速流行有望重新定义人工智能产业2018年以来预训练语言模型PLM及其预训练-微调方法已成为自然语言处理NLP任务的主流范式该范式先利用大规模无标注数据通过自监督学习预训练语言大模型得到基础模型再利用下游任务的有标注数据进行有监督学习微调模型参数实现下游任务的适配规模越大的模型不仅在已知任务上有着更好的表现同时展现出完成更复杂的未知任务的强大泛化能力大模型示意图基础模型的预训练-微调范式与传统深度学习区别资料来源CSDN国信证券经济研究所整理资料来源清华大学国信证券经济研究所整理请务必阅读正文之后的免责声明及其项下所有内容11AI工程化门槛不断降低有望重新定义生产力AI工程化门槛不断降低有望重新定义生产力AI的10时代存在模型碎片化明显AI泛化能力不足等问题导致大多数行业需要花费巨大成本来收集和标注数据从而导致规模不经济而且下游场景存在诸多细分小场景其商业化价值小有效数据少模型训练不足AI的2O时代预训练微调大模型能显著降低AI工程化门槛预训练大模型在海量数据的学习训练后具有良好的通用性和泛化性细分场景的应用厂商能够基于大模型通过零样本小样本学习即可获得显著的效果使得人工智能有望构建成统一的智能底座AI赋能各行各业本轮的生成式AI有望从简单的内容生成逐步达到具有预测决策探索等更高的认知智能人工智能10时代与20时代大模型将显著降低人工智能应用门槛资料来源创新工场国信证券经济研究所整理资料来源IDC国信证券经济研究所整理请务必阅读正文之后的免责声明及其项下所有内容12产业分类AI产业链主要包括基础层技术层应用层三大层人工智能产业链可分为基础层技术层和应用层三大层面基础层侧重基础支撑平台的搭建包含传感器AI芯片数据服务和计算平台技术层侧重核心技术的研发主要包括算法模型基础框架通用技术应用层注重产业应用发展主要包含行业解决方案服务硬件产品和软件产品人工智能产业链行业应用金融零售医疗安防教育工业交通农业应用层产品应用智能机器人智能无人机智能语音识别系统智能搜索系统通用技术自然语言处理智能语音机器问答计算机视觉技术层算法模型机器学习深度学习增强学习基础框架分布式存储分布式计算神经网络传感器光学传感器声学传感器其他传感器基础层芯片GPUFPGAASIC计算平台数据服务数据采集数据处理资料来源36氪研究院国信证券经济研究所整理请务必阅读正文之后的免责声明及其项下所有内容12产业分类AI模型可分为决策式AI与生成式AIAI模型大致可以分为决策式AI和生成式AI两种决策式AI指学习数据中的条件概率分布根据已有数据进行分析判断预测主要应用模型有用于推荐系统和风控系统的辅助决策用于自动驾驶和机器人的决策智能体生成式AI指学习数据中的联合概率分布并非简单分析已有数据而是学习归纳已有数据后进行演技创造基于历史进行模仿式缝合式创作生成了全新的内容也能解决判别问题中国生成式AI商业应用规模迎来快速增长预计2025年破两千亿根据中关村大数据产业联盟发布的中国AI数字商业展望2021-2025报告披露到2025年中国生成式AI商业应用规模将达到2070亿元未来五年的年均增速84根据Gartner2021年预测人工智能对人类和社会的影响给出的积极预测到2023年将有20的内容被生成式AI所创建至2025年预计生成式AI产生的数据将占所有数据的10生成式AI应用场景2020-2025年中国生成式AI技术栈应用规模亿元2500200015001000207016065001077663343980202020212022202320242025资料来源知乎国信证券经济研究所整理资料来源中国AI数字产业展望2021-2025国信证券经济研究所整理10请务必阅读正文之后的免责声明及其项下所有内容13AI产业正在逐渐从传统分析型AI走向生成式AI人工智能在经历前期技术积累和迭代后逐渐突破传统分析型AI领域迎来生成式AI的爆发期从2012年至今生成式AI急速发展其源头就是DNN算法的升级实现了语音和图像识别等功能生成式AI市场前景广阔赛道内诞生多家独角兽企业据波士顿咨询预测至2025年生成式人工智能的市场规模将至少达到600亿美元而其中大约30的AI应用将来自广义的生成式AI技术随着生成式AI模型的进一步完善自主创作和内容生产的门槛将大大降低市场响应该领域的巨大需求在2019-2022年间共有7家独角兽公司诞生截至2023年2月这七家的估值合计达到644亿美元其中OpenAI借助旗下产品ChatGPT爆火的东风一家公司的估值便突破290亿美元生成式AI竞争格局生成式AI领域独角兽公司及其公司市值亿美元公司市值亿美元900796800700600500400290300200130401001015160adagleanOpenAIJasperCREASTAgrammarlystabilityai201920202022资料来源澳财国信证券经济研究所整理资料来源CSDN国信证券经济研究所整理11请务必阅读正文之后的免责声明及其项下所有内容13生成式AI在文本代码图片语音等领域应用广阔生成式AI在文本Text代码生成Codegeneration图片Images语音合成Speechsynthesis视频和3D模型等领域拥有广阔的应用场景AIGC三大前沿能力资料来源红杉资本国信证券经济研究所整理请务必阅读正文之后的免责声明及其项下所有内容13AIGC具备三大前沿能力生成式AI有望带动新一轮创新周期AIGC具备三大前沿能力未来应用空间广阔AIGC发展火热以chatgpt为代表的问答机器人逐步走向大众视野AIGCAI-GeneratedContent即人工智能生产内容可用于代码生成文本问答图像生成等AIGC是继专业生成内容PGC和用户生成内容UGC之后利用人工智能技术生成内容的新生产方式AIGC技术演化出三大前沿技术能力数字内容孪生数字内容的智能编辑数字内容的智能创作ChatGPT能理解并生成文字属于AIGC技术应用中的文本生成模态应用模型根据Gartner测算当前AIGC占所有生成数据小于1AIGC生成数据渗透率有广阔提升空间预计该数字到2025年或上升至10AIGC产业链上游主要提供AI技术及基础设施包括数据供给方数据分析及标注创造者生态层相关算法等AIGC应用对数字基础设施要求较高随着ChatGPT掀起AIGC发展浪潮数据基础设施有望加速升级中游主要针对文字图像视频等垂直赛道提供数据开发及管理工具包括内容设计运营增效数据梳理等服务下游包括内容终端市场内容服务及分发平台各类数字素材以及智能设备AIGC内容检测等AIGC三大前沿能力AIGC产业链资料来源中国信通院国信证券经济研究所整理资料来源量子位智库国信证券经济研究所整理请务必阅读正文之后的免责声明及其项下所有内容2海外玩家OpenAI持续领先谷歌等巨头纷纷布局请务必阅读正文之后的免责声明及其项下所有内容21OpenAI发展历程1OpenAI的发展历程分为四个阶段阶段一2015年OpenAI首席执行官阿尔特曼与埃隆马斯克等人宣布出资10亿美元创立了非营利性研究机构OpenAI阶段二2019年OpenAI的架构进行了调整调整后变身为两家机构营利性机构OpenAILP和最初的非营利机构OpenAIInc阶段三从2019年开始微软与OpenAI建立了战略合作伙伴关系不少于三次投资共投入130亿美元成为OpenAI最大的有限合伙人OpenAILP从成立之初参与投资的VC也成为有限合伙人阶段四在OpenAI未来盈利后逐步回报投资人1优先保证OpenAI的首批投资者收回初始资本2微软投资完成OpenAILP首批投资人收回初始投资后微软有权获得OpenAILP75利润3微软收回130亿美元投资从OpenAILP获得920亿美元利润后它分享利润的比例从75降到494OpenAILP产生的利润达到1500亿美元后微软和其他风险投资者的股份将无偿转让给OpenAILP的普通合伙人非营利机构OpenAIIncOpenAI发展阶段201520192019至今未来盈利后非营利性研究机构OpenAI调整为OpenAILP和OpenAIInc微软成为OpenAI最大的有限合伙OpenAI给予投资人回报人OpenAI首席执行官阿尔特曼OpenAI的架构进行了调整从2019年开始微软与OpenAI选择了一种新的股权与埃隆马斯克等人宣布出资变为两家机构营利性机构OpenAI建立了战略合作伙伴投资协议模式以投资回报10亿美元创立非营利性研究OpenAILP和最初的非营利机关系不少于三次投资共投速度代替投资回报水平机构OpenAI构OpenAIInc入130亿美元成为OpenAI最大的有限合伙人资料来源OpenAI官网国信证券经济研究所整理请务必阅读正文之后的免责声明及其项下所有内容21OpenAI发展历程2OpenAI成立于2015年自2013年起人工智能迎来发展高潮2006年Hinton提出深度学习神经网络使得人工智能性能获得突破性进展在2013年深度学习宣发在语音和视觉识别上取得成功识别率分别超过99和95人工智能进入感知智能时代在此期间全球人工智能市场保持高速增长截至2015年全球AI市场规模达到745亿美元而且愈发受到投资机构青睐投资额从2012年的062亿元提升至2015年的1423亿美元增长幅度达到2195162015年OpenAI作为一家非营利性人工智能研究公司创立基于人工智能高速发展的背景Openai由ElonMuskSamAltman美国创业孵化器总裁及PieterAbbeelPayPal联合创始人等人创建在创立之初由ElonMusk和SamAltman担任其联合主席由PieterAbbeel等人担任顾问OpenAI初创成员及其担任职务2012-2015年人工智能行业投资次数和金额投资额千万元投资次数次1600501423434514004012003510002630810800251820600460154009102006250002012201320142015资料来源OpenAI官网国信证券经济研究所整理资料来源艾瑞咨询国信证券经济研究所整理请务必阅读正文之后的免责声明及其项下所有内容21OpenAI发展历程32016年发布第一个开源平台2016年4月OpenAI发布了第一个项目OpenAIGymBetaOpenAIGym是由OpenAI开发的一个开源平台旨在在各种强化学习问题中加速算法的开发和比较该工具也是OpenAI第一个开放的成果Gym的核心组件是环境Environment和智能体Agent环境是一个可观察到的系统它定义了智能体如何与外部世界交互智能体则是一个能够感知到和影响环境的程序是训练和优化的对象Gym提供了许多强化学习问题的标准化环境例如经典控制问题ClassiccontrolAtari游戏甚至是Roboschool等物理模拟环境GYM基本应用示意图Universe基础设施和应用示意图资料来源OpenAI官网国信证券经济研究所整理资料来源OpenAI官网国信证券经济研究所整理请务必阅读正文之后的免责声明及其项下所有内容21OpenAI发展历程42017年公布最新强化学习算法PPO2017年7月OpenAI公布最新强化学习算法PPOProximalPolicyOptimization好于同期最强的算法模型成为openai默认的强化学习算法PPO包含三方面的技术进步1代理策略和价值函数的优化在PPO算法中同时优化代理策略和价值函数ValueFunction通过在最大化奖励的同时最大化代理策略和价值函数的梯度同时对这两者进行优化2剪辑代理策略更新是PPO算法的核心部分该方法通过使用约束优化来保证新的策略不会太远离旧的策略减轻了过渡调整代理策略的问题并提高总体稳定性3优化函数的选择在PPO算法中需要选择合适的优化函数来最大化代理策略和价值函数的梯度常用的优化函数包括AdamSGD和RMSProp等新的目标函数可以在连续任务方面表现出优异性能策略梯度解决方案正奖错罚资料来源OpenAI官网国信证券经济研究所整理资料来源OpenAI官网国信证券经济研究所整理请务必阅读正文之后的免责声明及其项下所有内容21OpenAI发展历程52018年发布第一代transformer的GPT模型2018年6月OpenAI公布了第一个将transformer与无监督的预训练技术相结合的GPT模型其取得的效果要好于当前的已知算法该模型被称为GPT-1并由一个具有10亿个参数的单层transformer组成这一模型的训练使用了大规模的无监督语料库使它能够生成各种自然语言处理任务的有力表现同月OpenAI宣布他们的OpenAIFive已经开始在Dota2游戏中击败业余人类团队OpenAIFive使用了256个P100GPUs和128000个CPU核通过每天玩180年时长的游戏来训练模型在同年8月份的专业比赛中OpenAIFive输掉了2场与顶级选手的比赛但是比赛的前25-30分钟内OpenAIFive的模型的有着十分良好的表现OpenAIFive继续发展并在2019年4月15日宣布打败了当时的Dota2世界冠军GPT可以显著提高在复杂NLP任务中的表现OpenAIFive与早期游戏机器人的参数对比资料来源OpenAI官网国信证券经济研究所整理资料来源OpenAI官网国信证券经济研究所整理请务必阅读正文之后的免责声明及其项下所有内容21OpenAI发展历程6生成模型开始拓展至其他领域2019年2月OpenAI在博客BetterLanguageModelsandTheirImplications中官宣GPT-2模型GPT-2模型拥有15亿参数基于800万网页数据训练该模型就是GPT的规模化结果在10倍以上的数据以10倍以上的参数训练OpenAI在2月份GPT-2发布的时候仅仅公开了他们的124亿版本的预训练结果其后的5月份发布了355亿参数版本的预训练结果并在半年后的8月份发布了一个774亿参数版本的GPT-2预训练结果2019年11月5日15亿参数的完整版本的GPT-2预训练结果发布2019年3月OpenAI将生成模型开始拓展至其他领域同年3月4日OpenAI发布了一个用于强化学习代理的大规模多代理游戏环境NeuralMMO该平台支持在一个持久的开放的任务中的存在大量的可变的agent4月25日OpenAI继续公布最新的研究成果MuseNet这是一个深度神经网络可以用10种不同的乐器生成4分钟的音乐作品并且可以结合多种音乐风格GPT-2在zero-shot的条件下的NLP任务中取得极大进展利用SparseTransformers的原理可以生成音频资料来源OpenAI官网国信证券经济研究所整理资料来源OpenAI官网国信证券经济研究所整理请务必阅读正文之后的免责声明及其项下所有内容
|
|