ChatGPT在各场景通用化效果显著。ChatGPT在生成内容的信息量、逻辑组织结构、文本表达形式都较好地满足用户需求,通用性得到了大大增强,可应用的场景有较大拓展。未来,我们看好ChatGPT在文案写作、邮件撰写、宣传广告生成、软件代码编写等场景的应用。
以ChatGPT为代表的AI大模型推动AI生产方式的变化。以ChatGPT为代表的AI大模型对于模型、算力和数据三大基础要素的生产组织方式已经有了较大改变。其有效提升AI模型研发效率,驱动AI算力需求的增长,并对训练数据的数量和质量提出了更高要求。 AI大模型驱动AI算力需求增长。大规模智能算力基础设施是各科技公司训练AI大模型的前提,是竞争的关键要素。从2018年开始,AI模型的参数近乎每年一个数量级的速度快速增长。模型的规模和模型训练、推理时所消耗的算力存在正相关关系。我们认为,随着AI大模型的开发和应用,其有望驱动AI加速卡和AI服务器等硬件需求的增长。 GPT系列AI大模型在文字类工具软件的商业化应用前景广阔。我们认为,未来,GPT系列AI大模型最具有成功潜力的商业化落地形式是其与微软从浏览器Bing到Office的全线软件的融合应用。二者的融合应用有望对微软的软件产品的门槛和附加值有较大提高效果,同时对相应竞品实现降维竞争。我们可以预期微软相关产品线的竞争优势会迅速扩大并能逐步新增体现在全球市场份额和财务回报上。 各科技公司已积累了一定的AI大模型的技术,ChatGPT推动其应用向内容生成类方向发展。自GPT-3之后,以华为、阿里、百度为代表的科技公司纷纷展开了AI大模型的研究和探索。我们认为,在各大科技公司已经具备一定AI大模型技术基础之上,ChatGPT的广泛应用将进一步推动各大科技公司将AI大模型向内容生产类应用发展。 国产“类ChatGPT”的发展前景中短期不宜乐观。我们认为,国产“类ChatGPT”AI大模型的发展预计将面临以下挑战:1.数据来源的割裂;2.产业链公司开放程度不够;3. AI算力存在瓶颈;4.国内互联网和科技巨头加速投入意愿具有不确定性。我们认为,除了寒武纪在基础AI算力方面相对突出,ChatGPT对A股计算机相关标签公司整体几乎没有实质驱动,整个产业链的追赶都面临较大挑战。 风险提示。技术处于发展早期,尚未形成成熟的商业化落地模式;研发投入较大与成果落地不及预期的风险;AI生成内容存在版权归属认定不明确的风险;AI芯片存在供应链不稳定的风险 研究报告全文:TablePage深度分析计算机证券研究报告计算机行业TableTitleTableGrade行业评级买入前次评级买入ChatGPT通用化效果突破前景广阔报告日期2023-02-14国内AI产业链追赶仍有较大挑战相对市场表现TablePicQuoteTableSummary6核心观点-2022204220622082210221222ChatGPT在各场景通用化效果显著ChatGPT在生成内容的信息量-9逻辑组织结构文本表达形式都较好地满足用户需求通用性得到了-16大大增强可应用的场景有较大拓展未来我们看好ChatGPT在文-23案写作邮件撰写宣传广告生成软件代码编写等场景的应用-31以ChatGPT为代表的AI大模型推动AI生产方式的变化以ChatGPT计算机沪深300为代表的大模型对于模型算力和数据三大基础要素的生产组织方AI式已经有了较大改变其有效提升AI模型研发效率驱动AI算力需分析师TableAuthor刘雪峰求的增长并对训练数据的数量和质量提出了更高要求SAC执证号S0260514030002AI大模型驱动AI算力需求增长大规模智能算力基础设施是各科技公SFCCENoBNX004司训练AI大模型的前提是竞争的关键要素从2018年开始AI模021-38003675型的参数近乎每年一个数量级的速度快速增长模型的规模和模型训gfliuxuefenggfcomcn练推理时所消耗的算力存在正相关关系我们认为随着AI大模型的开发和应用其有望驱动AI加速卡和AI服务器等硬件需求的增长相关研究TableDocReportGPT系列AI大模型在文字类工具软件的商业化应用前景广阔我们计算机行业ChatGPT主题背2023-02-12认为未来GPT系列AI大模型最具有成功潜力的商业化落地形式是后的风险偏好其与微软从浏览器Bing到Office的全线软件的融合应用二者的融合计算机行业龙头价值修复将2023-02-05应用有望对微软的软件产品的门槛和附加值有较大提高效果同时对引领计算机行业全面表现的相应竞品实现降维竞争我们可以预期微软相关产品线的竞争优势会下一阶段迅速扩大并能逐步新增体现在全球市场份额和财务回报上计算机行业全面注册制落地2023-02-02各科技公司已积累了一定的AI大模型的技术ChatGPT推动其应用金融IT持续受益于资本市场向内容生成类方向发展自GPT-3之后以华为阿里百度为代表推进发展的科技公司纷纷展开了AI大模型的研究和探索我们认为在各大科技公司已经具备一定AI大模型技术基础之上ChatGPT的广泛应用联系人TableContacts周源将进一步推动各大科技公司将AI大模型向内容生产类应用发展shzhouyuangfcomcn国产类ChatGPT的发展前景中短期不宜乐观我们认为国产类ChatGPTAI大模型的发展预计将面临以下挑战1数据来源的割裂2产业链公司开放程度不够3AI算力存在瓶颈4国内互联网和科技巨头加速投入意愿具有不确定性我们认为除了寒武纪在基础AI算力方面相对突出ChatGPT对A股计算机相关标签公司整体几乎没有实质驱动整个产业链的追赶都面临较大挑战风险提示技术处于发展早期尚未形成成熟的商业化落地模式研发投入较大与成果落地不及预期的风险AI生成内容存在版权归属认定不明确的风险AI芯片存在供应链不稳定的风险识别风险发现价值请务必阅读末页的免责声明123TablePageText深度分析计算机重点公司估值和财务分析表Tableimpcom最新最近合理价值EPS元PExEVEBITDAxROE股票简称股票代码货币评级收盘价报告日期元股2022E2023E2022E2023E2022E2023E2022E2023E寒武纪-U688256SHCNY875020230131增持9341-280-195-----2100-1610数据来源Wind广发证券发展研究中心备注表中估值指标按照最新收盘价计算识别风险发现价值请务必阅读末页的免责声明223TablePageText深度分析计算机目录索引投资要点5一CHATGPT在各场景通用化效果显著6一较传统NLP模型CHATGPT的通用性有较大提升6二CHATGPT实现较强通用性背后的原理8三国产类CHATGPTAI大模型与CHATGPT可能存在差距12二CHATGPT驱动AI大模型向内容生产类应用发展15一GPT系列AI大模型在文字类工具软件的商业化应用前景广阔15二科技公司开发的AI大模型预计由内部赋能转向内容生成16三国内发展AI大模型的环境有望得到改善19三风险提示21识别风险发现价值请务必阅读末页的免责声明323TablePageText深度分析计算机图表索引图1GPT-3人机对话能力展示6图2ChatGPT人机对话能力展示6图3ChatGPT连续问答能力展示7图4ChatGPT生成代码能力展示8图5ChatGPT生成演讲稿能力展示8图6AI预训练大模型在机器学习中的应用9图7应用了AI预训练大模型的迁移学习9图82018-2021年全球AI大模型规模变化10图92019-2022年6月底商汤和云从科技货币资金11图102019-2022年6月底商汤和云从科技电子设备账面净值11图11人工反馈的强化学习的基本原理12图12GPT-3和InstructGPT对相同问题的回答对比12图132019Q1-2022Q3阿里巴巴腾讯和百度资本开支及增速图14图14嵌入了GPT-35的Teams线上会议平台会议纪要自动生成功能展示15图15嵌入了Prometheus模型的Bing的搜索界面15图16嵌入了类ChatGPT的Outlook软件界面16图17嵌入了类ChatGPT的Word软件界面16图18阿里达摩院智能计算实验室M6大模型开发进程17图19华为盘古大模型17图20百度文心百中产品功能18图21百度文心NLP大模型对联自动生成效果19图22阿里M6大模型智能问答生成效果19表1GPT系列大模型参数数量与训练数据量对比6表2ChatGPT和传统NLP模型应用场景对比8表3AI大模型训练成本一览10表4互联网公司采集数据的渠道和类型对比13表5全球2020-2021年AI大模型一览16表62021年英伟达A10G与寒武纪MLU370-X4性能对比20识别风险发现价值请务必阅读末页的免责声明423TablePageText深度分析计算机投资要点ChatGPT在各场景通用化效果显著ChatGPT在生成内容的信息量逻辑组织结构文本表达形式都满足用户需求通用性得到了大大增强可应用的场景有较大拓展未来我们看好ChatGPT在文案写作邮件撰写宣传广告生成软件代码编写等场景的应用以ChatGPT为代表的AI大模型推动AI生产方式的变化以ChatGPT为代表的AI大模型对于模型算力和数据三大基础要素的生产组织方式已经有了较大改变1AI模型预训练微调的模型训练方式有望快速推广2AI算力AI大模型在训练和推理两个任务中都需要大规模智能算力基础设施的支持未来随着AI大模型的开发和应用其有望驱动AI加速卡和AI服务器等硬件需求的增长3训练数据在AI大模型对于训练数据的数量质量以及标注的精细化程度等有较高要求的情况下未来各家公司采集获取数据的方式是模型实现通用化的关键AI大模型驱动AI算力需求增长大规模智能算力基础设施是各科技公司训练AI大模型的前提正逐渐成为其在AI领域竞争的关键要素从2018年开始AI模型的参数近乎每年一个数量级的速度快速增长模型的规模和模型训练推理时所消耗的算力存在正相关关系我们认为随着AI大模型的开发和应用其有望驱动AI加速卡和AI服务器等硬件需求的增长GPT系列AI大模型在文字类工具软件的商业化应用前景广阔我们认为未来GPT系列AI大模型最具有成功潜力的商业化落地形式是其与微软从浏览器Bing到Office的全线软件的融合应用二者的融合应用有望对微软的软件产品的门槛和附加值有较大提高效果同时对相应竞品实现降维竞争我们可以预期微软相关产品线的竞争优势会迅速扩大并能逐步新增体现在全球市场份额和财务回报上各科技公司已积累了一定的AI大模型的技术ChatGPT推动其应用向内容生成类方向发展自GPT-3之后谷歌英伟达阿里百度为代表的国内外科技公司纷纷展开了AI大模型的研究和探索我们认为在各大科技公司已经具备一定AI大模型技术基础之上ChatGPT的广泛应用将进一步推动各大科技公司将AI大模型向内容生产类应用发展国产类ChatGPT的发展前景中短期不宜乐观我们认为国产类ChatGPTAI大模型的发展预计将面临以下挑战1数据来源的割裂2产业链公司开放程度不够3AI算力存在瓶颈4国内互联网和科技巨头加速投入意愿具有不确定性我们认为除了寒武纪在基础AI算力方面相对突出ChatGPT对A股计算机相关标签公司整体几乎没有实质驱动整个产业链的追赶都面临较大挑战风险提示技术处于发展早期尚未形成成熟的商业化落地模式研发投入较大与成果落地不及预期的风险AI芯片存在供应链不稳定的风险识别风险发现价值请务必阅读末页的免责声明523TablePageText深度分析计算机一ChatGPT在各场景通用化效果显著一较传统NLP模型ChatGPT的通用性有较大提升ChatGPT泛化能力较上一代产品有较大提升2022年11月OpenAI推出的ChatGPT模型展现了强大的内容生成能力与上一代AI大模型GPT-3相比其不仅在人机对话的覆盖面真实性和灵活度上有较大提升还可对文案邮件等常用的文字内容实时生成应用前景广阔ChatGPT性能的提升不仅源于其数据量上的增加还在于其引入了新的训练方法即基于人工反馈的强化学习机制RLHF本篇报告就ChatGPT性能提升效果原理应用场景以及未来商业化前景进行分析并探讨国产类ChatGPT产品未来发展的前景和挑战表1GPT系列大模型参数数量与训练数据量对比AI大模型发布时间参数数量个训练数据量GPT2018年6月117亿约5GBGPT-22019年2月15亿40GBGPT-32020年5月1750亿45TB在GPT-3的基础上进行参数的微调增加了包ChatGPT2022年11月-含3千亿单词量在内总计570GB的数据数据来源CSDNSciencefocus广发证券发展研究中心与GPT-3相比ChatGPT人机对话效果提升显著ChatGPT具备较强的语义分析能力可理解对话者的深层次需求并有丰富的语料库回答内容与正常人交流具有较高相似度具体来说在GPT-3的基础上其新增了大量社交媒体新闻文章等数据进行训练导致ChatGPT回答内容包含更多细节描述信息与之相比而GPT-3的回答提供的信息量较少图1GPT-3人机对话能力展示图2ChatGPT人机对话能力展示数据来源OpenAI官网广发证券发展研究中心数据来源OpenAI官网广发证券发展研究中心识别风险发现价值请务必阅读末页的免责声明623TablePageText深度分析计算机ChatGPT连续对话效果提升显著回答内容与用户需求契合度较高ChatGPT具备较强的上下文关联理解能力可准确记住多次问答的内容结合语境及时调整答案并给予一定的建议对话连贯性表现较好具有较强的语言丰富性其次ChatGPT可辨别不同的任务类型并根据要求组织回答如创作类阐述类简单提问类等不同任务的回答风格明显不同图3ChatGPT连续问答能力展示数据来源OpenAI官网广发证券发展研究中心ChatGPT的内容生成能力具有广阔的应用前景ChatGPT不仅可以和人实现连续流畅的对话还可实现包括邮件视频脚本文案代码论文等较长文字的生成这大大拓展了该模型的应用边界在办公场景中我们可以预期固定模式的流程化的文案工作的效率有望大大提升员工可以将精力用于更具创造性创新性的工作上在软件开发过程中ChatGPT不仅有望提升代码开发效率还大大降低了基础类算法开发的门槛有望使得软件开发工作更为普及识别风险发现价值请务必阅读末页的免责声明723TablePageText深度分析计算机图4ChatGPT生成代码能力展示图5ChatGPT生成演讲稿能力展示数据来源OpenAI官网广发证券发展研究中心数据来源OpenAI官网广发证券发展研究中心相较于传统NLP模型ChatGPT的应用场景更加广阔传统NLP模型主要针对文本分类情感倾向分析评论观点提取等分析类功能进行开发应用于新闻资讯分类品牌营销搜索等有限度的场景中存在功能单一可拓展性不足等问题而ChatGPT在设计之初就是针对内容生成类应用进行开发生成内容的信息量逻辑组织结构文本表达形式都已经满足一定比例场景中的用户需求通用性得到了大大增强可应用的场景有较大拓展未来我们看好ChatGPT在文案写作邮件撰写宣传广告生成软件代码编写不同语言代码的转译等场景的应用表2ChatGPT和传统NLP模型应用场景对比功能应用场景问答AI聊天语法纠正文本分类文本匹配文本生成序列标注特征提取语法纠文案写作邮件撰写宣传广告生成ChatGPT正代码解释程序命令生成程序语言转化软件代码编写不同语言代码的转译等广告设计段落创作等文本分类新闻标签打标情感倾向分析智能文档搜索新闻咨询分类品牌营传统NLP模型文本匹配文本生成序列标注特征提取评销搜索等论观点提取数据来源广发证券发展研究中心二ChatGPT实现较强通用性背后的原理ChatGPT较强的通用性能力和模型算力和数据三大基础要素有关ChatGPT是在GPT-3预训练模型的基础上再新增输入了包含3千亿单词量在内总计570GB的数据后对其参数进行了微调后训练所得这种训练方法一般称为迁移学习由于所识别风险发现价值请务必阅读末页的免责声明823TablePageText深度分析计算机需训练的数据量较大在这一过程中也离不开较大规模算力的支持我们将从模型训练算力支持和训练数据三方面详细分析ChatGPT实现较强通用性的原理1AI预训练大模型是ChatGPT实现通用化的基础ChatGPT采用预训练微调的模型训练方式研发效率较高ChatGPT是在GPT-3的基础上进行微调得到的GPT-3在预先学习了各场景海量数据的基础上其包含了具有通用共性特征的底层卷积层这部分卷积层无需再进行训练网络权重和阈值可以直接复用到新的任务中在研发阶段开发人员通过对GPT-3这一预训练大模型进行剪裁域的自适应和新增部分类等微调即可实现类似ChatGPT特定模型的量产提升开发效率我们认为与从零开始训练AI模型相比引入AI预训练大模型的训练方式具有以下优势1训练时间更短预训练模型中的部分卷积层可以复用无需重复训练2训练成本更低训练所消耗的算力随着数据训练时长的减少而减少在预训练模型的基础上微调的开发成本大大低于从零训练的成本图6AI预训练大模型在机器学习中的应用图7应用了AI预训练大模型的迁移学习数据来源Nvidia官网广发证券发展研究中心数据来源Medium广发证券发展研究中心预训练大模型GPT-3是ChatGPT实现通用性的基础目前已开放API接口供调用自2018年OpenAI推出第一代GPT大模型开始公司持续向内容生成类AI模型研发2020年5月OpenAI发布了当时全球规模最大的预训练语言模型GPT-3在许多自然语言处理任务上均表现了出色的能力包括翻译问答和文本填空任务等GPT-3作为OpenAI多年研发的成果目前已开放API接口供开发者调用自2020年6月GPT-3开放API接口至2021年3月已有超过300个应用基于其进行开发我们认为OpenAI作为具有开放性质的研究机构对其研究成果对公众开放有利于行业整体技术进步但基于GPT-3开发出类似ChatGPT通用化效果的模型仍取决于算力的支持和训练数据的数量与质量识别风险发现价值请务必阅读末页的免责声明923TablePageText深度分析计算机2超大规模智能算力是ChatGPT实现通用化的壁垒包括ChatGPT在内的大模型在训练和推理阶段都需要大量算力的支持在Transformer模型推出后自2018年开始AI模型的参数近乎每年一个数量级的速度快速增长模型的规模和训练推理时所消耗的算力存在正相关关系AI大模型对于AI算力的需求不仅存在于训练阶段在各场景推理任务中也需要大规模智能算力基础设施是各科技公司训练AI大模型的前提正逐渐成为其在AI领域竞争的关键要素我们认为未来随着AI大模型的开发和应用其有望驱动AI芯片和AI服务器等硬件需求的增长利好寒武纪和浪潮信息等国产AI硬件公司表3AI大模型训练成本一览AI模型发布时间模型参数规模训练数据量所用算力训练时间训练成本Transformer2017年-69万个字符8个P10035天3840美元BERT2019年34亿33亿文字64GPU个TPU4天15万美元GPT-32020年5月1750亿570GB355个GPU-年1200万美元35天MT-NLG2021年105300亿15TB4480个GPU-1个月8500万美元数据来源人工智能计算中心发展白皮书月商汤招股说明书微软官网BERTPre-trainingofDeepBidirectionalTransformersforLanguageUnderstanding广发证券发展研究中心图82018-2021年全球AI大模型规模变化数据来源微软官网广发证券发展研究中心训练AI大模型所需的超大规模AI算力是主要壁垒2020OpenAI推出的GPT-3大模型拥有1750亿参数使用了570GB的数据进行训练训练成本达到了1200万美元2021年微软和英伟达使用了4480个GPU训练出的拥有5300亿参数的MT-NLG大模型训练数据多达15TB其训练成本更是高达8500万美元科技公司开发AI大模型需要专有AI算力基础设施和足够资金的支持我们认为受限于资金和算力基础设施中小规模的AI公司对AI大模型虽有强烈诉求但无力开发未来或需要依靠公识别风险发现价值请务必阅读末页的免责声明1023TablePageText深度分析计算机共部门或大型科技公司的算力和AI大模型而商汤在战略上预计持续投入底层AI算力基础设施建设AIDC有望保持长期竞争力图92019-2022年6月底商汤和云从科技货币资金图102019-2022年6月底商汤和云从科技电子设备账面净值16531801815616016140141143单1201037单1292位100位1080667870亿亿55元60元6404140181820101100852090500201912202012202112202206201912202012202112202206商汤货币资金云从科技货币资金商汤大型电子设备云从科技电子设备数据来源Wind广发证券发展研究中心数据来源商汤招股说明书云从科技招股说明书商汤年报商汤季报云从科技季报广发证券发展研究中心3训练数据的数量和质量是ChatGPT实现通用化的关键ChatGPT较强的通用化能力和其训练数据的数量质量有关一般而言用于训练的数据量越大模型的泛化能力越强训练数据高达45TB的GPT-3其在问题回答时的准确性和覆盖面远高于训练数据仅40GB的GPT-2此外训练数据所包含信息的丰富程度真实性和及时性也对AI大模型生成的内容有较大影响例如InstructGPT模型训练数据集中96以上是英文其它20个语种例如中文法语西班牙语等加起来不到4这导致其对其它语种的内容生成的拟人化效果不如英文ChatGPT引入了人工反馈强化学习机制有效提升模型拟人化效果InstructGPT和ChatGPT在拥有和GPT-3相同量级参数的情况下其回答相同问题的效果要远优于后者基于人工反馈的强化学习机制RLHF是InstructGPT和ChatGPT在生成内容流畅真实和拟人化的关键OpenAI在训练InstructGPT的过程中采用了40名人员的标注团队对模型提出各种类型问题并且根据其回答给予人工反馈这有效提升了模型输出结果与人类喜好的匹配度我们认为在数据标注过程中对于模型生成内容的反馈是建立在对于各场景需求的理解上的标注人员的价值观知识面和专业能力都会对训练的AI大模型有一定影响在AI大模型对于训练数据的数据量场景覆盖面以及标注的精细化程度等有较高要求的情况下未来各家公司采集获取数据的方式是关键科大讯飞在语音文字类数据采集手段丰富积累的数据量较大在开发AI大模型方面或具有一定优势此外具有中立属性和开放风格的公司更容易与产业链上下游形成合作通过构建开放的生态拓宽数据获取的渠道有望建立AI大模型开发上的相对优势识别风险发现价值请务必阅读末页的免责声明1123TablePageText深度分析计算机图11人工反馈的强化学习的基本原理图12GPT-3和InstructGPT对相同问题的回答对比数据来源DeepMind官网广发证券发展研究中心数据来源Voicebotai广发证券发展研究中心总体而言ChatGPT大模型的训练和应用对于AI领域的模型算力和数据三大基础要素的生产组织方式已经有了较大改变具体如下1AI模型预训练微调的模型训练方式有望快速推广开发者可通过对类似GPT-3的AI预训练模型进行剪裁域的自适应和新增部分类等微调即可实现特定模型的量产提升开发效率2AI算力AI大模型在训练和推理两个任务中都需要大规模智能算力基础设施的支持未来随着AI大模型的开发和应用其有望驱动AI加速卡和AI服务器等硬件需求的增长3训练数据在AI大模型对于训练数据的数据量场景覆盖面以及标注的精细化程度等有较高要求的情况下未来各家公司采集获取数据的方式是模型实现通用化的关键三国产类ChatGPTAI大模型与ChatGPT可能存在差距ChatGPT激发国产类ChatGPT模型的开发和应用短期来看ChatGPT的广泛推广驱动了各科技公司向内容生成类应用的积极探索在ChatGPT技术路线较为开放的背景下我们预计国内参考其开发类ChatGPT模型的厂商将会持续出现长期来看我们认为国产类ChatGPTAI大模型的发展预计将面临以下挑战1数据来源的割裂国内科技公司采集数据的渠道有限用于AI大模型训练的数据存在多样性不足场景覆盖不全面等问题2产业链公司开放程度不够AI大模型的开发需要AI产业链上下游开放合作共同开发国内科技公司倾向于通过内生垂直一体化的发展策略留给具有创新力的小公司发展空间较小3AI算力存在瓶颈在美国对华实施的高端芯片出口管制措施下我国可用于AI大模型开发和应用的AI芯片存在供货短缺功耗较大等潜在问题识别风险发现价值请务必阅读末页的免责声明1223TablePageText深度分析计算机4国内互联网和科技巨头加速投入意愿具有不确定性AI大模型的开发所需的AI算力基础设施和应用阶段的运营费用较高国内科技巨头资本开支的短期恢复力度可能相对有限我们认为科技巨头在既有商业模式和B端应用盈利弱势瓶颈下是否有意愿加速投入存在相当的不确定性科技公司采集数据的方式有限各自的数据来源较为割裂科技公司根据主营业务不同其采集的数据范围有限例如阿里采集的主要是消费者行为和决策数据腾讯通过微信采集的是社交类数据小红书采集的主要是和生活方式相关数据有限的数据采集方式在多维度层面影响了可用于模型训练的数据质量进一步会影响到AI模型的泛化能力和不同场景的通用化效果表4互联网公司采集数据的渠道和类型对比公司主营业务采集数据的主要渠道主要采集的数据类型百度在线搜索搜索引擎小度音箱知识类和新闻类数据阿里巴巴电子商务淘宝和天猫等网上购物平台消费者行为和决策数据腾讯社交平台微信和QQ等在线聊天工具侧重日常交流的社交类数据数据来源广发证券发展研究中心从产业链分工的角度合作共赢包容开放的外部环境对于AI大模型的发展较为重要OpenAI在发展初期得到了微软等大型科技厂商的资助而其取得技术突破后又扩大和微软的合作实现了合作共赢具有技术原创精神的OpenAI对于内容生成类AI模型的持续探索和坚持投入是ChatGPT取得成功的主要原因而大型科技公司在技术投入时对于短期商业回报的考量过多往往导致其投入的持续力不够因此能否提供类似OpenAI中立属性独立开放的机构健康发展的外部环境是关键我们认为国内科技公司以倾向于通过内生垂直一体化为主的发展策略留给具有创新力的小公司发展空间较小美国针对高端芯片及其产业链上下游对中国实施出口限制措施2022年8月26日美国政府通知英伟达公司美国政府对其未来出口到中国和俄罗斯的A100和即将推出的H100等高端AI芯片实施了许可证要求AMD证实其也收到类似通知其用于AI计算的GPU等产品线的出口也受到了类似限制2022年10月7日美国商务部工业与安全局宣布修订出口管理条例加强限制中国获得先进计算芯片开发超级计算机以及制造先进半导体的能力针对高端芯片及相关终端产品制造设备等产业链上下游升级对华出口管制措施美国一系列的封锁措施可能导致我国面临先进制程AI芯片短缺的情况但成熟制程的芯片供货仍较为充足我们认为未来若先进制程AI芯片产能瓶颈长期得不到解决的话科技厂商或采用成熟制程芯片训练AI大模型模型开发的成本可能升高识别风险发现价值请务必阅读末页的免责声明1323TablePageText深度分析计算机AI大模型的开发所需的AI算力基础设施和应用阶段的运营费用较高2020OpenAI推出的GPT-3大模型训练成本高达1200万美元数据来源商汤招股说明书在应用阶段ChatGPT每生成一次内容成本在个位数的美分级别数据来源OpenAI的CEOSamAltman2023年以来ChatGPT每日访客量高达1300万人次数据来源路透社假设每个访客与ChatGPT对话5次可大致测算其每日运营成本在百万美元级别国内互联网公司近三年资本开支增长放缓在主营业务已过高速成长期云计算业务依然亏损的背景下资本开支的短期恢复力度可能相对有限另一方面从国内的市场环境来看此前自然语言处理类AI的商业应用更多存在于精准营销等C端已相对成熟但是现阶段国产类ChatGPTAI大模型对于要求较高的B端IT应用无论产品还是生态合作价值链均衡都有不小差距我们认为科技巨头在既有商业模式和B端应用盈利弱势瓶颈下是否有意愿加速投入存在相当的不确定性图132019Q1-2022Q3阿里巴巴腾讯和百度资本开支及增速图18030015025012020090150单位60100亿元305000-30-50-60-100阿里巴巴运营资本开支腾讯资本开支百度资本开支阿里资本开支同比增速腾讯资本开支同比增速百度资本开支同比增速数据来源各公司年报和季报广发证券发展研究中心国产类ChatGPT发展前景中短期不宜乐观从外部环境看我们面临高端AI芯片供货受限的压力未减从内部环境看科技厂商采集数据的方式有限数据来源割裂且其倾向于通过内生垂直一体化的发展策略留给具有创新力的小公司发展空间较小我们认为除了寒武纪在基础AI算力方面相对突出ChatGPT对A股计算机相关标签公司整体几乎没有实质驱动整个产业链的追赶都面临较大挑战识别风险发现价值请务必阅读末页的免责声明1423TablePageText深度分析计算机二ChatGPT驱动AI大模型向内容生产类应用发展一GPT系列AI大模型在文字类工具软件的商业化应用前景广阔OpenAI的GPT系列AI大模型已嵌入部分微软系列软件中较大增强其智能化功能商业化前景广阔过去几年微软在与OpenAI已经建立一定研究合作的基础上2023年1月23日双方宣布进一步拓宽合作范围2023年2月份我们观察到一系列嵌入了GPT系列AI大模型的微软的软件陆续推出智能化功能的应用较大提升用户体验12023年2月1日微软推出了嵌入GPT-35的Teams线上会议平台新增了自动会议纪要生成要点总结等大大节省了用户在会议进行中和会后手动记录会议纪要的工作22023年2月7日基于ChatGPT和GPT-35微软开发了Prometheus模型并推出了嵌入Prometheus模型的Edge浏览器和Bing搜索引擎在新版本的Bing搜索结果中新增了ChatGPT对于搜索内容的直接回答不仅很好的补充了既有的搜索结果还缩短了用户查询信息的时间图14嵌入了GPT-35的Teams线上会议平台会议纪图15嵌入了Prometheus模型的Bing的搜索界面要自动生成功能展示数据来源微软官网广发证券发展研究中心数据来源Bing官网广发证券发展研究中心我们认为未来GPT系列AI大模型最具有成功潜力的商业化落地形式是其与微软从浏览器Bing到Office的全线软件的融合应用二者的融合应用有望对微软的软件产品的门槛和附加值有较大提高效果同时对相应竞品实现降维竞争我们可以预期微软相关产品线的竞争优势会迅速扩大并能逐步新增体现在全球市场份额和财务回报上识别风险发现价值请务必阅读末页的免责声明1523TablePageText深度分析计算机图16嵌入了类ChatGPT的Outlook软件界面图17嵌入了类ChatGPT的Word软件界面数据来源TheVerge广发证券发展研究中心数据来源TheVerge广发证券发展研究中心二科技公司开发的AI大模型预计由内部赋能转向内容生成各科技公司已积累了一定的AI大模型的技术ChatGPT推动其应用向内容生成类方向发展2020年5月OpenAI发布了当时全球规模最大的预训练语言模型GPT-3GPT-3具有1750亿参数训练所用的数据量达到45TB其在许多自然语言处理数据集上的出色表现激发了阿里华为百度等科技公司在AI大模型领域的研发投入我们认为在各大科技公司已经具备一定AI大模型技术基础之上ChatGPT的广泛应用将进一步推动各大科技公司将AI大模型向内容生产类应用发展目前各科技公司开发的AI大模型主要应用于分析类功能中赋能各自的主营业务阿里在电商业务中的智能化需求是精准营销智能推荐其对于文字与图像的匹配度具有较高要求阿里开发的M6大模型主要应用于通过用户输入的文字智能推荐相关的产品的多模态AI大模型华为在各行业积累了大量项目的基础上深入理解下游客户智能化改造的需求痛点其开发的盘古NLP大模型主要应用于舆情分析企业运营分析等提升企业运营管理效率的相关功能百度的主打产品是搜索引擎产品以文字搜索为主其开发的NLP文心AI大模型主要用于提升对于用户输入的文字的精准分析中赋能搜索业务表5全球2020-2021年AI大模型一览企业发布时间模型名称模型参数OpenAI2020年6月GPT-31750亿Google2021年1月SwitchTransformer16万亿华为2021年4月盘古NLP大模型2000亿北京智源AI研究院2021年6月悟道20175万亿浪潮人工智能研究2021年9月源102457亿英伟达院微软2021年10月MT-NLG5300亿阿里巴巴2021年11月M610万亿百度鹏城实验室2021年11月文心2600亿数据来源人工智能基础设施发展态势报告2021中国信通院广发证券发展研究中心识别风险发现价值请务必阅读末页的免责声明1623TablePageText深度分析计算机在电商领域阿里的M6大模型已应用于消费者需求分析产品设计等工作中阿里达摩院在AI大模型上的研发从2020年开始其主推的M6多模态大模型的参数规模由2020年的3亿个提升至2021年10月的10万亿个其规模在全球排名前列M6已经在超40个场景中应用日调用量上亿具体的商用案例包括在犀牛智造平台上通过结合潮流趋势进行快速设计试穿效果模拟有望大幅缩短快时尚新款服饰设计周期此外M6还应用于支付宝淘宝等平台参与跨模态搜索文案撰写图片设计等工作图18阿里达摩院智能计算实验室M6大模型开发进程数据来源阿里达摩院官网广发证券发展研究中心华为盘古NLP大模型主要应用于舆情分析企业运营分析等盘古NLP大模型在预训练阶段学习了40TB的中文文本数据其中包括细分行业的小样本数据基于提示prompt-based的调优动态冰化等一系列正则化技术盘古大模型的AI算力和数据吞吐能力由国内规模的AI训练集群之一的鹏城云脑II提供除了硬件算力支持华为底层软件训练框架ModelArts平台也为盘古大模型的训练提供了技术保障目前盘古NLP大模型主要应用于金融电商政务等领域实现精准舆情分析企业运营分析智能营销等功能图19华为盘古大模型数据来源WAIC2021广发证券发展研究中心百度文心大模型不仅对其搜索业务内部赋能还广泛向AI开发人员提供API调用服务2021年12月百度与鹏城实验室联合发布鹏城-百度文心ERNIE30Titan是参数规模达到2600亿的自然语言处理的大模型在机器阅读理解文本分类语识别风险发现价值请务必阅读末页的免责声明1723TablePageText深度分析计算机义相似度计算等60多项任务取得最好效果并在30余项小样本和零样本任务上刷新基准在开发过程中百度依托鹏城云脑II自研的飞浆深度学习框架有效支持大模型高效稳定的训练除了文心NLP大模型外百度还开发了CV大模型和跨模态大模型文心AI大模型不仅内部赋能其搜索业务还通过百度智能云的EasyDL和BML开发平台向AI应用开发者提供服务已广泛应用于医疗金融等领域相关客户包括中国人寿国美集团度小满金融等图20百度文心百中产品功能数据来源百度官网广发证券发展研究中心未来ChatGPT推动各大科技厂商将AI大模型向内容生成类方向发展在内容生成应用方面各厂商已具备一定经验百度的文心NLP大模型已经推出歌词续写诗词续写对联续写及自由问答等功能阿里的M6大模型也已提供服装设计图像描述生成及智能问答等功能但其生成内容覆盖面回答满意度和需求契合度都较ChatGPT有一定差距目前训练GPT-3和InstructGPT等AI大模型相关学术论文是公开可查阅的我们认为国内各大科技厂商在AI大模型领域已具备一定技术基础与项目经验其在参考了ChatGPT相关开发方法的海外公开资料后有望推出国产类ChatGPT的AI大模型2023年2月7日百度宣布将于近期出文心一言ERNIEBot大模型识别风险发现价值请务必阅读末页的免责声明1823TablePageText深度分析计算机图21百度文心NLP大模型对联自动生成效果图22阿里M6大模型智能问答生成效果数据来源百度官网广发证券发展研究中心数据来源阿里达摩院官网广发证券发展研究中心国内科技厂商开发的AI大模型大规模商业化应用中短期不宜乐观从国内的市场环境来看此前自然语言处理类AI的商业应用更多存在于精准营销等C端已相对成熟但是现阶段国产类ChatGPTAI大模型对于要求较高的B端IT应用无论产品还是生态合作价值链均衡都有不小差距我们认为除了寒武纪在基础AI算力方面相对突出ChatGPT对A股计算机相关标签公司整体几乎没有实质驱动整个产业链的追赶都面临较大挑战三国内发展AI大模型的环境有望得到改善数据基础制度的构建有望加快数据的流通和共享近年来数据作为新型生产要素正受到越来越高的重视2022年12月国务院发布的中共中央国务院关于构建数据基础制度更好发挥数据要素作用的意见提出了合理降低市场主体获取数据的门槛增强数据要素共享性普惠性我们认为未来随着数据流通共享相关法律法规的健全以及授权确权机制的完善科技公司用于AI大模型开发的数据质量有望得到改善AI芯片产业链自主可控建设节奏有望加快在芯片设计环节国产高端AI芯片在过去几年性能有了较大提升以华为昇腾910和寒武纪思元370为代表的国产AI芯片已经具备和英伟达高端AI芯片直接竞争的技术基础在芯片制造环节中国大陆晶圆厂的先进制程芯片规模化量产能力与国际一流厂商仍有一定差距长期来看美国对华实施的高端芯片出口管制措施预计将倒逼国内芯片制造工艺水平的提升加速芯片制造产业链自主可控的建设节奏我们认为长期来看高端芯片在中国市场供给的不确定性将催化AI芯片产业链的国产化进程叠加AI大模型对AI专用算力需求的驱动因素预计将利好以寒武纪为代表的国产AI芯片厂商识别风险发现价值请务必阅读末页的免责声明1923TablePageText深度分析计算机表62021年英伟达A10G与寒武纪MLU370-X4性能对比产品A10GMLU370-X4公司英伟达寒武纪推出时间2021年4月2021年11月制程8nm7nm整数算力250TOPSINT8256TOPSINT8浮点数算力312TFLOPSFP3224TFLOPSFP32功耗150W150W内存类型GDDR6LPDDR5内存容量12G24G内存宽带600GBs3072GBs数据来源英伟达官网寒武纪官网广发证券发展研究中心识别风险发现价值请务必阅读末页的免责声明2023
|
相关行业报告
|
||||||||||||||||||||||||||
