研报下载就选股票报告网
您好,欢迎来到股票分析报告网!登录   忘记密码   注册
>> 华西证券-传媒行业AGI(通用人工智能)专题之二:“文心一言”发布,国内厂商距离复现ChatGPT有多远?-230317
上传日期:   2023/3/19 大小:   2110KB
格式:   pdf  共20页 来源:   华西证券
评级:   增持 作者:   赵琳
行业名称:   传媒
下载权限:   无限制-登录即可下载
“文心一言”表现一如预期,不必过度悲观
  3月16日“文心一言”发布,从官方demo来看,文心一言具备文学创作、商业文案创作、数理逻辑推算、中文理解、多模态生成能力,存在超预期亮点,但事前录屏降低了其演示的真实性,也并未对外直接开放,多因素导致公众反馈不佳。我们认为尽管上下文理解、语义逻辑、多轮对话方面尚有欠缺,“文心一言”展现了足够的文案创作能力,为B端降本增效的起始逻辑已经明晰,尽管尚未对公众大范围开放,企业用户已经能够申请内测邀请码,若邀请范围持续扩大,飞轮效应将推进“文心一言”表现改善,且优化空间极大。
  复现ChatGPT的难点在哪里?AI三要件略逊一筹,但差距并非不可逾越
  1)算法上,去开源化极大增加了国内科技企业的复现难度,但学术界已有相对成功复现先例,随着人才流动、时间推移和研究进步,大模型性能很可能逐渐趋同。2)数据上,数据集质量、标注细节处理、用户真实交互是关键,尽管优质的中文标注数据集匮乏,使用英文数据进行预训练并不影响中文输出,科技企业能够参考GPT3的路径,利用海量用户交互提升数据质量。3)算力上,国内头部科技企业多已完成数据中心建设,能够实现算力资源部分自给,此外算力更接近于自由流通的商品,战略押注意愿明确、现金流充沛的国内厂商有希望弥合算力上的差距。
  工程化和应用分发能力是隐形壁垒,头部厂商优势明显
  国产ChatGPT的落地在技术准备之外还需要两项核心要素:工程化与分发能力。1)工程化能力,即能够利用更低的成本和更高效的迭代做出先进的大模型应用,制作更高效、廉价、贴合市场的产品,能够同时容纳亿级用户在线。2)充沛的C端用户及B端应用场景,即更低的分发触达成本、更快速的产品应用迭代。国内厂商完全具备大DAU场景下AI工程化处理的潜力,且应用分发是国内企业的长项,头部厂商本身已经建起规模及心智壁垒,且商业模式无需再探索,如要落地AGI相关应用,获客成本远低于新进入者。
  若“文心一言”对外开放,增量成本仍可控
  短期我们关注“文心一言”等产品对科技企业财务状况的影响,将增量成本拆分为训练成本、推理成本及数据标注成本(暂不考虑人力支出及维护费用),测算大模型落地搜索页面后年均增量成本约为16亿元。但考虑到国产模型参数量及数据集token数量均是未知,且Azure云计算价格与实际成本存在偏差,此外实际落地后各项成本均存在优化可能、具体会计处理方式还存在探讨空间,我们判断10-20亿元为其增量成本的合理范围(暂不考虑人力支出及维护费用),参考百度2022年经营现金流净额261.7亿元,对公司正常经营影响可控。
  投资建议
  GPT4、Office365(Copilot)对公众的震撼只是前期技术突破后的余韵,而非AGI领域想象力的终点,产品的成功会驱动更多学术资源与产业投资的倾斜,人工智能必然成为产业发展长期主线,国产替代具有需求上的紧迫性。依然重点推荐百度(BIDU.US),判断“文心一言”表现符合预期,公司目前仍处于低估区间,尽管技术差距依然存在,短期内研发投入可能上行,我们看好人工智能领域投入对公司业绩及估值的长线提振。同时关注已在视频、营销、阅读等相关细分领域抢跑的重点标的,推荐当虹科技、捷成股份、蓝色光标、风语筑、浙文互联。
  风险提示
  “文心一言”落地效果不及预期风险;ToB服务推进节奏不及预期风险;成本大幅增长风险;AI产品道德及监管风险。
  
  
研究报告全文:仅供机构投资者使用证券研究报告行业深度研究报告TableDate2023年03月17日TableTitle文心一言发布国内厂商距离复现ChatGPT有多远TableTitle2AGI通用人工智能专题之二评级及分析师信息TableSummary文心一言表现一如预期不必过度悲观行业评级TableIndustryRank推荐3月16日文心一言发布从官方demo来看文心一言具备文学创作商业文案创作数理逻辑推算中文理解行业走势图TablePic多模态生成能力存在超预期亮点但事前录屏降低了其演示的真实性也并未对外直接开放多因素导致公众反馈不10佳我们认为尽管上下文理解语义逻辑多轮对话方面尚4有欠缺文心一言展现了足够的文案创作能力为B端降-2本增效的起始逻辑已经明晰尽管尚未对公众大范围开放-7企业用户已经能够申请内测邀请码若邀请范围持续扩大-13飞轮效应将推进文心一言表现改善且优化空间极大-19复现ChatGPT的难点在哪里AI三要件略逊一筹202203202206202209202212202303传媒沪深300但差距并非不可逾越1算法上去开源化极大增加了国内科技企业的复现难度但学术界已有相对成功复现先例随着人才流动时间推移TableAuthor分析师赵琳和研究进步大模型性能很可能逐渐趋同2数据上数据邮箱zhaolinhx168comcn集质量标注细节处理用户真实交互是关键尽管优质的SACNOS1120520040003中文标注数据集匮乏使用英文数据进行预训练并不影响中文输出科技企业能够参考GPT3的路径利用海量用户交互提升数据质量3算力上国内头部科技企业多已完成数据中心建设能够实现算力资源部分自给此外算力更接近于自由流通的商品战略押注意愿明确现金流充沛的国内厂商有希望弥合算力上的差距工程化和应用分发能力是隐形壁垒头部厂商优势明显国产ChatGPT的落地在技术准备之外还需要两项核心要素工程化与分发能力1工程化能力即能够利用更低的成本和更高效的迭代做出先进的大模型应用制作更高效廉价贴合市场的产品能够同时容纳亿级用户在线2充沛的C端用户及B端应用场景即更低的分发触达成本更快速的产品应用迭代国内厂商完全具备大DAU场景下AI工程化处理的潜力且应用分发是国内企业的长项头部厂商本身已经建起规模及心智壁垒且商业模式无需再探索如要落地AGI相关应用获客成本远低于新进入者若文心一言对外开放增量成本仍可控短期我们关注文心一言等产品对科技企业财务状况的影响将增量成本拆分为训练成本推理成本及数据标注成本暂不考虑人力支出及维护费用测算大模型落地搜索页面后年均增量成本约为16亿元但考虑到国产模型参数量及数据集token数量均是未知且Azure云计算价格与实际成本存在偏差此外实际落地后各项成本均存在优化可能具体会计处理方式还存在探讨空间我们判断10-20亿元为其增量成本的合理范围暂不考虑人力支出及维护费用参请仔细阅读在本报告尾部的重要法律声明证券研究报告行业深度研究报告考百度2022年经营现金流净额2617亿元对公司正常经营影响可控投资建议GPT4Office365Copilot对公众的震撼只是前期技术突破后的余韵而非AGI领域想象力的终点产品的成功会驱动更多学术资源与产业投资的倾斜人工智能必然成为产业发展长期主线国产替代具有需求上的紧迫性依然重点推荐百度BIDUUS判断文心一言表现符合预期公司目前仍处于低估区间尽管技术差距依然存在短期内研发投入可能上行我们看好人工智能领域投入对公司业绩及估值的长线提振同时关注已在视频营销阅读等相关细分领域抢跑的重点标的推荐当虹科技捷成股份蓝色光标风语筑浙文互联风险提示文心一言落地效果不及预期风险ToB服务推进节奏不及预期风险成本大幅增长风险AI产品道德及监管风险请仔细阅读在本报告尾部的重要法律声明2证券研究报告行业深度研究报告正文目录1文心一言答卷未知但国产替代并不遥远411细究算法数据算力三要件略逊一筹但仍有追平可能512工程化处理与分发能力是更高的壁垒1013商业化路径已经明晰搜索场景鲜明契合122若文心一言成功对公众开放年化增量成本可控1521训练前期固定投入较大莱特定律驱动下成本必然下行1522推理与用户数量成正比成本优化路径明确1623数据标注取决于人力价格成本量级较低173投资建议184风险提示18图表目录图1文心一言生成图片4图2文心一言生成视频4图32005年起中国AI论文总数超美国5图4海外AI机构预测中国高引论文占比将超过美国5图5类ChatGPT产品的技术发展示意图5图6ChatGPT的技术突破点在于引入了RLHF基于人类反馈的强化学习6图7主流大模型数据集来源可分为六类8图8各类数据来源大小8图9全球前十大科技企业数据中心容量排名9图10百度昆仑一二代芯片与英伟达A100参数对比9图112013年起公司资本开支及经营现金流情况10图122013年起公司现金及现金等价物充沛亿元10图13AGI产业链及底层支撑示意图10图14未接入GPT4的Bing仅对搜索结果进行简单整合12图15NewBing的Chat入口可以对搜索结果进行人性化整合12图16NewBing能够帮助用户编写代码13图17NewBing能够帮助用户进行文件阅读13图18NewBing发布次日Bing下载量猛增75813图19百度知识图谱的首要应用场景即为搜索13图20用户输入宝可梦朱紫后出现游戏购买链接14图21用户输入健美运动员姓名后出现健身补剂广告14表1Github社区中主流AI框架情况202216表2类ChatGPT模型年均训练成本测算15表3类ChatGPT应用中期年均推理成本测算16表4类ChatGPT应用中期年均成本测算17请仔细阅读在本报告尾部的重要法律声明3证券研究报告行业深度研究报告1文心一言答卷未知但国产替代并不遥远3月16日百度AI对话模型文心一言发布我们据发布会信息总结文心一言基于此前ERNIE大模型PLATO对话模型训练而成是对百度2019年起便已开始的NLP实践的延续从技术角度看除百度已有的知识增强检索增强对话增强技术外文心一言引入了有监督的精调RLHF基于人类反馈的强化学习提示学习等ChatGPT基础技术但具体参数量数据量耗能对话时效等均未公开事前录屏而非实机演示对外界信心产生负面影响从现场发布的demo来看文心一言具备文学创作商业文案创作数理逻辑推算中文理解多模态生成能力同类问题下中文理解能力强于GPT4且随输入内容生成音频视频尚属AI对话模型中的首例存在超预期亮点但发布会未能展示模型的编程能力且事前录屏降低了其演示的真实性也并未对公众开放多种因素导致公众反馈不佳图1文心一言生成图片图2文心一言生成视频资料来源百度华西证券研究所资料来源百度华西证券研究所文心一言展现了足够的文案创作能力为B端降本增效的起始逻辑已经明晰出于商业角度考虑和高昂的端侧微调成本厂商普遍放弃开源转而以提供API的方式供下游用户在特定场景下进行推理使用以ChatGPT为例OpenAI并未公布其基础模型GPT35GPT4技术细节用户仅能够在自身应用内通过API调用其模型从第一批用户实际使用来看文心一言已经展示了基础文案工作能力除此前接入650家企业外发布当日有65万家企业申请测试签约5家客户一定程度反映了企业客户的认可程度用户交互能够进一步改善模型表现我们判断这也是公司急于推动模型面世的原因之一OpenAI自GPT-3便开始对外提供服务通过开放给公众GPT3收集来自用户输入内容的多样性数据从而迭代出效果更好的模型这就决定了GPT4是站在用户交互飞轮的巨人肩膀上与文心一言并不在同一起跑线但是海量用户群也是百度的长处之一GPT的飞轮效应是可复制的尽管尚未对公众大范围开放企业用户已经能够申请内测邀请码邀请范围若持续扩大飞轮效应将推进文心一言表现改善且优化空间极大我们判断尽管上下文理解语义逻辑多轮对话方面尚有欠缺文心一言在部分问题处理上已经能够对标GPT3水平但具体表现仍需时间和公众验证我们依然认为人工智能必然成为产业发展长期主线国产替代具有需求上的紧迫性以文心一言发布为契机我们重点分析国内主流科技企业在复现ChatGPT领域需要克服的差距判断对国产大模型的发展不必过度悲观请仔细阅读在本报告尾部的重要法律声明4证券研究报告行业深度研究报告11细究算法数据算力三要件略逊一筹但仍有追平可能111算法核心差距在于方法及细节处理大模型的技术积累已经行至一个质变节点我们将NLP自然语言处理及CV计算机视觉技术视作类ChatGPT产品的技术底座从深度学习的角度分析其发展历程残差网络及Transformer的出现使得模型的深度和参数量指数级增加大模型成为可能大语言模型出现后大模型的使用方式从预训练的单一任务模型迭代到多模态模型微调时所需的标注数据量显著减少从而降低了业务的使用成本图5类ChatGPT产品的技术发展示意图资料来源公开资料整理华西证券研究所国内AI领域积累深厚历年论文发表及专利申请占优Elsevier数据显示2012-2021年中国AI相关论文篇数始终排在首位到2021年增至美国2倍从论文引用次数进入前10的篇数来看中国2019年跃居首位2021年达到比美国多7成的7401篇斯坦福大学数据显示2021年中国提交的人工智能专利申请全球占比超50图32005年起中国AI论文总数超美国图4海外AI机构预测中国高引论文占比将超过美国资料来源Wired华西证券研究所资料来源AllenInstituteforAI华西证券研究所请仔细阅读在本报告尾部的重要法律声明5证券研究报告行业深度研究报告从基本操作系统看国内已经具备建立AI底层框架的能力深度学习框架是实现算法的基础架构和工具可类比为开发过程中必须使用的操作系统如游戏制作过程中的虚幻引擎从技术定位看AI框架对下调用底层硬件计算资源能够屏蔽底层差异并提供良好的执行性能对上支撑AI应用算法模型搭建提供算法工程化实现的标准环境是AI体系的关键核心目前海外AI框架领域已经形成TensorFlowGooglePyTorchMeta双寡头格局国内主流AI框架主要有PaddlePaddle百度MindSpore华为MegEngine旷视OneFlow等从Github指标看我国主体推出的AI框架中华为MindSpore百度飞桨引用次数点赞数贡献者数量占优表1Github社区中主流AI框架情况20221地区排名框架代码提交次数引用数点赞数贡献者1TensorFlow1244948630016300030562PyTorch4339014800537002137海外3Theano28127250095003524CNTK161164400171002015Maneet117766900198008681PaddlePaddle337534300175005242MindSpore373085142700267国内3MegEngine22824624100324OneFlow76213513000995Jittor1266235230031资料来源AI框架发展白皮书2022年华西证券研究所但ChatGPT在算法上的突破更多在于思路而非具体理论是菜谱而非食材的创新这成为了复现的难点之一2022年11月OpenAI上线了机器人对话模型ChatGPTGPT-35引入了RLHF基于人类反馈的强化学习利用人类的标注数据去对GPT3GPT35进行有监督训练针对模型的多个回答进行排序标注形成奖惩机制让模型去拟合人的偏好从而实现了史上最佳的输出效果ChatGPT并未实现任何底层理论的创新更近于多种前沿算法理论组合选取了大量的数据设计了合理的标注流程并且将这些融合真正复杂的是这一过程图6ChatGPT的技术突破点在于引入了RLHF基于人类反馈的强化学习步骤3强化学习PPO算法步骤1收集数据监督学习图步骤ChatGPT2建立训练汇报模型实现路径写一个关于水獭的提示学习引入监督学习提一个提问对Q如何向一个六一个新提问故事算法高模型认知能力应多个回答岁的孩子解释强化学习初始化强化学习是奖励机制是标注者将回解释巩固学习到雇佣标注工进行数据标注答从最好到在机器学围棋策略模型进行输出六岁阶段最差排序习中很久很久以前奖励模型对输出进行该过程中产使用监督学公司给予信任和评价习对GPT-生的数据用35进行微调惩罚在教授过程于训练奖励该评价用于模型更新策略模型的参数基于PPO算法资料来源公开资料整理华西证券研究所OpenAI逐步放弃开源极大增加了国内科技企业的复现难度相比谷歌此前公布了大量的模型原理OpenAI并未提供开源论文大量的技术细节并未公开GPT35的参数规模也并不明确尽管国内学术及业界均在AI领域有一定的积累历请仔细阅读在本报告尾部的重要法律声明6证券研究报告行业深度研究报告年论文发表及专利数占优但在复现过程中大量细节都并不明朗如提示学习的具体机制算法如何泛化算法微调的具体环节数据标签的设置等从国产实践来看学术界已有相对成功复现先例但尚未工程化落地百度文心一言外清华智谱ChatGLM亦引入了监督微调反馈自助人类反馈强化学习等技术尽管参数量较小输出表现良好2022年11月斯坦福大学大模型中心对全球30个主流大模型进行了全方位的评测GLM-130B是亚洲唯一入选的大模型评测报告显示GLM-130B在准确性和公平性指标上与GPT-3接近或持平鲁棒性校准误差和无偏性均优于GPT-3请仔细阅读在本报告尾部的重要法律声明7证券研究报告行业深度研究报告112数据数据集质量标注细节处理用户真实交互是关键相比传统无监督学习的GPT模型ChatGPT表现更好的原因之一是在无监督学习的基础上提供了高质量的真实数据精标的多轮对话数据和比较排序数据主要得益于敏感词标注领域技术投入对公众开放后形成的数据飞轮OpenAI并没有公开训练ChatGPT的相关数据集来源和具体细节我们参考AlanDThompson文章判断主流大模型数据集来源可分为六类分别是维基百科书籍期刊Reddit社交媒体平台链接CommonCrawl大型数据集和其他数据集GitHub等代码数据集StackExchange等对话论坛和视频字幕数据集图7主流大模型数据集来源可分为六类图8各类数据来源大小资料来源AlanDThompson华西证券研究所资料来源AlanDThompson华西证券研究所国内厂商在中文训练数据方面有一定优势以百度为例ERNIE30的中文预训练语料数量最多主要来源为ERNIE20包括百科Feed等百度搜索包括百家号知乎铁算盘经验网络文本QA-longQA-shortPoetry2Couplet3医学法律金融等领域的特定数据以及百度知识图谱超过5000万条事实但中文互联网语料质量相对较差优质的中文标注数据集匮乏使用英文数据进行预训练更为可行RLHF论文中的训练数据英文占比极高但对中文和其他小语种能力的提升非常显著可见RLHF对模型能力的提升能够跨越语种以ChatGLM-6B为例该模型在11比例的中英语料上训练了1T的token量兼顾双语能力我们认为中文数据集的薄弱对于国产大模型而言并不构成较大阻碍精细标注对标注人员的培训是技术难点ChatGPT的前身GPT-3已经展示了非常强大的语句串联的能力但互联网的词汇存在负面信息单纯凭借学习能力无法来清除这些训练数据GPT35给AI提供标有暴力仇恨语言等标签AI工具就可以学会检测这些内容并在它触及到用户之前将不良内容过滤掉尽管标签主要通过人工标注具体标注技术细节对标注员的培训等仍需要国内科技企业探索科技企业能够参考GPT3的路径利用海量用户交互提升数据质量作为国内最大的搜索引擎服务商百度在真实数据和用户需求理解方面有较多积累能够对旗下的AI大模型进行充分的训练和预测进而使得AI大模型的智能化水平不断进化参考GPT3的经验GPT-3是OpenAI正式对外提供服务的模型通过将模型开放给公众GPT3收集来自用户输入内容的多样性数据从而迭代出效果越好的模型若文心一言向公众开放我们判断真实的用户调用与模型迭代之间有望形成正向循环缩窄国产大模型产品与ChatGPT的差距请仔细阅读在本报告尾部的重要法律声明8证券研究报告行业深度研究报告113算力更多关乎资金充足程度与公司战略类ChatGPT产品的复现需要庞大的算力支持浮点运算FLOPS的数值通常与参数数量成比例随着GPTGPT-2和GPT-3当前开放的版本为GPT-35的参数量从117亿增加到1750亿预训练数据量从5GB增加到45TB算力需求随之增长据OpenAI训练一次13亿参数的GPT-3XL模型需要的全部算力约为275PFlops-day即1PetaFLOPs效率跑275天训练一次1746亿参数的GPT-3模型需要的算力约为3640PFlops-day即1PetaFLOPs效率跑3640天需求呈现指数级增长衡量头部厂商能否支撑训练及推理环节的算力需求我们认为更多需要考虑资金充足程度与公司战略模型层企业更多是算力的消费者美国芯片出口政策影响存在但并不致命对试图复现ChatGPT的头部厂商而言我们认为算力更接近于自由流通的商品只需高额的资金投入即可完成布局尽管美国出口限制政策影响较大国内仍能采购性能更低的前代算力芯片只是相对牺牲了计算速度国内头部科技企业多已完成数据中心建设能够实现算力资源部分自给StructureResearch数据显示到2022年全球超大规模自建数据中心总容量将达到13177兆瓦MW中国超大规模数据中心企业占亚太地区的24阿里巴巴华为百度腾讯和金山云均位于领先位置图9全球前十大科技企业数据中心容量排名图10百度昆仑一二代芯片与英伟达A100参数对比7000参数昆仑1昆仑2英伟达6000N10050006241248TINT8256TOPS512-768TOPS4000OPS3000312624TFINTFP1664TOPS128-192TOPS2000LOPS1000Tensor156312TF--0Float32LOPS195TFLOPINTFP3216TOPS32-48TOPSSFP64Tensor195TFLOP--CoreS2022年数据容量MW未来计划新增容量MWFP64--97TFLOPS资料来源StructureResearch华西证券研究所资料来源MIT机器学习加速器的调查和基准测试研究华西证券研究所长线投入战略充足资金预算是复现ChatGPT所必须的要素因此战略押注意愿明确现金流充沛的国内厂商更有希望弥合算力上的差距以百度为例2017年提出AllINAI后资本开支波动上升2022全年资本开支除爱奇艺高达181亿元同期经营现金流增长30至2617亿元截至2022年末公司用于进行资本支出的现金及现金等价物余额为5316亿元现金流稳健流动性充足请仔细阅读在本报告尾部的重要法律声明9证券研究报告行业深度研究报告图112013年起公司资本开支及经营现金流情况图122013年起公司现金及现金等价物充沛亿元12020000100150008060100004050002000002013201420152016201720182019202020212022-20-5000资本开支爱奇艺亿元exyoy资料来源公司公告华西证券研究所资料来源公司公告华西证券研究所12工程化处理与分发能力是更高的壁垒从国产替代角度看算法数据算力壁垒并非不可逾越随着人才流动时间推移和研究进步大模型性能很可能逐渐趋同从落地角度来看ChatGPT更多实现了工程而非技术上的成功即完成了从底层技术到工程落地再到产品的跨越在成本规模和效率之间实现了正确的权衡取舍1从B端来看此前的AI公司需要根据不同的任务训练出不同的模型算法很难复用于其他场景OpenAI提供了泛化通用的算法让更多的使用者受益并为之消费各行业厂商可以利用统一的预训练大模型微调来直接应对不同的任务后续开发工程量大幅下降实现了AI开发的工业化2从C端来看ChatGPT做到了在稳定输出的同时容纳破亿月活用户具有低使用门槛高效强传播性的特点开启了AI领域大众化的序章图13AGI产业链及底层支撑示意图请仔细阅读在本报告尾部的重要法律声明10证券研究报告行业深度研究报告资料来源公开资料整理华西证券研究所梳理海外AGI产业链发展趋势我们判断国内厂商相对优势存在于国内局部场景的应用AGI受益产业链可划分为1上游数据及底层算力供给2中游ToB定制化模型开发3下游形成ToC应用并进行分发海外目前涌现的公司则集中于以下三类1专注于大模型开发的公司对外允许开发者以其预训练大模型为底座通过微调或API针对不同的细分领域开发应用场景如OpenAI2兼具大模型开发及垂直应用一体化能力的公司如Midjourney3单纯调用大模型API开发具体场景应用的公司如JasperAI因此考虑到中外环境的显著差异技术水平尚有差距模型及服务模式下提供国内特定场景下的定制化商业模型或面向国内C端消费者提供内容生产应用更加有望成为国内厂商弯道超车的机会这意味着国产ChatGPT的落地在技术准备之外还需要两项核心要素工程化与分发能力1工程化能力即能够利用更低的成本和更高效的迭代做出先进的大模型应用制作更高效廉价贴合市场的产品能够同时容纳亿级用户在线大模型调优周期长难度大产业相关工程化经验欠缺难以实现大模型对数据的充分吸收与利用在ChatGPT之前已有多个行业领域涌现出智能化应用但其工程化落地情况并不理想ChatGPT做到了在稳定输出的同时容纳破亿月活用户具有低使用门槛高效强传播性的特点但其对于训练集群代码编译等细节的优化处理至今未披露而这些工程化细节正是国内厂商目前核心差距所在从主流科技企业用户数来看百度淘宝微信等国民级应用均能承载亿级日活我们认为国内厂商完全具备大DAU场景下AI工程化处理的潜力2充沛的C端用户及B端应用场景即更低的分发触达成本更快速的产品应用迭代此时下游流量的充沛程度便是变现的壁垒应用分发是国内企业的长项头部厂商本身已经建起规模及心智壁垒全球竞争力坚实且变现路径可以复用商业模式无需再探索如要落地AGI相关应用获客成本远低于新进入者请仔细阅读在本报告尾部的重要法律声明11证券研究报告行业深度研究报告13商业化路径已经明晰搜索场景鲜明契合除开星辰大海的展望商业化变现的落地更能驱动企业加大科技投入而类ChatGPT产品的变现逻辑已经相当坚实1为开发者直接提供API调用接口此前诸如GoogleOpenAI等头部厂商将自身开发的预训练大模型开源供下游应用者在这些模型上进行参数的微调但随着预训练语言模型的规模急剧增长出于商业角度考虑和高昂的端侧微调成本大规模预训练语言模型不再被开源转而以提供API的方式供下游用户在特定场景下进行推理使用以ChatGPT为例OpenAI并未公布其基础模型GPT35GPT4技术细节用户仅能够在自身应用内通过API调用其模型从这一角度看文心一言已经以API形式接入650家企业发布当日已有65万家企业申请测试签约5家客户为B端降本增效的起始逻辑已经明晰2模型即服务即为细分行业定制大模型厂商以公司的预训练大模型底座结合用户的数据集通过微调来提升模型在某一细分领域的表现但这一模式可能随着AGI通用人工智能的发展逐步式微因为端侧精调成本昂贵通用大模型出现后出售API接口会更主流3面向C端提供杀手级应用头部产品ChatGPT日活超一亿人SaaS公司JasperAI通过调用GPT-3API已实现超7500万美元收入国内头部科技企业既具备自建应用的能力也具备向JasperAI等广大创业公司提供API的能力4将AGI技术嵌入到自身成熟应用中提供更强用户体验进而推动用户为附加服务付费目前搜索引擎及办公软件领域已有成熟案例2022年2月微软将GPT模型嵌入至其搜索引擎Bing中NewBing能够与用户对话协助用户起草文本此外微软已经将Office365云计算模型Azure中悉数加入AI大模型线上会议软件Teams已经推出了AI撰写会议纪要和邮件的付费服务图14未接入GPT4的Bing仅对搜索结果进行简单整合图15NewBing的Chat入口可以对搜索结果进行人性化整合资料来源Bing华西证券研究所资料来源Bing华西证券研究所ToC对用户心智的冲击更为直观我们高度重视文心一言为百度搜索带来的增量搜索平台是最直观的对话模型使用场景与类ChatGPT产品双向互补1引擎的海量数据能够弥补对话模型数据更新不及时的缺陷ChatGPT的训练数据集仍停留在2021年因此难以回答时效性问题而BingChat基于搜索库内容对内容进行回答给出相应的搜索结果2GPT的语言处理能力又使得模型能够对搜索结果进行直观集成增进用户体验目前微软为NewBing设置了三种性格状态用户可根据偏好自行设定对话模型的回应风格请仔细阅读在本报告尾部的重要法律声明12证券研究报告行业深度研究报告图16NewBing能够帮助用户编写代码图17NewBing能够帮助用户进行文件阅读资料来源Bing华西证券研究所资料来源Bing华西证券研究所Bing的崛起已经证明了人工生成智能作为新介入因素能够对曾经的垄断巨头产生威胁百度将文心一言嵌入搜索具有必要性此前海内外搜索市场均呈现一家独大的格局据statcounter截至2022年6月Google在全球搜索引擎的市占率达到9242远超第二名bing的345第三名Yahoo的132但NewBing的发布打破了这一稳态dataai数据显示新功能上线当日必应Bing应用程序的全球下载量在一夜之间猛增十倍蹿升至苹果AppStore应用商店最受欢迎的免费应用榜中的第十位并使其成为第二大最受欢迎的免费生产力应用仅次于谷歌邮箱Gmail截至3月10日Bing活跃用户已突破1亿人增幅超600我们认为作为国内搜索巨头百度在搜索领域进行人工生成智能布局已经成为战略上的必需图18NewBing发布次日Bing下载量猛增758图19百度知识图谱的首要应用场景即为搜索资料来源BusinessInsider华西证券研究所资料来源百度华西证券研究所-从Bing的成功实践来看尽管接入GPT4带来了边际成本的显著增长但商业模式已经雏形初现随着用户数量级的提升用户对话带来的推理成本我们将在下文对搜索业务推理成本进行年化分析将显著拉低搜索业务的毛利率但人性化的对话体验是提升用户基数用户粘性及使用时长的利器Bing借此实现了用户数量的快速增长和变现广告引流已经开始Bing根据用户输入的问题在下方广告位对电商产品进行展示引流沿用了搜索广告的旧逻辑即基于用户的搜索关键词对应到精确的广告Chat界面事实上提供了新的广告位我们认为这只是新搜索引擎变现的起点后续微软生态内的各类插件和增值服务均有望集成至Bing带来新的商业变现机会这也是一条百度完全有能力复制的路径请仔细阅读在本报告尾部的重要法律声明13证券研究报告行业深度研究报告图20用户输入宝可梦朱紫后出现游戏购买链接图21用户输入健美运动员姓名后出现健身补剂广告资料来源Bing华西证券研究所资料来源Bing华西证券研究所请仔细阅读在本报告尾部的重要法律声明14证券研究报告行业深度研究报告2若文心一言成功对公众开放年化增量成本可控短期我们关注文心一言等产品对科技企业财务状况的影响将增量成本拆分为训练成本推理成本及数据标注成本暂不考虑人力支出及维护费用测算大模型落地搜索页面后年均增量成本约为16亿元这一金额有望随着技术进步逐步降低具体来看ChatGPT算力成本包括训练推理及数据标注1训练基于大量数据集来调整和优化模型的参数对模型做反复迭代计算是大模型落地前的成本环节2推理大模型的运行成本即模型基于用户输入信息进行推理计算并输出过程中产生的成本与用户数量3数据标注通过数据标注提高数据集质量21训练前期固定投入较大莱特定律驱动下成本必然下行假设所有厂商站在同一起跑线我们将单次训练成本的测算思路总结为训练天数x云计算成本1以达到模型预期效果所需消耗的训练token数量为基础结合GPU在训练过程中的token吞吐能力来计算在一定GPU数量下完成训练需要的天数2根据GPU数量及计算出的的训练天数假设云计算的市场价格能够代表训练过程中的硬件及能源成本取Azure公开价格但已经完成自有数据中心建设的厂商实际年化训练成本应当低于云计算市场价从而计算出多次迭代训练的年化成本参考英伟达Megatron-LM团队在2021年发表的论文完成一个Epoch的端到端训练时间具体来看关键名词可以理解为1Epoch将所有训练样本训练一次的过程当一个完整的数据集通过了神经网络一次并且返回了一次这个过程称为一次Epoch2T到模型预期效果所需消耗的训练token数量3P大模型的参数数量4N完成一次训练所需的GPU数量5XGPU能够达到的有效吞吐量根据这一计算方法考虑到GPT35系在GPT3基础上微调而成我们选取1750亿参数的GPT-3模型为样本进行测算在包含3000亿tokens的数据集上假设完成一组训练需要1024张英伟达A100芯片且GPU在训练过程中能达到的有效计算吞吐为140TFlops每秒浮点运算次数那么完成一次训练需要34天在此基础上考虑到大模型的训练过程并不是一劳永逸的我们假设完成实际训练至少需要两组芯片2046张留出试错空间为了充分进行模型训练需要不间断进行训练训练过程中会产生20的试错成本对厂商的年均实际训练成本做出调整以AzureNDA100v4series8张A100芯片的服务器三年包年月租1万美元为基准测算出采用云计算的前提下大模型的年化训练成本为229亿元但根据OpenAI数据ChatGPT离线训练成本仅为1200万美元考虑到微软前期已经进行大量硬件投入我们据此认为对于已完成自有数据中心建设的厂商实际训练成本会更低表2类ChatGPT模型年均训练成本测算训练所需GPU数量2048单台服务器GPU数量8服务器数量256单次训练时长天34年均训练次数107服务器月租成本万美元1试错空间20年均训练成本万美元3298请仔细阅读在本报告尾部的重要法律声明15证券研究报告行业深度研究报告美元汇率694年均训练成本亿元229资料来源Azure华西证券研究所美元汇率为2023年3月7日数据我们认为在人工智能领域莱特定律依然有效大模型的训练成本正随着硬件软件的优化不断降低目前海外已有成功商业化实践1莱特定律指飞机制造数量每累计增加一倍制造成本就会实现固定百分比的持续下降主要系人工熟练度的提升生产工序的优化和原材料的节约导致莱特定律的作用弹性取决于新技术的累积产量翻倍时间该过程的时间越短成本下降的作用越明显因此在技术应用早期产量翻倍时间短莱特定律作用会更显著海外机构ARK据此判断人工智能相对计算单元RCU的生产成本及软件成本将分别以每年57和47的速度下降硬件和软件的融合可以推动人工智能训练成本在2030年前每年70的速度下降参考OpenAI创始人提出每十八个月AI算力需求翻倍我们认为随着应用程度加深优化需求提升大模型的训练成本降低是必然趋势2从海外相关商业化尝试来看专业优化公司MosaicML通过下调模型参数量调升训练数据集tokens数量将具备GPT-3同等能力的大模型的一次训练成本下调至45万美元较2020年下降超90我们认为国内厂商实现同等能力只是时间问题22推理与用户数量成正比成本优化路径明确推理成本最直观实际的估算方法是参考市场上现有基础模型API的标价OpenAI为GPT3及ChatGPT先后设置的API定价分别为002美元1000tokens及0002美元1000tokens目前ChatGPT成本降低90的原因尚未披露我们综合参考SaaS业务普遍毛利率情况OneFlow测算及Azure云计算价格判断对于国内厂商而言选取GPT3的API价格而不是ChatGPT的超低价并对其进行成本溢价的调整更加合理判断合理成本约千字007人民币元中文预训练模型将中文拆成一个个的字做学习每一个token对应一个汉字我们参考NewBing数据上线ChatGPT聊天机器人功能后用户数突破一亿约13用户每日在搜索页面使用对话功能我们判断单用户对话数约在5次单次输出token约在100个相比嵌入AI后用户增长6倍的Bing国内用户基数更大AI认知程度低用户使用内嵌对话模型的比例极有可能低于13我们判断亿级日活应当是国产类ChatGPT应用更加合理的中期天花板据此测算年度推理成本约在1362亿元表3类ChatGPT应用中期年均推理成本测算类ChatGPT应用日活用户数亿人107单人单日对话次数5平均token输出个数100单日推理成本万元373年均推理成本亿元1362资料来源公司公告华西证券研究所测算尽管国内厂商难以短期内实现与OpenAI同等的成本优化程度推理成本的优化目前已经有明确的路径1压缩模型以减少总内存占用量通过使用模型压缩技术如权重共享量化和剪枝可以降低模型的内存占用量和计算复杂度从而降低推理成本2协同推理多个设备或服务器共享计算任务通过去中心化分摊成本3计算卸载部分计算任务从一个设备卸载到另一个设备从而实现对计算资源的优化分配例如将部分计算任务从CPU卸载到GPU从而提高计算效率4知识蒸请仔细阅读在本报告尾部的重要法律声明16证券研究报告行业深度研究报告馏通过让一个较小的模型学生模型学习一个较大的模型教师模型的知识可以在保持较好性能的同时降低模型的复杂度和推理成本相对于独立的模型应用搜索页面的对话模型输出效果有限科技企业出于经济考虑对细分场景下使用的模型进行推理成本优化存在极大可能性因此我们给出的推理成本预测仍有下调空间23数据标注取决于人力价格成本量级较低相比传统无监督学习的GPT模型ChatGPT表现更好的原因之一是在无监督基础上提升了训练数据的质量而实现这一点的经济成本并不高OpenAI借鉴了Facebook等社交媒体公司的做法构建一个额外的AI检测器向它提供带有暴力仇恨言论等标签的示例让它学会识别有害内容该检测器被内置到ChatGPT中以检测输出内容是否反映了其训练数据的问题并在它到达用户之前将其过滤为了获得这些不良内容的标签OpenAI在2021年11月将标注工作交给肯尼亚外包公司Sama三份合同总价仅为20万美元我们参考时代周刊调查数据数据标注员团队为30人每9小时轮班阅读和标记150至250段文字每段100-1000词不等实得工资约为每小时132美元至2美元我们据此认为数据标注目前壁垒仍集中于技术领域而从经济成本上看尽管ChatGPT的数据标注工作并非完全由Sama完成2022年2月Sama与OpenAI终止合作我们判断其完整标注成本并不高给出年化500万元的估算表4类ChatGPT应用中期年均成本测算年均训练成本亿元229年均推理成本亿元1362年均数据标注成本亿元005年均成本合计亿元1596资料来源AzureOpenAI时代周刊华西证券研究所测算综合以上分析我们粗略推测类ChatGPT应用正式运营后为公司带来的年化增量成本约为16亿元但考虑到国产模型参数量及数据集token数量均是未知且Azure云计算价格与实际成本存在偏差此外实际落地后各项成本均存在优化可能具体会计处理方式还存在探讨空间我们判断10-20亿元为其增量成本的合理范围暂不考虑人力支出及维护费用请仔细阅读在本报告尾部的重要法律声明17证券研究报告行业深度研究报告3投资建议微软新产品对公众的震撼只是前期技术突破后的余波Copilot的模型基础GPT4早在2022年8月便已训练完成而非通用人工智能领域想象力的终点产品的成功会驱动更多学术资源与产业投资的倾斜更多直接应用的突破已经箭在弦上人工智能必然成为产业发展长期主线国产替代具有需求上的紧迫性以文心一言发布为契机我们重点分析国内主流科技企业在复现ChatGPT领域需要克服的差距判断对国产大模型的发展不必过度悲观算法算力数据差距可以弥合工程化应用分发能力交互飞轮可能成为厂商弯道超车的契机具体投资机会来看依然重点推荐百度BIDUUS判断文心一言表现符合预期公司目前仍处于低估区间尽管技术差距依然存在短期内研发投入可能上行我们看好人工智能领域投入对公司业绩及估值的长线提振同时关注已在视频营销阅读等相关细分领域抢跑的重点标的推荐当虹科技捷成股份蓝色光标风语筑浙文互联4风险提示文心一言落地效果不及预期风险ToB服务推进节奏不及预期风险成本大幅增长风险AI产品道德及监管风险请仔细阅读在本报告尾部的重要法律声明18证券研究报告行业深度研究报告分析师与研究助理简介TableAuthorInfo赵琳华西证券传媒行业首席南开大学本硕本科毕业后自愿到乡村学校长期支教后担任校长期间获中国教育报头版头条关注报道2017年硕士毕业后到新时代证券从事传媒行业研究2019年加盟华西证券分析师承诺作者具有中国证券业协会授予的证券投资咨询执业资格或相当的专业胜任能力保证报告所采用的数据均来自合规渠道分析逻辑基于作者的职业理解通过合理判断并得出结论力求客观公正结论不受任何第三方的授意影响特此声明评级说明投资公司评级标准说明评级买入分析师预测在此期间股价相对强于上证指数达到或超过15以报告发布日后的6个增持分析师预测在此期间股价相对强于上证指数在515之间月内公司股价相对上证中性分析师预测在此期间股价相对上证指数在-55之间指数的涨跌幅为基准减持分析师预测在此期间股价相对弱于上证指数515之间卖出分析师预测在此期间股价相对弱于上证指数达到或超过15行业评级标准以报告发布日后的6个推荐分析师预测在此期间行业指数相对强于上证指数达到或超过10月内行业指数的涨跌幅中性分析师预测在此期间行业指数相对上证指数在-1010之间为基准回避分析师预测在此期间行业指数相对弱于上证指数达到或超过10华西证券研究所地址北京市西城区太平桥大街丰汇园11号丰汇时代大厦南座5层网址httpwwwhx168comcnhxzqhxindexhtml请仔细阅读在本报告尾部的重要法律声明19证券研究报告行业深度研究报告华西证券免责声明华西证券股份有限公司以下简称本公司具备证券投资咨询业务资格本报告仅供本公司签约客户使用本公司不会因接收人收到或者经由其他渠道转发收到本报告而直接视其为本公司客户本报告基于本公司研究所及其研究人员认为的已经公开的资料或者研究人员的实地调研资料但本公司对该等信息的准确性完整性或可靠性不作任何保证本报告所载资料意见以及推测仅于本报告发布当日的判断且这种判断受到研究方法研究依据等多方面的制约在不同时期本公司可发出与本报告所载资料意见及预测不一致的报告本公司不保证本报告所含信息始终保持在最新状态同时本公司对本报告所含信息可在不发出通知的情形下做出修改投资者需自行关注相应更新或修改在任何情况下本报告仅提供给签约客户参考使用任何信息或所表述的意见绝不构成对任何人的投资建议市场有风险投资需谨慎投资者不应将本报告视为做出投资决策的惟一参考因素亦不应认为本报告可以取代自己的判断在任何情况下本报告均未考虑到个别客户的特殊投资目标财务状况或需求不能作为客户进行客户买卖认购证券或者其他金融工具的保证或邀请在任何情况下本公司本公司员工或者其他关联方均不承诺投资者一定获利不与投资者分享投资收益也不对任何人因使用本报告而导致的任何可能损失负有任何责任投资者因使用本公司研究报告做出的任何投资决策均是独立行为与本公司本公司员工及其他关联方无关本公司建立起信息隔离墙制度跨墙制度来规范管理跨部门跨关联机构之间的信息流动务请投资者注意在法律许可的前提下本公司及其所属关联机构可能会持有报告中提到的公司所发行的证券或期权并进行证券或期权交易也可能为这些公司提供或者争取提供投资银行财务顾问或者金融产品等相关服务在法律许可的前提下本公司的董事高级职员或员工可能担任本报告所提到的公司的董事所有报告版权均归本公司所有未经本公司事先书面授权任何机构或个人不得以任何形式复制转发或公开传播本报告的全部或部分内容如需引用刊发或转载本报告需注明出处为华西证券研究所且不得对本报告进行任何有悖原意的引用删节和修改请仔细阅读在本报告尾部的重要法律声明20
 
Copyright © 2005 - 2021 Nxny.com All Rights Reserved 备案号:蜀ICP备15031742号-1