>> 开源证券-计算机行业深度报告:ChatGPT不断突破,AI驶入快车道-230222
| 上传日期: |
2023/2/22 |
大小: |
4484KB |
| 格式: |
pdf 共32页 |
来源: |
开源证券 |
| 评级: |
看好 |
作者: |
陈宝健 |
| 行业名称: |
计算机 |
| 下载权限: |
无限制-登录即可下载 |
|
|
ChatGPT:AIGC现象级应用,商业化落地打开成长空间 ChatGPT上线后热度持续提升,已超过TikTok成为活跃用户增长最快的产品。英伟达CEO黄仁勋表示“ChatGPT相当于AI界的iPhone问世”。目前ChatGPT已开启商业化探索,面向B端开放接口对外输出服务(如与微软Bing的结合);面向C端推出收费的Plus版本,月度费用为20美元/月。根据OpenAI预测,2023年将实现2亿美元收入,2024年将超过10亿美元,未来成长空间广阔。 大模型+大数据+高算力,ChatGPT不断突破 (1)预训练大模型:GPT大模型是ChatGPT的基础,目前已经过多个版本迭代,GPT-3版本参数量达1750亿,训练效果持续优化。(2)数据:数据是预训练大模型的原材料。GPT-3数据主要来自Common Crawl、新闻、帖子、书籍及各种网页,原始数据规模达45TB,训练效果大幅提升。(3)算力:微软AzureAI是OpenAI独家云计算供应商,所用超算拥有285,000个CPU内核、约10,000个GPU。在大模型、大数据和高算力的支撑下,ChatGPT技术持续突破,表现惊艳。 巨头积极布局,产业落地加速 AIGC在AI技术创新(生成算法、预训练模型、多模态技术等)、产业生态(三层生态体系雏形已现)和政策支持(北京经信局表示支持头部企业打造对标ChatGPT的大模型)共振下,有望步入发展快车道,根据腾讯研究院发布的AIGC发展趋势报告,预计2030年AIGC市场规模将达1100亿美元,前景广阔。 (1)微软:微软自2019年与OpenAI展开合作,并表示未来所有产品将全线整合ChatGPT。目前已推出引入ChatGPT技术的搜索引擎New Bing,经过测试后,71%的用户对ChatGPT版Bing满意,AI与搜索协同效果显著。 (2)谷歌:2023年2月谷歌推出对标ChatGPT的对话机器人Bard。Bard基于谷歌LaMDA模型,参数量最高达1370亿,LaMDA已经在多个维度接近人类水平。谷歌表示未来会将AI技术率先应用于搜索领域,或将与微软展开正面竞争。 (3)百度:百度在AI领域深耕数十年,在芯片、深度学习框架、大模型以及应用已形成全栈布局,已有文心一格(AI作画)、文心百中(产业搜索)产品落地。2023年2月,百度推出聊天机器人“文心一言”,目前生态合作伙伴近300家,未来可期。 投资建议 国内具有丰富应用场景和数据积累,政策环境持续优化,随着巨头的纷纷投入,有望带动AIGC相关产业链加速发展,建议积极关注。算法和场景领域受益标的包括科大讯飞、三六零、拓尔思、金山办公、福昕软件、同花顺、万兴科技、格灵深瞳、云从科技,数据领域受益标的包括海天瑞声,算力及芯片领域受益标的包括浪潮信息、中科曙光、寒武纪、景嘉微、海光信息、龙芯中科、中国长城。 风险提示:技术发展不及预期;商业落地不及预期;政策支持不及预期。
研究报告全文:计算机行业研计算机ChatGPT不断突破AI驶入快车道究2023年02月22日行业深度报告投资评级看好维持陈宝健分析师闫宁联系人chenbaojiankyseccnyanningkyseccn证书编号S0790520080001证书编号S0790121050038行业走势图ChatGPTAIGC现象级应用商业化落地打开成长空间计算机沪深30010ChatGPT上线后热度持续提升已超过TikTok成为活跃用户增长最快的产品行业0英伟达CEO黄仁勋表示ChatGPT相当于AI界的iPhone问世目前ChatGPT深-10已开启商业化探索面向B端开放接口对外输出服务如与微软Bing的结合度-19报面向C端推出收费的Plus版本月度费用为20美元月根据OpenAI预测2023-29告年将实现2亿美元收入2024年将超过10亿美元未来成长空间广阔-382022-022022-062022-10大模型大数据高算力ChatGPT不断突破数据来源聚源1预训练大模型GPT大模型是ChatGPT的基础目前已经过多个版本迭代GPT-3版本参数量达1750亿训练效果持续优化2数据数据是预训练大相关研究报告模型的原材料数据主要来自新闻帖子书籍及各种GPT-3CommonCrawl数据库潜力空间大替代正当时网页原始数据规模达45TB训练效果大幅提升3算力微软AzureAI是行业深度报告-2023221OpenAI独家云计算供应商所用超算拥有285000个CPU内核约10000个周观点寻找一季报高景气方向GPU在大模型大数据和高算力的支撑下ChatGPT技术持续突破表现惊艳行业周报-2023219巨头积极布局产业落地加速开周观点巨头纷纷入场AIGC加速AIGC在AI技术创新生成算法预训练模型多模态技术等产业生态三源落地行业周报-2023212层生态体系雏形已现和政策支持北京经信局表示支持头部企业打造对标证ChatGPT的大模型共振下有望步入发展快车道根据腾讯研究院发布的AIGC券证发展趋势报告预计2030年AIGC市场规模将达1100亿美元前景广阔券1微软微软自2019年与OpenAI展开合作并表示未来所有产品将全线整研究合ChatGPT目前已推出引入ChatGPT技术的搜索引擎NewBing经过测试后报71的用户对ChatGPT版Bing满意AI与搜索协同效果显著告2谷歌2023年2月谷歌推出对标ChatGPT的对话机器人BardBard基于谷歌LaMDA模型参数量最高达1370亿LaMDA已经在多个维度接近人类水平谷歌表示未来会将AI技术率先应用于搜索领域或将与微软展开正面竞争3百度百度在AI领域深耕数十年在芯片深度学习框架大模型以及应用已形成全栈布局已有文心一格AI作画文心百中产业搜索产品落地2023年2月百度推出聊天机器人文心一言目前生态合作伙伴近300家未来可期投资建议国内具有丰富应用场景和数据积累政策环境持续优化随着巨头的纷纷投入有望带动AIGC相关产业链加速发展建议积极关注算法和场景领域受益标的包括科大讯飞三六零拓尔思金山办公福昕软件同花顺万兴科技格灵深瞳云从科技数据领域受益标的包括海天瑞声算力及芯片领域受益标的包括浪潮信息中科曙光寒武纪景嘉微海光信息龙芯中科中国长城风险提示技术发展不及预期商业落地不及预期政策支持不及预期请务必参阅正文后面的信息披露和法律声明132行业深度报告目录1ChatGPTAIGC现象级应用商业化落地打开成长空间42大模型大数据高算力ChatGPT不断突破621预训练大模型GPT大模型多次迭代训练结果持续优化622数据数据量提升显著优化大模型表现1023算力微软是独家云计算供应商预计每月成本近千万美元123技术产业政策共振AIGC迎加速发展134巨头积极布局产业落地加速1641微软产品全线整合ChatGPT想象空间广阔1642谷歌推出对标产品Bard或将与微软正面竞争1843百度AI领域全栈布局文心一言生态持续扩大2144国内其他巨头也纷纷布局产业落地加速275投资建议296风险提示30图表目录图1ChatGPT是OpenAI于2022年11月30日发布的通用型对话系统4图2大型语言模型在多项测试中已经超过人类5图3GhatGPT日活用户超过1000万人5图4ChatGPT已推出收费的Plus版本6图5ChatGPT是以Transformer为基础的预训练模型6图6GPT大模型多次迭代参数量大幅提升7图7GPT-3系列已经发展出50多种模型7图8ChatGPT训练包括三个步骤8图9ChatGPT通过RLHF优化训练结果8图10InstructGPT相比GPT-3更符合人类偏好9图11InstructGPT较GPT-3毒性降低9图12ChatGPT的信息相比InstructGPT更加有效9图13ChatGPT在无害性方面也有所提升9图14CommonCrawl数据规模达PB级10图15CommonCrawl英文数据占比约4510图16GPT-3预训练数据量大幅提升11图17ChatGPT预训练数据仅更新至2021年11图18ChatGPT每次聊天成本约为几美分12图19AI技术持续突破创新引领AIGC产业发展13图20预训练模型通过大数据和巨量参数的训练生成质量显著提升13图21预训练大模型从单模态向多模态的发展14图22AIGC产业生态持续完善14图23微软与OpenAI持续深度合作16图24微软ChatGPT版Bing可以自动抓取关键内容并生成回答17图252022年12月GoogleBing在搜索领域的市场份额分别为840889517图262018年谷歌推出自然语言预训练模型BERT18请务必参阅正文后面的信息披露和法律声明232行业深度报告图27谷歌已将预训练模型用于改善搜索18图282023年2月谷歌推出对标ChatGPT的对话机器人Bard19图29Bard基于谷歌LaMDA模型表现已接近人类水平19图30未来谷歌AI技术将率先应用于搜索业务20图31昆仑芯2单卡算力达128TFLOPS21图32第三代昆仑芯3将采用4nm制程21图33百度飞桨是国内规模第一的深度学习框架和赋能平台21图34百度在大模型领域积累深厚22图35百度已发布4个基础通用大模型以及11个行业大模型22图36文心ERNIE大模型已在百度百余个产品中应用23图37百度推出AI作画产品文心一格23图38百度推出产业级搜索系统文心百中23图39百度即将推出对标ChatGPT的AI聊天机器人文心一言24图40ERNIE具备业界领先的复杂知识推理能力24图41百度ERNIE30可节省50训练时间25图42ERNIE30基于鹏城云脑II高性能集群训练25图43京东宣布推出产业版ChatJD27图44阿里多模态大模型M6参数规模达10万亿28图45科大讯飞已开源了6大类超过40个通用领域的中文预训练语言模型28表1ChatGPT数据主要来自CommonCrawl新闻帖子书籍及各种网页10表2GPT-3预训练数据量大幅提升11表3文心一言生态圈持续扩大25表4受益标的盈利预测和估值29请务必参阅正文后面的信息披露和法律声明332行业深度报告1ChatGPTAIGC现象级应用商业化落地打开成长空间ChatGPT是AIGC领域现象级应用ChatGPT是美国AI公司OpenAI于2022年11月30日发布的通用型对话系统可以通过模拟对话的形式完成编程问答文本生成等任务ChatGPT的持续火热成为AIGC领域现象级应用为后续商业化和应用落地打开广阔空间也为以自然语言处理为核心的认知智能技术提供广阔发展机遇英伟达CEO黄仁勋表示ChatGPT相当于AI界的iPhone问世图1ChatGPT是OpenAI于2022年11月30日发布的通用型对话系统资料来源OpenAI官网ChatGPT在多项测试中超过人类2022年包括ChatGPT在内的许多大模型的测试表现已经超出人类目前ChatGPT已经通过SAT考试商学院考试美国律师资格注册会计师医师资格等高难度考试IQ测试达83已经具备取代无意义重复性工作的能力在专业领域也具有辅助决策的潜力请务必参阅正文后面的信息披露和法律声明432行业深度报告图2大型语言模型在多项测试中已经超过人类资料来源LifeArchitectai网站ChatGPT上线后热度持续提升已超过TikTok成为活跃用户增长最快的产品ChatGPT发布一周用户数就突破100万人月访问量达2100万人次目前ChatGPT尚未披露具体的日活用户数根据ARK数据截至2023年1月预计ChatGPT全球日活用户超过1000万人图3GhatGPT日活用户超过1000万人资料来源ARK网站ChatGPT商业化已经落地未来成长空间广阔面向B端ChatGPT可以开放接口对外输出服务如与微软Bing的结合面向C端2023年2月ChatGPT已推出收费的Plus版本月度费用为20美元月并表示未来或将探索价格更低的订阅方案2B的商业方案以及数据包等选项根据OpenAI预测2023年将实现收入2亿美元2024年将超过10亿美元未来成长空间广阔请务必参阅正文后面的信息披露和法律声明532行业深度报告图4ChatGPT已推出收费的Plus版本资料来源ChatGPT官网2大模型大数据高算力ChatGPT不断突破21预训练大模型GPT大模型多次迭代训练结果持续优化ChatGPT是以Transformer为基础的预训练模型GPT的全称为GenerativePre-TrainedTransformer即生成式预训练Transfomer模型预训练模型是指通过挖掘利用大规模无标注数据学习数据中的知识与规律然后针对特定任务通过微调手工调参等阶段进入到可以大规模可复制的大工业落地阶段Transformer模型来自谷歌2017年发表的论文Attentionisallyouneed是一种采用自注意力机制的深度学习模型模型按照输入数据各部分的重要性的不同而分配不同的权重Transformer的优势在于1采用并行训练大幅提高了训练效率2在分析预测更长的文本时对间隔较长的语义具有更好的关联效果图5ChatGPT是以Transformer为基础的预训练模型资料来源AI大模型公众号请务必参阅正文后面的信息披露和法律声明632行业深度报告GPT大模型经过多次迭代参数量大幅提升谷歌发表Transformer论文后的第二年即2018年OpenAI推出基于Transformer的第一代GPT模型随后陆续推出GPT-2GPT-3InstructGPT等版本GPT模型持续迭代OpenAI于2020年5月推出第三代GPT-3模型参数量达1750亿较上一代GPT-2参数量15亿提升了两个数量级是微软同年2月推出的T-NLG模型参数量170亿的10倍成为当时最大的预训练语言模型图6GPT大模型多次迭代参数量大幅提升资料来源medium网站GPT-3系列已经发展出50多种模型GPT-3模型推出后已陆续发展出面向不同场景的模型除ChatGPT外GPT-3系列中比较流行的还有CodeX代码生成DALL-E图片生成等CodeX经过自然语言和几十亿行代码的训练可以完成PythonJavaScript等十几种语言的代码任务DALL-E于2021年5月推出可以根据文字描述生成图像和艺术作品收费价格为0016-0020美元图图7GPT-3系列已经发展出50多种模型资料来源LifeArchitectai网站请务必参阅正文后面的信息披露和法律声明732行业深度报告ChatGPT由GPT-3微调而来模型更小专注于聊天场景对比来看GPT-3是一种大型通用语言模型可以处理各种语言处理任务ChatGPT是一个较小的专用模型专为聊天应用程序设计ChatGPT训练包括三个步骤1预训练一个语言模型LM2聚合问答数据并训练一个奖励模型RewardModelRM3用强化学习RL方式微调LM此外因为引入了代码作为训练语料ChatGPT还额外产生了自动写代码和理解代码的能力图8ChatGPT训练包括三个步骤资料来源OpenAI官网ChatGPT通过RLHF优化训练结果ChatGPT基于人类反馈强化学习RLHF通过众包团队大规模开展生成结果好坏的人工标注经过多次迭代使得大模型生成结果更加无偏见和符合人类预期实现了智慧涌现的效果图9ChatGPT通过RLHF优化训练结果资料来源Huggingface网站请务必参阅正文后面的信息披露和法律声明832行业深度报告InstructGPT相比GPT-31更符合人类偏好InstructGPT是在GPT-3微调而来经过人类反馈强化学习后InstructGPT相比GPT-3在71-88的情况下更符合人类偏好2真实性显著提升在TruthfulQA测试中InstructGPT生成真实信息的频率较GPT-3提升约一倍0413vs02243在生成有毒信息方面略有改善在RealToxicity测试中InstructGPT生成有毒信息的情况包含仇恨歧视或谣言的信息较GPT-3略有改善0196vs0233图10InstructGPT相比GPT-3更符合人类偏好图11InstructGPT较GPT-3毒性降低资料来源OpenAI官网资料来源OpenAI官网ChatGPT相比InstructGPT在有效性和无害性方面有所提升比如在哥伦布如何在2015年来到美国ChatGPT会回答哥伦布在1506年去世所以他不能在2015年到达美国相比InstructGPT的回答更加合理在如何欺负JohnDoe的问题上InstructGPT会给出建议ChatGPT则会指出欺负人是不对的图12ChatGPT的信息相比InstructGPT更加有效图13ChatGPT在无害性方面也有所提升资料来源OpenAI官网资料来源OpenAI官网请务必参阅正文后面的信息披露和法律声明932行业深度报告22数据数据量提升显著优化大模型表现ChatGPT数据主要来自CommonCrawl新闻帖子书籍及各种网页CommonCrawl网页书籍维基百科对于训练的贡献量分别为6022163英文维基百科全部内容包含约30亿tokens仅占到训练数据量的3表1ChatGPT数据主要来自CommonCrawl新闻帖子书籍及各种网页ProportionDatasettokenswithintrainingCommonCrawl410billion60WebText219billion22Books112billion8Books255billion8Wikipedia3billion3数据来源维基百科开源证券研究所CommonCrawl是一个由网络爬取产生的大型免费语料库数据规模达PB级CommonCrawlCC是一个从网络抓取数据并免费开放的非盈利组织数据库包含了2008年以来的原始网页元数据和抓取文本数据规模达PB级别其中英文数据占比约45中文数据占比约5CC数据库的应用场景包括训练NLP模型网络抓取和机器学习等CC数据库对于AI的意义堪比Google对于互联网的意义重点研究实验室一般会选取纯英文过滤版C4作为数据集图14CommonCrawl数据规模达PB级图15CommonCrawl英文数据占比约45资料来源CommonCrawl官网开源证券研究所资料来源CommonCrawl官网ChatGPT的优秀表现得益于预训练数据量大幅提升GPT-3和GPT-2采用了相同的架构在模型上没有大幅修改仅用更多的数据量参数量去进行训练GPT-2的预训练数据规模约40GB约有100亿个tokensGPT-3的预训练数据是由45TB的原始语料清洗而来数据规模达570GB约有4900亿个tokensGPT-2模型参数量为15亿GPT-3参数量为1750亿由于容量和参数量的的大幅提升GPT-3的准确性也得到大幅提升已经可以生成高质量文本让人难以确定是否是人写的请务必参阅正文后面的信息披露和法律声明1032行业深度报告表2GPT-3预训练数据量大幅提升模型GPT-1GPT-2GPT-3发布时间2018年6月2019年2月2020年5月层数124896头数12-96词向量长度768160012888参数量117亿15亿1750亿预训练数据量约5GB40GB45TB数据来源维基百科开源证券研究所图16GPT-3预训练数据量大幅提升资料来源LifeArchitectai网站ChatGPT局限1ChatGPT的知识有限ChatGPT的预训练数据库只更新至2021年无法进行联网更新因此不能理解和回答2021年之后发生的事情2真实性无法保障ChatGPT的部分训练是基于从互联网上搜集的数据因此它的输出结果经常受到偏见和不准确信息的影响无法保证真实性图17ChatGPT预训练数据仅更新至2021年资料来源OpenAI官网开源证券研究所请务必参阅正文后面的信息披露和法律声明1132行业深度报告23算力微软是独家云计算供应商预计每月成本近千万美元微软AzureAI是ChatGPT独家云计算供应商根据OpenAI于2018年的统计自2012年以来AI训练任务所运用的算力每343个月就会翻倍算力需求每年长10倍ChatGPT训练的硬件为超级计算机2019年微软向OpenAI投资10亿美元双方将共同开发AzureAI超算技术微软也成为OpenAI独家云计算供应商OpenAI提供训练的超级计算机拥有约285000个CPU内核约10000个GPU每个GPU服务器拥有约400GBs的网路连接速度预计ChatGPT每月成本约为900万美元根据OpenAI的CEOSamAltman在Twitter上透露ChatGPT每次聊天成本约为几美分single-digitscentsperchat其中一部分来自Azure云服务我们假设ChatGPT日活用户为1000万人每次完整对话的成本为3美分可测算得ChatGPT每日成本约为30万美元月度成本约为900万美元图18ChatGPT每次聊天成本约为几美分资料来源Twitter请务必参阅正文后面的信息披露和法律声明1232行业深度报告3技术产业政策共振AIGC迎加速发展AI技术持续突破创新引领AIGC产业发展1算法模型方面2014年以来GANTransformerFlow-basedmodelsDiffusionmodels等深度学习生成算法持续涌现在自然语言处理NLP计算机视觉CV等领域持续应用比如谷歌的BERT和LaMDAOpenAI的GPT-3预训练模型均基于Transformer模型而来为后续ChatGPT等应用的落地奠定基础图19AI技术持续突破创新引领AIGC产业发展资料来源腾讯研究院2预训练模型方面2018年谷歌推出自然语言预训练模型BERTAI进入预训练大模型时代相比之前的生成模型预训练模型通过大数据和巨量参数的训练生成质量显著提升满足下游场景对高精度高质量的要求成为了AI技术发展的范式变革引发了AIGC产业的质变在自然语言处理领域大模型的自然语言理解能力超越了人类并且体现出了超强的通用AI能力在计算机视觉领域预训练大模型的效果也超越了之前的监督学习方法在视觉分类图像分割等任务中取得了很大提升且表现出了强大的图像理解能力图20预训练模型通过大数据和巨量参数的训练生成质量显著提升资料来源AI大模型公众号请务必参阅正文后面的信息披露和法律声明1332行业深度报告3多模态技术方面多模态技术是指将图像声音文字等多类型内容融合学习比如将人这一文本与人的图片联系在一起从单模态向多模态的发展丰富了AIGC的内容使AIGC应用更具有通用性在视觉问答视觉推理等任务中取得了非常好的效果比如OpenAIDALL-E和百度的文心ERNIEViLG根据用户输入的文字即可生成出图片图21预训练大模型从单模态向多模态的发展资料来源AI大模型公众号AIGC产业生态持续完善已经进入产业落地的关键期AIGC产业链包括底层的芯片和数据服务支撑基础算法平台以及下游的行业应用图22AIGC产业生态持续完善资料来源IDC官网请务必参阅正文后面的信息披露和法律声明1432行业深度报告1基础算法平台方面预训练大模型需要高成本和技术投入具有较高的技术门槛行业参与者主要为头部科技企业和科研机构等以及一些垂直场景的公司2下游的行业应用方面大模型的落地痛点在于成本高昂的通用大模型与下游垂直应用场景需求的不匹配随着ChatGPT热度持续提升以及大厂的持续投入有望直接刺激下游付费意愿提升进一步加速AIGC应用落地和商业变现AIGC产业迎来发展良机政策支持落地AIGC有望迎来加速发展2月13日北京市经信局表示支持头部企业打造对标ChatGPT的大模型着力构建开源框架和通用大模型的应用生态加强人工智能算力基础设施布局加速人工智能基础数据供给支持人工智能优势企业在自动驾驶智能制造智慧城市等优势领域开展创新应用全面构筑人工智能场景创新高地北京经信局明确表示支持头部企业打造对标ChatGPT的大模型支持算力数据应用等相关产业协同发展AIGC行业从市场关注上升至政策支持层面预计2030年AIGC市场规模将达1100亿美元根据腾讯研究院发布的AIGC发展趋势报告AIGC在AI技术创新生成算法预训练模型多模态技术等和产业生态三层生态体系雏形已现的支持下有望步入发展快车道预计2030年AIGC市场规模将达1100亿美元请务必参阅正文后面的信息披露和法律声明1532行业深度报告4巨头积极布局产业落地加速41微软产品全线整合ChatGPT想象空间广阔微软与OpenAI持续深度合作是其独家云服务供应商2019年7月微软对OpenAI投资10亿美元OpenAI将服务移植在MicrosoftAzure上运行微软将成为OpenAI新技术商业化的首选合作伙伴2020年9月微软获得OpenAI的GPT-3模型独家授权OpenAI将继续向公众提供API只有微软可以访问GPT-3的底层代码并可以根据需要嵌入或修改模型2023年1月微软AzureOpenAI服务对外发布企业客户可以申请访问OpenAI旗下GPT-35Codex和DALLE2模型图23微软与OpenAI持续深度合作资料来源微软官网微软计划将ChatGPT整合进所有产品2023年2月2日微软宣布旗下所有产品将全线整合ChatGPT进一步加大与ChatGPT合作2023年2月7日微软推出引入ChatGPT技术的搜索引擎NewBing和浏览器Edge新Bing搜索栏升级为向我提问吧的对话框用户提出问题后搜索引擎可以自动抓取关键内容并生成回答请务必参阅正文后面的信息披露和法律声明1632行业深度报告图24微软ChatGPT版Bing可以自动抓取关键内容并生成回答资料来源BingChatGPT与搜索结合可改善搜索体验ChatGPT的对话模式对于用户更有吸引力由于训练数据有限同时真实性也无法得到保障尚不具备替代搜索引擎的能力ChatGPT与搜索结合则可以结合搜索和聊天的有点大幅改善搜索体验根据微软的调研显示71的用户对ChatGPT版Bing满意搜索与AI技术协同作用显著根据Statista数据截至2022年12月GoogleBing在搜索领域的市场份额分别为8408895微软推出结合ChatGPT版新Bing具备先发优势未来市场份额有望提升图252022年12月GoogleBing在搜索领域的市场份额分别为8408895资料来源Statista请务必参阅正文后面的信息披露和法律声明1732行业深度报告42谷歌推出对标产品Bard或将与微软正面竞争2018年谷歌推出自然语言预训练模型BERTBERTBidirectionalEncoderRepresentationsfromTransformers和ChatGPT同样以Transformers为基础模型BERT采用双向编码器表示技术在理解上下文方面有更好的表现数据方面BERT训练数据采用了开源语料BooksCropus以及英文维基百科数据共有约33亿个词参数方面基础版本base参数量为11亿大号版本large参数量达34亿训练方面大号版本BERT一次训练需要16个TPU集群约64TPU训练5天图262018年谷歌推出自然语言预训练模型BERT资料来源BERTPre-trainingofDeepBidirectionalTransformersforLanguageUnderstanding谷歌已将BERT模型用于改善搜索BERT模型可以借助某个单词前后的词来考虑其所处的完整语境应用于搜索引擎后更好的理解用户搜索意图2019年谷歌宣布将BERT模型应用于用于英文搜索随后又拓展至70余种语言2020年谷歌表示几乎所有英文搜索应用了BERT模型图27谷歌已将预训练模型用于改善搜索资料来源谷歌官网2023年2月谷歌推出对标ChatGPT的对话机器人Bard根据谷歌介绍Bard是由LaMDA提供支持的全新实验性对话谷歌AI服务寻求将世界知识的广度与谷歌大型语言模型的力量智慧和创造力相结合它利用来自网络的信息提供最新高质量的回复请务必参阅正文后面的信息披露和法律声明1832行业深度报告图282023年2月谷歌推出对标ChatGPT的对话机器人Bard资料来源谷歌官网Bard基于谷歌LaMDA模型表现已接近人类水平LaMDA同样以transformer模型为基础预训练数据库由156万亿个单词的文档和对话构成参数量最高达1370亿是GPT-3的78倍根据谷歌的测试经过微调后LaMDA已经在多个维度接近人类水平目前谷歌聊天机器人Bard仍处于内测阶段尚未对外开放图29Bard基于谷歌LaMDA模型表现已接近人类水平资料来源谷歌官网请务必参阅正文后面的信息披露和法律声明1932行业深度报告未来谷歌AI技术将率先应用于搜索业务在AI领域谷歌已有LaMDAPaLMImagenMusicLM等技术储备涵盖语言图像视频和音频领域未来将陆续整合进公司旗下产品谷歌表示AI技术将率先应用于搜索业务自动提炼搜索结果便于了解全局目前微软已经推出整合ChatGPT版本的搜索引擎NewBing未来或将与谷歌展开正面竞争图30未来谷歌AI技术将率先应用于搜索业务资料来源谷歌官网请务必参阅正文后面的信息披露和法律声明2032
|
|