研报下载就选股票报告网
您好,欢迎来到股票分析报告网!登录   忘记密码   注册
>> 民生证券-计算机行业ChatGPT系列报告-百度、三六零与科大讯飞:谁是ChatGPT“国家队”?-230213
上传日期:   2023/2/14 大小:   1187KB
格式:   pdf  共5页 来源:   民生证券
评级:   推荐 作者:   吕伟
行业名称:   计算机
下载权限:   此报告为加密报告
从开源模型GPT-2迈向通用模型的ChatGPT。自2017年6月,Google发布论文《Attentionisallyouneed》,首次提出Transformer模型,成为GPT发展的基础;2018年-2020年,OpenAI基于Transformer模型发布多篇论文,并陆续提出GPT-1、GPT-2、GPT-3的三类语言模型,并在2022年2月发布论文《 Training language models to follow instructions with humanfeedback》(使用人类反馈指令流来训练语言模型),公布InstructionGPT模型,随后在2022年11月30日,OpenAI推出ChatGPT模型,并提供试用。仅仅不足6年时间,ChatGPT走完从理论到现实的历程,其核心催化在于算法+数据+算力的共振。
  模型的进步是算法+算力的加持下,通过海量参数带来从量变到质变的升华。GPT模型依托于Transformer解除了顺序关联和依赖性的前提,提出一个建设性的主张:先通过大量的无监督预训练(Unsupervisedpre-training),再通过少量有监督微调(Supervisedfine-tunning),来修正其理解能力。整个算法模型包含三个步骤:1.人类反馈强化学习(RLHF);2.收集参照参数并训练奖励模型;3.使用PPO算法进一步对GPT实现的内容进行强化学习加成,从人类偏好学习模型解决了强化学习对奖励机制保持一致的高度依赖。而复盘技术路径,算法模型在2017年时已被提出,从GPT-1到ChatGPT依然遵循Transformer的框架。而真正带来升华的是在高性能算力加持下,通过优质数据的不断迭代演变而来。
  高质量的数据资源是推动GPT进化的重要抓手。从GPT-1的1.17亿参数到GPT-2的15亿参数,再到GPT-3划时代的1750亿参数,OpenAI依托筛选过的优质数据形成参数量的阶梯式上升,最终带来GPT-3乃至ChatGPT具备理解上下文、连贯性等诸多先进特征。
  在提出GPT-3的论文《LanguageModelsareFew-ShotLearners》中,OpenAI在收集近一万亿文字(参数)的数据库后,放弃直接使用海量数据训练模型,而是转向通过三种模式筛选优质数据进行训练,从而从万亿参数归纳出众人所熟知的1750亿参数,其核心原因在于“未经过滤或轻度过滤的爬虫数据往往比筛选后数据集质量更低”。
  论文中所用的三种筛选数据模式如下:
  1)根据与一系列高质量参考语料库的相似度比较,从而过滤出的爬虫数据;
  2)通过对数据集内部和跨数据集的文档上执行重复数据的删除;
  3)将已知的高质量参考语料库添加到训练组合中,以增强数据集的多样性。
  根据OpenAI的设计,在筛选出的优质数据下,最终训练出的GPT-3成本极其高昂。即使在团队明确发现失误的前提下,依然无法承担二次训练的代价,其本质原因在于优质数据的来源是OpenAI通过大量前期的工作筛选而成。通过梳理,筛选后的数据主要分为:1)过滤后的爬虫数据、2)WebText2的数据集、3)一号图书馆数据、4)二号图书馆数据、5)英文版的维基百科等五种。而将五类数据映射至国内,我们发现在互联网高歌猛进的建设中,我国天然具备五类数据的优质土壤。
  以百度、360和科大讯飞为代表的通用模型中国队,同时具备模型+算力+数据的天然属性。在模型上,无论是GPT-3、亦或是ChatGPT,其底层的技术仍未跳出2017年Transformer模型的框架。1)三六零:根据2月7日,公司在互动平台上的回答,公司的搜索引擎团队及人工智能研究院从2020年开始一直在包括类ChatGPT、文本生成图像等技术在内的AIGC技术上有持续性的研发及算力投入,目前公司的类ChatGPT技术的各项指标已实现强于GPT-2的水平,并在中文语境下实际效果强于ChatGPT2;2)百度公众号宣布将在3月上线类ChatGPT应用“文心一言”;3)在NLP所在的认知智能领域,科大讯飞主导承建了认知智能全国重点实验室(科技部首批20家标杆全国重点实验室之一),多年来始终保持关键核心技术处于世界前沿水平,并在去年获得CommonsenseQA2.0、OpenBookQA等12项认知智能领域权威评测的第一;4)浪潮信息发布的源1.0,作为人工智能巨量模型,单体模型参数量达到2457亿,超越美国OpenAI组织研发的GPT-3模型,成为全球最大规模的中文语料AI巨量模型。
  结合OpenAI以非盈利的模式下,仅仅在一年多便从GPT-2升级到GPT-3,我们判断百度、三六零以及科大讯飞为代表中国队,在模型上的差距有望在一定时间内实现追平。
  在算力上,OpenAI的算力依托于微软为其推出的超级计算机,根据微软表示,最新与OpenAI和合作研发的这款超级计算机居于世界Top5之列。而根据2022年6月1日新华网的报道,2022年上半年的全球超级计算机500强榜单中,中国共有173台超算上榜,上榜总数蝉联第一。同时,百度智能云落地新一代高性能AI计算集群,成为领先的AI原生云算力底座。研究人员可基于全新发布的实例组建上千节点规模的超高性能计算集群,成倍缩短超大AI模型的训练时间。经过百度内部NLP研究团队的验证,在这个网络环境下的超大规模集群上提交千亿模型训练作业时,同等机器规模下整体训练效率是普通GPU集群的3.87倍。我们认为,即使国内
研究报告全文:ChatGPT系列报告百度三六零与科大讯飞谁是ChatGPT国家队2023年02月13日TableAuthor分析师吕伟执业证号S0100521110003电话021-80508288邮箱lvweiyjmszqcom从开源模型GPT-2迈向通用模型的ChatGPT自2017年6月Google推荐维持评级发布论文Attentionisallyouneed首次提出Transformer模型成为GPT发展的基础2018年-2020年OpenAI基于Transformer模型发布多篇论文并陆续提出GPT-1GPT-2GPT-3的三类语言模型并在2022年2月发布论相关研究文Traininglanguagemodelstofollowinstructionswithhuman1计算机周报20230212ChatGPT有望带feedback使用人类反馈指令流来训练语言模型公布InstructionGPT模型来5G消息的业务重构-20230212随后在2022年11月30日OpenAI推出ChatGPT模型并提供试用仅仅2计算机行业点评计算机行业估值洼地支不足6年时间ChatGPT走完从理论到现实的历程其核心催化在于算法数付板块-202302123计算机行业事件点评数字经济有望进入政据算力的共振策密集催化期-202302074计算机周报20230205预期差最大的主图1ChatGPT的发展历程线央企搭台AI唱戏-202302055密码安全深度报告密码信创与数据安全皇冠上的明珠-20230130资料来源openAI官网民生证券研究院整理模型的进步是算法算力的加持下通过海量参数带来从量变到质变的升华GPT模型依托于Transformer解除了顺序关联和依赖性的前提提出一个建设性的主张先通过大量的无监督预训练Unsupervisedpre-training再通过少量有监督微调Supervisedfine-tunning来修正其理解能力整个算法模型包含三个步骤1人类反馈强化学习RLHF2收集参照参数并训练奖励模型3使用PPO算法进一步对GPT实现的内容进行强化学习加成从人类偏好学习模型解决了强化学习对奖励机制保持一致的高度依赖而复盘技术路径算法模型在2017年时已被提出从GPT-1到ChatGPT依然遵循Transformer的框架而真正带来升华的是在高性能算力加持下通过优质数据的不断迭代演变而来本公司具备证券投资咨询业务资格请务必阅读最后一页免责声明证券研究报告1行业点评计算机高质量的数据资源是推动GPT进化的重要抓手从GPT-1的117亿参数到GPT-2的15亿参数再到GPT-3划时代的1750亿参数OpenAI依托筛选过的优质数据形成参数量的阶梯式上升最终带来GPT-3乃至ChatGPT具备理解上下文连贯性等诸多先进特征在提出GPT-3的论文LanguageModelsareFew-ShotLearners中OpenAI在收集近一万亿文字参数的数据库后放弃直接使用海量数据训练模型而是转向通过三种模式筛选优质数据进行训练从而从万亿参数归纳出众人所熟知的1750亿参数其核心原因在于未经过滤或轻度过滤的爬虫数据往往比筛选后数据集质量更低图2放弃使用万亿数据集的原因资料来源TomBBrown等作者LanguageModelsareFew-ShotLearners民生证券研究院论文中所用的三种筛选数据模式如下1根据与一系列高质量参考语料库的相似度比较从而过滤出的爬虫数据2通过对数据集内部和跨数据集的文档上执行重复数据的删除3将已知的高质量参考语料库添加到训练组合中以增强数据集的多样性图3三种筛选数据模式资料来源TomBBrown等作者LanguageModelsareFew-ShotLearners民生证券研究院根据OpenAI的设计在筛选出的优质数据下最终训练出的GPT-3成本极其高昂即使在团队明确发现失误的前提下依然无法承担二次训练的代价其本质原因在于优质数据的来源是OpenAI通过大量前期的工作筛选而成通过梳理筛选后的数据主要分为1过滤后的爬虫数据2WebText2的数据集3一号图书馆数据4二号图书馆数据5英文版的维基百科等五种而将五类数据映射至国内我们发现在互联网高歌猛进的建设中我国天然具备五类数据的优质土壤本公司具备证券投资咨询业务资格请务必阅读最后一页免责声明证券研究报告2行业点评计算机图4筛选后的不同种类数据在训练中的情况资料来源TomBBrown等作者LanguageModelsareFew-ShotLearners民生证券研究院以百度360和科大讯飞为代表的通用模型中国队同时具备模型算力数据的天然属性在模型上无论是GPT-3亦或是ChatGPT其底层的技术仍未跳出2017年Transformer模型的框架1三六零根据2月7日公司在互动平台上的回答公司的搜索引擎团队及人工智能研究院从2020年开始一直在包括类ChatGPT文本生成图像等技术在内的AIGC技术上有持续性的研发及算力投入目前公司的类ChatGPT技术的各项指标已实现强于GPT-2的水平并在中文语境下实际效果强于ChatGPT22百度公众号宣布将在3月上线类ChatGPT应用文心一言3在NLP所在的认知智能领域科大讯飞主导承建了认知智能全国重点实验室科技部首批20家标杆全国重点实验室之一多年来始终保持关键核心技术处于世界前沿水平并在去年获得CommonsenseQA20OpenBookQA等12项认知智能领域权威评测的第一4浪潮信息发布的源10作为人工智能巨量模型单体模型参数量达到2457亿超越美国OpenAI组织研发的GPT-3模型成为全球最大规模的中文语料AI巨量模型结合OpenAI以非盈利的模式下仅仅在一年多便从GPT-2升级到GPT-3我们判断百度三六零以及科大讯飞为代表中国队在模型上的差距有望在一定时间内实现追平在算力上OpenAI的算力依托于微软为其推出的超级计算机根据微软表示最新与OpenAI和合作研发的这款超级计算机居于世界Top5之列而根据2022年6月1日新华网的报道2022年上半年的全球超级计算机500强榜单中中国共有173台超算上榜上榜总数蝉联第一同时百度智能云落地新一代高性能AI计算集群成为领先的AI原生云算力底座研究人员可基于全新发布的实例组建上千节点规模的超高性能计算集群成倍缩短超大AI模型的训练时间经过百度内部NLP研究团队的验证在这个网络环境下的超大规模集群上提交千亿模型训练作业时同等机器规模下整体训练效率是普通GPU集群的387倍我们认为即使国内厂商在单颗芯片的算力上无法达到欧美水准但通过组建多个算力集群叠加多员工迭代的加持上将进一步抹平算力上的差距以三六零为例截至2022年半年报公司货币资金超200亿2021年研发投入超30亿具备充足资金储备面对算力竞赛的格局三大巨头具备国内海量优质数据的优势通过对GPT-3的五类数据分类以百度360和科大讯飞为代表的国内厂商天然具备优质数据的储存如百度和三六零同时具备类似CommonCrawlfiltered的数据对标Reddit的百度知道和360问答以及对标维基百科的百度百科和360百科两者更是国内搜索引擎第一与第二的龙头厂商根据2月7日三六零在互动平台的回答目前360搜索是本公司具备证券投资咨询业务资格请务必阅读最后一页免责声明证券研究报告3行业点评计算机中国搜索引擎的Top2市场份额为35海量数据存于自身天然具备数据清洗和数据迭代的核心功能而科大讯飞AI训练模型依托自身在医疗领域和教育领域的领军地位通过教育领域的成绩单和题库以及医疗领域大量的处方单和病例等专业数据支撑自身专业AI布局形成专用领域数据闭环的功能表1OpenAI的五类数据在国内的类似模式OpenAI筛选后的优质数据类型说明国内对应类型百度爬虫和360搜CommonCrawlfiltered过滤后的爬虫数据索蜘蛛等来自从Reddit的大于4500知乎豆瓣百度知WebText2万个网页的文本的筛选道360问答等科大讯飞教育医疗Books1图书库等专业数据中国知网万方中国期刊网等科大讯飞教育医疗Books2图书库等专业数据中国知网万方中国期刊网等百度百科360百科Wikipedia英文版的维基百科等资料来源OpenAI民生证券研究院整理投资建议百度和360作为国内前二的两大搜索引擎具备海量通用数据之外着重布局国家与科技巨头算力军备竞赛环节均构建算法数据算力三大核心能力或将成为国内通用算法的领军企业科大讯飞通过在NLP方面长期的技术优势构建讯飞开放平台提供超过500项AI产品及方案并链接500万合作伙伴共建人工智能生态结合自身在教育医疗翻译金融和司法等专业领域的数据积累有望形成通用专项模型的共振在ChatGPT带来业务逻辑质变重估的趋势下充分看好三者在通用模型的核心竞争力维持推荐评级三六零科大讯由于2022年疫情反复带来订单交付延期和费用率上升等原因对应调整相关公司盈利预测三六零预计2022-2024年归母净利润为-24495011170亿元23-24年对应PE为104X45X科大讯飞预计2022-2024年归母净利润为55717322759亿元23-24年对应PE为64X40X建议重点关注百度集团-SW风险提示技术落地不及预期竞争格局加剧重点公司盈利预测估值与评级股价EPS元PE倍代码简称评级元2021A2022E2023E2021A2022E2023E601360三六零937013-03400758104推荐002230科大讯飞47910670240757220064推荐9888HK百度集团1218351263548324622未评级资料来源Wind民生证券研究院预测注股价为2022年2月10日收盘价未覆盖公司数据采用wind一致预百度股价基于2月10日108675换算而成本公司具备证券投资咨询业务资格请务必阅读最后一页免责声明证券研究报告4行业点评计算机分析师承诺本报告署名分析师具有中国证券业协会授予的证券投资咨询执业资格并登记为注册分析师基于认真审慎的工作态度专业严谨的研究方法与分析逻辑得出研究结论独立客观地出具本报告并对本报告的内容和观点负责本报告清晰准确地反映了研究人员的研究观点结论不受任何第三方的授意影响研究人员不曾因不因也将不会因本报告中的具体推荐意见或观点而直接或间接收到任何形式的补偿评级说明投资建议评级标准评级说明推荐相对基准指数涨幅15以上以报告发布日后的12个月内公司股价或行业指谨慎推荐相对基准指数涨幅515之间公司评级数相对同期基准指数的涨跌幅为基准其中A中性相对基准指数涨幅-55之间股以沪深300指数为基准新三板以三板成指或回避相对基准指数跌幅5以上三板做市指数为基准港股以恒生指数为基准美股以纳斯达克综合指数或标普500指数为基推荐相对基准指数涨幅5以上准行业评级中性相对基准指数涨幅-55之间回避相对基准指数跌幅5以上免责声明民生证券股份有限公司以下简称本公司具有中国证监会许可的证券投资咨询业务资格本报告仅供本公司境内客户使用本公司不会因接收人收到本报告而视其为客户本报告仅为参考之用并不构成对客户的投资建议不应被视为买卖任何证券金融工具的要约或要约邀请本报告所包含的观点及建议并未考虑个别客户的特殊状况目标或需要客户应当充分考虑自身特定状况不应单纯依靠本报告所载的内容而取代个人的独立判断在任何情况下本公司不对任何人因使用本报告中的任何内容而导致的任何可能的损失负任何责任本报告是基于已公开信息撰写但本公司不保证该等信息的准确性或完整性本报告所载的资料意见及预测仅反映本公司于发布本报告当日的判断且预测方法及结果存在一定程度局限性在不同时期本公司可发出与本报告所刊载的意见预测不一致的报告但本公司没有义务和责任及时更新本报告所涉及的内容并通知客户在法律允许的情况下本公司及其附属机构可能持有报告中提及的公司所发行证券的头寸并进行交易也可能为这些公司提供或正在争取提供投资银行财务顾问咨询服务等相关服务本公司的员工可能担任本报告所提及的公司的董事客户应充分考虑可能存在的利益冲突勿将本报告作为投资决策的唯一参考依据若本公司以外的金融机构发送本报告则由该金融机构独自为此发送行为负责该机构的客户应联系该机构以交易本报告提及的证券或要求获悉更详细的信息本报告不构成本公司向发送本报告金融机构之客户提供的投资建议本公司不会因任何机构或个人从其他机构获得本报告而将其视为本公司客户本报告的版权仅归本公司所有未经书面许可任何机构或个人不得以任何形式任何目的进行翻版转载发表篡改或引用所有在本报告中使用的商标服务标识及标记除非另有说明均为本公司的商标服务标识及标记本公司版权所有并保留一切权利民生证券研究院上海上海市浦东新区浦明路8号财富金融广场1幢5F200120北京北京市东城区建国门内大街28号民生金融中心A座18层100005深圳广东省深圳市福田区益田路6001号太平金融大厦32层05单元518026本公司具备证券投资咨询业务资格请务必阅读最后一页免责声明证券研究报告5
 
Copyright © 2005 - 2021 Nxny.com All Rights Reserved 备案号:蜀ICP备15031742号-1