>> 中信证券-计算机行业“智能网联”系列报告26-GPT:大模型多模态应用展望-230312
| 上传日期: |
2023/3/13 |
大小: |
4001KB |
| 格式: |
pdf 共43页 |
来源: |
中信证券 |
| 评级: |
-- |
作者: |
杨泽原,丁奇,潘儒琛 |
| 行业名称: |
计算机 |
| 下载权限: |
此报告为加密报告 |
|
|
ChatGPT通过大模型突破AI瓶颈,GPT-4多模态应用带动商业化加速。 ChatGPT凭借大算力、大规模数据训练、基于人类知识的强化学习等方式突破AI技术瓶颈,获得超预期的用户体验效果与市场反响。回顾GPT系列模型演进,GPT-1结合无监督预训练与有监督微调过程,GPT-2突出零样本设定,GPT-3强调上下文学习能力,参数量、训练数据量不断提升。我们预计即将推出的GPT-4或支持多模态应用,开启通往人工通用智能(AGI)之路,并有望控制训练成本,降低使用门槛。目前,ChatGPT已在C端推出ChatGPTPlus订阅计划,B端开放ChatGPTAPI,且成本降低为0.002美金/1000token,海外多个应用率先接入。我们预计在GPT-4带动下,未来大模型以及多模态模型的商业化应用将进一步加速,带动行业景气度持续向上。 Transformer架构支撑GPT走向多模态,构筑AIGC领域核心基石。 GPT系列模型使用Transformer架构,当前基于Transformer的多模态研究为AI领域研究热点,Transformer已开始打破NLP与CV领域壁垒,有望支撑GPT系列模型走向多模态应用,构筑AIGC领域核心能力基石。我们梳理出GPT的潜在基础能力包括文本生成(分析)、代码生成、对话交互、机器翻译、图像生成、视频生成等。我们认为,前述基础能力将支撑GPT系列模型在通用与垂直领域的应用,典型应用场景如:通用领域—搜索引擎/办公软件,垂直领域—教育/金融/医疗/图像视频等。 通用与垂直场景多点开花,GPT变革内容生成与交互方式。 GPT有望革新各行各业的内容生成与交互方式。基于GPT+文本&代码&对话&翻译&图像&视频,我们看好GPT类技术未来在通用与垂直场景的应用空间。例如,搜索引擎结合GPT将重塑搜索结果呈现方式,多模态的引入带来一站式的文本、图像、视频汇集结果,将大为提升用户信息收集效率,百度文心一言有望引领用户搜索体验的代际变革;在办公软件领域,金山WPS、福昕PDF未来若结合多模态GPT,有望深化用户在流程/事务/知识/创意/协作型等多类工作事项上的智能办公体验,同时支撑产品打开客单价提升空间;讯飞将以AI学习机率先落地类ChatGPT技术,有望在作文辅导、口语学习方面实现跃升;当虹科技具有视频AI建模能力、落地AIGC相关技术,GPT赋能下或进一步深化传媒、安全领域应用。 投资策略:伴随成本下降以及多模态的持续演进,GPT等大模型有望构筑AIGC核心基石,推动AI商业化进程加速和市场天花板打开。建议持续关注相关领域的AI公司:1)应用层:AI+行业:办公—金山办公、福昕软件,教育—科大讯飞,金融—同花顺、东方财富,医疗—创业慧康、卫宁健康,图像视频—商汤科技、当虹科技、云从科技、格灵深瞳、创新奇智、虹软科技、魅视科技,其他-拓尔思、汉王科技、海天瑞声等;2)基础设施层:海光信息、景嘉微、寒武纪、浪潮信息、工业富联、中科曙光等。 风险提示:AI核心技术发展不及预期风险;科技领域政策监督收紧风险;企业数据安全风险;信息安全风险;行业竞争加剧风险。
研究报告全文:计算机行业智能网联系列报告26GPT大模型多模态应用展望杨泽原丁奇潘儒琛李康桥中信证券研究部计算机组2023年3月12日请务必阅读末页的免责条款和声明核心观点ChatGPT通过大模型突破AI瓶颈GPT-4多模态应用带动商业化加速ChatGPT凭借大算力大规模数据训练基于人类知识的强化学习等方式突破AI技术瓶颈获得超预期的用户体验效果与市场反响回顾GPT系列模型演进GPT-1结合无监督预训练与有监督微调过程GPT-2突出零样本设定GPT-3强调上下文学习能力参数量训练数据量不断提升我们预计即将推出的GPT-4或支持多模态应用开启通往人工通用智能AGI之路并有望控制训练成本降低使用门槛目前ChatGPT已在C端推出ChatGPTPlus订阅计划B端开放ChatGPTAPI且成本降低为0002美金1000token海外多个应用率先接入我们预计在GPT-4带动下未来大模型以及多模态模型的商业化应用将进一步加速带动行业景气度持续向上Transformer架构支撑GPT走向多模态构筑AIGC领域核心基石GPT系列模型使用Transformer架构当前基于Transformer的多模态研究为AI领域研究热点Transformer已开始打破NLP与CV领域壁垒有望支撑GPT系列模型走向多模态应用构筑AIGC领域核心能力基石我们梳理出GPT的潜在基础能力包括文本生成分析代码生成对话交互机器翻译图像生成视频生成等我们认为前述基础能力将支撑GPT系列模型在通用与垂直领域的应用典型应用场景如通用领域搜索引擎办公软件垂直领域教育金融医疗图像视频等通用与垂直场景多点开花GPT变革内容生成与交互方式GPT有望革新各行各业的内容生成与交互方式基于GPT文本代码对话翻译图像视频我们看好GPT类技术未来在通用与垂直场景的应用空间例如搜索引擎结合GPT将重塑搜索结果呈现方式多模态的引入带来一站式的文本图像视频汇集结果将大为提升用户信息收集效率百度文心一言有望引领用户搜索体验的代际变革在办公软件领域金山WPS福昕PDF未来若结合多模态GPT有望深化用户在流程事务知识创意协作型等多类工作事项上的智能办公体验同时支撑产品打开客单价提升空间讯飞将以AI学习机率先落地类ChatGPT技术有望在作文辅导口语学习方面实现跃升当虹科技具有视频AI建模能力落地AIGC相关技术GPT赋能下或进一步深化传媒安全领域应用投资策略伴随成本下降以及多模态的持续演进GPT等大模型有望构筑AIGC核心基石推动AI商业化进程加速和市场天花板打开建议持续关注相关领域的AI公司1应用层AI行业办公金山办公福昕软件教育科大讯飞金融同花顺东方财富医疗创业慧康卫宁健康图像视频商汤科技当虹科技云从科技格灵深瞳创新奇智虹软科技魅视科技其他-拓尔思汉王科技海天瑞声等2基础设施层海光信息景嘉微寒武纪浪潮信息工业富联中科曙光等风险提示AI核心技术发展不及预期风险科技领域政策监督收紧风险企业数据安全风险信息安全风险行业竞争加剧风险2CONTENTS目录1ChatGPT通过大模型突破AI瓶颈GPT-4多模态应用带动商业化加速2Transformer架构支撑GPT走向多模态构筑AIGC领域核心基石3通用与垂直场景多点开花GPT变革内容生成与交互方式4投资策略5风险提示31ChatGPT通过大模型突破AI瓶颈GPT-4多模态应用带动商业化加速411概述ChatGPT为NLP下的AI大模型性能和使用体验超预期ChatGPT是自然语言处理NLP下的AI大模型通过大算力大规模训练数据突破AI瓶颈2022年11月OpenAI推出ChatGPTChatGPT基于GPT-35使用人类反馈强化学习技术将人类偏好作为奖励信号并微调模型实现有逻辑的对话能力ChatGPT本质上是通过超大的统计语言模型对词语序列的概率分布进行建模利用上下文信息预测后续词语出现的概率分布其表现的超预期反映了在算力水平提升的情况下大语言模型技术路线的成功通过对大规模的未标注的文本数据进行训练突破了AI发展的技术瓶颈根据瞭望新闻周刊报道OpenAI为了让ChatGPT的语言合成结果更自然流畅使用了45TB的数据近1万亿个单词来训练模型训练一次的成本高达千万美元一个月的运营成本需要数百万美元ChatGPT帮助用户给邻居写信ChatGPT帮助用户debug5资料来源OpenAI官网资料来源OpenAI官网11概述OpenAI倾力打造ChatGPT获得微软有力加持ChatGPT出自美国AI创业公司OpenAI是AI大模型领域的领军者OpenAI在2015年由SamAltmanPeterThielReidHoffmanElonMusk等人创办公司成立之初即确定了包括制造通用机器人和使用自然语言的聊天机器人的发展目标2019年OpenAI获得来自微软的10亿美元投资为Azure云端平台服务开发AI技术2018年起OpenAI开始发布GPTGenerativePre-trainedTransformer模型2020年发布GPT-3可以完成答题写论文代码生成等任务被视为人工智能竞赛的里程碑事件并直至ChatGPT的推出引起AI的热潮除了NLP领域OpenAI还在多模态领域取得成就包括发布了AI图像生成器DALL-E2对音频转录编辑器DescriptAI笔记应用Mem等进行投资OpenAI发展历程发布Proximal研究从文本创建图OpenAI成立马发布GPT-2获微Policy像神经网络斯克等人参与软10亿美元投资Optimization算法DALLE20152016201720182019202020212022OpenAI宣布其发展的主要目标发布GPT-3开发布人工智能系发布第一个项发布GPT-1放人工智能应用统DALLE2与目OpenAI程序接口ChatGPTGymBeta6资料来源OpenAI官网中信证券研究部12演变GPT-1无监督预训练有监督微调GPT-1发布于2018年6月参数量达117亿预训练数据量约5GBGPT-1包含预训练和微调两个阶段考虑到自然语言处理任务中有标签的语料少GPT-1先在大量的无标签数据上训练语言模型然后在下游具体任务如分类常识推理自然语言推理等的有标签数据集上进行微调1在无监督训练中GPT-1采用Transformer的架构即标准的语言模型的目标函数通过前面的词预测后面的词2在有监督训练中采用标准的分类目标函数仅需对第一阶段预训练的语言模型做出很小的结构改变即可应用于各种下游任务GPT-1使用了BooksCorpus数据集来训练语言模型其中有7000余本未出版的书籍具体表现上在有监督学习的12项任务中GPT-1在其中9项上的表现优于专门训练的受监督模型GPT-1包含预训练和微调两个训练阶段GPT-1在自然语言推理任务问答和常识推理任务中的表现资料来源ImprovingLanguageUnderstandingbyGenerativePre-TrainingAlecRadford资料来源ImprovingLanguageUnderstandingbyGenerativePre-TrainingAlecRadford7KarthikNarasimhanTimSalimans等KarthikNarasimhanTimSalimans等12演变GPT-2无监督预训练多任务学习GPT-2发布于2019年2月参数量达15亿预训练数据量约40GBGPT-1使用的概率条件模型为poutputinputGPT-2使用相同的无监督模型学习多个任务将概率条件模型修改为poutputinputtask期望模型对不同任务的相同输入产生不同的输出此外GPT-2采取Zero-shot设定不需要下游任务的标注信息而是根据给定的指令理解任务因此GPT-2的核心思想在于多任务学习GPT-2训练的数据集来自社交新闻平台Reddit共有约800万篇文章体积超40GB具体表现上在8个语言模型任务中仅通过Zero-Shot学习GPT-2在其中7个上领先GPT-2表明随着模型容量和数据量增大GPT模型的潜力仍有望进一步显现语言模型参数增加Zero-shot在NLP任务上表现提升8资料来源LanguageModelsareUnsupervisedMultitaskLearnersAlecRadfordJeffreyWuRewonChild等12演变GPT-3无监督预训练海量参数GPT-3发布于2020年5月参数量达1750亿预训练数据量约45TBGPT-3采用海量的参数来进行训练和学习不追求GPT-2中的Zero-shot设定而是通过少量样例Few-shot或One-shot理解并执行任务对应为模型的上下文学习能力GPT-3在作用到子任务时无需进行微调以避免庞大的模型体量所带来的高成本具体表现上在大量的语言模型数据集中Zero-shot或Few-shot设置下GPT-3超过了LAMBADA和PennTreeBankGPT-3也在很多复杂的NLP任务中超过微调后的最佳方法Few-shot准确性表现增速更快表明大模型在上下文学习上更强大Zero-shotone-shotfew-shot与fine-tune对比资料来源LanguageModelsareFew-ShotLearnersTomBBrownBenjamin资料来源LanguageModelsareFew-ShotLearnersTomBBrown9MannNickRyder等BenjaminMannNickRyder等12演变ChatGPT基于GPT-35引入人类反馈强化学习ChatGPT基于GPT-35开发最大的变化在于引入人类反馈强化学习ChatGPT引入人类反馈强化学习使用人工对模型回复进行打分排名使得其更好地理解并完成指令在表现上ChatGPT能够理解指令提供基本令人满意甚至是超预期的回答进行多轮对话以及拒绝不合理的请求等相较于GPT-3ChatGPT的回答更有体系性逻辑性相较于对话机器人ChatGPT能够回答假设性的问题并可以连续对话未来ChatGPT待强化的方向还包括纳入最新的网络语料避免不合理的答案输出等ChatGPT训练包括训练监督策略模型训练奖励模型PPO强化学习三个阶段10资料来源OpenAI官网13展望GPT-4此前外界预期参数量变化不大使用门槛有望降低GPT-4备受业界期待训练成本控制有望带动商业潜力的极大增强ChatGPT的突出表现使得外界对GPT-4十分期待自2021年以来便有报道称GPT-4即将推出OpenAI公司CEOSamAltman今年受StrictlyVC采访时表示GPT-4将在有信心可以安全且负责任地运行时推出外界此前也曾预期GPT-4的推出或分阶段进行例如GPT-3也是先开放给合作伙伴付费用户和学术机构才在2022年底开放给公众在参数量上针对有传言称GPT-4参数量将达到百万亿OpenAI公司CEOSamAltman予以否定此外AI专家AlbertoRomero预测GPT-4的重点在数据处理优化上因此其使用门槛有望降低我们预计训练成本的控制将带动其商业潜力的增强GPT-4参数量的传闻遭到否定Altman谈及GPT-4预计推出时间11资料来源微信公众号机器之心资料来源TheVerge中信证券研究部13展望GPT-4最新消息称推出在即支持多模态最新消息称GPT-4将于下周推出支持多模态应用开启通往人工通用智能之路根据德国科技媒体heise在线报道当地时间3月9日微软德国公司首席技术官AndreasBraun在名为AIinFocus-DigitalKickoff的活动中透露称将在下周推出GPT-4它将是一个多模态模型会提供完全不同的可能性例如视频这意味着GPT-4可以管理不同语言数据的输入和输出也能够做到输出图像甚至视频在活动上微软AI技术专家对多模态AI的应用案例进行了介绍例如能够将电话呼叫的语音直接记录成文本这为微软位于荷兰的一家大型客户节省500个工作小时天GPT-4对多模态的支持使得外界对模型潜力的预期进一步强化原因在于多模态感知是建立人工通用智能AGI的重要一步基于此能够执行人类水平的一般任务微软德国公司首席技术官AndreasBraun称GPT-4即将推出人工智能已从单模态转向多模态12资料来源heiseonline资料来源微信公众号水木学堂14商业模式C端推出订阅制会员B端提供调用API接口ChatGPT迅速走红以订阅制服务B端C端客户成本控制下将有效加速商业化落地ChatGPT自年初以来持续出圈截至2023年1月末月活突破1亿成为史上增长最快的消费者应用考虑到计算资源所牵涉的庞大训练成本运行成本ChatGPT的商业化路径已正在探索明确中商业模式1C端OpenAI发布ChatGPTPlus订阅计划每月收费20美元相较于免费版本即便在高峰时段用户也能正常访问ChatGPT响应时间更快可以优先使用新功能有望引领AI技术变现新模式2B端OpenAI发布ChatGPTAPI开发者可以将ChatGPT集成到产品中价格为00021ktoken相较于GPT-35降低90我们预计成本控制后有望快速带动GPT相关应用爆发根据微信公众号智东西生鲜电商Instacart跨境电商Shopify照片分享应用Snap单词背诵应用Quizlet等已率先接入ChatGPTAPIOpenAI上线ChatGPTPlus订阅计划Quizlet将基于ChatGPTAPI推出Q-Chat13资料来源OpenAI官网资料来源OpenAI官网2Transformer架构支撑GPT走向多模态构筑AIGC领域核心基石1421GPT采用的Transformer架构在NLP领域已跻身主流GPT沿用主流Transformer模型该模型采用自注意力机制在NLP上表现优于RNN循环神经网络2017年谷歌在AttentionisAllYouNeed中提出Transformer模型可用于文本摘要机器翻译等NLP任务在NLP方面Transformer模型的自注意力self-attention机制可以为输入序列中的任意位置提供上下文进而模型能够一次性处理所有输入数据而非RNN一次只处理一个单词的情况由此模型可以减少训练时间能够在更大的数据集上进行训练目前基于Transformer的预训练语言模型已成为NLP领域的主流Transformer在长序列处理上解决了CNN的最长路径问题也解决了RNN的并行度和Transformer的Encoder-Decoder示意图遗忘问题前馈神经网络交互层自注意力机制多头自注意力机制输入部分15资料来源AttentionisAllYouNeedGoogle中信证券研究部资料来源动手学深度学习李沐22Transformer也可用于CV领域相较于CNN实现性能巨大提升Transformer也可用于CV计算机视觉领域表现出巨大的性能提升CV领域此前更多由CNN卷积神经网络主导而Transformer凭借着自注意力机制表现出了巨大的性能提升根据微软亚洲研究院Transformer在图像分类物体检测等任务中刷新了测评记录例如2020年Transformer被首次应用于图像分类任务结合海量的预训练数据ViT在ImageNet-1K的validation评测集上取得8855的准确率Transformer也在视频动作识别视觉自监督学习图像复原图像分割等视觉任务中取得优异成绩谷歌提出的ViT-MoE模型目前在参数量上领先达到了150亿学术界挖掘出的Transformer建模的优点Transformer在大模型方面展示了强大的可扩展性16资料来源为何Transformer在计算机视觉中如此受欢迎微软亚洲研究院资料来源为何Transformer在计算机视觉中如此受欢迎微软亚洲研究院23Transformer支撑下GPT有望走向多模态构筑AIGC领域核心基石GPT有望基于Transformer延伸至多模态构筑AIGC核心基石GPT-4或实现领跑当前基于Transformer的多模态学习成为AI领域的研究热点研究者们提出了大量的Transformer变体鉴于Transformer具有较少的特定于模态的架构假设以及生成式预训练大模型大数据路线的成功Transformer能够联动CV与NLP通过联合建模完成打破CV与NLP领域之间的壁垒微软亚洲研究院2022年推出BEiT-3预训练模型在目标检测实例分割语义分割视觉推理图片描述生成等任务上取得了SOTA的迁移性能我们认为基于Transformer架构GPT未来有望延伸至多模态助力内容创作由UGCPGC全面走向AIGC赋能通用领域以及金融教育医疗传媒等垂直行业BEiT-3预训练示意图BEiT-3在视觉-语言任务上表现突出17资料来源通用多模态基础模型BEiT-3引领文本图像多模态预训练迈向大一统微软亚洲研究院资料来源通用多模态基础模型BEiT-3引领文本图像多模态预训练迈向大一统微软亚洲研究院23Transformer支撑下GPT有望走向多模态构筑AIGC领域核心基石微软Kosmos-1基于Transformer可完成语言任务和基础的视觉任务反映GPT发展潜力2023年3月初微软推出多模态模型Kosmos-1可以处理文本音频图像和视频等内容并遵循指令即零样本学习以及在上下文中学习即少样本学习Kosmos-1能够分析图像内容解决视觉难题执行视觉文本识别通过视觉智商测试准确度在22-26之间以及理解自然语言指令等Kosmos-1的骨干网络是基于Transformer的因果语言模型用于训练的数据来自多模态语料库包括单模态数据如文本跨模态配对数据图像-文本对和交错的多模态数据Kosmos-1的表现说明了多模态大模型的应用潜力Kosmos-1能够进行图像解释视觉应答数字识别Kosmos-1是第一个能完成零样本瑞文智商测试的AI模型18资料来源LanguageIsNotAllYouNeed微软亚洲研究院资料来源LanguageIsNotAllYouNeed微软亚洲研究院23Transformer支撑下GPT有望走向多模态构筑AIGC领域核心基石GPT基础能力包括文本生成分析代码生成对话交互机器翻译图像生成视频生成等借此赋能通用与垂直领域应用有望带来商业模式的重塑与变革结合ChatGPT现有应用场景以及对GPT未来模型演变的展望我们归纳出GPT的基础能力具体包括文本生成分析代码生成对话交互机器翻译图像生成视频生成等我们认为这些基础能力将支撑GPT在通用与垂直领域的应用新的应用领域的出现也将基于这些能力的组合例如在办公软件领域主要涉及GPT的文本能力在教育行业主要应用到文本对话翻译能力GPT能力与主要应用领域NLP能力拼写检查信息检索主题建模文本分类信息提取封闭会话文本概括问题回答机器翻译开放会话多模态演进GPT能力文本生成代码生成对话交互机器翻译图像生成视频生成赋能GPT应用搜索引擎办公软件教育金融医疗图像视频重塑结果呈现方式打造效率生产工具启发式教学智能客服营销导诊问诊辅助信息采集改变盈利模式深化智能办公体验深入的对话探讨智能精准的投顾临床研究助手信息制作影响竞争格局打开客单价空间个性化精准学习强大投研能力支持电子病历助手19资料来源中信证券研究部整理3通用与垂直场景多点开花GPT变革内容生成与交互方式20
|
|