>> 中信建投-计算机行业深度报告:多模态大模型技术演进及研究框架-230318
| 上传日期: |
2023/3/19 |
大小: |
5605KB |
| 格式: |
pdf 共51页 |
来源: |
中信建投 |
| 评级: |
-- |
作者: |
阎贵成,金戈,于芳博 |
| 行业名称: |
计算机 |
| 下载权限: |
此报告为加密报告 |
|
|
核心观点:Transformer颠覆了传统深度学习模型,但仅限于文本,ViT打通了Transformer与CV领域的壁垒,BEiT模型将生成式预训练引入CV领域,基于ViT的多模态模型涌现。多模态已经在多个领域中得到广泛应用,如虚拟人、智能座舱、机器人等,各式应用持续推动多模态模型的演进。近期OpenAI发布能处理图像和文本的多模态模型GPT-4,引发关注,随着底座模型推出,上层应用预计将会涌现,催生巨大商业市场,我们建议关注。 ViT打通了Transformer与CV领域的壁垒,BEiT模型将生成式预训练引入CV领域。Transformer的出现颠覆传统深度学习模型,BERT等证明了Transformer在NLP领域的优秀表现。然而传统的Transformer模型只适用于单模态文本,ViT模型将patch embedding引入Transformer,打通了Transformer与CV领域的壁垒。以ViT为基础的多模态模型如雨后春笋般涌现,以文图多模态为主,视频领域也产生了许多基于ViT的模型。生成式预训练被证明在自然语言处理领域有着广泛的应用,BEiT模型将生成式预训练引入CV领域,实现了CV领域大规模自监督预训练。 多模态发展经历五个阶段,包括行为时代、计算时代、交互时代、深度学习时代和大模型时代。多模态交互、感知、内容分发等应用已涉及多个方面,包括多模态检索、虚拟人、智能人、智能座舱、语音助手等。扩散模型等和多模态模型的结合催生了文生图任务的火爆。各式多模态场景下的应用持续推动多模态模型的演进。 多模态预训练大模型核心要素包括:对图文编码、设置学习目标、模型结构、模态融合等。多模态预训练模型首先要将图文进行编码,文字端有成熟的BERT等模型进行处理,图像特征基于Patch提取更加高效。学习目标是多模态预训练大模型重要一环,包括图文对比、编码语言模型、图文匹配等,模型可以使用不同的学习目标产生不同学习效果。多模态预训练大模型结果主要分为encoder-only和encoder-decoder,常见的是encoderonly模型,用于图文检索等任务,而后者适用于生成任务。根据模态融合方式不同,又可以分为fusion encoder和dual encoder模型,前者通过混合方式对模态进行处理,能够学习到不同模态之间的隐藏的知识,适合推理,后者分别对模态进行处理,适合检索等任务。 多模态预训练大模型未来将更加统一。虽然BEiT-3等统一模型将各种任务统一起来,但实际上仅仅是将几个任务的模块累加起来得到的,并非真正意义上的“统一”。未来,以微软发布的KOSMOS-1和谷歌发布的PaLM-E,将不同模态统一编码为文本模式或者使用通才模型统一下游任务使多模态预训练大模型走向统一。 多模态大模型正处于蓬勃发展阶段,随着底座模型的推出,上层应用预计将会涌现,催生巨大商业市场,我们建议关注,尤其关注当前多模态大模型的推出情况。 风险提示 多模态模型技术发展不及预期:多模态属于先进AI算法,若后续算法更新迭代效果不及预期,则会影响多模态演进及拓展,进而会影响其商业化落地等; 算法隐私问题:多模态预训练大模型在进行预训练过程中,使用了大量数据,很多都是从网络上直接获得的图文数据对,其中会涉及相关隐私问题; 算力基础设施支持不及预期:美国制裁中国高科技企业,对中国形成芯片、算力的封锁,大语言模型训练过程中需要大量算力资源,需要关注中美关系带来的中国算力的压力; 数据数量与数据质量不及预期:大型语言模型需要大量的高质量数据进行训练,若数据数量和质量存在短板,则会影响大语言模型效果; 伦理冲突风险:多模态大模型技术将进一步推动人工智能迈向通用型人工智能,人工智能进一步智能化将产生人工智能欺骗、人工智能上瘾、人与人工智能之间的关系等一些列伦理问题。
研究报告全文:证券研究报告行业深度报告多模态大模型技术演进及研究框架分析师阎贵成分析师金戈分析师于芳博yanguichengcsccomcnjingecsccomcnyufangbocsccomcnSAC编号S1440518040002SAC编号S1440517110001SAC编号S1440522030001SFC中央编号BNS315SFC中央编号BPD352发布日期2023年3月18日本报告由中信建投证券股份有限公司在中华人民共和国仅为本报告目的不包括香港澳门台湾提供在遵守适用的法律法规情况下本报告亦可能由中信建投国际证券有限公司在香港提供同时请参阅最后一页的重要声明核心观点核心观点Transformer颠覆了传统深度学习模型但仅限于文本ViT打通了Transformer与CV领域的壁垒BEiT模型将生成式预训练引入CV领域基于ViT的多模态模型涌现多模态已经在多个领域中得到广泛应用如虚拟人智能座舱机器人等各式应用持续推动多模态模型的演进近期OpenAI发布能处理图像和文本的多模态模型GPT-4引发关注随着底座模型推出上层应用预计将会涌现催生巨大商业市场我们建议关注ViT打通了Transformer与CV领域的壁垒BEiT模型将生成式预训练引入CV领域Transformer的出现颠覆传统深度学习模型BERT等证明了Transformer在NLP领域的优秀表现然而传统的Transformer模型只适用于单模态文本ViT模型将patchembedding引入Transformer打通了Transformer与CV领域的壁垒以ViT为基础的多模态模型如雨后春笋般涌现以文图多模态为主视频领域也产生了许多基于ViT的模型生成式预训练被证明在自然语言处理领域有着广泛的应用BEiT模型将生成式预训练引入CV领域实现了CV领域大规模自监督预训练多模态发展经历五个阶段包括行为时代计算时代交互时代深度学习时代和大模型时代多模态交互感知内容分发等应用已涉及多个方面包括多模态检索虚拟人智能人智能座舱语音助手等扩散模型等和多模态模型的结合催生了文生图任务的火爆各式多模态场景下的应用持续推动多模态模型的演进多模态预训练大模型核心要素包括对图文编码设置学习目标模型结构模态融合等多模态预训练模型首先要将图文进行编码文字端有成熟的BERT等模型进行处理图像特征基于Patch提取更加高效学习目标是多模态预训练大模型重要一环包括图文对比编码语言模型图文匹配等模型可以使用不同的学习目标产生不同学习效果多模态预训练大模型结果主要分为encoder-only和encoder-decoder常见的是encoder-only模型用于图文检索等任务而后者适用于生成任务根据模态融合方式不同又可以分为fusionencoder和dualencoder模型前者通过混合方式对模态进行处理能够学习到不同模态之间的隐藏的知识适合推理后者分别对模态进行处理适合检索等任务多模态预训练大模型未来将更加统一虽然BEiT-3等统一模型将各种任务统一起来但实际上仅仅是将几个任务的模块累加起来得到的并非真正意义上的统一未来以微软发布的KOSMOS-1和谷歌发布的PaLM-E将不同模态统一编码为文本模式或者使用通才模型统一下游任务使多模态预训练大模型走向统一多模态大模型正处于蓬勃发展阶段随着底座模型的推出上层应用预计将会涌现催生巨大商业市场我们建议关注尤其关注当前多模态大模型的推出情况目录一多模态预训练概述二多模态预训练关键要素三主要模型与下游场景四未来方向及演进趋势五风险提示概述总括1以BERT为主的Transformer模型取得很好的效果但是仅限于文本领域Transformer2Transformer中自注意力机制和前向传播网络权重共享适合于多模态模型处理图像1将图片patch化解决了Transformer不能应用于图像领域问题技术奇点VisionTransformer2patchembedding提取图像特征高效3基于ViT模型衍生了视频Transformer相关模型多模态大模型的技术奇点在于生成式预训练1BERT等模型证明了Transformer在NLP领域性能好并且对于数据量模型大小而言未见上限BEiT1将生成式预训练MLM方法从NLP迁移至CV实现CV大规模自监督预训练2ViT模型将Transformer模型迁移到2统一多模态大模型BEiT-3前身CV领域让Transformer能够处理图像3BEiT将生成式预训练从NLP迁移到CV图像大规模自监督学习成为可能4扩散模型与多模态大模型结合推动文生图领域发展扩散模型与CLIP结合衍生多个文图生成模型文图生成领域火爆应用催化智能家居机器人技术多模态检索各式多模态场景下的应用持续推动多模态模型的演进虚拟人智能助理机器翻译11多模态表示包含两个或两个以上事物表现形式模态是事物的一种表现形式多模态通常包含两个或者两个以上的模态形式是从多个视角出发对事物进行描述生活中常见多模态表示例如传感器的数据不仅仅包含文字图像还可以包括与之匹配的温度深度信息等使用多模态数据能够使得事物呈现更加立体全面多模态研究成为当前研究重要方面在情感分析机器翻译自然语言处理和生物医药前沿方向取得重大突破图表利用多模数据能有助于学习资料来源Multimodaldataasameanstounderstandthelearningexperience中信建投12多模态发展主要经历五个时代图表多模态模型发展的五个阶段资料来源carnegiemellonuniversity中信建投13Transformer颠覆传统模型但限于单模态领域2017年Transformer被提出颠覆了传统的深度学习模型在机器翻译任务上实现了最好性能Transformer在大规模语料库上进行自监督预训练然后在下游任务进行微调受到人们的关注许多预训练大模型都是遵守这一范式提出例如BERTGPT等虽然基于Transformer的大模型都取得了很好的效果但还是限于单一模态文本上无法将其self-attention中良好的泛化能力迁移到其他模态图像视频等中Transformer不能迁移图像领域的主要原因在于输入长度限制以BERT为例其输入数据的长度只能支持512而对于像素为224224的图片来讲其输入远大于512图表Transformer基本架构Multi-headAttentionScaledDot-ProductAttention资料来源AttentionIsAllYouNeed中信建投14ViT的出现打通了CV和NLP之间壁垒推动多模态演进TransformerSelf-attention在文本领域优秀的表现吸引着计算机视觉研究者许多人开始将Transformer机制引入到计算机视觉Transformer限制在于其输入数据大小需要考虑输入策略谷歌借鉴前人的思想在强大的算力资源加持下提出ViT模型ViT模型通过将图片进行切割成一个个patch原文将一张图片切割成16个patch对patch进行处理通过线性映射变成图表TransformerViT基本架构可接受的输入打通了CV和NLP之间的壁垒将图片切割解决ViT将图片的2D信息通过切输入大小割转化为类似文本的1D信息问题资料来源Animageisworth16x16wordsTransformersforimagerecognitionatscale中信建投15ViT中的Patchembedding在提取视觉特征方面效率优势明显ViT不仅能够让Transformer能够对图像进行处理而且ViT图像特征提取策略相较于之前的方式效率更高如左图虚线框内是三种视觉提取方式分别为基于Region基于Grid和ViT中线性映射方法进行视觉特征提取在ViT之前视觉算法中的视觉特征多基于Region提取大多会存在一个目标检测器使用目标检测方法提取视觉特征ViT在预训练阶段舍弃了目标检测器使用基于Patch的视觉特征几乎只相当于一个线性embedding降低了运算复杂度如右图所示ViLT多模态模型中在视觉特征提取方面使用了Patchembedding方法实现了运行效率的大大提升在特征提取阶段ViLT-B32的视觉特征提取阶段仅用04ms远高于Region885ms和Grid45ms方法图表ViLT模型使用Patchembedding提取视觉特征并取得很好效率资料来源ViLTVision-and-LanguageTransformerWithoutConvolutionorRegionSupervision中信建投16基于VisionTransformerVideoTransformer模型出现1视频领域基于ViT模型推出各类VideoTransformer视频是一个典型的多模态形式里面包含图像声音文字等2在ViT之前视频方面的任务如视频理解等基本是通过3D卷积网络展开的借鉴ViT思想许多VideoTransformer被提出来其中包括TimeSformerTimeSformer将每一帧视频抽象成图像并与其前一帧和后一帧相结合进行运算与3D卷积神经网络CNN相比TimeSformer的训练速度大约是其4倍而推断所需的计算量不足其十分之一TimeSformer的高效让在高空间分辨率例如高达560x560像素的帧和长视频包括高达96帧上训练模型成为可能图表自注意力机制在视频领域应用机制图表自注意力机制在视频领域应用详情TimeSformer将视频的每一帧看作一个图像采取五种策略对图像中的像素进行处理发现第三种处理方式最好资料来源IsSpace-TimeAttentionAllYouNeedforVideoUnderstand中信建投17Transformer权重共享决定其适合多模态Transformer存在权重共享模型内部的某些模块可以共享权重参数Transformer的权重共享主要是由于其自注意力模块和前向传播网络都和输入序列长度无关这种权重共享理念同样适合用于多模态模型中例如图文多模态中图像训练得到的权重参数可以用于训练文本结果依然有效甚至不用fine-tune许多多模态模型都借鉴了Transformer里面的权重共享理念典型的案例包括VLMo模型该模型首先在BEiT中使用大规模纯图像数据预训练视觉网络和自注意力模块然后冻结视觉网络和自注意力模块通过对大量纯文本数据进行建模训练语言网络最后使用视觉-语言预训练整个模型图表VLMo预训练阶段冻住的前向传播和自注意力共享视觉与文本参数资料来源VLMOUnifiedVision-LanguagePre-TrainingwithMixture-of-Modality-Experts中信建投18BEiT模型的出现将生成式预训练从NLP迁移到CV上生成式预训练是自监督学习重要方法和训练目标生成式预训练核心是在没有标签或者人工标注的情况下学习如何产生数据生成式预训练在自然语言处理中取得较大成功BEiT模型的出现将生成式预训练从NLP迁移到CV上就是将BERT中的掩码语言学习MLM方法应用到图像领域之后的MAE模型也是基于BEiT的工作展开的如果说ViT将Transformer迁移到CV中那么BEiT就是将BERT迁移到CV中BEiT解决了CV上生成式预训练的两个问题1如何将图像信息转化为NLP中离散的tokenBEiT使用到了dVEA方法将图像离散化2使用成熟的ViT结构将处理图像信息通过以上两点BEiT成功将MLMMIM方法应用图像领域将生成式预训练迁移到CV上实现CV领域中大规模自监督预训练图表BEiT模型预训练架构图表dVAE架构预训练前将图像Token化资料来源BeitBertpre-trainingofimagetransformers中信建投19图文多模态是多模态模型中目前重要方向图文多模态任务是目前视觉语言预训练模型VLP中最重要的任务之一图文任务包括图文检测图文分类图文分割等根据Paperwithcode网站上VLP领域中模型相关论文数量来看ALIGN和CLIP模型相关论文数量最多均超过500篇这两个模型均是以图像-文本为对象展开的研究其中ALIGN是谷歌2021年6月提出CLIP是OpenAI2021年2月提出图表VLP模型的相关论文数量Paperwithcode数据图表多模态模型主要情况70057960053750040030020010031241919109884444333322221111110ViLTOFABLIPCLIPVLMoOneRVL-T5XGPTSOHOALIGNALBEFFLAVAUNIMOAltCLIPOSCARWenLanSimVLMFlorenceLXMERTViLBERTVL-BERTInterBERTInternVideoPixel-BERTUnifiedVLPUnifiedVisualBERTKaleido-BERTVisualParsingVisual资料来源PaperwithcodeVision-LanguageIntelligenceTasksRepresentationLearningandLargeModels中信建投110扩散模型推动多模态中文本图像生成发展扩散模型是一种继GANVAEFlow-based模型之后最新的生成模型从气体扩散的物理过程中获得灵感通过正向扩散和反向扩散两个过程进行生成在OpenAI英伟达谷歌推出大模型后扩散模型受到了较多的关注扩散模型与多模态预训练大模型的结合主要应用在文本图像生成领域以扩散模型和多模态预训练大模型CLIP为基础模型2022年4月OpenAI发布文本生成图像模型DALLE2之后谷歌推出Imagen直接对标DALLE2图表几种生成式模型图表扩散模型与CLIP融合2022StableDiffusionStabilityAI扩散模型2020DALL-E2OpenAICLIP2021MidJourneyMidJourney基础模型衍生模型公司资料来源Github中信建投111多模态模型有包括COCO在内的多个预训练数据集和文本大模型或者视觉大模型类似多模态预训练大模型也需要大量数据提前进行预训练然后针对下游场景进行微调多模态模型目前用于许多预训练数据集包括Flickr30kCOCOLAION-400MRedCaps在内的多项英文图像文本数据集也包括WukongWuDaoMMWSCD在内的多项中文数据集这些数据集一般都是以图像文本对的形式存在例如LAION-400M包含CLIP模型过滤的4亿个图像文本对数据集Wukong包含1亿个中文图像文本对Flickr30K包含31000张图片每张都与5个句子相关LAION是多模态模型数据集领域重要组织他们是公益非营利性组织推出了LAION-400MLAION-5BClipH14等数据集并且完全开源图表多模态模型常见数据集数据集年份规模图文对数量语言是否可获取数据集年份规模语言是否可获取SBUCaptions20111MEnglish是LAION-400M2021400MEnglish是Flickr30k2014145KEnglish是RedCaps202112MEnglish是CoCo2014567KEnglish是Wukong2022100MChinese是FashionGen2018300kEnglish是CxC202124KEnglish是VQAv20201711MEnglish是Product1M20211MChinese是CC3M20183MEnglish是WIT2021375MMulti-lingual是GQA20191MEnglish是JFT-300M201730MEnglish否LAIT202010MEnglish否JFT-3B20213000MEnglish否CC12M202112MEnglish是IG-35B-17k2018350MEnglish否AltText202118BEnglish否M6-Corpus202160MChinese否TVQA201821793English是M5Product20216MEnglish是HT100M2019136MEnglish是LocalizedNarratives2020849kEnglish是WebVid2M202125MEnglish是RUC-CAS-WenLan202130MChinese否YFCC-100M2015100MEnglish是WuDaoMM2022600MChinese是资料来源Vision-LanguageIntelligenceTasksRepresentationLearningandLargeModels中信建投112多模态模型大一统成趋势2022年8月微软推出BEiT-3模型引领图像文本多模态迈向大一统BEiT-3提出了掩码图像建模将maskeddatamodeling引入到图像预训练任务将图像和文本同等看待以统一的方式对图像文本图像-文本对进行建模和学习实际上微软在2021年11月就推出了统一模型VLMO使用混合模态专家MOME的方式来进行不同模态中进行预训练训练出不同的编码器用于不同的下游任务BEiT-3在其基础上简化模型并增大预训练数据量最终在多项下游任务上表现亮眼2023年3月15日微软旗下OpenAI推出多模态大模型GPT-4图表VLMO预训练框架图表BEiT-3在多项任务上表现亮眼VLMO在前向传播层使用三个专家处理不同预训练任务资料来源ImageasaForeignLanguageBEITPretrainingforAllVisionandVision-LanguageTaskVLMOUnifiedVision-LanguagePre-TrainingwithMixture-of-Modality-Experts中信建投113视频音频等领域模态融合进展也较快在视频音频领域多模态融合同样是一种趋势图文多模态模型逐渐迁移至视频-文本音频-文本多模态领域典型的代表是CoCa模型图文领域中推出后在视频领域就推出了VideoCoCaCLIP模型推出后在视频领域就推出了VideoCLIP模型一些统一多模态大模型的出现也在推动该领域的发展例如阿里达摩院推出的mPLUG-2多模态大模型不仅在图-文下游任务中取得很好的效果也能进行视频领域的任务例如在视频问答视频字幕等领域相关工作上均取得了不错的成绩在音频多模态领域中比较著名的模型是谷歌推出的MusicLM模型能通过文字生成音乐图表视频多模态领域中的数据集及模型领域数据集BestModel评价评价标准ActivityNet-QAVideoCoCa5610MSRVTT-QAmPLUG-248iVQATextTextnoMultimodalPretextTraining4020VideoQuestionAnsweringMSRVTT-MCVIOLETv29760AccuracyTVQAFrozenBiLM82NExT-QAHiTeA6310Howto100M-QAHerowpre-training7775MSR-VTTmPLUG-2578YouCook2UniVL1735VideoCaptioningBLUE-4ActivityNetCaptionsVideoCoCa145HindiMSR-VTTSBDKeyframe4101MSR-VTT-1kAHunYuantvrhuge629MSR-VTTInternVideo552MSVDHunYuantvrhuge59VideoRetrievaltext-to-videoR1YouCook2VideoCLIP322TVRHerowpre-training434TGIFMDMMT-2255资料来源Paperwithcode中信建投114多模态广泛存在于机器人数字人智能家居等领域多模态在交互感知内容分发等众多领域都有较为重要的地位多模态交互在家庭与办公场景下应用广泛多模态交互可以进一步提升用户与智能家居设备的交互体验提升了用户完成相同意图的效率与成功率多模态感知包括车场景和语音助手下的用户意图感知例如在驾车场景中随着多屏主控等智能座舱技术进步各种智能终端可以通过多模态交互实现意图识别准确率更高的用户体验多模态内容分发场景下虚拟人结合动作表情情感文本等信息输出给用户图表在家里通过多模态方式发出指令图表多模态技术能够合成虚拟形象给予用户多模态的信息图表多模态技术的应用领域应用公司市场领域文本生成阿里商品推荐有道AR翻译机器翻译搜狗同传30谷歌图像检索多模态检索爱奇艺人脸识别阿里小蜜智能个人助理小爱同学虎牙直播数字人小爱虚拟形象传感器智能智能车舱资料来源多模态技术白皮书中信建投目录一多模态预训练概述二多模态预训练关键要素三主要模型与下游场景四未来方向及演进趋势五风险提示多模态预训练关键要素总括图像特征提取包括GridRegion文字使用成熟的BERT等模型进行处理1对图文进行tokenization转化为模型能处Patchbased方式理的形式需要重要视觉特征基于patch的方式更高效2设置学习目标图文对比ITC掩码语言模型MLM图文匹配ITM使用不同的学习目标会带来不同的结果模型3模型结构Encoder-onlyEncoder-decoder训可以通过叠加多个模型结构常见的是Encoder-only结构用于图文检索等任务encoder-decoder结构适合相关生成任务练模态融合方式改变模型性能要4模态融合方式素FusionEncoderDualEncoderFusionEncoder通过融合方式对模态进行处理DualEncoder分别对各模态进行处理BLIP生成图像描述并和原来的进5提升数据质量ALBEF动量蒸馏生成伪标签行比较过滤CLIPVisualChatGPT6PromptPrompt工程在多模态中更加重要例如以上两个模型采取Prompt方式提升性能
|
|