研报下载就选股票报告网
您好,欢迎来到股票分析报告网!登录   忘记密码   注册
>> 申万宏源-计算机行业AIGC系列深度之24:GPT-4v如何实现强大多模态,从文生图到图生文-231009
上传日期:   2023/10/10 大小:   2575KB
格式:   pdf  共37页 来源:   申万宏源
评级:   推荐 作者:   施鑫展,刘洋,洪依真
行业名称:   计算机
下载权限:   此报告为加密报告
本期投资提示:
  GPT-4V展现强大多模态能力,新兴应用曙光初现。9月25日,Open AI宣布即将发布新的多模态功能,包括图像读取与理解、语音对话和语音生成;根据微软测评:1)4V支持多种混合输入方式,同时展现了指令跟随、思维链、上下文少样本学习等能力;2)可以胜任大量具体任务,包括开放世界视觉理解、视觉描述、多模态知识、文档推理等都表现较好;3)可以期待4V出现后更多AI创新应用,包括工业缺陷检测、医疗影像识别、具身智能交互、汽车保险评估等。
  过去小模型时代“视觉智能”有限,增加语言模态或成为破局关键。在计算机视觉CV领域,过去常见方式仍是使用高质量、密集标注数据集进行预训练,这一训练方法下模型Few-shot和Zero-shot较弱。增加语言信息,有助于提升视觉模型的泛化能力。
  多模态两大重要基础工作:ViT和CLIP。1)ViT(Vision Transformer)首次将Transformer架构较好的应用在计算机视觉任务中;2)CLIP用于将相关文本和图像对应,Open AI从网上爬虫,抓取已经有过描述的文本-图像数据集,数据集规模达到了4亿。在这两个基础工作后,语言和视觉特征可以用同一架构Transformer提取,且也有了对应数据集训练。
  Open AI的GPT-4v多模态能力来源:1)强大的已有语言模型基础,产业界猜测GPT-4使用了类似Flamingo架构的交叉注意力机制,特点为不直接训练一个多模态模型,而是在已经预训练好的语言大模型中引入图像理解能力。即Open AI可以使用ChatGPT中已经构建的语言模块,大幅节约成本;2)2C应用发布前的大量安全工作,GPT-4尽管此前已经完成了多模态部分的测试,但是在发布前的6个月也经历大量调整,包括减少幻觉、拒绝越狱指令、拒绝回答刻板印象、仇恨问题等;3)包括Clip在内的优质联合训练数据;4)并行计算策略和达到175B参数Davinci模型3倍的推理成本。
  Google:从Palm到Gemini,应用发布值得期待。1)此前google发布了562B参数的多模态大模型Palm-E,可以理解图像,还能理解、生成语言,且可以用于多个具体任务,包括顺序机器人操作规划、视觉问题解答和图像视频字幕描述;2)目前业界对于后续即将发布的新模型Gemini期待,业界猜测训练Gemini的硬件FLOPS将超过1e26,比训练GPT-4的算力大5倍,训练总数据集大小约为GPT-4的两倍。
  无论Open AI还是Google,都在AI架构、Prompt、RLHF、安全、数据、计算资源等多个方面多做出努力。相比单模态大模型,多模态的进入门槛更高。因此在上市公司层面,我们认为后续应当更加重点关注应用环节。
  推荐标的:1)展现应用提价能力:金山办公、福昕软件;2)多模态核心受益:万兴科技、大华股份、虹软科技、科大讯飞。
  风险提示:大模型技术中美仍存在差异,部分技术尚处于早期实验室阶段,存在落地风险;实体清单等可能对训练硬件产生影响。
  
研究报告全文:行业及产计算机业2023年10月09日GPT-4v如何实现强大多模态从文行业研生图到图生文究行看好AIGC系列深度之24业深度相关研究本期投资提示GPT-4V与问界新M7计算机继续机证会的路边风景-计算机行业周报GPT-4V展现强大多模态能力新兴应用曙光初现9月25日OpenAI宣布即将发布20230925-202309282023年10月8券新的多模态功能包括图像读取与理解语音对话和语音生成根据微软测评14V支研日持多种混合输入方式同时展现了指令跟随思维链上下文少样本学习等能力2可究发布潮华为DojoCopilot后计报算机反弹可持续多久-计算机行业周以胜任大量具体任务包括开放世界视觉理解视觉描述多模态知识文档推理等都表告报20230911-202309222023年9月现较好3可以期待4V出现后更多AI创新应用包括工业缺陷检测医疗影像识别23日具身智能交互汽车保险评估等过去小模型时代视觉智能有限增加语言模态或成为破局关键在计算机视觉CV领证券分析师域过去常见方式仍是使用高质量密集标注数据集进行预训练这一训练方法下模型F洪依真A0230519060003ew-shot和Zero-shot较弱增加语言信息有助于提升视觉模型的泛化能力hongyzswsresearchcom施鑫展A0230519080002多模态两大重要基础工作ViT和CLIP1ViTVisionTransformer首次将Transformershixzswsresearchcom刘洋A0230513050006架构较好的应用在计算机视觉任务中2CLIP用于将相关文本和图像对应OpenAI从liuyang2swsresearchcom网上爬虫抓取已经有过描述的文本-图像数据集数据集规模达到了4亿在这两个基础联系人工作后语言和视觉特征可以用同一架构Transformer提取且也有了对应数据集训练洪依真862123297818OpenAI的GPT-4v多模态能力来源1强大的已有语言模型基础产业界猜测GPT-4hongyzswsresearchcom使用了类似Flamingo架构的交叉注意力机制特点为不直接训练一个多模态模型而是在已经预训练好的语言大模型中引入图像理解能力即OpenAI可以使用ChatGPT中已经构建的语言模块大幅节约成本22C应用发布前的大量安全工作GPT-4尽管此前已经完成了多模态部分的测试但是在发布前的6个月也经历大量调整包括减少幻觉拒绝越狱指令拒绝回答刻板印象仇恨问题等3包括Clip在内的优质联合训练数据4并行计算策略和达到175B参数Davinci模型3倍的推理成本Google从Palm到Gemini应用发布值得期待1此前google发布了562B参数的多模态大模型Palm-E可以理解图像还能理解生成语言且可以用于多个具体任务包括顺序机器人操作规划视觉问题解答和图像视频字幕描述2目前业界对于后续即将发布的新模型Gemini期待业界猜测训练Gemini的硬件FLOPS将超过1e26比训练GPT-4的算力大5倍训练总数据集大小约为GPT-4的两倍无论OpenAI还是Google都在AI架构PromptRLHF安全数据计算资源等多个方面多做出努力相比单模态大模型多模态的进入门槛更高因此在上市公司层面我们认为后续应当更加重点关注应用环节推荐标的1展现应用提价能力金山办公福昕软件2多模态核心受益万兴科技大华股份虹软科技科大讯飞风险提示大模型技术中美仍存在差异部分技术尚处于早期实验室阶段存在落地风险实体清单等可能对训练硬件产生影响请务必仔细阅读正文之后的各项信息披露与声明行业深度投资案件结论和投资分析意见1本次GPT-4V发布展现出的多模态能力超过市场预期2未来AI多模态应用有望加速3但同时多模态大模型的进入门槛相比语言单模态阶段也大幅提高原因及逻辑1根据微软详细测评GPT-4V可以胜任大量具体任务包括开放世界视觉理解视觉描述多模态知识文档推理等都表现较好2过去小模型时代视觉智能有限主要因为在计算机视觉CV领域过去常见方式仍是使用高质量密集标注数据集进行预训练这一训练方法下模型Few-shot和Zero-shot能力较弱增加语言模态后视觉模型泛化能力大幅提升3除了常见的ChatGPT对话功能以外可以期待更多AI创新应用包括工业缺陷检测医疗影像识别具身智能交互汽车保险评估等4为了达到多模态智能无论OpenAI还是Google都在AI架构PromptRLHF安全数据计算资源等多个方面多做出努力相比单模态大模型多模态的进入门槛更高因此在上市公司层面我们认为后续应当更加重点关注应用环节有别于大众的认识市场此前并未充分了解GPT-4多模态能力来源我们认为它来自于1强大的已有语言模型基础产业界猜测GPT-4使用了类似Flamingo架构的交叉注意力机制特点为不直接训练一个多模态模型而是在已经预训练好的语言大模型中引入图像理解能力即OpenAI可以使用ChatGPT中已经构建的语言模块大幅节约成本22C应用发布前的大量安全工作GPT-4尽管此前已经完成了多模态部分的测试但是在发布前的6个月也经历大量调整包括减少幻觉拒绝越狱指令拒绝回答刻板印象仇恨问题等3包括Clip在内的优质联合训练数据4并行计算策略和达到175B参数Davinci模型3倍的推理成本市场对于OpenAI之外的多模态大模型关注较少我们认为Google的Palm和Gemini等工作也值得期待1此前google发布了562B参数的多模态大模型Palm-E可以理解图像还能理解生成语言且可以用于多个具体任务包括顺序机器人操作规划视觉问题解答和图像视频字幕描述2目前业界对于后续即将发布的新模型Gemini期待业界猜测训练Gemini的硬件FLOPS将超过1e26比训练GPT-4的算力大5倍训练总数据集大小约为GPT-4的两倍请务必仔细阅读正文之后的各项信息披露与声明第2页共37页简单金融成就梦想行业深度目录1海外AI应用更新集中体现多模态能力611OpenAI在ChatGPT中升级了图片语音多模态能力612GPT-4V的使用方法工作模式任务能力813微软AICopilot系统更新OfficeCopilot办公能力即将发布112多模态原理解析从文生图到图生文1521文生图最先成熟的AIGC应用核心在CLIP1522图生文语言等模态有助于扩展视觉AI理解能力边界1723OpenAIGPT-4的多模态能力猜测1823Google从Palm-E到Gemini213后续AI应用关注重点多模态安全产品提价2631GPT-4v重点提升安全能力这也是多模态应用落地核心2632海外映射哪些AIGC应用可提价284重点标的3041金山办公直接对标微软copilot高价值AI应用入口3042福昕软件面向海外B端客户率先落地AIGC能力3243万兴科技OpenAI图片能力升级重点受益3444大华股份多模态视频分析有望在能源等行业率先落地应用35请务必仔细阅读正文之后的各项信息披露与声明第3页共37页简单金融成就梦想行业深度图表目录图1向ChatGPT求助如何降低自行车座椅中间涉及多轮图文对话6图2ChatGPT理解复杂图表6图3DALLE3模型图文能力进步显著7图4GPT-4V支持交错图像-文本输入8图5按照指令一步一步思考体现了思维链能力8图6上下文的零样本学习8图7让GPT-4V描述下图中飞盘和人让人的位置关系9图8让GPT假设自己是侦探从图片中推测信息9图9圈出画面中一部分问GPT这是什么9图10画线和点问GPT下一张图片应该是什么9图11输入关键帧让GPT4排序10图12理解视频中人物行动10图13GPT应用于工业缺陷检测10图14GPT应用于医疗影像10图15为新游戏头像创建一张特写飞行员照片有坚毅眼神同样prompt在前一代模型和DALLE3中的不同效果12图16AI设计工具MicrosoftDesignerprompt为制作一幅捕捉秋收节日气氛的拼贴画12图17Excel中自动生成数据高级分析13图18生成OneNote笔记草稿13图19视觉与语言Transformer技术的演进15图20DALLE设计一颗白菜穿着芭蕾舞裙在遛狗15图21DALLE-2设计一碗汤是另一个次元的入口15图22CLIP需要的数据为图像及其标题数据集中大约包含4亿张图像及描述16图23CLIP的核心思路16图24视觉zero-shot示意图17图25CV中图像分类语义分割目标检测实例分割任务的区别18图263月发布的GPT-4基础模型已可以理解网络搞笑图片18图27多模态模型的5种典型结构19请务必仔细阅读正文之后的各项信息披露与声明第4页共37页简单金融成就梦想行业深度图28Flamingo的整体架构20图29Flamingo使用的文本-图像交叠的多模态数据集20图30多模态提示示例21图31google的VisionTransformer的核心思路22图32PaLM-E核心思路和可以做到的任务22图33PaLM-E-562B可以进行zero-shot多模态chain-of-thought推理22图342023年7月13日GoogleBard更新多模态功能可以理解图片中的笑点23图35DylanPatel关于Gemini预测24图36SemiAnalysis关于Gemini预测24图37GPT-4VLaunch版本拒绝了图片中的越狱要求26图38GPT-4V拒绝不安全行为的比例较高26图39GPT-4在科学专业知识的风险右27图40GPT-4V修正刻板印象回答27图41GPT-4V修正误导信息回答27图42DoulingoMax订阅采用AI大模型技术提升外语学习效率提价至30美金月28图43NotionAI功能融入后实现了8美金月的提价29图44WPSAI已经全面接入WPS产品线30图45AI能力的融入将有助于WPS付费率和ARPU值进一步提升31图46面向企业的WPS365已于近期上线32图47福昕软件率先将AIGC能力融入PDF产品线33图48在Filmora中使用ChatGPT功能34图49在思维导图中使用AI功能34表1常见的视觉FSLFewShotLearning17表2海外和国内AIGC融入后的典型提价应用29表3金山办公C端空间测算31表4福昕编辑器订阅制与授权制价格美元33表5AI行业重点公司估值表35请务必仔细阅读正文之后的各项信息披露与声明第5页共37页简单金融成就梦想行业深度1海外AI应用更新集中体现多模态能力近期海外AI应用催化较多1OpenAI升级了图片语音多模态能力并即将应用在最新ChatGPT中2微软宣布本月底更新AICopilot系统全面集成OpenAI模型能力11OpenAI在ChatGPT中升级了图片语音多模态能力9月25日OpenAI宣布即将发布新的多模态功能包括图像读取与理解语音对话和语音生成ChatGPT即将在两周内对Plus用户与企业用户开放一系列新功能其中图文能力如下图对全平台开放与Chatgpt语音对话的能力仅对ios及安卓客户端开放图1向ChatGPT求助如何降低自行车座椅中间涉及多轮图文对话资料来源OPENAI官网申万宏源研究对话能力通过语音直接对ChatGPT对话同时GPT可以直接语音回复客户可选5种定制声音支持ios和Android移动应用使用图像-文本能力ChatGPT除了文字之外可以理解客户上传的图片信息GPT能够理解照片图片截图包含图像的文档等客户可以上传一张或者多张图片给系统甚至可以用画笔标注重点内容让系统读取理解可以用于辅导学生作业搜索日常食谱等各个方向语音和图像提供了更多在生活中使用ChatGPT的方式例如在旅行时拍摄地标的照片并就其进行实时对话问答拍摄冰箱和食品储藏室的照片以确定晚餐的食物并询问后续问题以获取分步食谱通过直接拍摄家庭作业照片来获得解答或分析与工作相关的数据的复杂图表图2ChatGPT理解复杂图表请务必仔细阅读正文之后的各项信息披露与声明第6页共37页简单金融成就梦想行业深度资料来源ChatGPT申万宏源研究此前OPENAI也升级了DALLE3模型能力新的DALLE模型与ChatGPT能力合并画作更加细腻同时可以不用prompt准确还原细节并且为图片配上文字Plus和企业版用户通过文本就能直接在ChatGPT中生成各种类型图片不仅加强提示词的生成图像体验而且增强模型理解用户指令的能力图像效果也有提升图3DALLE3模型图文能力进步显著资料来源OPENAI官网申万宏源研究请务必仔细阅读正文之后的各项信息披露与声明第7页共37页简单金融成就梦想行业深度更好的掌握用户提出的每一个描述例如上图享受夜间生活的行人满月的光辉蒸汽朋克电话和怒气冲冲的老商人讨价还价等多个较难以体现的细节描述都体现在图画中同时可以对生成内容进行多轮自然语言对话编辑例如让DALL-E模型生成多个刺猬图片选出其中一只取名为Larry并要求模型生成更多Larry图片甚至可以询问模型为什么Larry这么可爱模型可以做出文字解答期间完成了5轮对话和修改12GPT-4V的使用方法工作模式任务能力微软在OpenAI发布后公布了GPT-4V详细测评TheDawnofLMMsPreliminaryExplorationswithGPT-4Vision5种使用方式输入图像images子图像sub-images文本texts场景文本scenetexts和视觉指针visualpointers即同时支持纯图像输入也支持图像文本交互输入同时也可以对图片进行指向性提示例如画箭头画圈基本上涵盖了图-文多模态的每个场景图4GPT-4V支持交错图像-文本输入资料来源微软申万宏源研究3种支持的能力指令遵循instructionfollowing思维链chain-of-thoughts上下文少样本学习in-contextfew-shotlearning图5按照指令一步一步思考体现了思维链能力图6上下文的零样本学习请务必仔细阅读正文之后的各项信息披露与声明第8页共37页简单金融成就梦想行业深度资料来源微软申万宏源研究资料来源微软申万宏源研究此外微软也展示了GPT-4V的多项基本能力1视觉-语言能力2与人类的互动视觉参考提示3时间和视频理解4其它包括智商测试情商测试以及创新场景应用1视觉-语言能力除常见的人物地标等识别外GPT-4V还可以理解人和物体间的关系计数生成字幕和描述解释笑话回答科学问题根据手写数学方程生成LaTeX代码等图7让GPT-4V描述下图中飞盘和人之间的位图8让GPT假设自己是侦探从图片中推测信息置关系资料来源微软申万宏源研究资料来源微软申万宏源研究2与人类的互动视觉参考提示在与多模态系统的人机交互中指向特定空间位置是一项基本能力例如进行基于视觉的对话图9圈出画面中一部分问GPT这是什么图10画线和点问GPT下一张图片应该是什么请务必仔细阅读正文之后的各项信息披露与声明第9页共37页简单金融成就梦想行业深度资料来源微软申万宏源研究资料来源微软申万宏源研究3时间和视频理解多图像序列视频理解基于时间理解的视觉参考提示输入视频的几个关键帧可以理解事件前后关联图11输入关键帧让GPT4排序图12理解视频中人物行动资料来源微软申万宏源研究资料来源微软申万宏源研究4视觉推理智商情商测试等此外GPT-4v还可以用于工业医药汽车保险具身智能GUI交互等图13GPT应用于工业缺陷检测图14GPT应用于医疗影像请务必仔细阅读正文之后的各项信息披露与声明第10页共37页简单金融成就梦想行业深度资料来源微软申万宏源研究资料来源微软申万宏源研究整体来看GPT-4V1展现出强大的混合输入能力并且可以较好的支持LLM中观察到的test-time技术包括指令跟随思维链上下文少样本学习等2在不同领域人物中完成度和通用性都较强包括开放世界视觉理解视觉描述多模态知识常识场景文本理解文档推理编码时间推理抽象推理情感理解等3像素级编辑能力扩展了4V的使用边界44V出现后人工智能应用空间进一步打开包括工业医疗金融具身智能等多个产品都看到应用可能13微软AICopilot系统更新OfficeCopilot办公能力即将发布AICopilot9月26日起发布OfficeCopilot11月1日起大范围开放19月21日微软更新AICopilot功能并宣布Copilot功能将自9月26日起随着更新的Windows11以初期版本形式免费更新支持在多个APP和设备运行2OfficeCopilot将于11月1日开始大范围开放此前7月微软曾表示将把Copilot的价格定在每人每月30美元这是传统Office365订阅价格之外的额外费用这次Win11版本更新了超过150个新功能新版本中AICopilot既可以始终显示在任务栏上也可以通过WinC的快捷键启动新功能包括为WindowsPC带来Copilot功能以及画图照片Clipchamp等应用必应将增加对OpenAI最新DALLE3模型的支持请务必仔细阅读正文之后的各项信息披露与声明第11页共37页简单金融成就梦想行业深度我们认为本次发布的AICopilotOfficeCopilot亮点包括1图像能力显著提升正式加入DALLE3模型新增图文生成图片理解AI编辑P图等功能此前OpenAI发布了第三代AI绘图工具DALLE3集成了ChatGPT用户不需要在prompt上多费时间就能生成图像相比上一代DALLE3提供了更强的细节渲染还可以更好地理解要求提供更准确的图像图15为新游戏头像创建一张特写飞行员照片有坚毅眼神同样prompt在前一代模型和DALLE3中的不同效果资料来源微软发布会申万宏源研究同时微软必应中也集成了这一AI设计工具MicrosoftDesigner用户在使用Designer可在通过拖曳prompt等简单操作直接将原始画质图像添加到自己的设计中比如使用本地图片设计封面并直接执行消除背景等操作或通过AI创作图片内容对图像进行延申图16AI设计工具MicrosoftDesignerprompt为制作一幅捕捉秋收节日气氛的拼贴画资料来源微软发布会申万宏源研究请务必仔细阅读正文之后的各项信息披露与声明第12页共37页简单金融成就梦想行业深度此外基于DALLE3微软更新了Bing搜索引擎和Edge浏览器的AI功能例如在购物中以图识图搜索商品细节根据网络上的买家评论结合优惠券和促销打折码帮忙寻找合适的产品和最优惠价格同时微软通过加密方法向Bing中所有AIGC图像添加内容凭证ContentCredentials即一种不可见的数字水印包括最初的创建时间和日期2AICopilot升级了多端和团队协同能力AICopilot支持下OutlookforWindows可连接到谷歌苹果等不同公司的多个云端账户文件管理器FileExplorer的主页地址栏和搜索框能直接访问重要且相关的内容无需打开文件便可进行协作备份Backup功能可将大多数文件应用程序和个性化设置等从一台Windows电脑无缝转移到另一台上Copilot还可从用户手机例如短信中获取内容导入Win11系统假设用户要给家人发送航班时刻表Copilot会根据要求将数据导入电脑桌面上无需拿出手机就可完成信息发送3集合展示了wordexcelpptOneNote中的copilot能力本次发布会展示的办公软件插件能力与此前多次发布并无较大差异仍然包括Word文档摘要重写内容调整语气从副本中生成表格等Excel通过自然语言Prompt实现数据可视化添加计算公式等OneNote对note提出较为综合的问题生成摘要文章快速编辑等图17Excel中自动生成数据高级分析图18生成OneNote笔记草稿资料来源微软发布会申万宏源研究资料来源微软发布会申万宏源研究请务必仔细阅读正文之后的各项信息披露与声明第13页共37页简单金融成就梦想行业深度基于以上本次增加了办公软件AI助手功能Microsoft365Chat可梳理工作中的各个数据领域信息包括电子邮件会议聊天记录文档以及网络信息Microsoft365Copilot企业版将提取用户的企业数据来帮助撰写电子邮件规划活动等我们认为本次发布会相对超预期的点包括1展示了AI能力在Windows操作系统中的全局管理能力2融合图片大模型DALLE3基础从纯文本能力升级到文本-图片多模态同时图片AIGC水平远超前一代3明确Win11更新免费可以使更多人体验AICopilot4对OfficeCopilot发布给定明确时间但同时我们认为目前发布也存在争议点包括1OfficeCopilot体现出的能力尤其语言文字理解能力相比于3月发布并无显著优势2而OfficeCopilot定价30美金月能否体现增量价值有待商榷2部分Win系统中通过AI操作调用需要大量Prompt便捷性需要验证请务必仔细阅读正文之后的各项信息披露与声明第14页共37页简单金融成就梦想行业深度2多模态原理解析从文生图到图生文2022年后随着Transformer技术的发展Transformer也使用在了CV领域并形成了VisionTransformer技术2023年后基于Transformer的多模态大模型出现AI大模型应用新的空间打开图192019年到2022年的多模态预训练大模型资料来源Large-scaleMulti-modalPre-trainedModelsAComprehensiveSurvey申万宏源研究注包括多模态数据集和代表性模型紫色字体表示该数据集包含中文文本其他数据集包含英文文本红色突出显示的模型是使用两个以上的模态进行训练的21文生图最先成熟的AIGC应用核心在CLIPDALLE基于CLIP可以按照文字描述生成对应图片DALLE是OpenAI2021年发布的多模态-文生图模型DALLE基于GPT-3经过文本-图像数据集训练有120亿参数图20DALLE设计一颗白菜穿着芭蕾舞裙在遛图21DALLE-2设计一碗汤是另一个次元的入狗口资料来源OpenAI官网申万宏源研究资料来源OpenAI官网申万宏源研究请务必仔细阅读正文之后的各项信息披露与声明第15页共37页简单金融成就梦想行业深度Dall-E一代的创新点CLIP形成文字和图片对照1在文字输入部分仍然使用了与GPE-3类似的transformer语言模型且参数量大幅降低DALLE有12B参数相比GPT-3的175B大幅降低该模型是在250M图像-文本对的数据集上训练的训练后的模型根据提供的文本生成了几个样本最多512个然后再由CLIP进行排序2CLIP暴力美学下的文本-图像对应工具DALL-E的最大创新点CLIPContrastiveLanguage-ImagePre-Training用于将相关文本和图像对应背后思路简单OpenAI从网上爬虫抓取已经有过描述的文本-图像数据集但是数据集规模达到了4亿图22CLIP需要的数据为图像及其标题数据集中大约包含4亿张图像及描述资料来源新智元申万宏源研究然后在数据集上训练对比模型对比模型可以给来自同一对的图像和文本产生高相似度得分而对不匹配的文本和图像产生低分如下图左对比式无监督预训练图23CLIP的核心思路资料来源LearningTransferableVisualModelsFromNaturalLanguageSupervision申万宏源研究请务必仔细阅读正文之后的各项信息披露与声明第16页共37页简单金融成就梦想行业深度但是到DALL-E为止AI仍然无法实现zero-shot1或者few-shot下的图片理解即无法形成图生文能力22图生文语言等模态有助于扩展视觉AI理解能力边界传统CV小模型在解决Few-shot和Zero-shot问题时能力受限GPT-3结果说明使用超大规模的文本集合训练出的NLP模型性能是足以超越高质量密集标注数据集训练的结果的但是在CV领域在LLM成熟前常见方式仍是使用高质量密集标注数据集如ImageNet-1K进行预训练表1常见的视觉FSLFewShotLearningFSL分类具体Few-shot图像分类在FSL视觉任务中每个任务可能只包含一个或几个样本而解决few-shot图像分类任务常常通过数据增强迁移学习元学习和多模态融合学习解决Few-shot目标检测FSOD是从多个样本中检测稀有物体的任务目前可以分为三个阵营数据增强迁移学习和元学习其中Attention机制在小样本目标检测中起到了举足轻重的作用Few-shot语义分割Few-shot语义分割可以大致分为有监督分割无监督分割和视频语义分割Few-shot实例分割与语义分割相比实例分割还涉及到了识别图像中的每个像素并分别标记目前的工作大多仍然集中在改进r-cnn较少有研究处理实例中的少样本分割问题资料来源申万宏源研究多模态信息有助于提升视觉的FewShotLearningFSL能力多模态预训练模型的出现可以支持多个任务跨多场景泛化并具有大规模泛化和复制的强大能力例如下图给出一个CV识别领域的Zero-shot案例在机器没有进行斑马图片识别小样本训练的情况下识别出一个斑马1通过大量图片但没有斑马预训练模型学会各种有助于识别的特征attributefeature马的形状horselike条纹stripe黑白色2通过理解语言描述掌握了斑马的特征形状像马且有黑白条纹3一张机器从未见过的斑马照片并完成识别图24视觉zero-shot示意图1NLP领域自监督预训练的方法一般是采用自回归Autoregressive或者掩码文本建模MaskedLanguageModeling其特点是在模型容量数据规模方面扩展了许多数量级使得模型能力稳步提高并发现模型开始具备了Zero-Shot能力也叫零样本学习的能力即无需在目标下游任务上面进行专门的训练即获得对应的能力请务必仔细阅读正文之后的各项信息披露与声明第17页共37页简单金融成就梦想行业深度此前模型没有见过斑马图片资料来源CSDN申万宏源研究图25DinoV2实现深度估计语义分割目标检索资料来源Meta申万宏源研究除此以外纯视觉任务已经有了较多泛化工具例如meta的dinov2SAMDinoV2可以实现zero-shot下的语义分割深度估计图像检索通过训练vit模型并将其提取为较小的模型这些模型在图像和像素级都超过了可用的最佳通用功能OpenCLIP但是截至目前仍然缺乏较为有效的0样本实例分割工具23OpenAIGPT-4的多模态能力猜测此前GPT-4模型已具有多模态能力但OpenAI并未具体公布其训练方法根据OpenAI近期发布的GPT-4V与此前发布GPT-4训练过程基本相同2023年3月GPT-4已经展示出多模态能力例如可以理解网络搞笑图片理解图表含义和计算等但是OpenAI在技术报告中并没有给出GPT-4的参数训练方法等具体细节图263月发布的GPT-4基础模型已可以理解网络搞笑图片请务必仔细阅读正文之后的各项信息披露与声明第18页共37页简单金融成就梦想行业深度资料来源OpenAI申万宏源研究产业界猜测GPT-4的视觉多模态来自于类似Flamingo的架构使用交叉注意力机制2产业界猜测GPT-4的模型架构基于一个独立于语言预训练模型的视觉Transformer二者之间存在交叉注意力该架构类似于Flamingo这在GPT-4的18万亿个参数之上增加了更多参数在纯文本的预训练之后它又经过了另外约2万亿个token的微调产业界认为这是目前多模态模型中对OpenAI最有成本优势的架构图27多模态模型的5种典型结构资料来源Large-scaleMulti-modalPre-trainedModelsAComprehensiveSurvey申2一般认为多模态模型的5种典型结构来源深圳鹏城实验室请务必仔细阅读正文之后的各项信息披露与声明第19页共37页简单金融成就梦想行业深度万宏源研究注a合并注意力架构Merge-attention多个输入模态调整为同一的特征表示多个模态的特征在自注意力之前被合并共同进入Transformerb共同注意力架构Co-attention每个输入模态都具备私有自注意力通道用于模态独立特征的导入然后再使用共同的交叉注意力层融合多模态特征c交叉注意力架构Cross-attention对于多模态任务将图像与语言分别结合实现图文信息的相互嵌入与问答d三角Transformer架构Tangled-transformer使用三组Transformer模块同时处理动作图形对象和语言特征通过特定的三角连接关系注入其他模态的Transformer网络以不同模态的信息融合e模态间对比学习架构Inter-ModalityContrastiveLearning不同模态的信息被分解通过矩阵结构建立多模态对比学习关联Flamingo是DeepMind在2022年4月发布的工作Flamingo模型是一个可以输入图像和文本来生成文本的多模态模型Flamingo建立在预训练好的语言模型基础上DeepMind之前所提出的Chinchilla最大参数量70B又引入了一个VisionEncoder图28Flamingo的整体架构资料来源FlamingoaVisualLanguageModelforFew-ShotLearning申万宏源研究核心思路为不是直接训练一个多模态模型而是在已经预训练好的语言大模型中引入图像理解能力1引入预训练好的视觉模型用来提取图像的语义特征并且嵌入预训练好的语言模型中如上VisionEncoder2引入一个包含图像和文本的多模态数据集用来finetune模型如下图模型支持图像输入而本身的任务还是文本生成所以训练损失还是采用语言模型的languagemodelingloss即根据前面的输入预测下一个token图29Flamingo使用的文本-图像交叠的多模态数据集资料来源FlamingoaVisualLanguageModelforFew-ShotLearning申万宏源研究请务必仔细阅读正文之后的各项信息披露与声明第20页共37页简单金融成就梦想
 
Copyright © 2005 - 2021 Nxny.com All Rights Reserved 备案号:蜀ICP备15031742号-1