研报下载就选股票报告网
您好,欢迎来到股票分析报告网!登录   忘记密码   注册
>> 海通证券-信息服务行业跟踪报告:CoDi持续迭代,多模态大模型发展得到重点关注-240123
上传日期:   2024/1/23 大小:   362KB
格式:   pdf  共2页 来源:   海通证券
评级:   优于大市 作者:   杨林
下载权限:   此报告为加密报告
CoDi迭代升级,在多模态基础模型领域取得重大突破。近日,加州大学伯克利分校、微软Azure AI、Zoom、北卡罗来纳大学教堂山分校等多个机构的研究者提出了CoDi-2模型。CoDi-2建立在CoDi(Composable Diffusion)模型的基础上,在开发综合多模态基础模型方面取得了重大突破。CoDi-2擅长解释上下文语言-视觉-音频交错指令,并生成多模态输出。CoDi-2能够遵循复杂的多模态交错指令,采用any-to-any的输入-输出模态范式进行上下文学习、推理、聊天、编辑等。通过在编码和生成阶段将模态与语言进行对齐,CoDi-2使大语言模型(LLM)不仅能够理解复杂的模态交错指令和上下文示例,还能自回归地生成基于连续特征空间的多模态输出。为了训练CoDi-2,研究者构建了一个大规模的多模态指令数据集,涵盖了文本、视觉和音频。CoDi-2在多模态生成上展示了一系列的零样本能力,如上下文学习、推理以及通过多轮交互对话实现的any-to-any模态生成组合。CoDi-2在多个任务上超越了以往的特定领域模型,例如主题驱动的图像生成、视觉转换和音频编辑任务。
  突破CoDi的局限,可进行多轮多模态对话。先前提出的CoDi模型虽然在多模态生成方面取得了显著进展,但仍存在几个关键挑战:(1)零样本的细粒度和复杂用户控制的多模态生成并不可行:在不对子任务进行微调的情况下(例如通过“类比”设置或以主题为驱动的生成复制或转移编辑效果),当前的多模态生成模型(MGM)无法生成复杂的上下文生成示例。此外,MGM的推理能力较有限,例如,输入提示通常是描述性的,不需要逻辑、组合和分析智能等能力来生成。(2)用户与模型的交互通常被限制在单轮交互,或者在多轮指令下模型难以确保跨轮响应的一致性和忠实性。(3)先前的MGM输入大多只包含一两种模态。理解模态交织输入的能力对于构建基础多模态模型至关重要,比如将语言指令与上下文视觉和听觉输入混合。因此,迫切需要一种多功能的“任意模态-任意模态”MGM,能够遵循交织的上下文多模态指令并进行多轮互动聊天。为此,研究者提出了CoDi-2,一种多功能的多模态大语言模型(MLLM),它可以进行“任意模态-任意模态”的生成,遵循上下文和模态交错指令,以及进行多轮多模态对话,以完成编辑、推理和组合等任务。
  CoDi-2以MLLM为基础引擎,处理多模态上下文输入。模型架构方面,CoDi-2在设计上旨在处理上下文多模态输入,包括文本、图像和音频,利用特定指令来促进上下文学习并生成相应的文本、图像或音频输出。研究者提出,该模型因两个关键特性而区别于其它:(1)将MLLM作为基础引擎。构建一个能够处理模态交织输入、理解和推理复杂指令(例如多轮对话、上下文示例)并与多模态扩散器互动的“任意模态-任意模态”基础模型,需要一个强大的基础“引擎”。为此,研究者通过赋予仅文本的LLM多模态感知能力构建了MLLM,并将其作为引擎。LLM在仅语言领域表现出色,如聊天、零样本学习、遵循指令等方面,再通过利用来自对齐的多模态编码器的投影,可以无缝赋予LLM感知模态交织输入序列的能力。(2)基于MLLM的多模态生成。MLLM可以自回归生成文本标记以生成文本;对于多模态生成,先前常见的一种方法是将多模态目标(例如,真实图像)转换为离散标记,使其可以类似文本自回归生成。然而,此方法的生成质量本质上受到类似VAE的生成解码器的限制,而当前的SOTA多模态生成框架通常采用扩散模型(DMs)。因此,研究者提出将DMs整合到MLLM中,遵循精细的模态交织指令和提示以生成多模态输出。我们认为,CoDi这类多模态大模型的不断迭代,背后代表的是学术界与产业界对于多模态大模型的重点关注,未来多模态大模型的商业应用也有望持续加速。
  风险提示:AI技术发展不及预期,AI商业落地不及预期。
  
  
 
Copyright © 2005 - 2021 Nxny.com All Rights Reserved 备案号:蜀ICP备15031742号-1