>> 长江证券-软件与服务行业大模型技术进化论系列三:多模态大模型综述-231014
| 上传日期: |
2023/10/15 |
大小: |
2647KB |
| 格式: |
pdf 共21页 |
来源: |
长江证券 |
| 评级: |
增持 |
作者: |
宗建树 |
| 下载权限: |
此报告为加密报告 |
|
|
多模态模型重塑AI技术范式 多模态模型通过融合语言模态与图像模态,将语言模态包含的文本理解与思维链能力投射在图像模态上,赋予了模型图像理解与生成功能。从AI技术范式来看,多模态技术通过预训练+调参的方式颠覆了传统机器视觉小模型CNN高度定制化的业务模式,模型的泛用性大幅度提高。从AI商业模式来看,产业的话语权逐渐由应用端走向研发端,即改变了之前完全由客户定夺市场转向由技术定义市场。多模态模型的核心目标是模拟人类大脑处理信息的方式,技术路径是从大语言模型到图像-文本模型再泛化到其他模态的细分场景模型。与大语言模型相比,多模态模型扩大了信息输入规模、提高了信息流密度、突破了语言模态不同语种的限制;与传统机器学习模型相比,多模态模型具备较高的可迁移性,且可以做到内容生成与逻辑推理。 语言-图像模型一般包含6大任务:表征、对齐、推理、生成、迁移、量化 图像-语言多模态模型一般包含6大任务:表征、对齐、推理、生成、迁移、量化,其中对齐任务的重要性最高,也是当前多模态模型训练的主要瓶颈。1)表征:研究如何表示和总结多模态数据,以反映各个模态元素之间的异质性和相互联系;2)对齐:旨在识别所有元素之间的连接和交互;3)推理:旨在从多模态证据中合成知识,通常通过任务的多个推理步骤;4)生成:包括学习生成过程,以生成反映跨模态交互、结构;5)迁移:旨在将高泛化性的模型通过调参的方式适应各种垂类场景;6)量化:旨在通过研究模型的结构和工程化落地方式,更好地理解异质性、模态互联和多模态学习过程。 产品陆续发布,应用落地加速 9月25日,OpenAI开放了GPT-4多模态能力。图像能力基于GPT-4 Vision模型,可以理解并解释图像内容,同时具备上下文回溯能力。在长期打磨后OpenAI才开放了GPT-4的多模态能力。这代表应用落地的门槛目前不是技术限制,而是在于模型打磨和场景挖掘,长期打磨的GPT-4多模态能力具备较高的鲁棒性,安全性已达到商用标准,产品或有较高的成熟度。由此推测GPT-4多模态模型的应用落地或许可以更乐观。9月21日,OpenAI发布了DALLE-3文生图模型。相比2022年4月发布的DALLE-2,DALLE-3理解图像细微差别和细节的能力大幅度提高,生成的图像包含更多细节,更符合prompt描述。DALLE-3深度整合了ChatGPT模型,用户可以直接通过自然语言与DALLE-3交互。文生图应用门槛大幅度降低。 场景匹配度提升,核心赛道有望快速渗透 图像模态与物理世界更加贴切,信息密度更高,应用门槛更低,更符合人机交流习惯。随着GPT-4多模态能力放开,多模态模型应用有望快速落地。多模态模型大幅度提高了场景匹配度,有望在医疗、教育、办公、工业等场景快速渗透,其高实用性的特质或催生大批爆款应用。因此建议关注核心场景多模态应用落地节奏。多模态模型或带动新一轮军备竞赛。当前算力仍是阻碍AI模型训练端与推理端的主要瓶颈之一,多模态模型落地有望催生AI公司开启新一轮算力端的军备竞赛。因此建议关注英伟达链配套厂商与华为昇腾链厂商。多模态大模型合并了人形机器人感知与决策模块,有望实现人形机器人“端到端”的方案,建议关注人形机器人相关标的。 风险提示 1、人工智能技术发展不及预期; 2、人工智能下游应用需求不及预期。
|
|