研报下载就选股票报告网
您好,欢迎来到股票分析报告网!登录   忘记密码   注册
>> 申万宏源-AI大模型行业点评:Google Gemini多模型大模型发布,GPT有力竞争出现-231208
上传日期:   2023/12/8 大小:   1685KB
格式:   pdf  共9页 来源:   申万宏源
评级:   看好 作者:   刘洋,林起贤,洪依真
下载权限:   此报告为加密报告
本期投资提示:
  事件:美国当地时间12月6日,谷歌发布多模态大模型Gemini。谷歌DeepMind直接宣布,Gemini是“谷歌最大、最强的人工智能模型”。
  Gemini专攻多模态,整体能力整体超过GPT-4,也超过了人类专家水平。Gemini是一个多模态大模型,意味着它可以泛化并无缝地理解、操作和组合不同类型的信息,包括文本、代码、音频、图像和视频。Gemini在32个多模态基准测试中取得了30个SOTA的记录,是第一个在MMLU测评上超过人类专家的模型。
  共有三个版本。Gemini Ultra,适用于高度复杂的任务;Gemini Pro,扩展至各种任务的Gemini模型。Gemini Nano,体量较小,可以运行在本地设备如Pixel手机上。
  谷歌的类ChatGPT应用Bard已经升级到了Gemini Pro版本,暂时只能支持英文、文字模态输入。新Bard实现了更高级的推理、规划、理解能力,同时保持免费,后续多模态能力陆续上线。谷歌预计在明年初将推出Bard Advanced,其将使用Gemini Ultra。
  我们认为Gemini在上下文、推理和思维链、遵循指令等多方面相比上一代模型都有较大提升,且多模态能力迭代,尤其Bard Ultra版推出后,可能成为Open AIGPT大模型的有利竞争对手。我们认为gemini主要做了以下提升:
  1、新增理解视频模态:根据官网,Gemini可以理解完整视频,虽然案例视频普遍只有3s左右,但这是大模态大模型首次展现出直接的视频理解并输出文字能力。
  2、多模态能力提升:Gemini支持多模态交互输入,除了图片+文字Prompt形式以外,也支持图片+代码,图片+语音等,同时也支持文字和语言的输出。
  3、复杂推理能力提升:Gemini够更全面地理解输入中信息的细节,也能回答与复杂主题相关的问题。因此,它特别擅长对数学和物理等复杂学科的问题进行推理。
  4、更强的编码能力:Gemini使用了google更先进的代码生成系统AlphaCode2,它擅长解决超出编码范围、涉及复杂数学和理论计算机科学的竞争性编程问题。
  建议后续重点关注多模态模型、数据、应用相关公司。我们认为一方面国内多个大模型语言能力已达到或接近GPT3.5水平,文本生成等能力迭代较快;但另一方面,国内在多模态、视频理解和生成等方面进展落后于海外,而多模态必然对应着比单一文字模态更大的市场空间。因此,建议重点关注提前布局多模态的上市公司。
  相关标的。多模态算法布局:金山办公、科大讯飞、虹软科技、万兴科技、大华股份。多模态应用:紫天科技(互联网传媒)、易点天下(互联网传媒)、焦点科技(互联网传媒)、美图公司(互联网传媒)、福昕软件、信雅达。
  风险提示:大模型技术中美仍存在差异,部分技术尚处于早期实验室阶段,存在落地风险。
  
  
 
Copyright © 2005 - 2021 Nxny.com All Rights Reserved 备案号:蜀ICP备15031742号-1