多模态能力跃迁,GPT-4V开启视觉交互时代。1)9月25日,OpenAI官方宣布,其开始在ChatGPT中推出新的语音和图像功能;同日,OpenAI发布《GPT-4V(ision) system card》,探索并展示此次大模型在视觉上的能力及其边界,类似于GPT-4,GPT-4V的训练在2022年完成,OpenAI从2023年3月开始提供早期访问;9月29日,微软团队发布《The Dawn of LMMs: Preliminary Explorations with GPT-4V(ision)》,详细测评GPT-4V在多类任务上的表现。2)具体而言,支持图像输入并理解分析为GPT-4V的主要革新。在输入方式上,GPT-4V支持图像、子图像、文本、场景文本、视觉指针及其混合集;在能力上,GPT-4V在视觉理解和解释、视觉参考提示、时间序列与视频理解、抽象视觉推理与智力测试、情商测试等实验中均表现优秀。3)未来,GPT-4V应用场景广阔,其在理解视觉世界上的卓越能力,可应用于缺陷检测、安全检查、杂货结账、医疗影像、汽车保险相关评估、定制化图像生成、智能机器、GUI导航等多个场景。
CLIP打开图文对齐大门,或为实现多模态的核心基础。1)目前,视觉+语言多模态大模型相对主流的实现方法为:借助预训练好的大语言模型和图像编码器,用一个图文特征对齐模块来连接,从而让语言模型理解图像特征并进行更深层的问答推理。根据OpenAI及微软目前官方发布的GPT-4V相关信息,我们并不能详细了解其实现视觉模型的具体方法,但或许可以从OpenAI发布的CLIP系统,初步了解多模态大模型的实现方式。2)CLIP由OpenAI于2021年1月提出,其通过超大规模模型预训练提取视觉特征,进行图片和文本之间的对比学习,即将一张图片与能较好表达这张图片内容的一段文字联系起来,该模型训练完毕后即使不微调直接进行推理,即可达到良好的效果。为了训练CLIP,OpenAI构建了一个4亿容量的数据集,彼时在2021年,最优的模型大约需要256张V100、训练12天,效果即可显著优于传统视觉分类器。3)我们认为,通过将图像和文本的特征对齐,CLIP充当了图像-文本编码器,在视觉和文本之间架起一座桥梁,将其整合到同一个潜在空间(一种矢量化的数据关系网)中,这种技术或可以让ChatGPT跨文本和图像进行上下文推理,CLIP以及后续迭代的BLIP、BLIP2等为实现大模型视觉功能的核心基础。 多模态应用空间广阔,算力需求或呈量级式提升。1)训练阶段:GPT4可能是在10000-25000张A100上训练的;而对于GPT5,其可能需要25000-50000张H100进行训练。相比GPT3.5约数千张H100的需求量,GPT4、GPT5等相对成熟的多模态模型算力需求提升约数倍至十倍级别。2)推理阶段:数据量角度而言,图片、视频、语音均相对于文字交互有数个量级的提升,或对应算力需求的高速扩张。文字:Outlook等主流邮箱已可利用OpenAI技术及GPT自动生成格式化的电子邮件回复,考虑全球每天超3000亿封的电子邮件发送量、Outlook约8%的市占率、每个单词数据量约为5B等因素,我们预计,接入Outlook邮件场景后,Chatgpt每日生成数据量或为261GB,相比ChatGPT官网问答式场景约33GB的数据量有数倍提升。语音:Teams与OpenAI已正式开展合作,可实现生成纪要、划分章节、时间标记、实时翻译等多类功能,官方定价为10美元/月。相比文字,音频数据量明显更大,约为2B/秒;参考Teams每日约60亿分钟的总会议时长,考虑相关功能使用比例,Teams每日新增数据量需求约为336GB。图片:根据文字描述、标签点击等自动生成图片的功能已有商业化落地,万兴科技Filmora也已接入OpenAI,为视频创作者提供更定制化的图片素材。根据我们估算,以Filmora现有场景为基础,OpenAI图片素材输出数据量约为每日586GB。视频:《犬与少年》是AIGC技术辅助商业动画片的发行级别作品,由Netflix、小冰公司日本分部(rinna)、WITSTUDIO共同创作。在视频领域,单秒输出数据量或达到1MB,是目前最为复杂的应用场景之一。随着AIGC技术在影视剧集、宣传视频等领域逐步渗透,视频创作效率或迎来显著提升,星辰大海拉开序幕。 相关标的: 1)多模态应用:大华股份、海康威视、中科创达、千方科技、虹软科技、当虹科技等。 2)办公应用:金山办公、万兴科技、福昕软件、科大讯飞等。 3)落地快&估值性价比:大华股份、漫步者、传音控股、海康威视、新国都、赛意信息、紫天科技等。 4)算力侧:英伟达、中科曙光、浪潮信息、中际旭创、工业富联、云赛智联、神州数码、拓维信息、四川长虹、烽火通信、海光信息、恒润股份、新易盛、恒为科技、易华录、阿尔特、润建股份、寒武纪、景嘉微、中贝通信、创业黑马等。 5)机器人:硬件供应商:三花智控、拓普集团、鸣志电器、绿的谐波、峰岹科技等。 风险提示:AI技术迭代不及预期风险;假设与实际情况不符风险;经济下行超预期风险;行业竞争加剧风险。 研究报告全文:证券研究报告行业周报2023年10月07日计算机多模态对算力影响探讨多模态能力跃迁GPT-4V开启视觉交互时代19月25日OpenAI官方宣布其开始增持维持在ChatGPT中推出新的语音和图像功能同日OpenAI发布GPT-4Visionsystemcard探索并展示此次大模型在视觉上的能力及其边界类似于GPT-4GPT-4V的训练在2022年完成OpenAI从2023年3月开始提供早期访问9月29日微软团队发布TheDawn行业走势ofLMMsPreliminaryExplorationswithGPT-4Vision详细测评GPT-4V在多类任务上的表现2具体而言支持图像输入并理解分析为GPT-4V的主要革新在输入方式上GPT-4V支持图像子图像文本场景文本视觉指针及其混合集在能力上GPT-4V在视觉理解和解释视觉参考提示时间序列与视频理解抽象视觉推理与智力测试情商计算机沪深30080测试等实验中均表现优秀3未来GPT-4V应用场景广阔其在理解视觉世界上的卓越64能力可应用于缺陷检测安全检查杂货结账医疗影像汽车保险相关评估定制化图48像生成智能机器GUI导航等多个场景32CLIP打开图文对齐大门或为实现多模态的核心基础1目前视觉语言多模态大模16型相对主流的实现方法为借助预训练好的大语言模型和图像编码器用一个图文特征对0齐模块来连接从而让语言模型理解图像特征并进行更深层的问答推理根据OpenAI及-16微软目前官方发布的GPT-4V相关信息我们并不能详细了解其实现视觉模型的具体方法2022-102023-022023-062023-09但或许可以从OpenAI发布的CLIP系统初步了解多模态大模型的实现方式2CLIP由OpenAI于2021年1月提出其通过超大规模模型预训练提取视觉特征进行图片和文本之间的对比学习即将一张图片与能较好表达这张图片内容的一段文字联系起来该模型训练完毕后即使不微调直接进行推理即可达到良好的效果为了训练CLIPOpenAI构作者建了一个4亿容量的数据集彼时在2021年最优的模型大约需要256张V100训练12天效果即可显著优于传统视觉分类器3我们认为通过将图像和文本的特征对齐CLIP分析师刘高畅充当了图像-文本编码器在视觉和文本之间架起一座桥梁将其整合到同一个潜在空间一执业证书编号S0680518090001种矢量化的数据关系网中这种技术或可以让ChatGPT跨文本和图像进行上下文推理邮箱liugaochanggszqcomCLIP以及后续迭代的BLIPBLIP2等为实现大模型视觉功能的核心基础分析师陈芷婧多模态应用空间广阔算力需求或呈量级式提升1训练阶段GPT4可能是在10000-执业证书编号S068052308000125000张A100上训练的而对于GPT5其可能需要25000-50000张H100进行训练相邮箱chenzhijing3659gszqcom比GPT35约数千张H100的需求量GPT4GPT5等相对成熟的多模态模型算力需求提升约数倍至十倍级别2推理阶段数据量角度而言图片视频语音均相对于文字交互相关研究有数个量级的提升或对应算力需求的高速扩张文字Outlook等主流邮箱已可利用OpenAI技术及GPT自动生成格式化的电子邮件回复考虑全球每天超3000亿封的电子邮1计算机奇点之跃ChatGPT即将推出图生文2023-件发送量Outlook约8的市占率每个单词数据量约为5B等因素我们预计接入09-26Outlook邮件场景后Chatgpt每日生成数据量或为261GB相比ChatGPT官网问答式场景约33GB的数据量有数倍提升语音Teams与OpenAI已正式开展合作可实现生成2计算机AI代表应用时间表明确2023-09-24纪要划分章节时间标记实时翻译等多类功能官方定价为10美元月相比文字3计算机OpenAI有望推出多模态GPT模型2023-音频数据量明显更大约为2B秒参考Teams每日约60亿分钟的总会议时长考虑相关功能使用比例每日新增数据量需求约为图片根据文字描述标签点09-20Teams336GB击等自动生成图片的功能已有商业化落地万兴科技Filmora也已接入OpenAI为视频创作者提供更定制化的图片素材根据我们估算以Filmora现有场景为基础OpenAI图片素材输出数据量约为每日586GB视频犬与少年是AIGC技术辅助商业动画片的发行级别作品由Netflix小冰公司日本分部rinnaWITSTUDIO共同创作在视频领域单秒输出数据量或达到1MB是目前最为复杂的应用场景之一随着AIGC技术在影视剧集宣传视频等领域逐步渗透视频创作效率或迎来显著提升星辰大海拉开序幕相关标的1多模态应用大华股份海康威视中科创达千方科技虹软科技当虹科技等2办公应用金山办公万兴科技福昕软件科大讯飞等3落地快估值性价比大华股份漫步者传音控股海康威视新国都赛意信息紫天科技等4算力侧英伟达中科曙光浪潮信息中际旭创工业富联云赛智联神州数码拓维信息四川长虹烽火通信海光信息恒润股份新易盛恒为科技易华录阿尔特润建股份寒武纪景嘉微中贝通信创业黑马等5机器人硬件供应商三花智控拓普集团鸣志电器绿的谐波峰岹科技等风险提示AI技术迭代不及预期风险假设与实际情况不符风险经济下行超预期风险行业竞争加剧风险请仔细阅读本报告末页声明2023年10月07日内容目录1多模态能力跃迁GPT-4V开启图像时代32CLIP打开图文对齐大门或为实现多模态的核心基础73多模态应用空间广阔算力需求或呈量级式提升94相关标的145风险提示15图表目录图表1与ChatGPT语音交谈3图表2与ChatGPT谈论图像3图表3图像-文本对输入4图表4GPT-4V支持的的不同输入形式的视觉指针4图表5地标识别5图表6表格理解与推理5图表7GPT-4V可理解并分析视觉指向提示5图表8GPT-4V可理解并排序一系列视频帧6图表9代表性视觉大模型发布时间7图表10CLIP训练方法8图表11CLIP与以往视觉分类模型效果比较8图表12Outlook利用GPT生成邮件9图表13ChatGPTWriter在Gmail中生成完整邮件9图表14由GPT-35自动创建生成的会议纪要10图表15通过实时翻译与字幕减少会议期间的语言障碍10图表16音频数字化后的数据量11图表17WondershareFilmora一键创作图片11图表18WondershareFilmora情人节简笔画11图表19犬与少年AI参与制作12图表20视频文件数据量计算公式13图表21SDR视频上Youtube的推荐比特率13图表22OpenAI大模型各类场景数据量测算14P2请仔细阅读本报告末页声明2023年10月07日1多模态能力跃迁GPT-4V开启图像时代9月25日起ChatGPT正式具备图像与语音能力19月25日OpenAI官方宣布其开始在ChatGPT中推出新的语音和图像功能它们提供了一种新的更直观的界面允许用户进行语音对话或向ChatGPT显示正在谈论的内容2简单的使用例子包括在旅行时拍摄地标的照片并实时讨论其中的有趣之处当回到家时拍下冰箱和食品储藏室的照片以了解晚餐吃什么并询问后续问题以获取逐步食谱晚餐后通过拍照圈出问题集并让它与用户分享提示来帮助孩子解决数学问题39月25日起接下来两周内向Plus和Enterprise用户推出ChatGPT中的语音和图像其中语音将在iOS和Android上提供在设置中选择加入并且图像将在所有平台上提供图表1与ChatGPT语音交谈图表2与ChatGPT谈论图像资料来源OpenAI国盛证券研究所资料来源OpenAI国盛证券研究所核心视觉模型GPT-4V细节一并放出其已于2022年3月训练完成2023年3月开始早期访问19月25日晚OpenAI发布GPT-4Visionsystemcard探索并展示此次大模型在视觉上的能力及边界2类似于GPT-4GPT-4V的训练在2022年完成OpenAI从2023年3月开始提供早期访问由于GPT-4是GPT-4V视觉能力的技术基础其训练过程基本相同首先预训练模型使用来自互联网和许可数据源的大量文本和图像数据来预测文档中的下一个单词然后使用RLHF算法对额外数据进行微调以产生人类训练者更喜欢的输出支持图像输入并分析为GPT-4V的主要革新其在视觉理解描述推理等诸多方面表现出了类似人类水平的能力前景广阔9月29日微软团队发布TheDawnofLMMsPreliminaryExplorationswithGPT-4Vision详细测评GPT-4V在多类任务上的表现并传授整套多模态大模型提示词使用技巧1输入方式图像子图像文本场景文本视觉指针等仅文本输入GPT-4V强大的语言能力使其能够作为有效的单模式语言模型使用在输入和输出中仅使用文本GPT-4V能够执行各种语言和编码任务P3请仔细阅读本报告末页声明2023年10月07日图像-文本对1单个图像-文本对接受图像和文本作为输入以生成文本输出其中图像-文本对中的文本可以用作类似于描述图像的指令或者用作视觉问题回答中问题的查询输入2交错图像-文本对交错的图像-文本输入可以是视觉为中心的例如带有简短问题或指令的多个图像或者是文本为中心的例如带有两个插入图像的长网页或者是图像和文本的平衡混合图表3图像-文本对输入资料来源微软团队国盛证券研究所视觉指向与视觉参考提示指向可以表示为数值空间坐标如框坐标和图像裁剪或者覆盖在图像像素上的视觉标记如箭头框圆和手绘图视觉参考提示编辑图像像素而不是常规的文本提示以执行感兴趣的任务图表4GPT-4V支持的的不同输入形式的视觉指针资料来源微软团队国盛证券研究所以上图像子图像文本场景文本和视觉指针等输入方式可任意混合GPT-4V均表现出来较好的通用性2能力视觉语言能力视觉参考提示时间序列和视频理解等视觉语言能力理解和解释视觉世界即阐释图片信息1名人识别地标识别食物识别医学图像理解图标识别场景理解等2对象定位计数和密集标注3多模态知识和常识推理笑话和梗图科学与知识多模态常识4场景文本识别视觉数学推理图表理解与推理表格理解与推理文档理解5多种语言理解与推理6视觉编码能力如根据手写数学方程生成LaTeX代码的能力P4请仔细阅读本报告末页声明2023年10月07日图表5地标识别图表6表格理解与推理资料来源微软团队国盛证券研究所资料来源微软团队国盛证券研究所视觉参考提示指向特定的空间位置是与多模态系统进行人机交互的基本能力核心思想是直接编辑图像像素空间以绘制视觉指针或场景文本作为人类的指示指令包括理解指向输入视觉指示提示生成指向输出等GPT-4V能够解构问题生成不同的视觉标记以在每个子步骤中迭代地聚焦于不同的图像区域最终整合信息以制定最终答案图表7GPT-4V可理解并分析视觉指向提示资料来源微软团队国盛证券研究所时间序列和视频理解尽管GPT-4V主要关注图像但它能够以类似于人类的方式理解视频和时间序列输入方式可以为多个选定的视频帧1多图像序列GPT-4V理解了各种姿势的序列和上下文并且聪明地将它们与正在进行的活动关联起来2视频理解时间排序后续动作预测时间定位和推理3用于基于时间理解的视觉引用提示P5请仔细阅读本报告末页声明2023年10月07日图表8GPT-4V可理解并排序一系列视频帧资料来源微软团队国盛证券研究所另外GPT-4V在抽象视觉推理与智力测试情商测试等实验中均展现了良好的表现其在理解视觉世界上的卓越能力可应用于缺陷检测安全检查杂货结账医疗影像汽车保险相关评估定制化图像生成智能机器GUI导航等多个场景P6请仔细阅读本报告末页声明2023年10月07日2CLIP打开图文对齐大门或为实现多模态的核心基础目前视觉语言的多模态大模型相对主流的方法为借助预训练好的大语言模型和图像编码器用一个图文特征对齐模块来连接从而让语言模型理解图像特征并进行更深层的问答推理根据OpenAI及微软目前官方发布的GPT-4V相关新闻与论文我们并不能详细了解其实现多模态尤其是视觉模型的具体方法但我们或许可以从OpenAI发布的CLIP以及其迭代后的BLIPBLIP2等模型上初步了解多模态大模型的实现方式CLIP模型实现了图像与文本的特征对齐基础架构已于2021年发布1在CLIP提出之前计算机视觉系统被训练成分类系统这严重影响了其在未见类别上的泛化性和可用性因为其需要用额外的有标注数据因此直接从原始文本中学习是一个更有前景的可替代方法其能带来大量广泛的有监督数据2CLIP由OpenAI于2021年1月发布其通过超大规模模型预训练提取视觉特征进行图片和文本之间的对比学习即将一张图片与能较好表达这张图片内容的一段文字联系起来该模型训练完毕后不微调直接进行推理即可达到良好的效果图表9代表性视觉大模型发布时间1月3月4月5月6月8月10月11月DDIM2020DERTDDPMVisionTransformerMAECLIPSwinTransf2021SwinTransfDALLEormerormerV2BEiT-3StableDiffu2022BLIPDALLE2MidjourneysionV3SAMFastSAMGPT4Segment中科院版2023BLIP2MidjourneyAnythingSAMV5ModelMobileSAM资料来源康奈尔大学官网36氪OpenAIIT之家Researchgate国盛证券研究所CLIP的输入是配对好的图片-文本对输出为对应特征然后在特征上进行对比学习即可以实现zero-shot的图像分类1CLIP的输入是一对对配对好的的图片-文本对例如输入是一张狗的图片对应文本也表示这是一只狗这些文本和图片分别通过TextEncoder和ImageEncoder输出对应的特征然后在这些输出的文字特征和图片特征上进行对比学习结合CSDN解释假如模型输入的是n对图片-文本对那么这n对与相配对的图像-文本对是正样本即对角线部分其它n2-n对样本都是负样本这样模型的训练过程就是最大化n个正样本的相似度同时最小化n2-n个负样本的相似度其中TextEncoder可以采用NLP中常用的texttransformer模型ImageEncoder可以采用常用CNN模型或者visiontransformer等模型相似度是计算文本特征和图像特征的余弦相似性cosinesimilarityP7请仔细阅读本报告末页声明2023年10月07日图表10CLIP训练方法资料来源OoenAI国盛证券研究所2之后根据任务的分类标签构建每个类别的描述文本Aphotooflabel然后将这些文本送入TextEncoder得到对应的文本特征如果类别数目为n那么将得到n个文本特征3将要预测的图像送入lmageEncoder得到图像特征然后与n个文本特征计算缩放的余弦相似度和训练过程保持一致然后选择相似度最大的文本对应的类别作为图像分类预测结果进一步地可以将这些相似度看成logits送入softmax后可以到每个类别的预测概率自此CLIP即可以实现zero-shot的图像分类即不需要任何训练和微调CLIP最大的创新在于使用超大规模的数据集直接训练简单而有效1CLIP其实并未提出超越以往的创新性架构而是使用简单的ConVIRT模型在大规模图像-文本数据上训练就是一个高效且规模化的方法2在CLIP发布之前视觉数据集主要有3个MS-COCOVisualGenomeYFCC100M其中前两者是人工标注的质量高但是数据量小大约只有01MYFCC100M大约有100M图片但是质量堪忧有些标题只有无意义的名字过滤后这个数据集缩小至15M大约和ImageNet差不多大3考虑到现有数据集太小OpenAI构建了一个4亿容量的数据集使用50万个查询进行搜索每个查询大约有2万个图像-文本对该数据集被称为WITwebimagetext数据量和GPT-2使用的类似2021年彼时最优的模型大约需要256张V100训练12天效果即可显著优于传统视觉系统1基于5种ResNet和3种VisionTransformer架构OpenAI训练了一系列模型最大的ResNet模型RN50x64在592个V100GPU上训练了18天而最大的VisionTransformer在256个V100GPU上训练了12天彼时最优的模型为ViT-L14336px即ViT表现优于ResNet且大的ViT优于小的ViT3将CLIP与先前的零样本迁移图像分类工作进行比较CLIP在所有三个数据集上的性能都有很大提高图表11CLIP与以往视觉分类模型效果比较aYahooImageNetSUNVisualN-Grams724115230CLIP984762585资料来源OpenAI国盛证券研究所我们认为通过将图像和文本的特征对齐CLIP在视觉和文本之间架起一座桥梁将其整合到同一个潜在空间一种矢量化的数据关系网中这种技术或可以让ChatGPT跨文本和图像进行上下文推理CLIP以及后续迭代的BLIPBLIP2等为实现大模型视觉功能的核心基础P8请仔细阅读本报告末页声明2023年10月07日3多模态应用空间广阔算力需求或呈量级式提升训练阶段多模态需求或呈量级提升或对应数万张AH卡1根据GPUUtils报道Inflection表示针对他们与GPT35相当的大语言模型其使用了大约3500张H100进行训练同时对于初创公司而言其需要数千张H100对大语言模型进行训练需要几十张或者小几百张H100做微调2根据GPUUtils报道GPT4有可能是在10000-25000张A100上训练的而对于GPT5其可能需要25000-50000张H100进行训练相比GPT35约数千张H100的需求量GPT4GPT5等相对成熟的多模态模型算力需求提升约数倍至十倍级别推理阶段数据量角度而言图片视频语音均相对于文字交互有数个量级的提升或对应算力需求的高速扩张31文字从搜索到邮件OutlookGmailWord有望渐次开放邮件服务已落地OutlookGmail等主流邮箱已适配1OutlookVivaSales在微软云中利用OpenAI和GPT自动生成格式化的电子邮件回复在回复电子邮件时VivaSales根据提出建议答复询问表达关切或自定义等类别提供对应文本用户只需选择适合他们需求的选项在生成文本后根据自己的喜好进行编辑和发送2Gmail目前ChatGPT已经与Gmail邮箱进行适配可以通过ChatGPTAI生成完整的电子邮件和消息在Google浏览器提供免费Chrome图表12Outlook利用GPT生成邮件图表13ChatGPTWriter在Gmail中生成完整邮件资料来源microsoft官网国盛证券研究所资料来源chatgptwriter官网国盛证券研究所全球每天电子邮件发送量超三千亿封Outlook市占率约81根据FinancesOnline数据2022年全球企业和个人用户每天发送约3332亿封电子邮件垃圾邮件占电子邮件流量的4732根据LitmusEmailAnalytics数据从2021年1月到2021年3月电子邮件客户端Gmail与Outlook的市场占有率为27278则可以推出每天企业和个人使用Gmail与Outlook客户端发送非垃圾邮件约33321-47378137亿封据估算整体而言Outlook每日邮件数据量约为2552TB邮件字符数根据Aweber统计每封邮件平均长度为43448个单词根据EnglishLetterFrequencyCountsMayznerRevisitedorETAOINSRHLDCU论文统计谷歌扫描的书籍数据库中平均每个单词479个字母邮件数据量每个英文字母大约一个字节Byte可推出一封邮件平均约为4344847910242KB则考虑Outlook每日约137亿封邮件的发送量总数据量P9请仔细阅读本报告末页声明2023年10月07日约为2552TB其他影响因素1仅考虑纯文本未考虑文字排版与储存格式对数据量的影响根据PC网MicrosoftWord100页文档纯文本格式占用了376KB而Word格式保存同一份文档大小提升至872KB2邮件平均长度数据为英文单词数未考虑中文等其他字符接入Outlook邮件场景后Chatgpt每日生成数据量或为261GB相比目前官网问答式场景或有约8倍的提升1考虑存在推广营销邮件工作日程邮件等群发场景我们以1的比例保守假设Chatgpt在邮件写作中的使用比例则接入Outlook后估算模型需要处理及生成的数据量约为261GB2对照而言参考前文Chatgpt截至2月初每日官网咨询量约为25亿平均每个问题30词同样假设平均每个单词中包含约479个字母则其数据量约为2510930479B3346GBWord等Office套件场景有望渐次接入远期空间广阔9月21日微软宣布Microsoft365Copilot将于11月1日面向企业客户全面推出OutlookWordExcelLoopOneNote和OneDrive中为Copilot引入新功能32语音Teams已于OpenAI结合大幅提升线上会议效率Teams与OpenAI结合可实现生成纪要划分章节时间标记实时翻译等多类功能根据公司官网Teams与OpenAI进行合作从6月30日起用户每月支付10美元就可以使用OpenAI的GPT-35模型体验自动生成会议纪要实时字幕与语言翻译自动生成会议章节个性化时间轴标记隐私保护等功能自动生成会议纪要由GPT-35自动创建生成的会议纪要功能将于2023年第二季度推出实时字幕与语言翻译可以获得40种语言的实时翻译同时可以自行选择字幕语言实时标注在视频下方自动生成会议章节AI自动将会议划分为多个部分自动生成会议章节用户可以轻松挑选最感兴趣的章节浏览个性化时间轴标记标注个性化时间轴标记可以查看加入和离开会议的时间节点名字被提及的时间节点显示会议期间发言人可以快速单击并收听错过的内容隐私保护对于不可泄密的会议提供加水印限制会议记录浏览等功能同时可以选择端到端加密E2EE图表14由GPT-35自动创建生成的会议纪要图表15通过实时翻译与字幕减少会议期间的语言障碍资料来源microsoft官网国盛证券研究所资料来源microsoft官网国盛证券研究所大模型输入模式由文字扩散至语音Teams新增数据量需求约为336GB日P10请仔细阅读本报告末页声明2023年10月07日音频每秒数据量根据张振花田宏团王西等所著书籍多媒体技术与应用数字音频的存储量单位为字节与采样频率量化位数声道数和时间有关而量化位数8是将位数转换成字节数根据多媒体技术与应用电话质量的音频信号采用ITUTG711标准8kHz采样8bit量化则码率为64kbits假设音频为双声道则存储量为16bit秒由于1B等于8bit所以存储量可以换算成2Bs图表16音频数字化后的数据量资料来源多媒体技术与应用张振花等国盛证券研究所音频时长根据Microsoft官网文章2020年4月Teams每日会议总时长为27亿分钟2020年9月日活跃用户115亿根据微软22年第二季度财报电话会Teams日活跃用户数超过27亿未披露会议总时长假设2020-2022年会议总时长与日活跃用户等比例增长则2022年Teams每日会议总时长约60亿分钟音频数据量Teams每日3600亿秒若参照电话质量估计数据量约671GB假设约50的用户会参考Chatgpt整理会议纪要则数据量约为336GB其他影响因素1仅考虑电话质量的音频信号标准音频信号的用途不同采样量化和码率的要求也不同高保真立体声音频压缩标准AM广播等采样量化和码率会更高根据多媒体技术与应用AM广播采用ITUTG722标准16kHz采样14bit量化码率224kbits高保真立体声音频压缩标准由ISO和ITU-T联合制订CD11172-3MPEG音频标准为48kHz441kHz32kHz采样每声道数码率32-448kbits2使用Chatgpt辅助线上会议的用户比例可能有所变动33图片Filmora接入OpenAI服务实现文生图及图生图Filmora接入OpenAI一键智能生成图片素材万兴科技旗下视频创意软件WondershareFilmora全球上线接入ChatGPT母公司OpenAI相关服务WondershareFilmora为视频制作平台随着OpenAI的接入用户在创作视频时可自由调用OpenAI强大的AI绘图功能一键即可智能生成图片素材快速创作大师同款作品WondershareFilmora情人节开发AI简笔画产品用户用简笔画描绘出大致的形状5秒钟可以生成一副人机共创的完善绘画作品从文生图到图生图未来用户有望体验更多AIGC新功能图表17WondershareFilmora一键创作图片图表18WondershareFilmora情人节简笔画资料来源万兴科技官方公众号国盛证券研究所资料来源万兴科技官方公众号国盛证券研究所P11请仔细阅读本报告末页声明2023年10月07日以Filmora现有场景为基础OpenAI图片素材输出数据量约为586GB日单张图片数据量根据Photoshop官网每张图片数据量Byte水平像素垂直像素3其中水平像素垂直像素为分辨率每个像素点中三原色红色绿色和蓝色均占用内存中的1个字节即1个字节用于红色1个字节用于绿色1个字节用于蓝色总共3个字节根据WondershareFilmora官网Filmora默认尺寸169默认分辨率1920px1080px则每张照片数据量约为192010803B6MB图片数量根据万兴科技官方微信公众号报道截至2018年底视频剪辑软件Filmora月活跃用户已超过300万假设单次视频剪辑约调用1次OpenAI接口自动生成图片素材则月均调用300万次日均调用10万次总数据量610104MB586GB天亿图脑图已结合AIGC功能继续推动创作模式革新1根据财报网报道2月17日创意软件公司万兴科技旗下亿图脑图协同版正式开启AIGC功能内测用户只需要输入一句话即可一键生成头脑风暴演讲大纲SWOT分析活动策划生活计划等脑图这意味着AI加持下亿图脑图将大大简化思维脑图的创作流程并革新创作模式助力用户创作提质增效区别于从思维到脑图的传统创作模式借助AIGC新技术亿图脑图将大幅省去用户的思索时间助力用户更快生成灵感与解题思路开启更智能畅快的思维脑图协作之旅据了解亿图脑图AIGC功能即将面向用户开放内测申请获得名额的用户届时可尝鲜体验我们认为图片应用场景丰富包括营销宣传读物插画艺术创作医疗影响安全检测等多领域未来空间有望进一步打开34视频AIGC辅助生成动画星辰大海拉开序幕AIGC辅助商业动画片视频领域前景广阔犬与少年是AIGC技术辅助商业动画片的发行级别作品由Netflix小冰公司日本分部rinnaWITSTUDIO共同创作根据新华网报道小冰公司前身为微软人工智能小冰团队2020年分拆为独立技术研发实体2022年11月7日小冰公司宣布完成总额10亿元规模的新融资用于加速AIBeing小冰框架技术研发还宣布对旗下人工智能数字员工AIBeingEmployee产品线启动年度升级升级内容包括大模型对话引擎3D神经网络渲染超级自然语音及AIGC人工智能内容生成根据新华网报道小冰公司目前已经覆盖中国日本印度尼西亚等国66亿在线用户10亿台第三方智能设备和9亿内容观众图表19犬与少年AI参与制作资料来源NetflixJapanYoutube官方账号国盛证券研究所P12请仔细阅读本报告末页声明2023年10月07日RunwayGen2已正式放开生成一个视频约需02美元商业化路径初显1根据机器之心报道7月25日Runway宣布Gen-1和Gen-2已经彻底开放任何人都可以注册一个账号免费尝试生成的视频长度为4秒每秒消耗5个积分利用免费额度可以生成二十几个视频如果免费积分耗尽付费标准为001美元积分也就是生成一个视频需要02美元2仅需输入文字图像或文字加图像的描述Gen-2即可在很短的时间内生成相关视频其为市场上首个公开可用的文本到视频模型单秒输出数据量达到1MB星辰大海或拉开序幕1视频大小根据存储卡制造商ProGradeDigital官网视频文件大小MB比特率Mbps8位x持续时间秒犬与少年为1920x108024fps即1080p每秒24帧根据YoutubeHelp1080p24fps的SDR视频建议上传Youtube的比特率为8Mbps据此计算1秒视频大小约为1MB2随着AIGC技术在影视剧集宣传视频等领域逐步渗透视频创作效率或迎来显著提升星辰大海拉开序幕图表20视频文件数据量计算公式图表21SDR视频上Youtube的推荐比特率资料来源ProGradeDigital官网国盛证券研究所资料来源YoutubeHelp国盛证券研究所综上我们认为目前应用较为广泛的文字交互仅为Chatgpt以及AIGC应用场景的冰山一角语音图片视频等多形式的输入输出或将为内容创作领域带来革命性变化而更广的数据形态更多的应用场景更深的用户体验亦将大幅提升支撑人工智能的算力需求算力或迎来高速扩张时代服务器芯片IDC光通信等厂商有望核心受益P13请仔细阅读本报告末页声明2023年10月07日图表22OpenAI大模型各类场景数据量测算使用场景交互问答邮件写作线上会议图片生成视频生成Chatgpt微软落地应用Outlook等Teams等Filmora等Runway等Bing输入形式文字文字标签点击语音文字标签点击文字图片输出形式文字文字文字文档图片视频单位数据量479B词479B词2B秒6MB张1MB秒137亿封邮件天单位个数75亿天3600亿秒天10万张天-434个单词封使用比例100150--总计数据量3346GB天261GB天336GB天586GB天-算力投入759亿美元----1剔除垃圾邮件1以Chatgpt于12未考虑文本格月底大约2500万式影响1仅考虑一般电日活为基础3未考虑除英文话质量的音频信号1视频剪辑时调1尚未有大规模备注2参考Google每外的其他字符标准用OpenAI接口的的落地应用日约35亿的搜索4使用比例或存2使用比例或存频率或有所变动量日活提升空间在变化在变动广阔5仅考虑所列的特定落地应用下同资料来源OneFlow英伟达官网FinancesOnlineAweberEnglishLetterFrequencyCountsMayznerRevisitedorETAOINSRHLDCUStanfordCS课程官网PCHelpCenter多媒体技术与应用Microsoft官网Photoshop官网WondershareFilmora官网万兴科技官方公众号NetflixJapanYoutube官方账号YoutubeHelp国盛证券研究所测算4相关标的1多模态应用大华股份海康威视中科创达千方科技虹软科技当虹科技等2办公应用金山办公万兴科技福昕软件科大讯飞等3落地快估值性价比大华股份漫步者传音控股海康威视新国都赛意信息紫天科技等4算力侧英伟达中科曙光浪潮信息中际旭创工业富联云赛智联神州数码拓维信息四川长虹烽火通信海光信息恒润股份新易盛恒为科技易华录阿尔特润建股份寒武纪景嘉微中贝通信创业黑马等5机器人硬件供应商三花智控拓普集团鸣志电器绿的谐波峰岹科技等P14请仔细阅读本报告末页声明2023年10月07日5风险提示AI技术迭代不及预期风险若AI技术迭代不及预期则对产业链相关公司会造成一定不利影响假设与实际情况不符风险大语言模型与多模态模型的使用仍属于初期阶段尤其是以GPT-4及GPT-4V为代表的多模态模型仍处于应用早期使用情况及与行业的结合情况存在较高变数文中假设参数可能与未来发展情况不完全相符经济下行超预期风险若宏观经济景气度下行固定资产投资额放缓影响企业再投资意愿从而影响消费者消费意愿和产业链生产意愿对整个行业将会造成不利影响行业竞争加剧风险若相关企业加快技术迭代和应用布局整体行业竞争程度加剧将会对目前行业内企业的增长产生威胁P15请仔细阅读本报告末页声明2023年10月07日免责声明国盛证券有限责任公司以下简称本公司具有中国证监会许可的证券投资咨询业务资格本报告仅供本公司的客户使用本公司不会因接收人收到本报告而视其为客户在任何情况下本公司不对任何人因使用本报告中的任何内容所引致的任何损失负任何责任本报告的信息均来源于本公司认为可信的公开资料但本公司及其研究人员对该等信息的准确性及完整性不作任何保证本报告中的资料意见及预测仅反映本公司于发布本报告当日的判断可能会随时调整在不同时期本公司可发出与本报告所载资料意见及推测不一致的报告本公司不保证本报告所含信息及资料保持在最新状态对本报告所含信息可在不发出通知的情形下做出修改投资者应当自行关注相应的更新或修改本公司力求报告内容客观公正但本报告所载的资料工具意见信息及推测只提供给客户作参考之用不构成任何投资法律会计或税务的最终操作建议本公司不就报告中的内容对最终操作建议做出任何担保本报告中所指的投资及服务可能不适合个别客户不构成客户私人咨询建议投资者应当充分考虑自身特定状况并完整理解和使用本报告内容不应视本报告为做出投资决策的唯一因素投资者应注意在法律许可的情况下本公司及其本公司的关联机构可能会持有本报告中涉及的公司所发行的证券并进行交易也可能为这些公司正在提供或争取提供投资银行财务顾问和金融产品等各种金融服务本报告版权归国盛证券有限责任公司所有未经事先本公司书面授权任何机构或个人不得对本报告进行任何形式的发布复制任何机构或个人如引用刊发本报告需注明出处为国盛证券研究所且不得对本报告进行有悖原意的删节或修改分析师声明本报告署名分析师在此声明我们具有中国证券业协会授予的证券投资咨询执业资格或相当的专业胜任能力本报告所表述的任何观点均精准地反映了我们对标的证券和发行人的个人看法结论不受任何第三方的授意或影响我们所得报酬的任何部分无论是在过去现在及将来均不会与本报告中的具体投资建议或观点有直接或间接联系投资评级说明投资建议的评级标准评级说明评级标准为报告发布日后的6个月内公司股价或行业买入相对同期基准指数涨幅在15以上指数相对同期基准指数的相对市场表现其中A股市增持相对同期基准指数涨幅在515之间股票评级场以沪深300指数为基准新三板市场以三板成指针持有相对同期基准指数涨幅在-55之间对协议转让标的或三板做市指数针对做市转让标的减持相对同期基准指数跌幅在5以上为基准香港市场以摩根士丹利中国指数为基准美股增持相对同期基准指数涨幅在10以上市场以标普500指数或纳斯达克综合指数为基准中性相对同期基准指数涨幅在-1010行业评级之间减持相对同期基准指数跌幅在10以上国盛证券研究所北京上海地址北京市东城区永定门西滨河路8号院7楼中海地产地址上海市浦明路868号保利One561号楼10层广场东塔7层邮编200120邮编100077电话021-38124100邮箱gsresearchgszqcom邮箱gsresearchgszqcom南昌深圳地址南昌市红谷滩新区凤凰中大道1115号北京银行大厦地址深圳市福田区福华三路100号鼎和大厦24楼邮编330038邮编518033传真0791-86281485邮箱gsresearchgszqcom邮箱gsresearchgszqcomP16请仔细阅读本报告末页声明
|
相关行业报告
|
||||||||||||||||||||||||||
