◆数据、算法、算力共振推动AIGC发展,模型开源及商业化带来的产品化浪潮及通用人工智能领域的初探推动AIGC破圈。AIGC传媒相关应用有望超千亿。
复盘AIGC算法迭代:竞争中发展,模型开源及商业化推动应用破圈。2017年推出的Transformer架构的并行训练优势奠定了大模型训练的基础,以GPT为代表的预训练模型,通过使用无标注数据预训练及微调,缓解了标注数据不足的问题,并不断提升参数量级及模型通用性,ChatGPT在此基础上加入了利用人类反馈强化学习的训练方法。扩散模型取代GAN成为图像生成领域的主流模型,CLIP模型推动跨模态生成技术的发展。GPT3的商业化及CLIP及Stable Diffusion模型的开源推动文本生成、文生图产品化的浪潮。谷歌、Meta持续探索文字生成视频领域模型。 国内传媒领域应用有望超千亿。Gartner预测至2023年将有20%的内容被生成式AI所创建;至2025年生成式AI产生的数据将占所有数据的10%(目前不到1%)。红杉预测生成式ai将产生数万亿美元经济价值。2025年,国内生成式ai应用规模有望突破2000亿,我们预测国内传媒领域应用空间超1000亿。 ◆ AIGC应用于文本、音频、跨模态、策略生成,在设计、内容创作、广告营销、游戏、企业服务等领域开启商业化,有望开启新一轮内容生产力革命。 文本生成:应用于辅助写作、营销、社交、浏览器、企业级服务、心理咨询等领域。代表公司Jasper.ai,通过SaaS订阅收费模式,获得B端客户认可,率先实现规模化收入;OpenAI旗下ChatGPT由于其通用性被集成至浏览器、办公自动化软件、企业级服务产品中,作为增值服务项目。 音频生成:应用于智能客服、有声读物制作、配音、导航、虚拟歌手、作曲等领域。代表公司喜马拉雅、倒映有声、标贝科技、StarXMusicXLab等。 跨模态生成:包括文生图、文生视频,图片视频生成文字等应用。AI绘画代表产品Midjourney、DALL-E2、Dream studio、文心一格,主要按生成次数收费。 策略生成:应用于游戏、自动驾驶、机器人控制、智能交互数字人等领域。游戏领域代表性公司腾讯AILab、网易伏羲、启元世界、rct.ai、超参数等。 ◆投资建议:AIGC的快速发展源于数据、算法、算力的共振。在此基础上,AIGC的出圈源于模型商业化及开源带来的产品化浪潮,及ChatGPT在通用人工智能领域投射的曙光带来的震撼。AIGC目前在营销、社交、内容创作、游戏等领域均有应用,并开启商业化变现。随着算法迭代、算力提升,AIGC将开启新的内容生产力革命,为传媒行业发展提供新动力。基于此,我们维持行业“推荐”评级。建议重点关注三类公司: 一、拥有自有算法及模型的公司,建议关注昆仑万维、神州泰岳; 二、拥有海量内容及版权储备的公司,建议关注视觉中国、中文在线; 三、相关应用领域龙头公司,重点推荐游戏、影视、营销板块。相关标的三七互娱、吉比特、完美世界、芒果超媒、蓝色光标。 ◆风险提示:技术发展演进不及预期、商业化进程不及预期、企业技术管理能力建设不足风险、企业内容审核能力不足风险、版权保护风险、新技术增加监管难度风险、技术滥用风险、核心人才流失风险、创作伦理风险、法律政策监管风险、估值中枢下移风险等。 研究报告全文:证券研究报告传媒2023年03月02日AIGC深度报告新一轮内容生产力革命的起点评级推荐维持姚蕾证券分析师方博云证券分析师S0350521080006S0350521120002yaol02ghzqcomcnfangbyghzqcomcn最近一年走势相关报告国海证券行业研究元宇宙系列深度报告下一代互联网前瞻传媒姚沪深300传媒5蕾20220105国海证券行业研究元宇宙系列深度报告之二数字虚拟人科技人文0的交点赋能产业的起点传媒姚蕾20220310-5国海传媒行业研究元宇宙系列深度报告之三NFT的本质思考及破圈之-10路传媒姚蕾20220311-15-20-25-30相对沪深300表现表现1M3M12M传媒8511959033沪深300-1311055-992请务必阅读报告附注中的风险提示和免责声明2重点关注公司及盈利预测202331EPSPE股票代码股票名称投资评级股价2021A2022E2023E2021A2022E2023E300002SZ神州泰岳67020303336237192未评级300418SZ昆仑万维252131011192257231未评级300364SZ中文在线12301-0102903-523未评级000681SZ视觉中国158020203725877572未评级300058SZ蓝色光标6202-0103295-235未评级002555SZ三七互娱230131416176168144买入603444SH吉比特3666204184241179199152买入002624SZ完美世界145020709765203167买入300413SZ芒果超媒348121013297354268买入003032SZ传智教育186020506977383325买入注盈利预测除芒果超媒三七互娱完美世界吉比特传智教育外均来自Wind一致预期单位元资料来源wind国海证券研究所请务必阅读报告附注中的风险提示和免责声明3核心要点数据算法算力共振推动AIGC发展模型开源及商业化带来的产品化浪潮及通用人工智能领域的初探推动AIGC破圈AIGC传媒相关应用有望超千亿复盘AIGC算法迭代竞争中发展模型开源及商业化推动应用破圈2017年推出的Transformer架构的并行训练优势奠定了大模型训练的基础以GPT为代表的预训练模型通过使用无标注数据预训练及微调缓解了标注数据不足的问题并不断提升参数量级及模型通用性ChatGPT在此基础上加入了利用人类反馈强化学习的训练方法扩散模型取代GAN成为图像生成领域的主流模型CLIP模型推动跨模态生成技术的发展GPT3的商业化及CLIP及StableDiffusion模型的开源推动文本生成文生图产品化的浪潮谷歌Meta持续探索文字生成视频领域模型国内传媒领域应用有望超千亿Gartner预测至2023年将有20的内容被生成式AI所创建至2025年生成式AI产生的数据将占所有数据的10目前不到1红杉预测生成式ai将产生数万亿美元经济价值2025年国内生成式ai应用规模有望突破2000亿我们预测国内传媒领域应用空间超1000亿AIGC应用于文本音频跨模态策略生成在设计内容创作广告营销游戏企业服务等领域开启商业化有望开启新一轮内容生产力革命文本生成应用于辅助写作营销社交浏览器企业级服务心理咨询等领域代表公司Jasperai通过SaaS订阅收费模式获得B端客户认可率先实现规模化收入OpenAI旗下ChatGPT由于其通用性被集成至浏览器办公自动化软件企业级服务产品中作为增值服务项目音频生成应用于智能客服有声读物制作配音导航虚拟歌手作曲等领域代表公司喜马拉雅倒映有声标贝科技StarXMusicXLab等跨模态生成包括文生图文生视频图片视频生成文字等应用AI绘画代表产品MidjourneyDALL-E2Dreamstudio文心一格主要按生成次数收费策略生成应用于游戏自动驾驶机器人控制智能交互数字人等领域游戏领域代表性公司腾讯AILab网易伏羲启元世界rctai超参数等投资建议AIGC的快速发展源于数据算法算力的共振在此基础上AIGC的出圈源于模型商业化及开源带来的产品化浪潮及ChatGPT在通用人工智能领域投射的曙光带来的震撼AIGC目前在营销社交内容创作游戏等领域均有应用并开启商业化变现随着算法迭代算力提升AIGC将开启新的内容生产力革命为传媒行业发展提供新动力基于此我们维持行业推荐评级建议重点关注三类公司一拥有自有算法及模型的公司建议关注昆仑万维神州泰岳二拥有海量内容及版权储备的公司建议关注视觉中国中文在线三相关应用领域龙头公司重点推荐游戏影视营销板块相关标的三七互娱吉比特完美世界芒果超媒蓝色光标风险提示技术发展演进不及预期商业化进程不及预期企业技术管理能力建设不足风险企业内容审核能力不足风险版权保护风险新技术增加监管难度风险技术滥用风险核心人才流失风险创作伦理风险法律政策监管风险估值中枢下移风险等请务必阅读报告附注中的风险提示和免责声明4目录1AIGC破圈元年11AIGC破圈12AIGC定义13发展历程14市场空间15商业模式2AIGC应用场景3产业链及相关公司请务必阅读报告附注中的风险提示和免责声明511AIGC连续破圈AI绘画ChatGPT相继破圈AI绘画作品获奖2022年8月在美国科罗拉多州举办的新兴数字艺术家竞赛中太空歌剧院获得数字艺术数字修饰照片类别一等奖参赛者没有绘画基础利用AI工具Midjourney创作ChatGPT于2022年11月30日推出5天后用户破百万两个月后月活用户突破1亿成为史上用户增长速度最快的消费级应用程序风投及产业资本涌入AIGC2021年开始风投对AIGC的投资金额金额出现爆发式增长2022年超20亿美元主打AI生成文字的Jasperai于2022年10月完成125亿美元A轮融资估值达15亿美元AI视觉艺术创业公司Stabilityai获101亿美元种子轮融资投后估值达10亿美元据美国财经媒体Semafor报道微软预计向ChatGPT的开发者OpenAI投资100亿美元OpenAI投后估值将高达290亿美元图表AIGC绘画作品太空歌剧院图表各应用程序达到全球100万1亿用户所用时间图表风投对生成式AI投入金额爆发式增长Netflix35年Airbnb25年Iwitter2年Foursquare13月Facebook10月Spotify5月Instagram25月5天ChatGPTTelephone75年Mobilephone16年WorldWideWeb7年iTunes65年Twitter5年Facebook45年WhatsApp35年Instagram25年AppleAppStore2年2月ChatGPT资料来源vcsmemo36Kr机器之心公众号国海证券研究所请务必阅读报告附注中的风险提示和免责声明612AIGC定义新的内容生成方式基于人工智能的技术集合AIGCAIGeneratedContent即利用人工智能技术自动生成内容受制于AI技术成熟度目前AI仍为内容制作的辅助型角色AIUGC待技术突破AI可真正作为内容创作者AIGCAIGC是技术集合基于生成对抗网络GAN大型预训练模型等人工智能技术通过已有数据寻找规律并通过适当的泛化能力生成相关内容的技术集合相关叫法合成式媒体SyntheticMedia即基于AI生成的文字图像音频等Gartner提出的生成式AIGenerativeAI即由人工智能自动生成新的编程内容或商业活动让文字音乐图像视频场景等都可由AI算法自动生成从PGC到UGC从UGC到AIGCWeb10时代只读模式催生出PGCWeb20时代社交媒体兴起人与人通过网络交互催生出以用户生产和分享内容的UGC模式Web30时代内容消费需求进一步增长个性化需求凸显AIGC将成为重要的新内容生成方式图表内容生产方式的变更图表从Web10到Web30的内容生成方式生产PGCAI技术发展尚未关键性突破接收内容的AIGCWeb10内人平台容内容质量参差不齐AIUGC数创作内容UGC量Web20接收内容产能不足UGC人平台PGCAIGC创作内容单人体验小范围多人交大范围多人交元宇宙的自然Web30互互的新兴体验社交网络接收内容人机器平台Web30时代资料来源a16z国海证券研究所请务必阅读报告附注中的风险提示和免责声明712AIGC定义机器对信息认知分三阶段从学习到超越经验机器对信息的认知处于第一或第二阶段人在遇到新问题时会通过以往类似经历总结规律并将新的问题套用到规律中以推测可能的结果相应地机器学习基于对历史数据的归纳和学习构建出事件模型并将合适的新数据输入到相应的模型来预测未来人类能够超越观察达到干预及想象阶段而对于AI来说目前还处于第一或第二阶段一些复杂的信息还没办法处理人类需要将其简化后再投喂给机器处理UGC为AIGC提供了发展的数据基础AIGC满足更个性化的内容消费需求用户不再满足于专业团队和用户创造对内容质量要求更高AI在提高内容生产效率丰富内容多样性及提供更加动态且可交互的内容上大有可为UGC生成的规模化内容创造了大量学习素材帮助AI实现从学习经验到超越并重构已有经验的飞跃性转变人脑思考过程机器对信息的认知三阶段未来阶段三在想象中对外界环境进行干AI逐渐具备了想象能力预在反事实中寻找规律超越并重构已有经验AI能自主创造多样的内容让计算机在对战中去想象如果执行这一步会怎么样阶段二对外界环境进行干预在改现阶段AI主动创造数据逐渐变中寻找规律超越已有经验用UGC的方式去做机器学习过程若改变现有围棋对战中的执行策略让人设和规则为计算机去进一步判断能否取得胜利AI编码人体基因阶段一对外界环境进行观察在观AI被动接受数据停留察中寻找规律在统计意义上对规律的早期阶段理解无法超越已有经计算机研究了数百万量级的围棋对战数验通过既定的图片或者据后就能够找出哪些对战的策略会导语音来生成风格一致致更高的胜率的内容资料来源rctAI2022AI营销白皮书国海证券研究所请务必阅读报告附注中的风险提示和免责声明813AIGC为何爆发数据算法算力共振AIGC发展核心三要素数据算力算法算法持续迭代2017年推出的Transformer架构的并行训练优势奠定了大模型训练的基础GPT为代表的预训练模型通过使用无标注数据预训练及微调缓解了标注数据不足的问题并不断提升参数量级及模型通用性ChatGPT在此基础上加入了利用人类反馈强化学习的训练方法扩散模型取代GAN成为图像生成领域的主流模型CLIP模型推动跨模态生成技术的发展模型商业化及开源释放创造力GPT3的商业化及CLIP及StableDiffusion模型的开源推动文本生成文生图产品化浪潮图表深度学习模型的发展图表训练模型的计算量左图以及AI模型参数量右图模型类别发布年份特点影响图像对输出结果的控制力较弱容易产GAN2014-生成生随机图像分辨率比较低自然语言理解飞跃引入自注意力机制能够基于两个性发展平行训练单词间的关系进行建模有效理解Transfor自然语优势逐步发展出超2017单词在上下文中的意思支持并行mer言模型亿规模的大模型训练使语言模型训练效果达到新ChatGPT打开AI新高度纪元对文字图像分别进行训练不断文本-图调整两个模型内部参数使得模型多模态技术推动CLIP2021像生成分别输出文字特征值和图像特征值AIGC内容多样性并确认匹配通过增加噪声破坏训练数据来学习图像然后找出如何逆转这种噪声过程以图像生成技术突破Diffusion2022生成恢复原始图像高效地解决GAN无AI绘画点燃AIGC法训练训练不稳定的问题注计算结果15000x为WuDao20中的参数数量除以GPT1中的参数数量的比值资料来源腾讯科技公众号谷歌研究GenerativeAIACreativeNewWorldAI2022TheExplosion国海证券研究所请务必阅读报告附注中的风险提示和免责声明913AIGC算法发展历程早期受制于算法算力瓶颈阶段萌芽阶段1950s-1990s沉淀积累阶段1990s-2010s从实验性向实用性转变但受限于算法瓶颈无法直特点受限于技术水平仅限于小范围实验接进行内容生成艾伦图灵提出著名第一支由计算世界第一款自然80年代中期声龙发布了第一款世界第一部完全由人工微软展示全自动事件的灵图测试机创作的弦乐语言聊天机器人IBM创造语音控消费级语音识别产智能创作的小说1同传系统给出判断机器是否四重奏依利Eliza问世制打字机品DragonDictatetheroad问世亚克组曲完具有智能的实成Tangora处理售价高达9000美元验方法20000个单词2000027198912002195059119911966691通过关键字扫描连续语音的识别迅速发展统计模型图形处理器GPU张深度神经网路和重组完成交互逐步取代模板匹配的方法隐马尔科量处理器TPU等算力算法DNN技术任务夫模型HMM成为语音识别系统的设备性能不断提升575基础模型互联网数据规模快速人物膨胀01事件0首次提出判断机器只有文本界面自然算法不断完善语音识别技术快速发可读性不强拼写错基本深层神经网络影响是否是人工智能的语言理解尚未取得真展误辞藻空洞缺乏可以将英文语音翻方法灵图被称作正突破逻辑等缺点明显译转化成中文语言人工智能之父资料来源信通院人工智能成内容AIGC白皮书中国移动雄安产业研究院国海证券研究所请务必阅读报告附注中的风险提示和免责声明1013AIGC算法发展历程模型持续迭代阶段快速发展阶段2010s-2021年特点深度学习算法不断迭代人工智能生成内容百花齐放效果逐渐逼真至难以分辨IanJ小冰推出英伟达发布人工智能生成DeepMind发布2020年伯克利OpenAI推出了OpenAI推出事件Goodfellow世界首部StyleGan模型画作在佳士得DVD-GAN模的PieterAbbeelGPT-3拥有超过DALL-E主要应用提出生成对100由人工可自动生成高以4325万美元型用以生成连续等人提出去噪扩散1750亿的训练参数于文本与图像交互生抗网络GAN智能创作的诗质量图片几成交成为首视频概率模型DDPM量被誉为万能生成内容同年将跨模集阳光失了个月后发布了个出售的人工成器态深度学习模型玻璃窗StyleGan2智能艺术品CLIP开源202202020110242021202201102820110272011029技术GANTransformerStyleGanGANDVD-GANDDPM自然语言生成模型关联文字和图像并架构提出GPT-3且关联特征非常丰富人物事件被广泛应Transformer在图像生成方面文本生成迎来重大突破CLIP模型搜集了大影响用在图像架构推动深度比GAN更优扩GPT-3庞大的运行规量数据为输入文本生成语学习算法突破散模型威望大幅模使得它不仅能答题生成图像视频应用音生成等发展迸发出提升写论文和生成代码等的落地奠定了基础场景中大模型还能编写曲谱写小说等资料来源信通院人工智能成内容AIGC白皮书机器之心Pro腾讯新闻DenoisingDiffusionProbabilisticModelsAttentionisAllYouNeed腾讯云环球网搜狐新闻国海证券研究所请务必阅读报告附注中的风险提示和免责声明1113AIGC算法发展历程从模型到应用井喷式发展阶段2022年AIGC元年以色列AI服务StabilityaiJasper小冰公司获AI图片视频服微软宣布商HourOne宣融资101亿美ai完成了10亿元人民币务商Runway完向OpenAI布将2000万美元元估值达10125亿美元融资估值超成5000万美元投资数十亿A轮融资用于投亿美元融资20亿美元C轮融资投后美元可能入研发文本-视估值5亿美元高达100亿频模型美元上线于2021OpenAI推出文本谷歌在2022年StabilityAI推谷歌研究院等年10月的文本--图像模型DALL-IO大会上公布了出文本-图像模型提出了视频生成图像模型DiscoE2可以从自然语对话式人工智能StableDiffusion模型DreamixDiffusion开始言的描述中创建逼真模型LaMDA2并开源流行的图像超过150万用户测试DeepMind推GitHub开放能微软将DALL-E2OpenAl的大语言模出了AI编码引擎够实时提供代码建集成到Bing搜索型聊天机器人ChatGPTAlphaCode议的Copilot的访Edge浏览器和新的上线建立在GPT-35问权限Office中模型之上2月4月5月6月8月10月11月12月1月2月扩散模型是StableDiffusion模ChatGPT对GAN的彻底型助力AIGC破圈文火爆全球革新字生成图像取得跨越式发展注曲线图为百度搜索指数橙色的曲线代表AI绘画蓝色曲线代表chatGPT绿色曲线代表AIGC资料来源36Kr百度指数华尔街见闻谷歌研究国海证券研究所请务必阅读报告附注中的风险提示和免责声明1213AIGC算法发展历程OpenAIVSGoogleOpenAI非盈利性转向封顶盈利性公司估值达290亿美金图表OpenAI核心人员2015年由马斯克等人创立的非盈利人工智能研究公司启动资金10亿美金成立初衷是与其它机构合作进行AI相关研究并开放研究成果以促进AI技术发展防止垄断核心团队为CEOSamAltmanGregBrockmanIIyaSutskever大都技术出身在通用AI领域经验丰富2019年宣布从非盈利性质过度到封顶盈利性之后获微软10亿美元战略投资并开启与微软在产品上的合作据美国财经媒体Semafor报道微软预计向ChatGPT的开发者OpenAISamAltmanGregBrockmanMiraMuratiIIyaSutskever投资100亿美元OpenAI投后估值将高达290亿美元CEO创始人总裁原CTOCTO首席科学家图表OpenAI融资过程图表OpenAI部分对外投资序号日期融资轮次融资金额投资机构序号被投公司主营业务投资阶段12021年A轮25亿美元-1AnysphereAI工具种子轮22021年种子轮延期--2AtomicSemi芯片制造种子轮32020年种子轮-MatthewBrownCompanies3Cursor代码编辑种子轮42019年战略融资10亿美元微软4Diagram设计工具种子轮52019年pre-种子轮-ReidHoffman慈善基金KhoslaVentures5HarveyAI法律顾问种子轮GabeNewellJaanTallinnAshtonEaton6Kick会计软件种子轮62018年天使轮-和BrianneTheisen-Eaton等7Milo家长虚拟助理种子轮8qqbotdev开发者工具种子轮72017年亲友轮--9EdgeDB开源数据库A轮ElonMuskSamAltmanLinkdin的联合创10MemLabs记笔记应用A轮82016年亲友前轮10亿美元始人ReidHoffmanPaypal联合创始人Peter11SpeakAI英语学习平台B轮ThielYC联合创始人JessicaLivingston等12Descript音视频编辑应用C轮注数据截止到2023年1月注数据截止到2023年1月资料来源datalearnerOpenAI官网澎湃新闻华尔街见闻腾讯新闻金融界智东西微信公众号等国海证券研究所请务必阅读报告附注中的风险提示和免责声明1313AIGC算法发展历程OpenAI推动AI算法模型发展OpenAI技术发展历史发布开源一个重现强化发布CLIP能有效地从发布WhisperInstructGPT学习算法的工具发布拥有15亿参数发布Microscope自然语言监督中学习视一个语音识别大量使用了人类OpenAIBaselinGPT-2基于800万网一个用于分析神经觉概念可以应用于任预训练模型反馈与指导在es提供用于正确页数据40GWebText网络内部特征形成何视觉分类基准只需结果逼近人类GPT3的基础上的强化学习算法实作为训练数据过程的可视化工具提供要识别的视觉类别水平支持多进一步精调使现的最佳实践的名称种语言得输出更加可控2016年4月2018年6月2019年4月2020年5月2021年1月2022年4月2022年11月2017年5月2019年2月2020年4月2021年1月2022年1月2022年9月发布GPT一个首次将生成模型从自发布GPT-3模型对在诸多语言处理然语言处理领域拓展第一个项目于所有任务无需进发布DALLE模型任务上都取得了到其它领域公布行任何梯度更新或微发布DALLEOpenAI一个120亿个参数发布ChatGPT很好结果的算法MuseNet一个深调仅通过与模型的20其效果比GymBeta的GPT-3版本一个AI对话系首个将度神经网络可以用文本交互指定任务和第一个版本更发布以开被训练成使用文统可以写代Transformer与10种不同的乐器生成少量示例即可获得很加逼真细节发和比较不本-图像对的数据码写博客无监督预训练技4分钟的音乐作品好的效果一个月后更加丰富且解同强化学习集从文本描述写短剧等等术相结合的算法并且可以结合从乡村发布ImageGPT模型析度更高算法GPT中生成图像其取得的效果好到莫扎特到披头士的将的成功引入计算机视觉领域于已知算法风格资料来源datalearner机器之心Pro国海证券研究所请务必阅读报告附注中的风险提示和免责声明1413AIGC算法发展历程OpenAI携手微软OpenAI携手微软获得资金支持落地场景借力微软云计算领域布局资金算力2019年7月OpenAI接受了微软10亿美元的战略投资同时将把微软的Azure作为其独家云计算供应商2021年微软加注投资具体金额未公布2023年微软预计向OpenAI再投资100亿美元在满足首批投资者收回初始资本后微软将获得OpenAI75利润直到收回投资业务协作2021年微软推出了AzureOpenAI服务预览2022年微软将DALL-E2模型集成到了AzureOpenAIMicrosoftDesignerBingImageCreator中2023年1月AzureOpenAI服务正式发布企业可以申请访问包括GPT-35Codex和DALL-E2等AI模型之后还可能通过AzureOpenAI服务访问ChatGPT2023年2月微软推出ChatGPT支持的最新版本Bing搜索引擎与Edge浏览器增加聊天写作功能此外微软计划将ChatGPT引入Office产品中进一步提升市场份额图表OpenAI盈利后利润分配的四阶段图表AzureOpenAI服务官网优先保证埃隆马斯克彼得泰尔雷德霍夫曼等微软无分成首批投资者收回初始资本微软将有权获得OpenAl的利润直至收回其微软获得130亿美元投资75利润在OpenAI的利润达到920亿美元后微软在微软获得OpenAI的持股比例将下降到49剩余的利润49利润由其他风险投资者和OpenAI的员工分享在利润达到1500亿美元后微软和其他风险投资微软无分成者的股份将无偿转让给OpenAI的非营利基金资料来源中国新闻网搜狐新闻Azure官网腾讯网微软科技公众号AzureOpenAI服务官网等国海证券研究所请务必阅读报告附注中的风险提示和免责声明1513AIGC算法发展历程谷歌持续重注AIGC研究2022年11月在AI年度活动上谷歌发布四项最新成果其能够根据文本提示生成高分辨率的长视频3D模型音乐代码文字内容等结合ImagenVideo和Phenaki两大模型的优势推出超长连贯性视频生成模型ImagenVideo是基于级联视频扩散模型的文本条件视频生成系统即给出文本提示就可以通过一个由frozenT5文本编码器基础视频生成模型级联时空视频超分辨率模型组成的系统来生成高清视频Phenaki模型可通过一系列提示在开放域中生成所有时间段的视频是谷歌首次以时间变量提示生成视频LaMDAWordcraft在大语言模型LaMDA基础上开发的能辅助专业作家写作的AI写文工具帮助创作者突破创作瓶颈AudioLM具备长期连贯性的高质量音频生成框架不需要任何文字或音乐符号表示的情况下只在极短三四秒即可的音频样本基础上训练可生成自然连贯真实的音频结果不限语音或者音乐文字生成3D模型通过结合Imagen和最新的神经辐射场NeuralRadianceField技术谷歌开发出了DreamFusion技术可根据现有文字描述生成具有高保真外观深度和法向量的3D模型支持在不同光照条件下渲染将推出Bard对话机器人2023年2月谷歌宣布将推出BardAI聊天机器人由谷歌大型语言模型LaMDA支持但参数量更少使公司能够以更低的成本提供该技术Bard能在获得简单提示的情况下生成详细答案图表谷歌Imagen模型架构图表谷歌Phenaki模型架构整个架构共有7个子模型1个T5文本编码器1个基础视频扩散模型3个SSR扩散模型3个TSR扩散模型共116亿个参数文本编码器将文本prompt编码为textembedding基础视频扩散模型以文本为条件生成初始视频SSR提高视频的分辨率TSR提高视频的帧数主要包含两大部分一个将视频压缩为离散嵌入即token的编码器-解码器模型和一个将文本嵌入转换为视频token的transformer模型资料来源腾讯新闻网易新闻谷歌research官网githubAudioLMaLanguageModelingApproachtoAudioGenerationPHENAKIVARIABLELENGTHVIDEOGENERATIONFROMOPENDOMAINTEXTUALDESCRIPTIONS国海证券研究所请务必阅读报告附注中的风险提示和免责声明1613AIGC算法发展历程谷歌持续重注AIGC研究2023年2月2日谷歌研究院等提出了一种视频生成新模型图表Dreamix模型原理Dreamix受到了AI作图UniTune的启发将文本条件视频扩散模型videodiffusionmodelVDM应用于视频编辑核心是通过两种在应用程序预处理的基础上左图将输入内容转换为统一的主要思路使文本条件VDM保持对输入视频的高保真度1不使用视频格式对于图像到视频输纯噪声作为模型初始化而是使用原始视频的降级版本通过缩小尺入图像被复制并被变换合成带有一些相机运动的粗略视频对寸和添加噪声仅保留低时空信息2通过微调原始视频上的生成模于目标驱动视频生成其输入被型来进一步提升对原始视频保真度微调确保模型了解原始视频的高省略单独进行微调以维持保真度然后使用DreamixVideo分辨率属性对输入视频的简单微调会促成相对较低的运动可编辑性Editor右图编辑这个粗糙的视频首先通过采样破坏视频这是因为模型学会了更倾向于原始运动而不是遵循文本prompt添加噪声然后应用微调的文本引导视频扩散模型将视频升级到最终的时间空间分辨率图表Dreamix模型应用于视频编辑图表Dreamix模型应用于图像生成视频单一图像文字生成视频在一个静态图像中注入复杂的运动比如添加一个移动的鲨鱼并让海龟游泳在这种情况下对物体位置和背景的视觉保真度被保留了下来将吃东西的猴子上面一排变成跳舞的熊最下面排改变外观和运动但保持对颜色多图像文字生成视频在给定主题下能够提取给定多个图像的主题的视觉特征然后在姿势物体大小和拍摄角度的保真度从而产生了一个时间上一致的视频不同的场景中制作动画资料来源谷歌研究DreamixVideoDiffusionModelsareGeneralVideoEditors国海证券研究所请务必阅读报告附注中的风险提示和免责声明1713AIGC算法发展历程谷歌持续重注AIGC研究超长连贯性视频生成模型AudioLM刘宇昆在Wordcraft撰写的短篇小说EvaluativeSoliloquiesDreamFusion生成的3D模型资料来源量子位githubappspot国海证券研究所请务必阅读报告附注中的风险提示和免责声明1813AIGC算法发展历程你追我赶持续迭代基于自我注意力机制self-attention的变换器transformer模型首次将其用于理解人类的语言使用了经典的大型书籍文本数据集进行模型预训能够同时并行进行数据计算和模型训练训练时长更transformer练又针对四种不同的语言场景使用不同的特定2017年6月短并且训练得出的模型可用语法解释当时在包括6500万数据集对模型进行进一步训练最终训练所得的GPT-12018年6月翻译准确度英语成分句法分析等各项评分上都达到117亿模型在问答文本相似性评估语义蕴含判定以及文本分类这四种语言场景都取得了比基础了业内第一Transformer模型更优的结果成为了新的业内第一BERTTransformers的双向编码表示模型在机器阅读理解顶级水平测试中表现出惊人的成绩成为BERTNLP发展史上的里程碑式的模型成就在同等参数规3亿在文本内容生成方面表现出了强大的天赋最2018年10月模下BERT的效果好于GPT-1因为双向模型可以利大贡献是验证了通过海量数据和大量参数训练用上下文来分析出来的词向量模型可迁移到其它类别任务中2019年2月GPT-2而不需要额外的训练由于GPT-2的性能和生15亿成文本能力获得了很高赞誉OpenAI又扳回一T5作为一个文本到文本的统一框架可以将同一模型局目标训练流程和解码过程直接应用于实验中的每T52019年10月一项任务T5在摘要生成问答文本分类等诸多基110亿准测试中都取得了不错的效果一举超越现有最强模在一些NLP任务的数据集中使用少量样本的型GPT-3Few-shot方式甚至达到了最好效果省去了模2020年5月1750亿型微调也省去了人工标注的成本GPT-3的有效地利用了为稠密矩阵乘法广泛用于语言模型的神经网络是在超过45TB的文本上进行训练的Switch数学运算而设计的硬件例如GPU和Google数据相当于整个维基百科英文版的160倍Transformer2021年1月TPU新模型在翻译等领域获得了绝对的胜利但模16万亿型越大部署的难度越高成本也越高效率更低使用了遮掩语言模型的训练方法在这种方法2022年11月ChatGPT中模型被要求预测被遮盖的词并通过上下宣布将推出Bard的AI聊天机器人由谷歌大型语言模约20亿文来做出预测以用更接近人类的思考方式参型LaMDA支持是LaMDA的轻量级版本能够Bard与用户的查询过程推出两个月后月活用户已LaMDA以更低的成本提供该技术Bard能在获得简单提示的破亿2023年2月1370亿情况下生成详细答案资料来源做AI做的事儿公众号网易新闻澎湃新闻谷歌研究论文LaMDALanguageModelsforDialogApplications国海证券研究所注模型后面的数据为模型的参数数量请务必阅读报告附注中的风险提示和免责声明1914AIGC市场空间从决策走向创造推动内容生产向高效率和更富创造力方向发展与多产业融合不仅是降本增效更是个性化内容生成AI不仅能够以优于人类的制造能力和知识水平承担信息挖掘素材调用复刻编辑等基础性机械劳动从技术层面实现以低边际成本高效率的方式满足海量个性化需求根据Sequoiacap近年来AI模型在手写语音和图像识别阅读理解和语言理解方面的表现逐渐超过了人类的基准水平而且AI让所有人都能够成为艺术家可无时无刻生成更有创造力更个性化的内容通过支持AI生成式内容与其他产业的多维互动融合渗透从而孕育新业态新模式为各行各业创造新的商业模式提供价值增长新动能图表内容生成及创建的评价指标图表AI模型在语音识别图像识别阅读理解语言理解等方面的表现注内容生成及创建的评估指标根据行业公允评估方法设计采用影谱科技AI智能影像生成引擎AGC为数测平台资料来源中国AI数字商业展望2021-2025SequoiacapGenerativeAIACreativeNewWorld请务必阅读报告附注中的风险提示和免责声明20
|
相关行业报告
|
||||||||||||||||||||||||||
