>> 长江证券-媒体行业:谷歌推出多模态大模型Gemini,AI落地更进一步-231211
| 上传日期: |
2023/12/11 |
大小: |
503KB |
| 格式: |
pdf 共4页 |
来源: |
长江证券 |
| 评级: |
看好 |
作者: |
高超 |
| 下载权限: |
此报告为加密报告 |
|
|
事件描述 当地时间12月6日,谷歌发布多模态大模型Gemini 1.0,共分为Ultra、Pro和Nano三个版本;根据行业标准测试,Gemini Ultra综合能力超越GPT-4V。 事件评论 谷歌发布多模态大模型Gemini。Gemini分为Ultra、Pro和Nano三个版本,Ultra最强大,能完成高度复杂任务,主要面对数据中心和企业级应用,暂未开放;Pro性能最好,适合各种任务扩展,在Bard可用;Nano参数较小,主要用于设备端,如谷歌Pixel 8手机。 有别于模态拼接,Gemini为原生性多模态。此前的多模态大部分将文本、图片、音频等进行拼接,而Gemini从一开始就在不同模态上进行训练、调试,是原生性的多模态大模型,可以无缝理解、推理各种模态输入,且输出文字、图像、音频和视频。 Gemini综合能力表现突出,超越GPT-4V。Gemini在MMLU(大模型多任务语言理解)测试中得分90%,是第一个超越人类专家的模型;在包含了数学、物理、历史等57个学科测试中,都表现得和这些领域最好的专家一样好。在32个常用的学术标准中,Gemini在其中30个标准上已经超越GPT-4,特别是音频和视频领域。 Pika1.0正式测评超出预期,海内外巨头积极布局AI视频赛道。Pika 1.0随着首批账号发放,正式测评也席卷全球媒介,正式版本不仅能够生成3D动画、动漫、卡通和电影,在风格转换、幕布扩展等上同样表现惊艳。在按邀请页面流量排序的AI应用程序中,Pika目前已成为仅次于Midjourney的第二大应用程序。除Pika外,11月初Runway宣布发布Gen-2更新,为视频结果的保真度和一致性带来重大改进,分辨率显著升级;Meta、Adobe、Stable Diffusion等海内外科技巨头及AI独角兽公司均在11月加速驶入AI生成视频赛道。 传媒作为内容赛道,兼具文字、图片、音乐、视频等多维度属性,与AIGC单维度及跨维度结合成为重点。目前AI在广告、游戏等领域降本增效已有所成效;而基于增收逻辑的AI+产品也正随着海内外大模型多模态变革走向商业化。如广告领域易点天下发布AIGC数字营销创作平台Kreado AI已覆盖超过全球60+国家、注册用户突破60万;电商领域焦点科技发布AI麦可并进行版本持续迭代;游戏领域盛天网络AI音乐社交产品“给麦”开启商业化变现。多模态大模型、AI+视频海外底层技术和应用突破加速,我们认为国内AI+游戏、AI+广告、AI+电商、AI+影视也将加速落地,建议关注相关投资机会。 风险提示 1、AI技术发展不及预期风险; 2、内容监管风险。
|
|