>> 长江证券-媒体行业AI系列跟踪(78):Sora出圈带动AI视频迎来变革,腾讯生图模型、视觉模型表现亮眼-251010
| 上传日期: |
2025/10/11 |
大小: |
602KB |
| 格式: |
pdf 共5页 |
来源: |
长江证券 |
| 评级: |
看好 |
作者: |
高超,杨云祺 |
| 下载权限: |
此报告为加密报告 |
|
|
事件描述 10月1日Sora发布Sora2模型及Sora App,模型能力获得显著提升,且AI版“抖音”上线后迅速在美国等市场走热。近期腾讯混元发布一系列多模态新模型,多个模型在LMArena等榜单中取得亮眼表现。 事件评论 Sora2出圈,AI+视频方向迎来新变革。10月1日Sora发布Sora2模型及Sora App。Sora 2已正式升级为音视频同步生成模型,且更能遵循遵守物理定律、具有更强的可控性和逻辑一致性,并且可以将现实世界的元素直接“注入”到视频生成中。Sora App定位于短视频社交应用,类似于“AI版”抖音短视频平台。OpenAI表示,Sora iOSAPP旨在让用户与朋友共同使用,它为用户提供了工具与自主选择空间,用户能够掌控自己在信息流中看到的内容,并依托OpenAI现有的LLM研发了全新类别的推荐算法,用户可通过自然语言对其下达调控指令。发布仅三天,Sora APP便超越谷歌Gemini、OpenAI自家ChatGPT等强势登顶美国App Store榜首。Sora APP出圈验证AI视频领域的用户需求和市场空间。 腾讯多模态新模型表现在行业内领先。9月28日腾讯混元图像3.0发布,宣布开源并免费使用。混元图像3.0是首个工业级原生多模态生图模型,参数规模80B,也是目前测评效果最好、参数量最大的开源生图模型,效果可对标业界头部闭源模型。混元图像3.0具备常识并能够利用知识进行推理;同时语义理解准确度高,并具备极致美学质感,能生成真实的高质感图片;支持中英文文字生成,长文本文字渲染。10月5日国际大模型竞技场LMArena最新文生图榜单显示,混元图像3.0在全球26个大模型中位居第一位,超过nano-banana等顶尖闭源模型。腾讯混元图像3.0发布后在Hugging Face开源社区持续一周稳居开源模型热榜第一。视觉理解能力方面,混元视觉理解最新的模型HunyuanVision-1.5-Thinking在7日发布的国际大模型竞技场LMArenaVision赛道排行榜中位居全球Top3,国内第1。该模型具备领先的多语言多模态理解和推理能力,能够通过多轮的反思,更加深入地理解“看”到的内容,完成相应的指令任务,例如让模型识别图片中的物体、图中的多语言图表、通过多轮思考和推理并拆分问题深度思考等。我们认为腾讯在模型能力方面亦具备较强的行业竞争力,多模态正在成为混元大模型的核心竞争力之一,混元3D与图像生成模型均处于行业顶尖水平。在3D生成领域,8月上海人工智能实验室的全球3D生成模型评测榜单显示,混元3D模型在图生3D和文生3D任务中均位列第一;混元世界模型Voyager在斯坦福大学WorldScore基准测试中综合能力排名首位,混元3D系列模型社区下载量超过260万,是全球最受欢迎的3D开源模型。 建议关注以下AI细分赛道:1)优质IP或受益于AI技术演进带来的创作效率和变现价值提升,看好具备强IP储备和运营能力的公司,关注工具型实力领先的且AI能力持续迭代升级的快手等;2)大厂具备流量分发、模型、数据等优势,聚焦to CAIAgent打造商业闭环,关注腾讯控股等;3)海外已跑通商业模式,国内有望复制的广告、电商、教育等垂直赛道;4)AI+游戏陆续落地,关注AI布局积极的巨人网络、恺英网络等游戏厂商。 风险提示 1、AI技术发展及应用落地不及预期风险;2、内容监管风险。
|
|