>> 五矿证券-电子行业点评:Sora模型横空出世,AIGC行业又一里程碑-240220
| 上传日期: |
2024/2/20 |
大小: |
1180KB |
| 格式: |
pdf 共7页 |
来源: |
五矿证券 |
| 评级: |
看好 |
作者: |
王少南 |
| 行业名称: |
电子 |
| 下载权限: |
此报告为加密报告 |
|
|
事件描述 2月16日凌晨,OpenAI发布了文生视频AI模型Sora,可以根据文本提示(prompt)、静态图像或视频直接生成或扩展视频,视频时长可达1分钟。 事件点评 OpenAI发布了具有里程碑意义的文生视频AI模型Sora。Sora能够生成具有多个角色、特定类型的主题和运动,具备准确且高清的细节特征的复杂场景。该模型不仅满足用户在prompt中要求的内容,还了解这些东西在物理世界或数字世界中的存在方式。此外,Sora还可以在单个视频中创建多个镜头,且准确保留角色和视觉风格的一致性和连贯性。当前OpenAI尚未向公众开放,仅向数量有限的红队成员以及艺术家、制作人开放权限。 Sora亮点1:首次提出统一各类视觉数据的——patch,打通了扩散模型和大模型之间的桥梁。为了对齐不同时长、分辨率和纵横比的视觉数据,Sora在训练时先将大量不统一的视频和图像编码为较小的数据单元集合patches,使得Sora可以使用更加广泛的视觉数据来训练扩散模型。Patch的出现打通了扩散模型与transformer架构下大模型之间的桥梁,使得Sora能够在DALL·E和GPT模型技术基础上,生成高质量的视频。且OpenAI官方技术报告显示,训练计算量越大,样本质量的提升越显著。 Sora亮点2:“涌现”出新的模拟功能,视频长度、镜头切换效果与画面流畅度大幅提升,“世界模型”雏形初显。受益于扩散模型的生成和transformer注意力机制下的推理能力,Sora在训练过程中“涌现”了许多新型的模拟功能,而非得益于对3D、物体等属性的归纳偏置(inducitive bias):1)3D一致性;2)远距离相干性和物体持久性;3)模拟物理世界的交互性;4)模拟数字世界。得益于涌现出的创新功能和领先技术,有别于传统AI视频生成工具,OpenAI的Sora模型能够实现场景和物象的多视角、逻辑合理、内容连贯且稳定的高清镜头切换,在生成视频的时长(60s)上也遥遥领先。 Sora的推出给文生视频产业明确发展路径:更丰富的下游应用、更高的算力需求与安全需要。我们认为,在软件领域,Sora的推出将进一步加深和拓宽OpenAI的护城河;在底层算法和模型方面,少数巨头将占据主导地位;下游第三方应用与生态将不断丰富。在硬件领域,一方面,Sora模型本身需要更丰富的数据和更强的算力来优化其性能,另一方面,丰富的第三方应用生态和更多的视频创作者也带来了更高的算力需求。因此,我们看好相关AI文生视频,AI算力芯片,光模块等产业,以及给AIPC等端侧硬件带来的新机遇。此外,目前推出的Sora模型仍存在弱点,且安全性问题尚未推出完整的解决方案,因此,AIGC视频在中短期内将主要扮演“辅助者”的角色,未来对于模型的安全性问题以及相关规则制度的建立将势在必行。 风险提示:1、宏观经济恢复不及预期,下游行业需求不及预期;2、贸易摩擦加剧,供应链进一步受限的风险;3、技术研发和迭代、产品推进不及预期,存在国产替代不及预期的风险;4、行业竞争加剧,使得部分企业盈利能力下滑的风险。
|
|