>> 中信建投-AI行业点评:OpenAI发布Sora模型,Google发布Gemini 1.5 Pro-240221
| 上传日期: |
2024/2/21 |
大小: |
1136KB |
| 格式: |
pdf 共8页 |
来源: |
中信建投 |
| 评级: |
-- |
作者: |
崔世峰,许悦 |
| 下载权限: |
此报告为加密报告 |
|
|
核心观点 Google发布Gemini 1.5 Pro,拓展上下文窗口至1M tokens,结合研究轨迹推测Gemini调整了注意力计算机制,且对训练数据集做了二次采样,未来长上下文本窗口的发展预计主要依靠训练数据集的优化,关注Google在专有数据集领域的优势。此外,OpenAI发布Sora模型,采用DiT架构及NaViT,复刻GPT系列模型之路,存在Scaling Laws,目前可生成60s内视频,后续通过数据集优化等有望进一步突破。 事件: OpenAI发布文生视频模型Sora,Google发布Gemini 1.5 Pro北京时间2月16日,OpenAI发布首个文生视频模型Sora,可以直接输出长达60秒的视频,并且包含高度细致的背景、复杂的多角度镜头,以及富有情感的多个角色。同时,Google宣布推出全新的Gemini 1.5 AI模型,通过新的专家混合(MoE)架构使Gemini 1.5的训练和服务更加高效。 简评 OpenAI发布Sora,生成视频质量较市面平均水平大幅提高 Sora以Open AI过去DaLLE和GPT模型的研究为基础,同时采用Diffusion Transformer(DiT)模型,能够一次性生成整个视频的长度,并逐步消除噪声完成视频转换。同时在一致性的保障机制上,通过一次性为模型提供多帧预测的方式,Sora可以确保一些物体即使镜头远离也能保持不变。Sora生成的视频在一致性方面强于此前的Runway/Pika。但目前Sora的缺点表现在无法理解因果关系/难以模拟物理定律。 Google推出Gemini 1.5 Pro,MoE架构+长上下文窗口 Gemini 1.5 Pro模型采用MoE架构,性能与Gemini 1.0 Ultra类似。Gemini 1.5 Pro上下文窗口达到12.8万个token,部分开发者和企业用户可以通过Vertex AI和AIStudio的预览版尝试最多100万个token的上下文窗口。在Gemini 1.5技术报告中,Gemini1.5 Pro在较短的文本长度上的性能超过了GPT-4-Turbo,并且在100万token的范围内保持了相对稳定的表现。与之对比,GPT4 Turbo的性能则明显下降,且无法处理超过128,000 token的文本。Gemini 1.5继续强化模型向长上下文窗口发展的趋势。 Gemini 1.5 Pro主要更新上下文窗口,结合研究轨迹推测其结合了数据集二次采样及注意力机制调整。上下文窗口相当于LLM的缓存,目前学界/业界扩展上下文窗口的主要方式包括1)训练数据集的二次采样,例如符尧等1提出通过upsampling(上采样)等方式在预训练环节强化LLM处理长文本的能力,可以将LLM的窗口拓展至128K。;UCB研究团队2则提出通过层次训练高效扩展上下文窗口;2)调整注意力计算机制。Yale及Google团队3提出通过在不损失太多精度的情况下快速近似注意力矩阵的输出,从而实现长文本下的计算速度提升。 Gemini 1.5 Pro在长文本取回方面速度和成本不如RAG,且受限于注意力机制,难以颠覆搜索性能。Gemini 1.5 Pro长文本的取回在速度和成本上较RAG不经济。随文本长度提升,召回率持续下降,仅为60~80%左右,对RAG替代有限。此外,在准确度层面与RAG存在差距,在速度上Elasticsearch 1个节点/1个分片下最大索引吞吐量可达220K,是当前Gemini 1.5 Pro的22x。因此Gemini 1.5 Pro本身在计算、索引等方面的能力仍然弱于专业的搜索引擎。且受注意力机制限制,长文本的计算成本和复杂度指数级提升,架构不大幅改变的情况下很难颠覆搜索性能。 OpenAISora采取DiT模型,复刻GPT系列模型迭代之路。DiT作者谢赛宁推测Sora建立在Transformer(DiT)模型之上,它是一个带有Transformer的扩散模型:DiT = [VAE编码器+ ViT + DDPM + VAE解码器]。其中,Sora可能使用了Google的Patch n’ Pack(NaViT),使DiT能够适应不同的分辨率/持续时间/宽高比。 DiT建立在DDPM基础之上,将DDPM的UNet替换成Transformer。DDPM的本质就是学习训练数据的分布,产出尽可能符合训练数据分布的真实图片。DDPM包含Diffusion/Denoise两个训练过程,且每一轮都加入/去除高斯分布的噪声,需要引入时间标记(即U-Net),类似于Transformer的位置编码。使用Transformer进行改进的处理方式包括1)In-context Conditioning:将条件信息(timestep t和label c)作为额外的token直接添加到输入序列中。2) Cross-attention Block:对条件信息进行特殊处理,构建长度为2的单独序列,然后在其后的Transformer块中增加一个多头交叉注意力层,使得patch与条件信息能够相互作用。3)Adaptive Layer Norm(adaLN) Block:在标准Transformer块内的Layer Norm层替换为adaLN,该层从条件信息(t和c的嵌入向量之和)回归学习到各维度的缩放和偏移参数。 Sora可能采用NaViT,将来自不同图像的多个patches打包成一个序列,从而实现可变分辨率并保持宽高比。实验表明1)NaViT在
|
|