>> 中泰证券-科技行业:Llama 2升级迭代效果显著,有望加速应用端落地-230730
| 上传日期: |
2023/7/31 |
大小: |
1289KB |
| 格式: |
pdf 共16页 |
来源: |
中泰证券 |
| 评级: |
-- |
作者: |
闻学臣 |
| 下载权限: |
此报告为加密报告 |
|
|
Llama2:最大规模70B,部分任务评分可媲美GPT-3.5和PaLM-540B 2023年7月19日,Meta发布了Llama2开源预训练大模型。该模型是Llama1的更新版本,在公开可用的数据集上进行训练。与LLaMA相比,预训练语料库的大小增大约40%,达到了2.0T。同时模型的上下文长度增加到了4k tokens,并采用了分组查询注意力机制(GQA, grouped-query attention)。 Llama 2有7B、13B、34B和70B的四个版本,在多项基准测试中表现优异。特别是在阅读理解和常识推理方面,70亿参数规模的Llama 2预训练模型的表现已经可以与当前顶尖的预训练语言模型GPT-3.5和PaLM-540B相媲美。 Llama 2-Chat是Llama 2的微调版本,经过了多轮微调和优化以适用于对话任务。Meta发布了该模型的7亿、13亿和70亿参数规模的变体。 高质量预训练:数据集包含2万亿tokens,英语语料占比近90% Llama 2的预训练过程持续约4个月,主要在Meta自建的AI研究超级计算集群(RSC)和内部生产集群上完成。所有模型训练总耗时约330万GPU小时。 Llama 2使用来自公开数据源的预训练数据,总计2万亿tokens,其中不包含任何Meta用户数据。预训练数据主要以英语为主,占比近90%,代码占比约8.4%,其次是德语、法语等其他语言的语料数据。 投资建议和风险提示 Llama 2发布后,能够成为目前最有竞争力的开源模型。目前有部分海内外应用端厂商会选择使用Llama进行精调,再进行有针对性的应用部署。Llama 2发布之后,部分厂商可以基于Llama 2进行模型精调和部署,能够获得比之前模型更佳的表现结果。对于一些应用端厂商,在进行基础模型迭代后有望大幅提升应用端产品能力。我们认为应当更关注应用端公司,相关应用有望加速落地。 对于大模型而言,提升效果最重要因素依旧是数据质量。Llama 2相比Llama 1,除了常规扩大预训练的规模之外,最主要的就是对SFT使用的数据进行搜集,没有选择使用第三方的精调数据集。因此我们认为,应当更关注拥有高质量训练数据的模型厂商。 应当更加关注大模型尤其是开源模型的安全性。Llama 2模型训练了高质量的安全和可用性奖励模型,对模型的安全效果进行了RLHF约束。近期各国也陆续发布有关生成式人工智能的法律或监管规范。我们认为,在效果之外应当更加关注模型的安全性,重视相关安全应用厂商机会。 模型厂商:未来的格局将是基础大模型+行业/场景模型,建议关注科大讯飞、三六零、格灵深瞳、云天励飞、云从科技等; 应用场景厂商:任何一轮技术的创新最终都将带来应用的大发展、大繁荣,建议按照下列标准寻找应用机会: 1)与AIGC技术相关度更为直接的应用场景,内容的丰富与工具生产力的提升,建议关注金山办公、广联达、万兴科技、中望软件、彩讯股份等; 2)高价值、高壁垒、数据量大的垂直场景,如金融、医疗、教育等,建议关注恒生电子、同花顺、明源云、中科软、宇信科技、京北方、长亮科技、顶点软件、创业慧康、嘉和美康、久远银海、卫宁健康等; 基础算力层厂商:建议关注服务器厂商浪潮信息、中科曙光、工业富联、宝信软件等; 安全厂商:人工智能时代攻防双方都将迎来新的机会和挑战,建议关注深信服、安恒信息、启明星辰、三未信安、天融信、安博通、迪普科技、奇安信、亚信安全、中孚信息、绿盟科技、山石网科、永信至诚等。 风险提示:技术落地不及预期,竞争加剧等
|
|