研报下载就选股票报告网
您好,欢迎来到股票分析报告网!登录   忘记密码   注册
>> 华泰证券-金工深度研究-“GPT如海”:RAG与代码复现-240506
上传日期:   2024/5/6 大小:   2514KB
格式:   pdf  共19页 来源:   华泰证券
评级:   -- 作者:   林晓明,何康
下载权限:   此报告为加密报告
人工智能系列之77:基于GPT和RAG技术的代码复现系统
  本文探索大语言模型在量化研究领域中进行代码复现的实际应用。基于GPT-4系列模型和RAG技术,本文构建了一个完善且易用的代码复现框架,我们称之为“GPT如海”。在框架内部,GPT多模态模型提供了提取图片语义信息的能力,RAG模块则有效支持海量文档的切分与检索,为大模型提供外部知识库,基于此,“GPT如海”能够根据输入的图片或PDF文档,准确提取与代码复现任务相关的信息,并进行代码自动化生成。测试结果显示,“GPT如海”能较准确地复现因子计算和人工智能量化策略代码。
  多模态大语言模型:勾勒图片中蕴含的语义信息
  传统的大语言模型仅能处理单一模态的数据,例如文本,而多模态大模型拥有多模态感知和生成能力,例如图像、语音和视频,在交互性上更贴近通用人工智能的愿景。近年来,多模态大模型已经得到了长足的发展,目前多模态大模型已经具备同时感知文本、图像、音频的能力,并且逐渐发展出生成多模态内容的能力。在量化研究领域中,研究报告同样蕴含较为丰富的多模态数据,包括文本和图像数据,在多模态大语言模型图像感知能力的加持下,代码复现系统可能会更具准确性与实用性。
  检索增强生成:为大语言模型披上知识之铠
  RAG(Retrieval-Augmented Generation,检索增强生成)是一种通过使用外部来源事实构建向量知识库,用于提升生成式人工智能准确性和可靠性的技术。具体而言,在大模型生成内容时,RAG将首先在外部知识库中检索相关信息,随后依据相关信息大模型将生成更为准确的回答。基于可随时更新的外部知识库,RAG在有效提升大模型生成内容的时效性与准确性的同时,降低了大模型产生“幻觉”现象的可能性。对于代码复现系统,RAG能支撑海量文档并提供高效信息检索,为代码生成提供信息依据。
  “GPT如海”可复现因子计算和人工智能量化策略代码
  我们针对不同应用场景设计了两套代码复现模板,分别是因子代码复现和人工智能量化策略代码复现。对于因子代码复现场景,测试结果显示“GPT如海”能够较准确地提取出图片或PDF文档中的因子表达式以及因子构建步骤,并能进一步以此为基础构建因子计算代码;对于人工智能量化策略复现场景,测试结果显示,“GPT如海”能够较准确地提取出人工智能量化策略的构建步骤和细节参数,并依次输出数据集构建、模型架构和模型训练的.py代码,在代码细节上,我们观察到“GPT如海”能够敏锐捕捉到策略构建的细节,例如损失函数设计等,尽管这些细节信息散布在文章各处。
  多模型复现效果对比:小模型也可“纳须弥于芥子”
  在大模型如火如荼的发展进程中,专为响应大模型落地需求的小型大语言模型也渐为兴盛。我们简易对比了GPT-4、通义千问(Qwen 1.5,7B)和Llama3(8B)的代码生成效果,在不同评价维度上,三个模型展现出差异性特征,例如GPT-4并不严格遵守代码模板,而通义千问和Llama3较为遵守代码模板。客观而言,通义千问和Llama3以小参数体量博得不错的代码生成效果,体现出小型模型“纳须弥于芥子”的潜力。
  风险提示:大模型存在幻觉现象,模型生成结果可能不符合事实。大模型生成的代码可能存在错误,使用需谨慎。大模型提取信息可能存在遗漏。大模型训练集广泛,可能存在过拟合风险。
  
  
 
Copyright © 2005 - 2021 Nxny.com All Rights Reserved 备案号:蜀ICP备15031742号-1