>> 浙商证券-AI+行业系列之智能驾驶:自动驾驶的“大模型”时代-230923
| 上传日期: |
2023/9/24 |
大小: |
2278KB |
| 格式: |
pdf 共39页 |
来源: |
浙商证券 |
| 评级: |
看好 |
作者: |
刘雯蜀,刘静一 |
| 下载权限: |
此报告为加密报告 |
|
|
1、大模型技术发展历程 大模型泛指具有数十亿甚至上百亿参数的深度学习模型,而大语言模型是大模型的一个典型分支(以ChatGPT为代表)。Transformer架构的提出引入了注意力机制,突破了RNN和CNN处理长序列的固有局限,使语言模型能在大规模语料上得到丰富的语言知识预训练,一方面,开启了大语言模型快速发展的新时代;另一方面奠定了大模型技术实现的基础,为其他领域模型通过增大参数量提升模型效果提供了参考思路。 复杂性、高维度、多样性和个性化要求使得大型模型在自动驾驶、量化交易、医疗诊断和图像分析、自然语言处理和智能对话任务上更易获得出色的建模能力。 2、自动驾驶模型迭代路径 自动驾驶算法模块可分为感知、决策和规划控制三个环节,其中感知模块为关键的组成部分,经历了多样化的模型迭代:CNN(2011-2016)—— RNN+GAN(2016-2018)—— BEV(2018-2020)—— Transformer+BEV(2020至今)——占用网络(2022至今)。 特斯拉自动驾驶技术路径的演进可视为自动驾驶技术迭代的风向标,呈现全栈自研、出软硬件的协同发展趋势:软件层面从采用Mobileye到自研Transformer+BEV和占用网络;硬件层面从与Mobileye、英伟达合作到自研FSD芯片方案。 3、大模型对自动驾驶行业的赋能与影响 自动驾驶领域的大模型发展相对大语言模型滞后,大约始于2019年,吸取了GPT等模型成功经验。大模型的应用加速模型端的成熟,为L3/L4级别的自动驾驶技术落地提供了更加明确的预期。 可从成本、技术、监管与安全四个层面对于L3及以上级别自动驾驶落地的展望,其中:成本仍有下降空间;技术的发展仍将沿着算法和硬件两条主线并进;法规政策还在逐步完善之中;安全性成为自动驾驶汽车实现商业化落地必不可少的重要因素。 各主机厂自2021年开始加速对L2+自动驾驶的布局,且预计在2024年左右实现L2++(接近L3)或者更高级别的自动驾驶功能的落地,其中政策有望成为主要催化 风险提示 1、自动驾驶算法研发与迭代不及预期 2、智能网联汽车政策落地不及预期 3、由于中美关系影响导致自动驾驶芯片供应链出现波动的风险 4、行业竞争加剧导致价格战的风险 5、报告中的统计信息均为基于公开信息的不完全统计,各公司实时动态和最新发展可能存在动态调整
研究报告全文:证券研究报告自动驾驶的大模型时代AI行业系列之智能驾驶行业评级看好2023年9月23日分析师刘雯蜀分析师刘静一邮箱liuwenshu03stockecomcn邮箱liujingyistockecomcn证书编号S1230523020002证书编号S1230523070005摘要1大模型技术发展历程大模型泛指具有数十亿甚至上百亿参数的深度学习模型而大语言模型是大模型的一个典型分支以ChatGPT为代表Transformer架构的提出引入了注意力机制突破了RNN和CNN处理长序列的固有局限使语言模型能在大规模语料上得到丰富的语言知识预训练一方面开启了大语言模型快速发展的新时代另一方面奠定了大模型技术实现的基础为其他领域模型通过增大参数量提升模型效果提供了参考思路复杂性高维度多样性和个性化要求使得大型模型在自动驾驶量化交易医疗诊断和图像分析自然语言处理和智能对话任务上更易获得出色的建模能力952自动驾驶模型迭代路径自动驾驶算法模块可分为感知决策和规划控制三个环节其中感知模块为关键的组成部分添加标题经历了多样化的模型迭代CNN2011-2016RNNGAN2016-2018BEV2018-2020TransformerBEV2020至今占用网络2022至今特斯拉自动驾驶技术路径的演进可视为自动驾驶技术迭代的风向标呈现全栈自研出软硬件的协同发展趋势软件层面从采用Mobileye到自研TransformerBEV和占用网络硬件层面从与Mobileye英伟达合作到自研FSD芯片方案3大模型对自动驾驶行业的赋能与影响自动驾驶领域的大模型发展相对大语言模型滞后大约始于2019年吸取了GPT等模型成功经验大模型的应用加速模型端的成熟为L3L4级别的自动驾驶技术落地提供了更加明确的预期可从成本技术监管与安全四个层面对于L3及以上级别自动驾驶落地的展望其中成本仍有下降空间技术的发展仍将沿着算法和硬件两条主线并进法规政策还在逐步完善之中安全性成为自动驾驶汽车实现商业化落地必不可少的重要因素各主机厂自2021年开始加速对L2自动驾驶的布局且预计在2024年左右实现L2接近L3或者更高级别的自动驾驶功2能的落地其中政策有望成为主要催化风险提示1自动驾驶算法研发与迭代不及预期2智能网联汽车政策落地不及预期3由于中美关系影响导致自动驾驶芯片供应链出现波动的风险4行业竞争加剧导致价格战的风险5报告中的统计信息均为基于公开信息的不完全统计各公司实时动态和最新发展可能存在动态调整301大模型技术发展历程自动驾驶技术迭代路径02感知算法迭代路径特斯拉软硬件解决方案迭代路径目录大模型对自动驾驶行业的赋能与影响CONTENTS03大模型对自动驾驶行业的赋能高级别自动驾驶落地展望车厂自动驾驶布局04风险提示401大模型技术发展历程Partone501大模型基本定义与基础功能大模型基本定义由大语言模型到泛在的大模型大模型主要指具有数十亿甚至上百亿参数的深度学习模型图大模型发展历程比较有代表性的是大型语言模型LargeLanguageModels比如最近大热的ChatGPT大型语言模型是一种深度学习算法可以使用非常大的数据集来识别总结翻译预测和生成内容大语言模型在很大程度上代表了一类称为Transformer网络的深度学习架构Transformer模型是一个神经网络通过跟踪序列数据中的关系像这句话中的词语来学习上下文和添加标题含义Transformer架构的提出开启了大语言模型快速发展的新时代谷歌的BERT首先证明了预训练模型的强大潜力OpenAI的GPT系列及Anthropic的Claude等继续探索语言模型技术的边界越来越大规模的模型不断刷新自然语言处理的技术状态这些模型拥有数百亿或上千亿参数可以捕捉语言的复杂语义关系并进行人类级别的语言交互6资料来源NVIDIA官网GitHub网站浙商证券研究所01解锁大模型时代的钥匙Transformer的注意力机制图Transformer模型架构图注意力机制Transformer的核心创新Transformer模型最大的创新在于提出了注意力机制这一机制极大地改进了模型学习远距离依赖关系的能力突破了传统RNN和CNN在处理长序列数据时的局限在Transformer出现之前自然语言处理一般使用RNN或CNN来建模语义信息但RNN和CNN均面临学习远距离依赖关系的困难RNN的序列处理结构使较早时刻的信息到后期会衰减而CNN的局部感知也限制了捕捉全局语义信息这使RNN和CNN在处理长序列时往往难以充分学习词语之间的远距离依添加标题赖Transformer注意力机制突破了RNN和CNN处理长序列的固有局限使语言模型能在大规模语料上得到丰富的语言知识预训练该模块化可扩展的模型结构也便于通过增加模块数量来扩大模型规模和表达能力为实现超大参数量提供了可行路径Transformer解决了传统模型的长序列处理难题并给出了可无限扩展的结构奠定了大模型技术实现的双重基础7资料来源AttentionIsAllYouNeedAshishVaswani等浙商证券研究所01大模型超越传统的新范式大模型的预训练-微调范式图增大参数量的优点大模型代表了一种新的预训练-微调范式其核心是先用大规模数据集预训练一个极大的参数模型然后微调应用到具体任务这与传统的单任务训练形成了对比标志着方法论的重大变革参数量的倍数增长是大模型最根本的特点从早期模型更好的表示能力增大泛化能力和迁移学习的百万量级发展到现在的十亿甚至百亿量级实现了与以往参数量使模型能够更好地大模型能够从一个领域学数量级的突破学习数据中的复杂关系和习到的知识迁移到另一个Transformer架构的提出开启了NLP模型设计的新纪元它引模式从而提高模型的表领域实现更好的迁移学入了自注意力机制和并行计算思想极大地提高了模型处理长示能力使其在不同任务添加标题习效果这对于数据稀缺距离依赖关系的能力为后续大模型的发展奠定了基础正是上表现更出色的任务尤其有价值由于Transformer架构的成功研究者们意识到模型的架构设计在处理复杂任务和大规模数据中发挥着举足轻重的作用这一认识激发了研究者进一步扩大模型参数量的兴趣虽然之前零样本学习增大参数也曾有过扩大参数量的尝试但因受限于当时模型本身的记忆创新和探索大模型的量可以使模型更好地利用力等能力提高参数数量后模型的改进并不明显强大能力可以帮助人们进已有的知识和模式从而行更多创新性的实验和探GPT-3的成功充分验证了适度增大参数量能显著提升模型的泛在零样本学习中取得更好索挖掘出更多数据中的化能力和适应性由此掀起了大模型研究的热潮它凭借过的效果即使只有很少的隐藏信息千亿参数量和强大的语言生成能力成为参数化模型的典范示例也能完成任务GPT-3在许多NLP任务上表现亮眼甚至在少样本或零样本学习中也能取得惊人的效果8资料来源AttentionIsAllYouNeedAshishVaswani等浙商证券研究所01大模型的域差异NLP大模型发展为何领先计算机视觉领域NLP任务涉及大规模文本数据易于获取处理和标注而视觉数据的采集和标注相对数据特点和计算资源更为复杂和昂贵早期计算资源有限难以支持视觉领域大模型的训练NLP问题要求模型理解语义上下文和逻辑大模型有助于捕捉这些特征任务复杂性与需求视觉问题更注重图像特征提取和模式识别不需要过大的参数量即可实现较好效果早期或不紧迫需要大模型的加入添加标题早期语言模型如RNNLSTM为NLP领域的大模型奠定基础促使研究关注构建更大模型与算法发展复杂的模型早期视觉领域主要使用CNN等模型注重局部特征的提取未迫切需要大模型的引入视觉数据的标注通常需要人工干预而NLP领域的文本数据可以相对容易地进行自动标模型架构和数据标注注大模型在大规模通用语料上进行预训练之后已经学会了广泛的知识然后迁移到下游特定标注任务中微调就可以减少人工标注的需求9资料来源TheUnreasonableEffectivenessofRecurrentNeuralNetworks2015浙商证券研究所01探索大模型任务适配性模型变革与应用前景与早期的人工智能模型相比大型模型在参数量上取得了质的飞跃导致了在复杂任务的建模能力整体上的提升1学习能力增强以应对更复杂的任务2泛化能力加强以实现更广泛的适用性3鲁棒性提高4具备更高层次认知互动能力可模拟某些人类能力等复杂性高维度多样性和个性化要求使得大型模型在某些任务上更易获得出色的建模能力多模态传感器数据的融合分析尤其涉及到时序数据的处理如自动驾驶复杂且动态的目标需要模型从大规模多样化的数据模式中学习如金融领域中的量化交易策略优化涉及异构数据源的高维输入空间如医学图像和报告需要为不同用户或场景进行个性化建模的定制化需求如智能助理添加标题自动驾驶量化交易医疗诊断和图像分析自然语言处理智能对话大模型可以分析多模态传大模型在金融领域可以优在医疗领域大模型可以大模型在自然语言处理任感器数据如视觉图像化量化交易策略通过学处理医学图像如X射线务中表现优异可以用于激光雷达数据和车辆信息习大规模的市场数据模式MRICT扫描等以及临智能助理在线客服自帮助自动驾驶系统更好地预测股票价格和市场趋势床报告等多种数据源帮动翻译等应用提供更自理解复杂的交通场景做助医生更准确地诊断疾病然准确和流畅的对话体出准确的决策提高驾驶发现潜在问题并提供治疗验安全性建议10资料来源NVIDIA官网浙商证券研究所02自动驾驶技术迭代路径Partone1102自动驾驶算法核心模块概览自动驾驶算法模块可分为感知决策和规划控制三个环节其中感知模块为关键的组成部分感知模块负责解析并理解自动驾驶所处车辆周边的交通环境是实现自动驾驶的基础和前提感知模块的精准程度直接影响并制约着自动驾驶系统的整体安全性和可靠性感知模块主要通过摄像头激光雷达毫米波雷达等各类传感器获取输入数据然后通过深度学习等算法准确解析出道路标线其他车辆行人交通灯路标等场景元素以供后续流程使用与感知模块相比决策和规划控制等模块的作用更为单一和被动这些模块主要依据感知模块输出的环境理解结果通过算法决策生成驾驶策略并实时规划车辆的运动轨迹和速度最终转换为控制命令以实现自动驾驶因此在自动驾驶研发过程中工程师投入的时间和精力主要放在提升感知算法上的精度上图自动驾驶汽车架构概述12资料来源MDPI官网浙商证券研究所02CNN2011-2016CNN引发自动驾驶领域的首次革新浪潮随着深度学习和计算能力的提升卷积神经网络CNN在图像识别任务上的出色表现引发了自动驾驶领域的首次革新浪潮2011年IJCNN的论文TrafficSignRecognitionwithMulti-ScaleConvolutionalNetworks展示了CNN在交通标志识别方面的潜力2016年Nvidia团队发表的End-to-EndDeepLearningforSelf-DrivingCars成为最早将CNN应用于端到端自动驾驶的工作之一CNN极大提升了自动驾驶车辆的环境感知能力一方面CNN在图像识别与处理方面的卓越表现使车辆能够准确分析道路交通标志行人与其他车辆另一方面CNN有效处理多种传感器数据的优势实现了图像激光雷达等数据的融合提供全面的环境认知叠加计算效率的提高CNN模型进一步获得了实时进行复杂的感知与决策的能力但CNN自动驾驶也存在一定局限性1需要大量标注驾驶数据进行训练而获取足够多样化数据具有难度2泛化性能有待提高3鲁棒性也需要经受更复杂环境的考验4时序任务处理能力相比较而言RNN等其他模型可能更占优势图一个两阶段的卷积神经网络架构输入通过两个卷积和子采样阶段进行前馈处理最终通过线性分类器进行分类第一阶段的输出还被直接馈送给分类器作为更高分辨率的特征13资料来源EndtoEndLearningforSelf-DrivingCarsMariuszBojarski等Trafficsignrecognitionwithmulti-scaleConvolutionalNetworksPierreSermanet等NVIDIA官网浙商证券研究所02RNNGAN2016-2018RNN和GAN被广泛应用到自动驾驶相关的研究推动自动驾驶在对应时间区间内快速发展RNN相较于CNN更适合处理时间序列数据RNN的循环结构可以建模时间上的动态变化这对处理自动驾驶中的轨迹预测行为分析等时序任务非常有用例如在目标跟踪多智能体互动建模等领域RNN和LSTMRNN的改进版本带来了巨大突破可以预测车辆未来的运动轨迹为决策和规划提供支持GAN的生成能力缓解自动驾驶系统训练数据不足的问题GAN可以学习复杂分布生成高质量的合成数据为自动驾驶领域带来了新思路用于缓解自动驾驶系统训练数据不足的问题例如GAN可以生成模拟的传感器数据场景信息测试自动驾驶算法的鲁棒性也可以用于交互式模拟场景生成RNNGAN可以实现端到端的行为预测和运动规划RNN负责时序建模GAN负责数据生成两者相互协同可以为自动驾驶系统提供更全面和可靠的环境感知状态预测和决策支持图融合了LSTM和GAN的模型架构图14资料来源Interaction-awareMulti-agentTrackingandProbabilisticBehaviorPredictionviaAdversarialLearningJiachenLi等浙商证券研究所02RNNGANRNN和GAN仍未解决的问题RNN类模型长期时序建模能力仍较弱特别是在处理较长的时间序列数据时可能出现梯度消失或梯度爆炸的问题限制了它在某些自动驾驶任务上的应用效果GAN模型生成的数据质量难以控制很难达到足够逼真的程度此外尽管GAN可以生成合成数据但在实际应用中它在自动驾驶领域的具体应用仍相对有限样本效率低RNN和GAN在样本效率方面仍较低通常需要大量的真实场景数据来训练和优化模型而且这些模型难以解释缺乏对内部决策过程的清晰解释同时模型的稳定性和可靠性也是需要进一步解决的问题之一RNN和GAN在自动驾驶领域应用趋冷的原因效率和实时性需求自动驾驶系统需要在实时性要求较高的情况下做出决策和控制传统的RNN在处理序列数据时存在计算效率较低的问题处理实时感知和决策任务能力有限复杂性和泛化能力自动驾驶涉及复杂多变的交通场景和环境需要具备强大的泛化能力然而传统的RNN可能在处理复杂的时序数据时遇到困难而无法很好地适应各种交通情况新兴技术的兴起随着深度学习领域的发展新的模型架构和算法不断涌现如Transformer架构强化学习等这些新技术在处理感知决策和规划等任务方面可能更加高效和适用15资料来源Interaction-awareMulti-agentTrackingandProbabilisticBehaviorPredictionviaAdversarialLearningJiachenLi等浙商证券研究所02BEV2018-2020基于鸟瞰视角BEV的模型在自动驾驶领域获得了广泛的研究和应用BEV模型的核心思想是将车辆周围的三维环境数据如来自激光雷达和摄像头的点云图像等数据投影到俯视平面上生成二维的鸟瞰图这种将三维信息压平成二维表示的方式为自动驾驶系统的环境感知和理解带来了重要优势鸟瞰图提供了比直接的原始传感器数据更加直观和信息丰富的环境表示可以更清晰地观察道路车辆行人标志等元素的位置和关系增强自动驾驶对复杂环境的感知能力全局的俯视视角更有利于路径规划和避障系统进行决策根据道路和交通状况规划更合理稳定的路径BEV模型可以将来自不同传感器的输入数据统一到一个共享表示中为系统提供更加一致和全面的环境信息但是BEV模型也存在一些问题亟待解决图BirdNet3D对象检测框架从原始三维数据生成BEV表示需要进行大量坐标变换和数据处理增加了计算量和对硬件的要求信息损失问题三维信息投影到二维时难免会损失一些细节如遮挡关系等不同传感器到BEV坐标系的转换也需要进行复杂的标定和校准需要研究如何有效融合各种异构数据源网络的三个输出是类别绿色2d边以生成更加准确和完整的BEV界框蓝色和偏航角红色16资料来源BirdNeta3DObjectDetectionFrameworkfromLiDARinformationJorgeBeltran等浙商证券研究所02TransformerBEV2020年以来TransformerBEV结合正在成为自动驾驶领域的重要共识推动自动驾驶技术进入崭新发展阶段将Transformer模型与BEV鸟瞰视角表示相结合的方法正在成为自动驾驶领域的重要共识推动完全自主驾驶的实现一方面BEV可以高效表达自动驾驶系统周围的丰富空间信息另一方面Transformer在处理序列数据和复杂上下文关系方面展现了独特优势在自然语言处理等领域得到成功应用两者结合可以充分利用BEV提供的环境空间信息以及Transformer在多源异构数据建模方面的能力实现更精确的环境感知更长远的运动规划和更全局化的决策图以对象为中心的TransformerBEV的总体架构a对象对齐时间融合首先根据车辆自身的移动情况把当前时刻t时刻的鸟瞰视角地图变形调整成上一时刻t-1时刻的样子这样就可以根据对象在上一时刻的位置结合速度预测出它当前的位置从而实现对象在不同时刻地图上的融合b对象聚焦多视图采样首先在三维空间预设一些点然后把这些点投影到图像上的特征上这样不仅可以在整个高度范围采样还可以对某些主要对象按照自适应和聚焦的方式在它们所处的局部空间区域采样更多点c对象通知查询增强在编码器处理图像特征后添加热图的监督信息同时用检测到对象高置信度位置对应的点来替换掉原本预设要查询的一些点17资料来源OCBEVObject-CentricBEVTransformerforMulti-View3DObjectDetectionZhangyangQi等浙商证券研究所02TransformerBEVGPT的出现对TransformerBEV模型的产生起到了重要影响GPT的成功表明了Transformer模型的潜力促使更多研究者将Transformer应用到计算机视觉和自动驾驶领域产生了TransformerBEV的创新做法GPT的预训练思想为TransformerBEV的预训练和迁移学习提供了借鉴可以通过预训练捕捉语义信息然后迁移应用OpenAI公开的代码和模型也加速了Transformer类模型在各领域的研究进程当前TransformerBEV模型受关注主要基于它综合了Transformer和BEV各自的优势Transformer擅长处理序列数据捕捉语义信息而BEV提供场景整体观有利解析空间关系两者组合可实现互补增强对复杂场景的理解表达自动驾驶数据积累为训练大模型奠定基础大数据支持学习更复杂特征提升环境感知精度也使端到端学习成为可能提升安全性和泛化能力仍是自动驾驶核心难题目前阶段TransformerBEV较好地结合语义理解和多视角建模可处理相对不常见复杂或者挑战性的交通场景或环境具有很大潜力18资料来源OCBEVObject-CentricBEVTransformerforMulti-View3DObjectDetectionZhangyangQi等浙商证券研究所02占用网络模型2022年特斯拉率先在自动驾驶系统中使用了占用网络模型实现了对道路场景的高效建模特斯拉在2023年AIDay公开了occupancynetwork占用网络模型基于学习进行三维重建意图为更精准地还原自动驾驶汽车行驶周围3D环境可视作BEV视图的升华迭代BEVTransformer的不足鸟瞰图为2D图像会缺失一些空间高度信息无法真实反映物体在3D空间的实际占用体积故而在BEV中更关心静止物体如路沿车道线等而空间目标的识别如物体3D结构难以识别占用网络现存三维表示方法体素网格点云在储存结构和是否利于学习方面均不够完全理想而占用网络基于学习将三维曲面表示为深度神经网络分类器的连续决策边界可以在没有激光雷达提供点云数据的情况下对3D环境进行重建且相较于激光雷达还可以更好地将感知到的3D几何信息与语义信息融合得到更加准确的三维场景信息图BEV鸟瞰视图图占用网络3D视图19资料来源Cleantechnicaelon-musk-interviews浙商证券研究所02特斯拉自动驾驶感知算法发展路径解析基于Mobileye的视觉算法技术BEV基于Mobileye的视觉算法技术2014-20162014年到2016年期间特斯拉自动驾驶系统采用了Mobileye的视觉算法技术Mobileye为特斯拉第一代自动驾驶提供了单目相机系统可以检测车道线车辆行人交通标志牌并分析自由空间通过特征提取目标检测等算法特斯拉能对前方道路情况进行感知并建模为决策规划提供环境输入双方合作推动特斯拉早期自动驾驶能力发展后因Mobileye产品体系过于封闭特斯拉决定自主研发感知系统这一期间的合作积累为特斯拉奠定了自动驾驶视觉感知的基础BEV2016-2021从2016年特斯拉自研自动驾驶系统开始特斯拉采用了鸟瞰视角BEV来建模自动驾驶系统的环境BEV将多源传感器数据投影到地面平面可以直观表达场景元素的空间关系使自动驾驶系统更好地看到车辆周围的全部情况但BEV难以分析远处目标的关联性特斯拉后来将BEV与Transformer等技术结合以融合局部和全局信息BEV奠定了特斯拉自动驾驶的环境建模基础特斯拉在大量实际道路数据的支持下不断优化BEV系统以产生更精确的三维场景表示为后续的规划与控制提供输入TransformerBEV2021至今2021年在BEV的基础上特斯拉将Transformer引入感知系统Transformer通过并行计算高效提取全局上下文信息以弥补BEV难以建模远距离依赖的不足BEVTransformer架构融合局部和全局信息增强对复杂交通场景的理解表达能力同时特斯拉大规模预训练该模型运用海量实车数据提升泛化能力提升了特斯拉FSD系统的安全性和可靠性在场景转换交通预测等情况下TransformerBEV展现出较强的鲁棒性特斯拉持续通过这一前沿架构迭代自动驾驶感知算法以处理更复杂的城市交通环境资料来源华尔街日报Auto-Data网站特斯拉官网infnews网站EVANNEX网站浙商证券研究所
|
|