特斯拉多次表示FSDV12将实现全新的“端到端自动驾驶”,模型架构将迎来重大变化。对于新架构的技术细节和潜在影响,市场仍有较多疑惑和分歧。根据特斯拉对外披露的信息及马斯克在X平台(前推特)发布的信息,我们推测特斯拉内部目前有两条“端到端”路线同步在研:1)级联式端到端神经网络;2)World Model。我们认为,FSDV12是前者的可能性较大,有望于明年初落地,以更好地实现L3能力;World Model仍较为新兴,但中长期有望成为自动驾驶乃至具身智能领域的基础模型,可类比GPT之于LLM,或对行业格局产生颠覆性影响。
▍可能性1(较高):级联式端到端神经网络,大幅提升训练效率和性能上限,有望助力自动驾驶系统更好地实现L3能力,但能否迈向L4仍待观望。 技术本质:系统从输入到输出,全程使用神经网络算法,无需任何人工规则介入。当前,自动驾驶模型多为模块化架构,感知预测、规划、控制等不同任务分属于多个不同的小模型,且下游规控环节普遍仍以规则为主。而“端到端”神经网络在输入图像后,可直接输出转向、刹车、加速等控制指令。为提升训练效果,“端到端”的大神经网络可能由多个小的子神经网络级联而成。但与传统模块化架构用“规则”连接模块不同,级联式神经网络的子模块是以“神经网络”的方式自行训练堆叠,因此可通过数据驱动优化整个端到端模型,避免“局部最优,而非全局最优”的困境。 潜在影响:更好地实现L3能力。端到端/神经网络的核心好处在于模型迭代的关键由“工程师”变为了更易于规模化的“数据和算力”,因而训练效率和性能上限有望得到显著提升。落到实处,我们认为端到端方案所展示出的性能潜力有望大幅提升自动驾驶系统的接管水平,从而实现真正无可争议的L3能力(例如达到每周接管1次)。但端到端模型的“黑盒”问题目前产业界尚未有十分成熟的解决方案,因此我们认为,其最终能否迈向追求极致安全性的L4全无人驾驶仍待观望。 发展进度:有望搭载于FSDV12,明年初正式落地的可能性较大。2023年8月26日,马斯克在X平台(前推特)进行了FSDV12 demo的驾驶直播。我们认为,尽管直播中展现出的能力距离正式推送给消费者仍有距离,但可基本推断当前的V12模型已十分接近端到端,再配合特斯拉在数据和算力上的巨大投入,V12接下来至年底的迭代速度有望大幅加快。 ▍可能性2(较低):World Model,有望打造自动驾驶领域的基础底座,引领视觉的GPT时刻;目前或仍处于GPT-1阶段,但发展速度值得期待,中长期看或对行业格局产生颠覆性影响。 技术本质:无需标注、自监督的预训练模型。World Model可生成自动驾驶相关的连续帧视频场景,其本质是对视频中的丰富语义以及背后的物理规律进行学习,从而对物理世界的演化产生深刻理解。基于World Model所提供的丰富语义信息以及对世界强大的理解力,自动驾驶模型的感知与预测能力有望得到显著提升,规划、控制等下游任务也有望迎刃而解。 潜在影响:为自动驾驶提供了一套未经证明的新路径,若得以走通,将对行业产生较大颠覆。中短期来看,World Model或将主要应用于数据合成和仿真模拟环节,厂商的车队规模对算法训练的重要性或有所下降,数据闭环的框架也将有所改变。长期来看,World Model有潜力成为自动驾驶乃至具身智能领域的基础模型,可类比GPT为所有NLP问题提供了一个通用解。考虑到更标准化的解决方案和更巨大的资金投入(资金需求或是这一代BEV+Transformer方案的数倍),行业内有望出现少数几家强大的World Model基础模型层平台方,以SaaS或API的方式为主机厂/运营方提供自动驾驶能力,行业格局和合作模式或将发生较大变化。 发展进度:仍处早期,但发展速度值得期待。我们认为,特斯拉、Wayve等公司不约而同地在今年推出World Model,很大程度上是受到了GPT的启发。目前,World Model或仍处于GPT-1的阶段,但考虑到目前行业整体对“大模型”潜力的强烈共识、算力的升级以及以特斯拉为代表的玩家此前积累的海量数据,我们认为World Model从0到1的爆发或较ChatGPT更快(OpenAI从GPT-1至GPT-3.5共历经4年)。 ▍国内玩家距离“端到端”仍有较远距离。无论是级联式端到端神经网络还是World Model,我们总结其核心壁垒皆在于:1)专业的AI人才团队,2)海量的视频数据,以及3)巨大的算力投入。国内主机厂从2023年开始陆续实现这一代“BEV+Transformer”架构的量产上车,尽快实现“脱图”以及尽可能多地“开城”是国内智驾车企当前的重点。 对于下一代的“端到端”技术路线,国内主机厂目前最快也仍处于早期预研阶段,且在人才、数据、算力三方面较特斯拉皆有较大差距,因此从预研到上车乐观看或也需3年左右的时间。 而对于前景更不明朗的World Model(或需等待特斯拉有更多成果展示),面临着较大销售和交付压力的国内主机厂,在新技术的人才和资源投入上或也有所 研究报告全文:FSDV12将迎重大架构变化端到端自动驾驶影响几何产业策略自动驾驶系列20231010中信证券研究部核心观点特斯拉多次表示FSDV12将实现全新的端到端自动驾驶模型架构将迎来重大变化对于新架构的技术细节和潜在影响市场仍有较多疑惑和分歧根据特斯拉对外披露的信息及马斯克在X平台前推特发布的信息我们推测特斯拉内部目前有两条端到端路线同步在研1级联式端到端神经网络2WorldModel我们认为FSDV12是前者的可能性较大有望于明年初落地以更好地实现L3能力WorldModel仍较为新兴但中长期有望连一席成为自动驾驶乃至具身智能领域的基础模型可类比GPT之于LLM或对行产业策略业格局产生颠覆性影响首席分析师S1010523020002可能性1较高级联式端到端神经网络大幅提升训练效率和性能上限有望助力自动驾驶系统更好地实现L3能力但能否迈向L4仍待观望技术本质系统从输入到输出全程使用神经网络算法无需任何人工规则介入当前自动驾驶模型多为模块化架构感知预测规划控制等不同任务分属于多个不同的小模型且下游规控环节普遍仍以规则为主而端到端神经网络在输入图像后可直接输出转向刹车加速等控制指令为提升训练效果端到端的大神经网络可能由多个小的子神经网络级联而成但与沈思越传统模块化架构用规则连接模块不同级联式神经网络的子模块是以神产业策略分析师经网络的方式自行训练堆叠因此可通过数据驱动优化整个端到端模型避S1010523030001免局部最优而非全局最优的困境潜在影响更好地实现L3能力端到端神经网络的核心好处在于模型迭代的关键由工程师变为了更易于规模化的数据和算力因而训练效率和性能上限有望得到显著提升落到实处我们认为端到端方案所展示出的性能潜力有望大幅提升自动驾驶系统的接管水平从而实现真正无可争议的L3能力例如达到每周接管1次但端到端模型的黑盒问题目前产业界尚未有十分成熟的解决方案因此我们认为其最终能否迈向追求极致安全性的L4全无人驾驶仍待观望发展进度有望搭载于FSDV12明年初正式落地的可能性较大2023年8月26日马斯克在X平台前推特进行了FSDV12demo的驾驶直播我们认为尽管直播中展现出的能力距离正式推送给消费者仍有距离但可基本推断当前的V12模型已十分接近端到端再配合特斯拉在数据和算力上的巨大投入V12接下来至年底的迭代速度有望大幅加快可能性2较低WorldModel有望打造自动驾驶领域的基础底座引领视觉的GPT时刻目前或仍处于GPT-1阶段但发展速度值得期待中长期看或对行业格局产生颠覆性影响技术本质无需标注自监督的预训练模型WorldModel可生成自动驾驶相关的连续帧视频场景其本质是对视频中的丰富语义以及背后的物理规律进行学习从而对物理世界的演化产生深刻理解基于WorldModel所提供的丰富语义信息以及对世界强大的理解力自动驾驶模型的感知与预测能力有望得到显著提升规划控制等下游任务也有望迎刃而解潜在影响为自动驾驶提供了一套未经证明的新路径若得以走通将对行业产生较大颠覆中短期来看WorldModel或将主要应用于数据合成和仿真模拟环节厂商的车队规模对算法训练的重要性或有所下降数据闭环的框架也将有所改变长期来看WorldModel有潜力成为自动驾驶乃至具身智能领域的基础模型可类比GPT为所有NLP问题提供了一个通用解考虑到更标准证券研究报告请务必阅读正文之后第23页起的免责条款和声明产业策略自动驾驶系列20231010化的解决方案和更巨大的资金投入资金需求或是这一代BEVTransformer方案的数倍行业内有望出现少数几家强大的WorldModel基础模型层平台方以SaaS或API的方式为主机厂运营方提供自动驾驶能力行业格局和合作模式或将发生较大变化发展进度仍处早期但发展速度值得期待我们认为特斯拉Wayve等公司不约而同地在今年推出WorldModel很大程度上是受到了GPT的启发目前WorldModel或仍处于GPT-1的阶段但考虑到目前行业整体对大模型潜力的强烈共识算力的升级以及以特斯拉为代表的玩家此前积累的海量数据我们认为WorldModel从0到1的爆发或较ChatGPT更快OpenAI从GPT-1至GPT-35共历经4年国内玩家距离端到端仍有较远距离无论是级联式端到端神经网络还是WorldModel我们总结其核心壁垒皆在于1专业的AI人才团队2海量的视频数据以及3巨大的算力投入国内主机厂从2023年开始陆续实现这一代BEVTransformer架构的量产上车尽快实现脱图以及尽可能多地开城是国内智驾车企当前的重点对于下一代的端到端技术路线国内主机厂目前最快也仍处于早期预研阶段且在人才数据算力三方面较特斯拉皆有较大差距因此从预研到上车乐观看或也需3年左右的时间而对于前景更不明朗的WorldModel或需等待特斯拉有更多成果展示面临着较大销售和交付压力的国内主机厂在新技术的人才和资源投入上或也有所保留相较之下我们认为特斯拉华为等行业巨头在资金和资源上更占优势而WAYVE极佳科技等初创企业的目标和精力更为聚焦也有望吸引到更多的AI人才类似于当年的OpenAI风险因素特斯拉端到端技术路线发展不及预期特斯拉FSDV12推送进度不及预期云端训练算力出现较大紧缺中国玩家追赶进度不及预期等请务必阅读正文之后的免责条款和声明2产业策略自动驾驶系列20231010目录报告缘起5可能性1级联式端到端神经网络大幅提升训练效率和性能上限6本质全程使用神经网络无需人工规则介入6影响有望助力FSD更好地实现L3能力但能否迈向L4仍待观望8进度FSDV12搭载概率大有望明年初落地国内距离端到端仍有较远距离11可能性2WorldModel有望引领视觉的GPT时刻14本质自监督的预训练模型有望打造视觉领域的基础底座14影响进度或仍处于GPT-1阶段中长期或对行业格局产生颠覆性影响18风险因素21插图目录图1马斯克在X平台表示FSDV12将是完全端到端自动驾驶左并进行FSDV12直播演示右5图2特斯拉引领下一代端到端技术路线国内玩家普遍仍处于BEVTransformer阶段5图3特斯拉FSDBetaV10至V12版本的架构变化红色为神经网络绿色为规则代码6图4模块化和端到端自动驾驶系统原理7图5商汤科技感知决策一体化模型UniAD技术架构8图6端到端自动驾驶模型的训练方式8图7大模型的涌现能力9图8学术界正在探讨可解释AI模型interpretableandexplainableAImodels的可能10图9LINGO-1可对其驾驶行为和意图进行解释10图10WAYVELINGO-1模型示意图11图118月26日的特斯拉直播中FSDV12的表现十分接近人类司机12图12特斯拉算力预期图13图13特斯拉D1vs英伟达GPU13图14主要车企自动驾驶厂商的智算中心14图15特斯拉WorldModel核心逻辑15图16特斯拉WorldModel生成的场景画面15图17特斯拉WorldModel所构建的场景可根据Prompt进行变化15图18WAYVEGAIA-1模型生成的画面15图19极佳科技世界模型DriveDreamer核心框架15图20极佳科技世界模型DriveDreamer可用于生成未来的驾驶场景和合理的驾驶行为16图21WorldModel有望成为视觉领域的基础模型17图22马斯克在X平台两次提到DiffusionModel17图23DiffusionModel的工作原理是加噪声和去噪的过程18图24DiffusionModel有助于生成高质量的图像18请务必阅读正文之后的免责条款和声明3产业策略自动驾驶系列20231010图25WorldModel中短期或将主要应用于数据合成和仿真模拟环节改变数据闭环的框架和流程19图26特斯拉历史算力规模预估个21图27WorldModel或仍处于GPT-1阶段21请务必阅读正文之后的免责条款和声明4产业策略自动驾驶系列20231010报告缘起特斯拉自2020年起在感知端引入BEV算法后又配合Transformer和OccupancyNetwork占用网络大幅提升视觉方案的感知精确度国内厂商普遍于2023年开始BEV上车使得无图城区领航成为可能进入2023年特斯拉开始向下一代自动驾驶模型架构端到端进发2023年5月11日马斯克在X平台前推特后同表示FSDV12版本将实现端到端的自动驾驶End-to-EndAIfromImagesintoSteeringBrakesAccelerationOut8月26日马斯克在X平台上进行了FSDV12工程版的首次试驾直播特斯拉作为目前自动驾驶行业引领技术潮流的存在使得端到端自动驾驶走向台前并引发资本市场关注但对于新模型的技术细节和潜在影响市场仍有较多的疑惑和分歧根据特斯拉对外披露的信息及马斯克在X平台发布的信息我们推测特斯拉内部目前有两条端到端自动驾驶技术路线同步在研1级联式端到端神经网络2WorldModel我们认为FSDV12是前者的可能性更大根据马斯克多次公开表态和V12demo8月底的直播表现我们预计V12有望于明年初正式上车而后者仍较为新兴但中长期有望成为自动驾驶乃至具身智能的基础模型FoundationModel可类比GPT之于LLM本篇报告将重点探讨上述两类端到端模型未来将如何影响和改变特斯拉FSD乃至整个自动驾驶产业图1马斯克在X平台表示FSDV12将是完全端到端自动驾驶左并进行FSDV12直播演示右资料来源马斯克X平台截图图2特斯拉引领下一代端到端技术路线国内玩家普遍仍处于BEVTransformer阶段小鹏华为理想蔚来特斯拉上一代传统架构BEVTransformer级联式端到端神经网络WorldModel以规则为主可跳过前者直接到后者资料来源中信证券研究部含推测请务必阅读正文之后的免责条款和声明5产业策略自动驾驶系列20231010可能性1级联式端到端神经网络大幅提升训练效率和性能上限本质全程使用神经网络无需人工规则介入端到端的本质是从系统输入到输出全程使用神经网络算法无需任何人工规则介入当前自动驾驶模型多为模块化架构感知预测规划控制等不同任务分属于多个不同的小模型感知端通过BEVTransformer架构已基本实现神经网络运算但下游的规控环节则普遍仍以规则为主rule-based即工程师编写条件规则代码相较之下特斯拉的自动驾驶模型神经网络参与度最高FSD每一次大版本的迭代本质上就是将更多子任务交由神经网络完成而减少人工规则的数量而FSDV12所谓的完全端到端就是在一个大的神经网络模型中输入图像后直接输出转向刹车加速等控制指令无需任何规则代码根据机器学习专家JamesDouma在与X平台Youtube博主HerbertOng对谈中的介绍在FSDBetaV10中仅感知端及规划端包含神经网络且规划模块仍以规则为主V11引入了更多的神经网络包括将Bag-o-bits转换器与感知神经网络合并新增多步骤规划神经网络控制神经网络等V12则致力于将所有模块集成为一个大的神经网络根据马斯克2023年8月2日的X平台发文目前车辆控制是FSD端到端模型中的最后一块拼图这将使得现在约30万行的C控制代码减少至约3000行图3特斯拉FSDBetaV10至V12版本的架构变化红色为神经网络绿色为规则代码感知Perception规划Planning控制Control神经网络Bag-o-bits转换器人工规则为主V10人工规则Bag-o-bits包括停车标志车道线有神经网络参与限速牌等神经网络神经网络神经网络V11Bag-o-bits转换器与感知神经网络合并为一个单一的神经网络直接输人工规则人工规则出向量空间V12神经网络资料来源HerbertOngYoutube中信证券研究部请务必阅读正文之后的免责条款和声明6产业策略自动驾驶系列20231010图4模块化和端到端自动驾驶系统原理端到端自动驾驶模块化自动驾驶传感器感知决策规划控制执行器端到端自动驾驶资料来源End-to-EndDeepNeuralNetworkArchitecturesforSpeedandSteeringWheelAnglePredictioninAutonomousDrivingPedroJNavarroLeanneMillerFranciscaRosique等著中信证券研究部为提升训练效果端到端的大神经网络可能是由多个小的子神经网络级联而成据机器学习专家JamesDouma的介绍对于一个从未训练过的大神经网络初期训练信号通常非常弱weaktrainingsignal训练难度很大因此可先在子系统subsystem或子模块block层面对较小的神经网络进行训练训练到一定程度后再将其堆叠为一个大的端到端神经网络再做进一步训练尽管同样为模块级联但传统的模块化架构中模块与模块间通常是通过某些规则进行连接因此无法进行整体的自动优化而对于级联式神经网络子模块间则是用神经网络的方式自行训练堆叠因此可以用数据驱动的方式优化整个端到端模型也就避免了局部最优而非全局最优的困境商汤科技的感知决策一体化的自动驾驶通用大模型UniAD就利用了类似的思路该研究论文Planning-orientedAutonomousDriving以路径规划为导向的自动驾驶YihanHuJiazhiYangLiChen等著斩获了2023届CVPR的最佳论文奖BestPaperAward这也是CVPR历史上第一篇以自动驾驶为主题的最佳论文在UniAD大模型中检测跟踪建图轨迹预测障碍物预测以及规划等子模块共享BEV特征并利用Transformer网络连接整合至一个端到端框架下具体来说摄像头采集图像会通过Transformer映射至BEV空间TrackFormer跟踪模块根据BEV信息推理出目标物的检测和跟踪信息MapFormer建图模块根据BEV信息实时构建地图随后MotionFormer轨迹预测模块会根据TrackerFormerMapFormer和BEV的结果计算预测周围物体的整体轨迹OccFormer障碍物预测模块则会根据上述信息输出占用网络的障碍物预测最后Planner模块会进行整个大模型的最终输出论文中提到为了得到更稳定的训练结果UniAD的训练分为两个阶段先对感知模块包括跟踪和建图做数次训练实验中为6次再对模型整体进行多次训练实验中为20次请务必阅读正文之后的免责条款和声明7产业策略自动驾驶系列20231010图5商汤科技感知决策一体化模型UniAD技术架构资料来源Planning-orientedAutonomousDrivingYihanHuJiazhiYangLiChen等著图6端到端自动驾驶模型的训练方式端到端整体训练子系统subsystem训练模块block训练资料来源HerbertOngYoutube中信证券研究部影响有望助力FSD更好地实现L3能力但能否迈向L4仍待观望对于神经网络组成的端到端架构模型迭代的关键由工程师变为了更易于规模化的数据和算力因而训练效率和性能上限有望得到显著提升落到实处我们认为端到端方案有望助力FSD以及其它自动驾驶系统更好地走向L3但端到端模型的黑盒问题目前产业界尚未有十分成熟的解决方案因此其最终能否迈向追求极致安全性的L4全无人驾驶仍待观望端到端神经网络的核心好处在于大幅提升模型的训练效率和性能上限传统自动驾驶模型中规则的占比较高想要提升模型性能就需要大量优秀的工程师编写海量的规则请务必阅读正文之后的免责条款和声明8产业策略自动驾驶系列20231010代码并持续优化模型的上限也取决于规则代码的质量而对于以神经网络为主的端到端模型性能提升的关键由人变为了数据和算力后者更可规模化同时也更有可能出现大语言模型中的涌现概念即当模型突破某个规模时性能突然显著提升这或也是为何马斯克在2023年6月接受CNBC的采访中表示FSD有望在未来两年迎来自己的ChatGPT时刻马斯克原话IthinkTeslawillhavesortofaChatGPTmomentifnotthisyearIdsaynolaterthannextyear落到实处我们认为该端到端方案有望助力FSD更好地走向L3由于法规限制FSD目前在美国仍属L2驾驶员不可脱手脱脚并自行承担事故责任而从技术的角度根据36氪网站上的文章智驾开城没有银子弹2023825作者李安琪FSD目前的主动接管里程约60公里次被动接管里程将更长这能否被视为具备L3的能力目前尚有争议而我们认为端到端方案所展示出的性能潜力有望大幅提升FSD的接管水平从而实现真正无可争议的L3能力例如达到每周接管1次但端到端模型的最大痛点在于可解释性差能否迈向L4目前仍待观望端到端自动驾驶模型并非特斯拉首创此前在学术和产业界已有诸多探讨最早的端到端自动驾驶模型可追溯至1998年的ALVINN项目可在大学校园里以55英里的时速行驶但端到端模型迟迟未能真正量产上车主要原因在于端到端模型近乎黑盒的工作模式使得其出现问题时较难追溯根本原因也就是无法针对某一个具体的bug进行定向优化即使是采用级联式神经网络也只能推测而无法证明感知预测等子模块的中间输出结果和规划模块的最终输出结果之间究竟存在何种逻辑关系事实上端到端大模型之所以能够出现涌现也正是得益于这种不可解释性而自动驾驶又涉及安全性容错率远低于ChatGPT等语言模型因此端到端的黑盒问题显得更为致命我们认为FSD目前作为乘用车智驾系统即使未来法规放开后走向L3也仍有驾驶员作为兜底因此特斯拉可在效率成本和绝对的安全之间进行平衡无需追求9999的安全性只需远比人安全即可但对于全无人的L4而言自动驾驶车辆究竟该追求多高的安全性以及系统是否需要具备可解释性等问题将在法律道德和舆论层面受到更多挑战图7大模型的涌现能力资料来源EmergentAbilitiesofLargeLanguageModelsJasonWeiYiTayRishiBommasani等著请务必阅读正文之后的免责条款和声明9产业策略自动驾驶系列20231010Wayve推出的Lingo-1模型为自动驾驶端到端提供了一种可能的解法但仍处于早期研究阶段AI模型的可解释性问题是学术界重要的研究方向之一2023年9月14日英国自动驾驶公司Wayve宣布推出用于自动驾驶的视觉语言动作模型VLAMLINGO-1将大语言模型和自动驾驶视觉模型进行深度融合具体来说LINGO-1可回答关于驾驶场景和驾驶行为的各种问题例如形容一下你所处的路况你目前最关心的三个目标物是什么你为什么放慢速度等LINGO-1主要靠人类专家对驾驶场景的语言解说数据进行训练截至9月准确率达到了人类水平的60LINGO-1为端到端自动驾驶模型的黑盒问题提供了一个可能的解法有望帮助人类理解AI模型究竟在想什么但目前仍处于早期研究阶段其准确度泛化能力幻觉率等各方面皆有较大的提升空间图8学术界正在探讨可解释AI模型interpretableandexplainableAImodels的可能资料来源EthicalChallengesofArtificialIntelligenceinHealthCareANarrativeReviewAaronHuiShawnAhnCarolynTLye等著图9LINGO-1可对其驾驶行为和意图进行解释资料来源WAYVE官网请务必阅读正文之后的免责条款和声明10产业策略自动驾驶系列20231010图10WAYVELINGO-1模型示意图ImslowingdownbecausethereisavanmergingintomylaneImslowingdownbecausethereisavanmergingintomylaneDrivingLanguagePolicyModelLanguageModelWhatsyourplanforthenext3secondsWhatsyourplanforWhythenext3secondsWhy资料来源WAYVE官网进度FSDV12搭载概率大有望明年初落地国内距离端到端仍有较远距离马斯克在X平台表示特斯拉FSD将于下一代V12版本实现端到端自动驾驶我们认为其所谓的End-to-EndAI采用级联式神经网络的概率大而对于FSDV12在8月26日的直播我们认为尽管其所展现出的能力距离正式推送给消费者仍有距离但可基本推断当前的V12模型或已十分接近端到端再配合特斯拉在数据和算力上的巨大投入V12接下来的迭代速度有望大大加快正式推送时间点为明年初的可能性较大但对于国内主机厂乐观看端到端上车或也仍需3年左右的时间特斯拉FSD将于下一代V12版本实现端到端自动驾驶采用级联式神经网络的概率大根据马斯克2023年5月的X平台原文FSDV12将实现的是输入图像直接输出转向刹车加速等控制信号的端到端AI模型End-to-EndAIfromImagesintoSteeringBrakesAccelerationOut而根据传记作家WalterIsaacson在2023年9月发布的马斯克传中的介绍特斯拉2023年年初才开始正式训练端到端模型其训练方式主要是向神经网络投喂大量特斯拉车主的驾驶视频初期就投喂了约1000万个视频片段videoclips书中还提到为了让神经网络学会正确开车特斯拉会有选择性地筛选出良好的驾驶行为片段再让神经网络进行学习这也意味着在模型正式训练前的数据处理清洗阶段需要有人工标注员对视频进行评估和打分FSDV12在直播中表现流畅自信处理十分接近人类司机但尚不成熟8月26日马斯克在X平台进行了一场45分钟的FSDV12试驾直播马斯克驾驶着一辆搭载FSDV12工程版的ModelS从特斯拉湾区PaloAlto的总部出发中间多次改变目的地最后回到总部行驶路段整体难度适中尽管有一些具有挑战的场景如施工环岛等且路线并未提前规划但PaloAlto属于特斯拉车辆较多的区域训练数据应较为丰富请务必阅读正文之后的免责条款和声明11产业策略自动驾驶系列20231010具体表现上V12在许多场景中的处理十分接近人类司机例如直播中特斯拉在面对STOPSIGN标志时并未完全停止这主要是由于V12并未编写看到STOPSIGN需完全停车的规则代码而训练数据集中的人类司机在面对STOPSIGN时基本不会选择停车而是减速通过又例如直播中当特斯拉与一位骑行者同时在路口等待红灯当绿灯亮起后骑行者行驶在特斯拉的右前方此时前方对向车道也有来车特斯拉选择加速超过骑行者而在过去情况下根据规则代码特斯拉可能会选择急刹马斯克也在直播中多次强调某些场景在数据库中从未见过例如施工标记和锥桶某些场景模型中并未编写对应的规则代码例如过减速带时需要减速而是完全靠神经网络基于视频进行训练但直播中也出现了一次较为致命的接管位于直行车道等待红绿灯的特斯拉在前方左转灯变绿后选择起步并企图闯红灯最终被马斯克接管马斯克表示后续需向V12投喂更多类似的红绿灯视频数据以解决此次failurecase失败案例图118月26日的特斯拉直播中FSDV12的表现十分接近人类司机多数车辆不会在停车标志完全停下V12根据周围交通环境灵活调节速度处在转向车道的最后一位时会拉近和前车的距离加速通过为骑行者让出空间资料来源马斯克X平台FSDV12直播截图中信证券研究部FSDV12接下来的迭代速度有望大大加快数据和算力是关键落地时间点为明年初的可能性较大尽管V12在直播中展现出的能力距离正式推送给消费者仍有距离但从马斯克直播中的言论以及V12的部分表现来看V12背后的模型已开始学习人类司机的驾驶行为或已十分接近端到端我们认为架构的颠覆远比V12在直播中的表现更为重要端到端最大的好处在于训练效率的提升训练的关键从人转变为了数据和算力而这两者正是特斯拉的强项和发力点所在-数据方面马斯克传WalterIsaacson著中提到特斯拉每天可访问来自其车主约1600亿帧的视频用于FSD的训练同时马斯克在8月26日的直播请务必阅读正文之后的免责条款和声明12产业策略自动驾驶系列20231010中提到FSDV12接下来将会开始向车主推送影子模式在车辆后台进行运行对比我们认为这将进一步增强特斯拉数据采集的效率和质量-算力方面特斯拉工程技术总监TimZaman在X平台发文表示特斯拉已于8月28日起正式启动了由10000块英伟达H100GPU组成的算力集群此外特斯拉自研的Dojo超算中心也于今年7月量产特斯拉规划至2024年年底为Dojo投入10亿美元至2024年年初成为全球规模最大的5台超级计算机之一图12特斯拉算力预期图资料来源TeslaAIX平台图13特斯拉D1vs英伟达GPU特斯拉英伟达D1A10080GBSXMV100forNVLinkH100SXM晶体管数量500亿542亿211亿800亿制程7nm7nm12nm4nmDieSizemm2645826815814算力FP32226TFLOPS195TFLOPS157TFLOPS67TFLOPSTDP热设计功耗400W400W300W700W资料来源特斯拉官网英伟达官网中信证券研究部我们认为端到端神经网络模型的核心壁垒在于专业的AI人才团队海量的视频数据以及巨大的算力投入国内主机厂乐观看或也仍需3年时间以实现端到端上车小鹏华为理想等国内主机厂从2023年开始陆续实现这一代BEVTransformer架构的量产上车目前尽快实现脱图以及尽可能多地开城是国内智驾车企的重点而对于下一代的端到端架构国内主机厂最快的也仍处于早期研发的阶段据36氪网站上的文章CVPR最佳论文大模型成就端到端自动驾驶2023625作者李安琪小鹏和理想目前都在筹备研发全栈端到端的自动驾驶方案但效果还不太好我们认为特斯拉之所以能够在短短的八个月时间内完成令人惊喜的端到端demo亮相主要是得益于其在过去3-4年的时间里打造了百万级别的车队规模并积累了丰富的数据飞轮经验同时还有强大的AI算法团队和雄厚的财力而国内主机厂在AI人才团队请务必阅读正文之后的免责条款和声明13产业策略自动驾驶系列20231010汽车销量规模数据闭环能力云端算力储备等方面皆有提升空间即使现在开始投入研发其神经网络模型的训练效率也势必会与特斯拉存在较大差距图14主要车企自动驾驶厂商的智算中心公司算力中心算力地点合作伙伴单个DojoExaPOD算力11EFLOPSBF16精度美国特斯拉超算中心计划2024年10月总算力规模达100EFLOPS-Dojo内华达另有大量英伟达A100H100GPU扶摇小鹏年月宣布建成时算力为乌兰察布阿里云智算中心20228600PFLOPS蔚来云蔚来不详合肥不详智算中心理想据新智驾报道理想智算中心算力至少750PFLOPS理想山西火山引擎智算中心FP16精度报道中预计23Q3交付完成星睿2023年2月正式启用算力达810PFLOPS吉利湖州阿里云智算中心计划至2025年将算力扩充至12EFLOP雪湖绿洲毫末智行2023年1月宣布成立算力达670PFLOPS山西火山引擎MANAOASIS资料来源各公司官网新智驾环球网中信证券研究部注1EFLOP1000PFLOPS可能性2WorldModel有望引领视觉的GPT时刻本质自监督的预训练模型有望打造视觉领域的基础底座WorldModel可预测动态视频的下一帧需要模型对物理世界有强大的认知力和理解力在2023年CVPR大会上特斯拉和Wayve分别展示了其目前正在研发的全新模型WorldModelWayve模型名为GAIA-1WorldModel可生成自动驾驶相关的连续帧视频场景并根据指令Prompt进行变化例如让视频中的车辆直行右转甚至偏离路面开到草地上等等本质上WorldModel学习的是视频中的丰富语义以及背后的物理规律从而对语言语义以及世界演化的规律产生深刻理解例如有人从人行道向马路上扔了一个乒乓球乒乓球会以怎样的抛物线和轨迹进行运动又例如前方发生交通事故后包括伤员警车救护车路人等不同的交通参与者会有什么行为等特斯拉研发总监Ashok在CVPR大会上特别提到特斯拉的WorldModel生成的是多个摄像头多视角的场景而从目前展示出的成果来看其WorldModel所生成的内容在不同视角中的动态行为皆能保持相对稳定这说明模型已开始初步理解物体的一些物理变化规律国内玩家极佳科技和清华大学也在联合构建自己的世界模型DriveDreamer根据其论文DriveDreamerTowardsReal-world-drivenWorldModelsforAutonomousDrivingXiaofengWangZhengZhuGuanHuang等著DriveDreamer的输入条件除了初始参考帧referenceframe外还可增加对应的道路结构信息包括HDMap和3D框可通过人工标注或已有的BEV感知方法得到作为约束条件并利用ActionFormer预测未来的道路结构特征上述条件输入至Auto-DM后将生成可控的未来驾驶视频同时请务必阅读正文之后的免责条款和声明14产业策略自动驾驶系列20231010DriveDreamer还可根据过去的驾驶行为信息以及从Auto-DM中提取的多尺度特征来生成合理的未来驾驶行为即合理预测驾驶动作的能力图15特斯拉WorldModel核心逻辑图16特斯拉WorldModel生成的场景画面ImageInputVolumeSurfaceObjectsLanesTrafficControls资料来源Tesla2023CVPR资料来源Tesla2023CVPR图17特斯拉WorldModel所构建的场景可根据Prompt进行变化图18WAYVEGAIA-1模型生成的画面资料来源Tesla2023CVPR资料来源WAYVE官网图19极佳科技世界模型DriveDreamer核心框架资料来源DriveDreamerTowardsReal-world-drivenWorldModelsforAutonomousDrivingXiaofengWangZhengZhuGuanHuang等著请务必阅读正文之后的免责条款和声明15产业策略自动驾驶系列20231010图20极佳科技世界模型DriveDreamer可用于生成未来的驾驶场景和合理的驾驶行为资料来源DriveDreamerTowardsReal-world-drivenWorldModelsforAutonomousDrivingXiaofengWangZhengZhuGuanHuang等著WorldModel的本质是无需标注自监督的预训练模型有望成为视觉领域的基础模型FoundationModelWorldModel的训练任务是视频帧的预测而视频属于序列数据因此可进行自监督训练类似于GPT利用词语接龙或词语填空的方式进行文本预测的自监督训练中长期来看WorldModel有潜力成为自动驾驶乃至具身智能领域的基础模型可类比GPT模型为所有NLP问题提供了一个通用解具体来说ChatGPT在语言通用模型GPT的基础上针对专门的对话场景进行RLHF训练ReinforcementLearningfromHumanFeedback基于人类反馈的强化学习从而实现更好的互动沟通效果与之类似基于WorldModel所提供的丰富语义信息以及对世界强大的理解力自动驾驶模型的感知与预测能力有望得到显著提升规划控制等下游任务也有望迎刃而解请务必阅读正文之后的免责条款和声明16产业策略自动驾驶系列20231010图21WorldModel有望成为视觉领域的基础模型场景视频语言文本操作信号WorldModel自动驾驶具身智能资料来源OntheOpportunitiesandRisksofFoundationModelsRishiBommasaniDrewAHudsonEhsanAdeli等著中信证券研究部DiffusionModel扩散模型或是WorldModel背后的核心技术之一马斯克在X平台两次提到针对视觉领域DiffusionModel或比Transformer更为高效极佳科技的世界模型DriveDreamer也利用了DiffusionModel来构建对复杂环境的表征以帮助WorldModel更好地理解复杂的自动驾驶场景DiffusionModel是生成式模型的一种其工作原理是通过学习数据集的扩散过程来生成数据的可能性分布即先随机添加噪声来破坏训练数据再学习逆转的去噪过程以生成样本DiffusionModel的应用使得图像生成有了新的可能目前最为火热的图像生成模型包括OpenAI的DALL-EGoogle的Imagen和StabilityAI的StableDiffusion皆是基于DiffusionModel来完成的最近新兴的DiffusionModel已开始扩展至视频乃至3D内容生成领域并展示出了强大的能力图22马斯克在X平台两次提到DiffusionModel资料来源马斯克X平台截图请务必阅读正文之后的免责条款和声明17产业策略自动驾驶系列20231010图23DiffusionModel的工作原理是加噪声和去噪的过程资料来源哈佛大学官网MathematicalFoundationofDiffusionGenerativeModels图24DiffusionModel有助于生成高质量的图像资料来源StabilityAI官网影响进度或仍处于GPT-1阶段中长期或对行业格局产生颠覆性影响WorldModel为自动驾驶提供了一套未经证明的新路径若得以走通将对行业产生较大颠覆我们对WorldModel的潜在影响进行可能性推演中短期来看WorldModel或将主要应用于数据合成和仿真模拟环节厂商的车队规模对算法训练的重要性或有所下降数据闭环的框架也将有所改变长期来看WorldModel有潜力成为视觉领域的基础模型行业内有望出现少数几家强大的平台方以SaaS或API的方式为主机厂运营方提供自动驾驶能力而打造WorldModel的关键仍在于人才数据和算力中短期来看WorldModel或将主要应用于数据合成和仿真模拟环节影响数据闭环和模型训练的流程和效率考虑到现实世界的复杂程度超乎想象即使借助于规模庞大的量产车队也难以遍历所有情形因此引入仿真模式测试Simulation成为自动驾驶模型训练的必要手段仿真模拟的核心在于真实性传统仿真平台基于WorldSimUnreal等游戏引擎搭建真实度不够高因此更多用于测试验证而非算法训练2022年以来NerfNeuralradiancefield神经辐射场DiffusionModelWorldModel等新技术的出现提升了仿真平台的模拟保真度使得仿真训练的质量大幅提升相较之下WorldModel的还原度最高同时可用于合成实车运行时很难收集到的cornercases且无需标注灵请务必阅读正文之后的免责条款和声明18产业策略自动驾驶系列20231010活高效因而有望大幅提升模型的训练效率而当生成式AI成为数据的主要来源后厂商的车队规模将不再是自动驾驶能力的关键数据闭环的框架和流程也将有所改变图25WorldModel中短期或将主要应用于数据合成和仿真模拟环节改变数据闭环的框架和流程OTA回传车端数据平台标注平台训练平台仿真平台数据数据数据数据数据模型仿真更新采集预处理传输处理标注训练验证训练测试模型原始数据结构化数据数据挖掘数据质量运营模型开发调优场景挖掘场景库数据清洗脱敏脱密等自动化标注人工标注等测评等建设仿真测试等初期与真实数据进行配合并进行逐步替代数据合成平台目前的数据闭环流程WorldModel虚拟数据生成WorldModel对数据闭环流程的潜在改变资料来源中信证券研究部长期来看当WorldModel成为视觉领域的基础模型后可能出现少数几个平台型玩家对自动驾驶行业格局产生较大影响无论是语言还是视觉领域长期来看基础模型都有望收敛至少数几个平台型玩家而绝大多数应用都将围绕着这些基础模型进行开发这主要是由于一方面基础模型的参数量巨大工程化复杂同时需要庞大的数据集及高昂的算力成本另一方面基础模型具有较强的通用性和泛化性具体来说在原来的技术路线下自动驾驶算法需根据车端传感器的配置位置乃至车型的尺寸进行调整即使特斯拉将其现在的FSD算法代码开源国内主机厂的适配工作量也不容小觑包括前文中提到的级联式端到端神经网络标准化程度也有限这也是为什么目前主机厂都追求自研且自研能力强的主机厂也走在了智驾行业的前列但对于WorldModel而言由于对世界有了强大的感知和理解力传感器和车型将不再是限制云端调参将成为WorldModel的核心而车端部署时标准化程度有望明显提高这将为平台型玩家的诞生奠定基础而当少数平台型玩家的WorldModel性能足够成熟强大后就有望通过SaaS或API的方式为主机厂运营方提供高性价比的自动驾驶能力谁能成为WorldModel的平台型玩家关键仍在于人才数据和算力资金投入需求较BEVTransformer或有数倍增长与级联式端到端神经网络类似WorldModel作为更纯粹的自监督预训练大模型同样需要专业的AI人才团队海量的视频数据以及巨大的算力储备资金投入方面尽管WorldModel所需要的工程师人数有所减少但对AI人才质量的要求将明显提升同时考虑到算力需求的大幅增长整体资金需求较这一代BEVTransformer或有数倍增长我们认为特斯拉华为等行业巨头在资金和资源上更占优势而WAYVE极佳等初创企业的目标和精力更为聚焦也有望吸引到更多的AI人才类似于当年的OpenAI而国内主机厂或许对WorldModel已有所关注但在激烈的竞争环境下各家普遍有较大请务必阅读正文之后的免责条款和声明19产业策略自动驾驶系列20231010的销售和量产交付压力且目前WorldModel的前景也尚不明朗或需等待特斯拉有更多成果展示因此大家在人才和资源投入上或有所保留-人才AI模型的首要难点在于人团队不在大而在精OpenAI也仅百人规模WorldModel的研发要求团队同时具有大模型视觉和自动驾驶的背景知识和能力同时大模型的训练涉及数据存储算法设计优化超大规模算力集群分布式通信等诸多工程化问题这也是为何OpenAI相当重视算法和工程团队之间的紧密配合搭载了有工程能力的算法团队和有算法理解的工程团队-数据根据马斯克传WalterIsaacson著中的介绍马斯克在开发端到端神经网络时发现至少需要超过100万个视频片段神经网络才会开始发挥性能而对于WorldModel究竟需要多少数据量目前尚无定论但可以确定的是基础模型对于数据的需求一定是海量的据36氪网站上的文章人类数据要被OpenAI用完了然后呢2023717作者极客公园OpenAI从GPT-1到GPT-3训练数据集从45GB指数级增长到了570GB此外与此前的数据驱动模型类似WorldModel同样对数据的质量有较高的要求-算力相较于文字图像的信息密度明显更低因此训练同等水平的CV基础模型比NLP模型需要更高的算力WorldModel的训练究竟需要多少算力目前尚未有定论但从特斯拉的算力投入来看较此前的BEVTransformer架构至少有数倍乃至数十倍的提升目前国内车企普遍选择与云厂商合作打造智算中心算力水平普遍在小几千张英伟达A100而根据知名半导体分析机构Semianalysis的预估特斯拉在2022年年底约拥有等效约1万张英伟达A100的算力此外根据特斯拉AI团队TeslaAI2023年6月在X平台公布的算力规划图特斯拉目标至2024年2月将算力规模扩大至全球前五规模对应10万张英伟达A100算力总和2024年10月算力总规模达100EFLOPS对应30万张英伟达A100算力总和从成本来看据雷锋网报道理想汽车智算中心向火山引擎购买了300多台英伟达服务器算力的公有云服务算力在FP16精度下至少达750PFLOPS根据A100FP16精度下312TFLOPS的算力计算未采用稀疏技术理想智算中心约租用了2400张英伟达A100的算力据36氪网站上的文章ChatGPT们难以复制的原因除了耗显卡还有水电费太贵2023417作者爱范儿一台8张A100组成的DGXA100服务器售价约199万美元对应300台的合计成本约4亿元人民币仅为一次性购置费用未考虑运营成本而若以火山引擎官网一台8张英伟达A100服务器包三年340万元人民币的租金计算租赁300多台服务器三年需投入超10亿元人民币平均每年投入约3-4亿元人民币而特斯拉于今年8月底表示将启用1万张英伟达H100GPU进行FSD训练据HPCwire英伟达H100当前售价约3万美元对应1万张英伟达H100合计售价约21亿元此外特斯拉还于今年7月表示计划至2024年年底在Dojo超算中心上投入超10亿美元合计约70亿元请务必阅读正文之后的免责条款和声明20
|
相关研报
|
||||||||||||||||||||||
