研报下载就选股票报告网
您好,欢迎来到股票分析报告网!登录   忘记密码   注册
>> 东吴证券-汽车行业深度报告:AI系列深度26期,云端基座模型如何在毫秒级车端跑起来-260807
上传日期:   2026/8/7 大小:   875KB
格式:   pdf  共11页 来源:   东吴证券
评级:   推荐 作者:   黄细里
行业名称:   汽车
下载权限:   无限制-登录即可下载
学术缩放定律与车端工程约束对应不同的优化目标。Kaplan、Chinchilla等缩放定律讨论的是给定训练算力下参数量、数据量与损失之间的最优关系,其“最优”指向训练算力前沿,并未把推理成本和毫秒级实时时延纳入目标函数。将推理成本显式纳入后,部署最优点会向更小模型、更多训练数据偏移;智能驾驶则进一步强化了这一部署约束。
  车端实时性构成大模型上车的核心约束。自动驾驶模型必须在固定车规算力上满足帧率、端到端时延和功能安全要求,大型视觉Transformer叠加大语言模型难以在现有车规算力下持续满足高频推理要求。理想披露VLA推理帧率约10Hz,NVIDIAAlpamayo-R1论文披露端到端推理时延99ms,小鹏称第二代VLA指令输出时延压缩至80ms以内。
  云端基座模型的效率优化主要可归纳为两类路径:一是通用模型稀疏化和注意力/KV缓存压缩,如MoE、MLA、MTP、FP8、线性注意力等;二是面向驾驶的视觉Token剪枝、动态/隐式Token和思维链压缩,用更少Token承载关键场景信息。其目标是在云端继续探索能力上限,同时降低长序列和多模态推理成本。
  车端时延压缩更强调可部署性,主流范式是“云端大模型蒸馏上车+快慢双系统”。Waymo通过教师—学生蒸馏把大模型能力迁移到实时学生模型,并采用Think Fast/Think Slow架构;理想由云端基座蒸馏出车端VLA,并用扩散流匹配减少去噪步数;小鹏则以基座蒸馏和视觉思维链效率提升,降低车端推理时延。
  我们归纳,未来云车分工或趋于“云端探上限、车端保实时”。云端模型负责更大规模、更复杂推理和世界模型训练,车端模型则围绕低时延、稳定性和安全冗余做压缩部署。该判断仍受蒸馏能力上限、统一评测缺失、芯片供给、量产时间表和功能安全验证约束,因此,训练侧的规模扩张逻辑不能直接外推至车端部署。
  我们认为,数字AI底座模型发展路径已逐渐清晰、价值在于确定性,但其难以实现物理世界的建模闭环;我们认为物理AI将成为物理世界的AI解决方案,从而在AI的当前发展阶段成为增量更大的方向,智能驾驶作为最先跑通闭环的代表场景,我们认为应重点关注。
  风险提示:技术迭代不及预期的风险;大模型厂商ARR增速放缓的风险;云服务商资本开支不及预期的风险;智能驾驶及机器人商业化落地不及预期的风险。
 
Copyright © 2005 - 2021 Nxny.com All Rights Reserved 备案号:蜀ICP备15031742号-1