>> 东吴证券-汽车行业深度报告:AI系列深度26期,云端基座模型如何在毫秒级车端跑起来-260807
| 上传日期: |
2026/8/7 |
大小: |
875KB |
| 格式: |
pdf 共11页 |
来源: |
东吴证券 |
| 评级: |
推荐 |
作者: |
黄细里 |
| 行业名称: |
汽车 |
| 下载权限: |
无限制-登录即可下载 |
|
|
学术缩放定律与车端工程约束对应不同的优化目标。Kaplan、Chinchilla等缩放定律讨论的是给定训练算力下参数量、数据量与损失之间的最优关系,其“最优”指向训练算力前沿,并未把推理成本和毫秒级实时时延纳入目标函数。将推理成本显式纳入后,部署最优点会向更小模型、更多训练数据偏移;智能驾驶则进一步强化了这一部署约束。 车端实时性构成大模型上车的核心约束。自动驾驶模型必须在固定车规算力上满足帧率、端到端时延和功能安全要求,大型视觉Transformer叠加大语言模型难以在现有车规算力下持续满足高频推理要求。理想披露VLA推理帧率约10Hz,NVIDIAAlpamayo-R1论文披露端到端推理时延99ms,小鹏称第二代VLA指令输出时延压缩至80ms以内。 云端基座模型的效率优化主要可归纳为两类路径:一是通用模型稀疏化和注意力/KV缓存压缩,如MoE、MLA、MTP、FP8、线性注意力等;二是面向驾驶的视觉Token剪枝、动态/隐式Token和思维链压缩,用更少Token承载关键场景信息。其目标是在云端继续探索能力上限,同时降低长序列和多模态推理成本。 车端时延压缩更强调可部署性,主流范式是“云端大模型蒸馏上车+快慢双系统”。Waymo通过教师—学生蒸馏把大模型能力迁移到实时学生模型,并采用Think Fast/Think Slow架构;理想由云端基座蒸馏出车端VLA,并用扩散流匹配减少去噪步数;小鹏则以基座蒸馏和视觉思维链效率提升,降低车端推理时延。 我们归纳,未来云车分工或趋于“云端探上限、车端保实时”。云端模型负责更大规模、更复杂推理和世界模型训练,车端模型则围绕低时延、稳定性和安全冗余做压缩部署。该判断仍受蒸馏能力上限、统一评测缺失、芯片供给、量产时间表和功能安全验证约束,因此,训练侧的规模扩张逻辑不能直接外推至车端部署。 我们认为,数字AI底座模型发展路径已逐渐清晰、价值在于确定性,但其难以实现物理世界的建模闭环;我们认为物理AI将成为物理世界的AI解决方案,从而在AI的当前发展阶段成为增量更大的方向,智能驾驶作为最先跑通闭环的代表场景,我们认为应重点关注。 风险提示:技术迭代不及预期的风险;大模型厂商ARR增速放缓的风险;云服务商资本开支不及预期的风险;智能驾驶及机器人商业化落地不及预期的风险。
|
|