核心观点
多模态模型历经多个阶段的发展,性能实现飞跃,现为AI大模型的新方向。多模态模型综合不同类型数据进行分析处理,拥有更高的准确性和鲁棒性,更贴近人类学习模式。随着大模型时代的到来,多模态技术迅速发展,如OpenAI的GPT系列不断推出新版本,提升了语言生成、逻辑推理以及多模态处理能力,预计将在各领域得到广泛应用。该系列模型不断增强的功能和性能,标志着人工智能发展的新阶段。 多模态模型的发展方向包括视觉理解、视觉生成、统一视觉、LLM支持以及多模态Agent,并从专业性向通用性改变,应用性增强。近期研究表明,多模态大模型发展方向涵盖了:1)视觉理解,涉及对图像信息进行深入解释;2)视觉生成,特别是生成符合人类意图的图像等内容;3)构建统一视觉模型,该方向面临多重挑战,但在CV领域未来的应用中非常有价值;4)LLM支持的多模态大模型显示出强大的跨模态理解能力;5)多模态Agent是当前研究的前沿方向,旨在通过将多个专家模型与LLM相结合来解决复杂的多模态理解问题。此外,多模态大模型已开始向通用方向转变,并在文本、图像、音视频等多个领域展现出应用潜力,如教育、办公、遥感、医疗和工业等领域。 机器人是多模态AI优质落地场景,商用落地有望加速。多模态模型融合视频、语言、文字等多方面能力,使得机器人能够将不同感知渠道获取的信息整合起来,形成更全面、准确的环境认知,从而更加高效地应对复杂多变的任务需求。多模态大模型的应用在机器人领域有充分的发挥空间。经过程序控制机器人、自适应机器人和智能机器人三波发展浪潮,智能人形机器人成为发展趋势。特斯拉打通了FSD和机器人的底层模型,Optimus采用端到端神经网络训练运行,实现视频信号输入,控制信号输出。尤其Optimus在23年的快速迭代进步,市场对于人形机器人的产业落地预期将提前,Optimus有望成为最快实现规模化商用的机器人。根据第三方预测,GGII预计到2026年全球人形机器人在服务机器人中的渗透率有望达到3.5%,市场规模超20亿美元,到2030年全球市场规模有望突破200亿美元。AI和机器人的持续融合也将进一步推动具身智能的发展,目前微软、谷歌等巨头均已在加大该领域投入。 投资建议:随着GPT-4V的推出,多模态将进一步扩大AI的应用范围,机器人也是极佳的多模态AI应用场景。此外,随着AI大模型成本下降与技术发展,AI应用产业将快速进步。建议重点关注AI应用、多模态、机器人领域相关个股,如萤石网络、宝信软件、金山办公、科大讯飞。 风险提示:大模型技术发展不及预期;AI商业化落地不及预期等。 研究报告全文:证券研究报告2023年10月19日计算机行业2023年10月投资策略超配GPT4-V推动多模态应用机器人是极佳落地场景核心观点行业研究行业投资策略多模态模型历经多个阶段的发展性能实现飞跃现为AI大模型的新方向计算机多模态模型综合不同类型数据进行分析处理拥有更高的准确性和鲁棒性超配维持评级更贴近人类学习模式随着大模型时代的到来多模态技术迅速发展如证券分析师熊莉证券分析师库宏垚OpenAI的GPT系列不断推出新版本提升了语言生成逻辑推理以及多模态021-61761067021-60875168处理能力预计将在各领域得到广泛应用该系列模型不断增强的功能和性xiongli1guosencomcnkuhongyaoguosencomcnS0980519030002S0980520010001能标志着人工智能发展的新阶段联系人艾宪多模态模型的发展方向包括视觉理解视觉生成统一视觉LLM支持以及0755-22941051aixianguosencomcn多模态Agent并从专业性向通用性改变应用性增强近期研究表明多模态大模型发展方向涵盖了1视觉理解涉及对图像信息进行深入解释市场走势2视觉生成特别是生成符合人类意图的图像等内容3构建统一视觉模型该方向面临多重挑战但在CV领域未来的应用中非常有价值4LLM支持的多模态大模型显示出强大的跨模态理解能力5多模态Agent是当前研究的前沿方向旨在通过将多个专家模型与LLM相结合来解决复杂的多模态理解问题此外多模态大模型已开始向通用方向转变并在文本图像音视频等多个领域展现出应用潜力如教育办公遥感医疗和工业等领域机器人是多模态AI优质落地场景商用落地有望加速多模态模型融合视频语言文字等多方面能力使得机器人能够将不同感知渠道获取的信息资料来源Wind国信证券经济研究所整理整合起来形成更全面准确的环境认知从而更加高效地应对复杂多变的相关研究报告任务需求多模态大模型的应用在机器人领域有充分的发挥空间经过程序计算机行业周报-微软Copilot重磅发布华为引领大模型行业赋能2023-10-11控制机器人自适应机器人和智能机器人三波发展浪潮智能人形机器人成Copilot功能演示及空间测算AI或开启微软第三轮增长2023-10-08为发展趋势特斯拉打通了FSD和机器人的底层模型Optimus采用端到端信息安全深度剖析6海外巨头引领安全大模型安全产业是神经网络训练运行实现视频信号输入控制信号输出尤其Optimus在23AI价值洼地2023-09-27计算机行业2023年9月投资策略暨财报总结-23H1计算机板块年的快速迭代进步市场对于人形机器人的产业落地预期将提前Optimus业绩稳步增长关注机器人领域产业机会2023-09-13有望成为最快实现规模化商用的机器人根据第三方预测GGII预计到2026人工智能行业专题AI产业链分析与展望2023-08-24年全球人形机器人在服务机器人中的渗透率有望达到35市场规模超20亿美元到2030年全球市场规模有望突破200亿美元AI和机器人的持续融合也将进一步推动具身智能的发展目前微软谷歌等巨头均已在加大该领域投入投资建议随着GPT-4V的推出多模态将进一步扩大AI的应用范围机器人也是极佳的多模态AI应用场景此外随着AI大模型成本下降与技术发展AI应用产业将快速进步建议重点关注AI应用多模态机器人领域相关个股如萤石网络宝信软件金山办公科大讯飞风险提示大模型技术发展不及预期AI商业化落地不及预期等重点公司盈利预测及投资评级公司公司投资昨收盘总市值EPSPE代码名称评级元亿元2023E2024E2023E2024E002230科大讯飞买入5347123808610262175242688111金山办公买入345001593306404112758540资料来源Wind国信证券经济研究所预测请务必阅读正文之后的免责声明及其项下所有内容证券研究报告内容目录多模态模型快速发展新应用落地可期4多模态是AI大模型的新方向4多模态模型厚积薄发性能实现飞跃4多模态模型五大方向视觉理解视觉生成统一视觉LLM支持多模态Agent6多模态大模型逐步从专用转向通用应用性增强10机器人是多模态AI优质落地场景商用落地有望加速11多模态将赋能机器人应用11多技术融合创新推动机器人能力边界持续拓展12特斯拉开启人形机器人新时代13AI大模型机器人具身智能时代有望开启14投资建议关注多模态机器人及AI应用16风险提示16请务必阅读正文之后的免责声明及其项下所有内容2证券研究报告图表目录图1MSRA提出桥塔架构Bridge-TowerArchitecture多模态预训练模型视觉-语言4图2多模态模型发展的五个阶段5图3视觉理解训练方法6图4视觉理解各方法的代表算法6图5视觉生成的重点为一致性生成7图6CV领域的关注点为是否可以实现统一视觉模型7图7统一视觉模型研究案例更好地将文本与视觉匹配8图8LLM支持的多模态大模型典型案例为GPT-4V可以识别图像并详细叙述9图9多模态agent的研究案例9图10模型识别CT影像可应用于医疗领域10图11模型识别手写方程可应用于教育领域10图12大模型建立数字人可应用于工业领域11图13多模态大模型MC-ACT赋能机器人增强其通用性11图14机器人种类繁多可分为工业服务特种机器人12图15机器人与AI技术结合13图16特斯拉机器人做瑜伽13图17特斯拉机器人做物品分类13图182024年10月Dojo总算力规模将达到100Exa-Flops14图19SayCan与PaLM结合使用时成功规划了101条测试指令中的8415图20ChatGPT应用于机器人的设计原则15表1GPT大模型的发展历程6请务必阅读正文之后的免责声明及其项下所有内容3证券研究报告多模态模型快速发展新应用落地可期多模态是AI大模型的新方向多模态模型是指将不同类型的数据例如图像文字视频语音等结合起来进行分析处理的模型其通过不同数据类型的相互关联和结合可以大幅提高模型的准确性和鲁棒性应用场景进一步拓展其次多模态更接近人类学习的模式在物理世界中人类认知一个事物并不是通过单一模态例如认知一只宠物可以从视觉宠物形貌听觉宠物叫声嗅觉宠物体味触觉宠物毛发宠物体温等等多模态全面立体认知是未来人工智能的发展方向图1MSRA提出桥塔架构Bridge-TowerArchitecture多模态预训练模型视觉-语言资料来源MSRA国信证券经济研究所整理多模态模型厚积薄发性能实现飞跃多模态模型历经多个发展阶段模型复杂度和性能持续提升多模态模型的发展经历了五个关键阶段分别是行为计算交互深度学习和大模型时代这一发展历程始于最初对行为理论和科学研究的探索如今正逐步转向多模态技术在产业领域的实际应用在这一过程中半导体技术和计算机科学的迅猛发展扮演了重要的推动角色多模态模型逐渐从简单模拟人类行为模式转变为复杂的计算模型随着深度学习技术的兴起这些模型获得了更深层次的理解和学习能力使得其在图像语音视频等多种形式数据处理上取得了突破性进展大模型开启新时代多模态技术发展迅速2020年大模型时代到来多模态技术的发展得到进一步推进大模型时代的核心在于构建能够处理海量数据的大规模模型从而使得多模态模型在处理复杂任务时展现出了更高的性能和智能最近OpenAI发布的GPT-4V已经具备了强大的图片理解逻辑推理以及情感感知能力预计将在各产业得到广泛应用请务必阅读正文之后的免责声明及其项下所有内容4证券研究报告图2多模态模型发展的五个阶段资料来源CarnegieMellonUniversity国信证券经济研究所整理GPT大模型持续迭代多模态是发展趋势GPT大模型经历了6个发展阶段模型体积增大功能不断增强性能实现飞跃12018年5月OpenAI发布GPT初代版本其特点为半监督式学习在训练方式上依赖于数据标注和模型微调2GPT-2于2019年2月正式发布相较于GPT-1的无监督式预训练有监督式学习和模型微调GPT-2舍弃了微调直接通过大规模数据进行预训练让模型开始具备解决多种语言任务的能力3GPT-3于2020年5月正式发布不仅在训练方式上引入In-context学习使得模型在Few-shot上有更优秀的表现同时模型参数量提升两个数量级是真正意义上的大语言模型训练成本也大幅提升4OpenAI在2022年11月发布ChatGPTGPT-35该模型引入了基于人工反馈的强化学习进行训练语言生成能力大幅提升可以完成自动文本生成问答对话等复杂的语言任务在海量数据和参数的支撑下模型也具备一定的逻辑推理与思维能力可以做一些相对复杂的任务5GPT-4是OpenAI在ChatGPT的基础上进一步迭代并于2023年3月15日发布的模型GPT-4在35版本的基础上增强了生成文本包括代码的能力同时还接受图像和文本输入模型在多领域通过专业水平考试在专业和学术基准上表现出接近人类的水平6GPT-4V是近期OpenAI要发布的多模态模型模型增加了语音功能且图像理解能更加强大可以进行语音对话和图像展示提供更直观的界面目前这些功能逐步推向Plus和Enterprise用户未来将扩大到其他用户群体也会开拓下游工业医疗机器人汽车保险等行业应用请务必阅读正文之后的免责声明及其项下所有内容5证券研究报告表1GPT大模型的发展历程模型功能与能力发布时间有监督学习和无监督学习的结合模型的语言泛化能力不够更接近于处理特定语言任务的专GPT-12018年5月家模型而非通用的语言模型舍弃了模型微调让多个不同的任务在同一个模型上学习构建了一个泛化能力更强的语言模GPT-22019年2月型开始让语言模型的通用性得到了更加充分的展现在训练方法上则采取了In-context学习参数量相较于GPT-2提升了两个数量级达到了1750GPT-32020年5月亿数据集在处理前容量达到了45TB是真正意义上的大语言模型引入人类反馈的强化学习RLHF及近端策略优化算法PPO等新的训练方式后语言生成能ChatGPTGPT-352022年11月力大幅提升并且涌现出了思维链及逻辑推理等多种能力在推理能力文本生成能力对话能力等方面有了进一步提升的同时实现了从大语言模型向GPT-42023年3月多模态模型进化的第一步GPT-4V支持文本图片交错输入的多模态能力图片理解能力逻辑推理能力情感感知能力表现优异2023年10月资料来源OpenAI国信证券经济研究所整理多模态模型五大方向视觉理解视觉生成统一视觉LLM支持多模态Agent多模态模型五大方向视觉理解视觉生成统一视觉LLM支持多模态Agent近期微软多位研究员联合撰写文章对多模态模型进行了全面的研究和分类并关注了模型从专业性向通用性转变的特点在模型分类中研究员们将模型研究方向分为两大类五个主题1目前已成熟完善的研究主题包括包括视觉理解视觉生成2具备探索性开放性的前沿研究领域包括统一视觉模型受LLM大语言模型支持的多模态大模型以及多模态agent方向一视觉理解在AI领域视觉理解是指使计算机系统能够解释和理解视觉信息的能力视觉理解的核心问题是通过预训练使得神经网络的主干架构backbone获得强大的图像理解能力模型训练方法可根据监督信号的不同分为三类标签监督语言监督和纯视觉自监督其中纯视觉自监督的监督信号来源为图像本身相关方法有对比学习非对比学习和掩码图像建模在这些方法之外常用的预训练方法还有多模态融合区域级和像素级图像理解等图3视觉理解训练方法图4视觉理解各方法的代表算法资料来源ChunyuanLi等-MultimodelFoundationModelsFrom资料来源ChunyuanLi等-MultimodelFoundationModelsFromSpecialiststoGeneralPurposeAssistants-Arxiv2023SpecialiststoGeneralPurposeAssistants-Arxiv2023-P14-P13国信证券经济研究所整理国信证券经济研究所整理请务必阅读正文之后的免责声明及其项下所有内容6证券研究报告方向二视觉生成这是AI图像生成与理解的核心不仅包括图像生成还包括视频3D点云图等多种内容的生成视觉生成不仅可以应用于艺术设计等内容创作领域它还在合成训练数据方面发挥着巨大作用从而促进多模态内容理解与生成的闭环发展视觉生成的重点在于如何生成与人类意图一致的图像常见的四类相关研究方向为有空间可控生成基于文本再编辑遵循文本提示生成和生成概念定制conceptcustomization当前研究趋势和未来短期研究方向是创建通用的文生图模型以更好地满足人类意图并提升上述方向的可替代性图5视觉生成的重点为一致性生成资料来源ChunyuanLi等-MultimodelFoundationModelsFromSpecialiststoGeneralPurposeAssistants-Arxiv2023-P28国信证券经济研究所整理方向三统一视觉模型构建统一视觉模型具有多重挑战在计算机视觉领域各任务的差异很大这为建立统一的视觉模型带来了巨大挑战1输入类型不同输入内容可包括静态图形动态视频纯视觉输入模糊图像等2不同的任务需要不同的粒度如图像级任务区域级任务像素级任务等因此输出的空间信息和语义信息也要求不同的格式3在建模之外数据也有挑战比如不同类型的标签注释成本差异很大收集成本比文本数据高这导致视觉数据的规模通常比文本语料库小得多图6CV领域的关注点为是否可以实现统一视觉模型资料来源ChunyuanLi等-MultimodelFoundationModelsFromSpecialiststoGeneralPurposeAssistants-Arxiv2023-P43国信证券经济研究所整理请务必阅读正文之后的免责声明及其项下所有内容7证券研究报告未来统一视觉模型是非常有价值的研究方向CV领域对于开发通用统一的视觉系统具有很高的兴趣实现这一目标的关键研究方向包括1从闭集模型到开集模型可以更好地将文本和视觉匹配2从特定任务到通用能力减少新模型垂直细分模型的开发成本3从静态模型到可提示模型未来通用视觉模型应具备强大的上下文学习能力因此LLM可以接受不同语言和上下文提示作为输入并生成用户所需的输出无需微调图7统一视觉模型研究案例更好地将文本与视觉匹配资料来源ChunyuanLi等-MultimodelFoundationModelsFromSpecialiststoGeneralPurposeAssistants-Arxiv2023-P47国信证券经济研究所整理方向四LLM支持的多模态大模型该领域的代表作为OpenAI的多模态模型GPT-4V模型具备较强大的能力1模型具有强大的通用性能力能够处理不同输入模态的任意组合包括图像子图像文本场景文本和视觉指针2经过详细测试研究人员发现GPT-4V支持LLM中的test-time技术如指令跟随思维链上下文少样本学习等3GPT-4V在多个实验领域表现接近人类水平的能力包括开放世界视觉理解视觉描述多模态知识常识场景文本理解文档推理编码时间推理抽象推理情感理解等LLM支持的多模态模型仍有部分领域需要改进和迭代包括更多超越视觉和语言的模态MultitaskInstructwithEstablishedAcademicDatasetsTasks多模态的上下文学习MultimodalIn-Context-Learning参数高效训练Parameter-EfficientTraining以及Benchmark等内容请务必阅读正文之后的免责声明及其项下所有内容8证券研究报告图8LLM支持的多模态大模型典型案例为GPT-4V可以识别图像并详细叙述资料来源ZhengyuanYang等-TheDawnofLMMsPreliminaryExplorationswithGPT-4Vision-Arxiv2023-P29国信证券经济研究所整理方向五多模态Agent多模态Agent是将不同的多模态专家模型同LLM联系起来进而解决复杂多模态理解问题的办法也是目前最前沿的多模态研究方向大语言模型LLM具有对各领域用户提示的通用性特点以及利用少量提示快速适应新场景的学习能力受到这种强大能力的启发研究人员正在探索一种新的模型范式该范式不再是针对解决有限预定义问题的独立模型而是通过将多个工具或专家与LLM协同来解决复杂的开放性问题与方向四不同这样的系统可以在没有任何训练的情况下构建只需使用少量提示训练LLM使其对现有工具进行调用整体而言多模态agent在多模态理解方面能力较强并可轻松扩展到潜在的数百万种工具中图9多模态agent的研究案例资料来源ChunyuanLi等-MultimodelFoundationModelsFromSpecialiststoGeneralPurposeAssistants-Arxiv2023-P81国信证券经济研究所整理请务必阅读正文之后的免责声明及其项下所有内容9证券研究报告多模态大模型逐步从专用转向通用应用性增强多模态大模型逐步从专用转向通用应用性增强多模态模型的潜在价值日益凸显模型所具备的跨感知理解与生成能力为各种应用提供了广阔的新领域在代码生成文本生成图像生成音视频游戏等领域已有部分应用未来多模态模型将赋能教育办公医疗机器人等赛道1文生图图片生成是目前AIGC领域相对成熟的方向已经达到商用水平2音视频游戏领域该领域起步较晚对模型复杂度和算力要求更高未来市场空间巨大3教育领域可先建立通用教育大模型并通过后续任务调整为多种多模态教育模型如自动生成教学资源支持人机协作辅助教师教学智能模型4办公赛道多模态模型的语音识别与图像生成功能可以用于会议记录语音识别管理和制作多媒体内容等为办公场景提供会议和协作支持多媒体内容管理文档自动化处理等5遥感领域多模态模型可用于对卫星图像航空影像和其他遥感影像进行分类和解译提供更全面更精准的地理信息分析和环境监测能力6医疗领域多模态模型可以结合医学影像数据如CT扫描MRI和X射线等辅助医生进行疾病诊断和影像分析还可用于医疗数据整合与分析远程医疗咨询个性化医疗方案定制等7工业工业缺陷检测机器人领域等图10模型识别CT影像可应用于医疗领域图11模型识别手写方程可应用于教育领域资料来源OpenAI-GPT-4VisionSystemCard-Arxiv2023资料来源ZhengyuanYang等-TheDawnofLMMsPreliminary-P9国信证券经济研究所整理ExplorationswithGPT-4Vision-Arxiv2023-P63国信证券经济研究所整理请务必阅读正文之后的免责声明及其项下所有内容10证券研究报告机器人是多模态AI优质落地场景商用落地有望加速多模态将赋能机器人应用多模态模型具备强大的语音识别和视觉理解能力机器人成为优质落地场景通过视觉理解机器人能够准确感知和解释环境中的视觉信息从而更好地适应各种复杂场景和任务同时强大的语音识别功能使得机器人能够准确捕捉和理解人类语言的含义和情感从而实现更自然流畅的人机交互在自然语言处理方面多模态模型的应用使得机器人能够更深入地理解和回应人类的语言表达增强了其智能决策和反应的能力此外多模态模型的传感器融合使得机器人能够将不同感知渠道获取的信息整合起来形成更全面准确的环境认知从而更加高效地应对复杂多变的任务需求例如谷歌在23年7月推出了机器人模型RoboticsTransformer2一个全新的视觉-语言-动作VLA模型来进行机器人控制特斯拉打通了FSD和机器人的底层模型让其机器人依靠视觉感知就能完成各项任务多模态大模型的应用在机器人领域有充分的发挥空间图12大模型建立数字人可应用于工业领域图13多模态大模型MC-ACT赋能机器人增强其通用性资料来源英伟达国信证券经济研究所整理资料来源CarnegieMellonUniversity国信证券经济研究所整理按照我国标准机器人可分为工业服务特种机器人目前国际机器人联盟IFR根据应用环境将机器人分为工业机器人和服务机器人两大类如工业场景的机械臂家用的扫地机等中国电子学会将机器人分为工业机器人服务机器人特种机器人此外依据国内机器人产业发展特性结合特殊环境作业需求国家标准进一步将服务机器人分为个人家用服务机器人公共服务机器人和特种服务机器人经过三波发展浪潮智能人形机器人成为发展趋势第一代程序控制机器人按照预装程序进行工作可以实现搬运拿取等工作已经在工业场景有规模应用第二代自适应机器人配套传感器进行工作具有自我调整功能可适应本身或是环境变化帮助生产效率进一步提升第三代智能机器人智能化水平进一步提升具有感知交互和思维能力并且人形成为发展趋势尤其是AI大模型的发展将具备更好的交互和自主处理复杂问题的能力请务必阅读正文之后的免责声明及其项下所有内容11证券研究报告图14机器人种类繁多可分为工业服务特种机器人资料来源中国电子学会著-机器人简史第三版-电子工业出版社2022-P29国信证券经济研究所整理多技术融合创新推动机器人能力边界持续拓展在信息技术材料技术传感技术等多种技术融合创新驱动下机器人能力边界持续拓展工业机器人在5G技术的赋能下经历了持续快速的升级实现了数字化网络化和智能化升级为工业环境极端操作等应用领域提供了技术保障与此同时服务机器人通过传感器的综合运用以及控制算法的优化智能水平显著提高在医疗服务机器人领域新兴技术如穿戴式医疗和智能材料的融合推动着智能服务机器人的发展例如强生的Monarch数字化手术平台通过多项技术的综合运用提高了手术治疗的精准性和灵活性为患者提供更精密的治疗体验AI为机器人发展注入新活力随着人工智能技术的不断发展和进步机器人行业进入发展快车道机器人的感知能力学习能力和与人类的交互能力得到提升1AI提升机器人的感知能力通过各种传感器摄像头雷达等设备机器人可以收集并处理大量的环境和自身数据从而实现对周围情况的感知和理解这种感知能力可应用于自动驾驶领域使得机器人能够识别道路交通信号障碍物行人等复杂场景为安全驾驶提供关键支持2AI赋能机器人学习和优化行为机器人可以从大量的数据和经验中学习和提升自己的行为和技能适应不同的任务和场景工业机器人可以通过AI技术来学习和优化自己的生产流程从而提高生产效率和质量3AI提升机器人的交互协作能力利用自然语言处理计算机视觉情感分析等技术机器人可以与人类或其他机器人进行有效的交流和协作实现更好的服务和合作这可应用于服务机器人领域的性能提升增强客户满意度请务必阅读正文之后的免责声明及其项下所有内容12证券研究报告图15机器人与AI技术结合资料来源优必选国信证券经济研究所整理特斯拉开启人形机器人新时代特斯拉开启人形机器人新时代Optimus预计明年可投入使用人形机器人是一种致力于模仿人类外观和行为的机器人在服务工业和军事等领域发挥着重要作用特斯拉公司于2021年8月推出人形机器人擎天柱TeslaBot开启了人形机器人时代2022年9月特斯拉又推出机器人Optimus该机器人重达73公斤身高172米具备搬运货物浇水以及移动金属棒等功能Optimus采用端到端模式运行其神经网络在边缘侧本地运行无需联网能够应对各类复杂任务近期特斯拉机器人官方账号公布了Optimus的最新进展该机器人具备高效的视觉感知和精细的手部设计可以对物体进行分类也可完成瑜伽动作公司预计明年Optimus将在特斯拉工厂内承担一些实际工作图16特斯拉机器人做瑜伽图17特斯拉机器人做物品分类资料来源特斯拉国信证券经济研究所整理资料来源特斯拉国信证券经济研究所整理请务必阅读正文之后的免责声明及其项下所有内容13证券研究报告人形机器人市场广阔特斯拉推动加快落地在AI和特斯拉引领下机器人市场有望迅速扩大根据GGII报告预测预计到2026年全球人形机器人在服务机器人中的渗透率有望达到35市场规模超20亿美元到2030年全球市场规模有望突破200亿美元随着特斯拉Optimus在22年的快速迭代进步市场对于人形机器人的产业落地预期将提前Optimus有望成为最快实现规模化商用的机器人根据特斯拉的预期Optimus有望在2023年出有用的呈现场景最快两年能做到小规模应用Dojo作为一款高度专业化超级算力的系统将为人形机器人的智能化和自主化发展提供强有力的支持特斯拉计划在2024年2月之前将Dojo建设成全球最先进的五台超级计算机之一到2024年10月Dojo的总算力规模预计将达到100Exa-Flops相当于30万片英伟达A100芯片的算力这种超级算力使得Dojo具备强大的处理视觉数据能力该视觉处理能力不仅可以应用于汽车行业还可以对机器人医疗保健安全等领域提供技术支持任何装备摄像头并依赖视觉输入做出实时决策的设备都有望受益于Dojo的技术优势图182024年10月Dojo总算力规模将达到100Exa-Flops资料来源特斯拉国信证券经济研究所整理AI大模型机器人具身智能时代有望开启具身智能是基于物理身体感知和行动的智能系统根据CCF的定义具身智能是指一种基于物理身体进行感知和行动的智能系统其通过智能体与环境的交互获取信息理解问题做出决策并实现行动从而产生智能行为和适应性早期的具身智能研究主要集中在机器人学和仿生学领域逐渐发展并融合了跨学科的方法和技术近年来随着深度学习等技术的快速发展具身智能研究进入了一个新的阶段研究人员利用虚拟物理环境和强大的计算能力设计和训练具备感知和行动能力的智能系统并将这种交互能力迁移到真实世界使智能体进行自主决策和执行物理交互任务简而言之即AI的思考能力机器人的躯体在大模型不断取得突破的背景下科技大厂纷纷尝试将语言视觉等模型嵌入机器人中以帮助机器人处理复杂任务谷歌PaLM-SayCan帮助机器人强化语言理解能力2021年谷歌研究院宣布了对Pathways的愿景希望其成为一个跨领域和任务泛化且高效的单一模型PaLM展请务必阅读正文之后的免责声明及其项下所有内容14证券研究报告示了Pathways系统的首次大规模使用大约包含5400亿个参数仅使用DensedecoderTransformer模型PaLM结合使用英语和多语言数据集进行训练其中包括高质量的网络文档书籍维基百科对话和GitHub代码PaLM与语言模型Say及函数Can结合便有了PaLM-SayCan能够帮机器人更好的理解复杂指令根据谷歌与EverydayRobots的测试将机器人放置在包含常见物体的厨房环境中并根据101条指令对其进行评估结果表明使用了PaLM-SayCan的机器人在84的时间内选择正确的技能序列并在74的时间内成功执行它们与FLAN基于T5的指令调优模型相比错误减少了50图19SayCan与PaLM结合使用时成功规划了101条测试指令中的84资料来源google国信证券经济研究所整理微软将ChatGPT应用于机器人帮助机器人实现自主决策微软2023年2月发布论文ChatGPTforRoboticsDesignPrinciplesandModelAbilities提出了ChatGPT应用于机器人的设计原则ChatGPT可以通过一系列的设计原则来指导其解决机器人学任务包括特殊的提示结构高级API和文本反馈等ChatGPT可以适应不同的机器人学任务仿真器和形态并且可以通过自然语言指令来与用户交互图20ChatGPT应用于机器人的设计原则资料来源微软国信证券经济研究所整理请务必阅读正文之后的免责声明及其项下所有内容15证券研究报告微软将ChatGPT应用于机器人领域可解决诸多问题1帮助客户高效生成多种机器人控制代码ChatGPT可以根据用户的自然语言指令生成适用于不同机器人平台和任务的代码无需任何预先训练或微调但可能存在一定的错误率这种能力可以让用户快速地探索不同的机器人方案而不需要了解底层的编程细节适用场景包括机械臂操作无人机导航家庭助理机器人等2帮助机器人更好的进行图像等视觉数据处理ChatGPT可以利用视觉信息来指导机器人进行物体识别距离估计规避障碍等可以通过XML标签或其他格式来接收和处理图像数据并生成相应的代码或动作序列这种能力可以让机器人更好地适应复杂和动态的环境而不需要预先定义会碰到的各种情况适用场景包括机器人导航机器人抓取等3帮助机器人拥有更好的数理逻辑解决抽象任务ChatGPT可以利用常识知识和推理能力来解决一些需要逻辑几何或数学思维的机器人任务例如计算角度判断方向选择最优路径等可以让机器人更智能地执行一些抽象任务适用场景包括机器人推理机器人游戏等投资建议关注多模态机器人及AI应用随着GPT-4V的推出多模态将进一步扩大AI的应用范围机器人也是极佳的多模态AI应用场景此外随着AI大模型成本下降与技术发展AI应用产业将快速进步建议重点关注AI应用多模态机器人领域相关个股比如萤石网络宝信软件金山办公科大讯飞风险提示计算机下游需求不及预期ChatGPT技术发展不及预期ChatGPT的商业化落地不及预期AI伦理风险等请务必阅读正文之后的免责声明及其项下所有内容16证券研究报告免责声明分析师声明作者保证报告所采用的数据均来自合规渠道分析逻辑基于作者的职业理解通过合理判断并得出结论力求独立客观公正结论不受任何第三方的授意或影响作者在过去现在或未来未就其研究报告所提供的具体建议或所表述的意见直接或间接收取任何报酬特此声明国信证券投资评级投资评级标准类别级别说明报告中投资建议所涉及的评级如有分为股票评买入股价表现优于市场代表性指数20以上级和行业评级另有说明的除外评级标准为报告发布日后6到12个月内的相对市场表现也即报股票增持股价表现优于市场代表性指数10-20之间告发布日后的6到12个月内公司股价或行业指数投资评级中性股价表现介于市场代表性指数10之间相对同期相关证券市场代表性指数的涨跌幅作为基卖出股价表现弱于市场代表性指数10以上准A股市场以沪深300指数000300SH作为基准新三板市场以三板成指899001CSI为基准超配行业指数表现优于市场代表性指数10以上行业香港市场以恒生指数HSIHI作为基准美国市场中性行业指数表现介于市场代表性指数10之间以标普500指数SPXGI或纳斯达克指数投资评级IXICGI为基准低配行业指数表现弱于市场代表性指数10以上重要声明本报告由国信证券股份有限公司已具备中国证监会许可的证券投资咨询业务资格制作报告版权归国信证券股份有限公司以下简称我公司所有本报告仅供我公司客户使用本公司不会因接收人收到本报告而视其为客户未经书面许可任何机构和个人不得以任何形式使用复制或传播任何有关本报告的摘要或节选都不代表本报告正式完整的观点一切须以我公司向客户发布的本报告完整版本为准本报告基于已公开的资料或信息撰写但我公司不保证该资料及信息的完整性准确性本报告所载的信息资料建议及推测仅反映我公司于本报告公开发布当日的判断在不同时期我公司可能撰写并发布与本报告所载资料建议及推测不一致的报告我公司不保证本报告所含信息及资料处于最新状态我公司可能随时补充更新和修订有关信息及资料投资者应当自行关注相关更新和修订内容我公司或关联机构可能会持有本报告中所提到的公司所发行的证券并进行交易还可能为这些公司提供或争取提供投资银行财务顾问或金融产品等相关服务本公司的资产管理部门自营部门以及其他投资业务部门可能独立做出与本报告中意见或建议不一致的投资决策本报告仅供参考之用不构成出售或购买证券或其他投资标的要约或邀请在任何情况下本报告中的信息和意见均不构成对任何个人的投资建议任何形式的分享证券投资收益或者分担证券投资损失的书面或口头承诺均为无效投资者应结合自己的投资目标和财务状况自行判断是否采用本报告所载内容和信息并自行承担风险我公司及雇员对投资者使用本报告及其内容而造成的一切后果不承担任何法律责任证券投资咨询业务的说明本公司具备中国证监会核准的证券投资咨询业务资格证券投资咨询是指从事证券投资咨询业务的机构及其投资咨询人员以下列形式为证券投资人或者客户提供证券投资分析预测或者建议等直接或者间接有偿咨询服务的活动接受投资人或者客户委托提供证券投资咨询服务举办有关证券投资咨询的讲座报告会分析会等在报刊上发表证券投资咨询的文章评论报告以及通过电台电视台等公众传播媒体提供证券投资咨询服务通过电话传真电脑网络等电信设备系统提供证券投资咨询服务中国证监会认定的其他形式发布证券研究报告是证券投资咨询业务的一种基本形式指证券公司证券投资咨询机构对证券及证券相关产品的价值市场走势或者相关影响因素进行分析形成证券估值投资评级等投资分析意见制作证券研究报告并向客户发布的行为证券研究报告国信证券经济研究所深圳深圳市福田区福华一路125号国信金融大厦36层邮编518046总机0755-82130833上海上海浦东民生路1199弄证大五道口广场1号楼12层邮编200135北京北京西城区金融大街兴盛街6号国信证券9层邮编100032
|
相关行业报告
|
||||||||||||||||||||||||||
