>> 海通证券-信息服务行业跟踪报告:大模型迭代速度或日益加快,具身智能发展有望持续深化-230919
| 上传日期: |
2023/9/19 |
大小: |
420KB |
| 格式: |
pdf 共3页 |
来源: |
海通证券 |
| 评级: |
优于大市 |
作者: |
杨林 |
| 下载权限: |
此报告为加密报告 |
|
|
投资要点: Colossal-AI对700亿参数大模型的训练加速195%,大型模型开发和应用的成本将大大降低。根据HPC-AITechnology官网,作为全球规模最大、最活跃的大模型开发工具与社区,Colossal-AI再次迭代,提供开箱即用的8到512卡LLaMA2训练、微调、推理方案,对700亿参数训练加速195%,并提供一站式云平台解决方案。在使用8卡训练/微调LLaMA2-7B时,Colossal-AI能达到约54%的硬件利用率(MFU),处于业界领先水平。而对于预训练任务,Colossal-AI则因卓越的系统优化和扩展性,仍能保持良好性能,训练提速195%。Colossal-AILLaMA-2训练/微调方案的高性能来源于新的异构内存管理系统Gemini和高性能算子(包括Flash attention 2)等系统优化。新Gemini提供了高可扩展性,高鲁棒性,高易用性的接口。同时,Colossal-AI的ShardFormer提供了开箱即用的多维并行和算子优化的能力,仅需数行代码即可使用,在单机以及大规模集群上都能提供良好的性能。其次,为了进一步提升开发和部署效率,Colossal-AI团队还将上述系统优势与算力结合,提供Colossal-AI云平台,提供廉价算力和开箱即用的AI主流应用。用户只需要上传相关数据,即可无代码训练个性化私有模型,并将训练好的模型一键部署。我们认为,Colossal-AI的这次迭代大大降低模型训练以及部署的成本,有望对大模型产业的加速发展起到重要的催化作用。 AI有望代替人类进行强化学习,大模型训练速度有望大幅提升。来自人类反馈的强化学习(RLHF)可以有效地使大型语言模型(LLM)与人类偏好保持一致,但收集高质量的人类偏好标签是一个关键瓶颈。Bai等人探索使用AI来训练用于强化学习微调的奖励模型,但他们的工作并没有直接比较人类与AI反馈的有效性,这使得来自人工智能反馈的强化学习(RLAIF)是否可以成为RLHF的合适替代品的问题仍没有定论。近日,谷歌研究院发表了论文RLAIF: Scaling Reinforcement Learning from Human Feedback with AIFeedback,直接比较了人类与AI反馈的有效性,发现RLAIF可以产生人类水平的性能,这一结果为RLHF的可扩展性方面的限制提供了潜在的解决方案。在这项研究中,研究者给定了一段文本和两个候选响应,使用现有的LLM为其分配一个偏好标签。然后再基于该LLM偏好,使用对比损失训练一个奖励模型(RM)。最后,他们使用该RM来提供奖励,通过强化学习方法微调得到一个策略模型。随后,研究者使用了三个评估指标:打标签AI对齐度、配对准确度和胜率来对AI和人类的反馈进行评估。最终得到RLAIF和RLHF策略分别在71%和73%的时间里比监督式微调(SFT)基准更受人类青睐,而这两个胜率在统计学意义上没有显著差别。同时,当被要求直接比较RLAIF与RLHF的结果时,人类对两者的偏好大致相同(即50%胜率)。我们认为,这些结果表明RLAIF不依赖于人类标注,并且具有良好的扩展性,故而拥有替代RLHF的潜力,如果AI能够代替人类进行强化学习,未来大模型的训练速度有望大幅提升。 大模型被证实理论上能教会机器人对模糊指令做出回应,具身智能发展或持续深化。近日,谷歌DeepMind和东京大学的研究团队共同发布了一篇论文SayTap: Language to Quadrupedal Locomotion,论文中提出的交互式系统(SayTap)方法使用了大型语言模型,可将自然语言指令转译成四足机器人的低层控制信号,而且这些指令可以相当模糊。近来大型语言模型(LLM)发展迅速,已经展现出了执行高层规划的潜力。然而,对LLM来说,理解低层指令依然很难,比如关节角度目标或电机扭矩,尤其是对于本身就不稳定、必需高频控制信号的足式机器人。因此,大多数现有工作都会假设已为LLM提供了决定机器人行为的高层API,而这就从根本上限制了系统的表现能力。此研究中,研究者提出了一种使用脚接触模式作为接口的方法,该接口在自然语言中连接人类命令,以及输出这些低级命令的运动控制器。这就搭建出了一个四足机器人的交互式系统(SayTap),允许用户灵活地制作各种运动行为。研究团队设计了一个LLM提示设计,一个奖励函数,以及一种将控制器暴露给接触模式的可行分布的方法。最终的结果显示,所提出的方法使四足机器人既能够遵循直接和精确的命令,同时还能遵循自然语言中的非结构化和模糊指令,从而促进人机交互。例如,当研究者给出“好消息,我们要去野餐了!”的指令时,机器人表现出上蹿下跳的行为。当研究者给出“表现得地面好像很热的样子”的命令时,机器人快速地移动,脚几乎不着地。这些反应大多与预期一致。我们认为,这一研究结果展示了未来机器人应用的广阔可能性,例如场景表演、人类伴侣甚至工业和家庭中许多更具创造性的任务,伴随大模型的持续迭代,未来机器人和理解人类意图的能力也有望持续提升,具身智能发展也有望持续深化。 风险提示:AI技术发展不及预期的风险,行业应用不及预期
研究报告全文:TableMainInfo行业研究信息服务证券研究报告行业跟踪报告2023年09月19日TableInvestInfo投资评级优于大市维持大模型迭代速度或日益加快具身智能发市场表现展有望持续深化TableSummaryTableQuoteInfo信息服务海通综指投资要点38182857Colossal-AI对700亿参数大模型的训练加速195大型模型开发和应用的成1896本将大大降低根据HPC-AITechnology官网作为全球规模最大最活跃的935大模型开发工具与社区Colossal-AI再次迭代提供开箱即用的8到512卡训练微调推理方案对亿参数训练加速并提供一站-026LLaMA2700195式云平台解决方案在使用8卡训练微调LLaMA2-7B时Colossal-AI能达到-987202292022122023320236约54的硬件利用率MFU处于业界领先水平而对于预训练任务Colossal-AI则因卓越的系统优化和扩展性仍能保持良好性能训练提速资料来源海通证券研究所195Colossal-AILLaMA-2训练微调方案的高性能来源于新的异构内存管理系统Gemini和高性能算子包括Flashattention2等系统优化新Gemini相关研究提供了高可扩展性高鲁棒性高易用性的接口同时Colossal-AI的TableReportInfo计算机行业跟踪周报316期华为重磅ShardFormer提供了开箱即用的多维并行和算子优化的能力仅需数行代码即大会推动社会数字化转型助力计算行业新变革20230917可使用在单机以及大规模集群上都能提供良好的性能其次为了进一步提计算机行业跟踪周报315期鸿蒙系统升开发和部署效率Colossal-AI团队还将上述系统优势与算力结合提供或正式落地PC华为持续加速行业智能Colossal-AI云平台提供廉价算力和开箱即用的AI主流应用用户只需要上传化20230913相关数据即可无代码训练个性化私有模型并将训练好的模型一键部署我通过备案的AI大模型产品开始陆续上们认为Colossal-AI的这次迭代大大降低模型训练以及部署的成本有望对大线AI商用进入新时代20230905模型产业的加速发展起到重要的催化作用AI有望代替人类进行强化学习大模型训练速度有望大幅提升来自人类反馈的强化学习RLHF可以有效地使大型语言模型LLM与人类偏好保持一致但收集高质量的人类偏好标签是一个关键瓶颈Bai等人探索使用AI来训练用TableAuthorInfo于强化学习微调的奖励模型但他们的工作并没有直接比较人类与AI反馈的有效性这使得来自人工智能反馈的强化学习RLAIF是否可以成为RLHF的合适替代品的问题仍没有定论近日谷歌研究院发表了论文RLAIFScalingReinforcementLearningfromHumanFeedbackwithAIFeedback直接比较了人类与AI反馈的有效性发现RLAIF可以产生人类水平的性能这一结果为RLHF的可扩展性方面的限制提供了潜在的解决方案在这项研究中研究者给定了一段文本和两个候选响应使用现有的LLM为其分配一个偏好标签然后再基于该LLM偏好使用对比损失训练一个奖励模型RM最后他们使用该RM来提供奖励通过强化学习方法微调得到一个策略模型随后研分析师杨林究者使用了三个评估指标打标签AI对齐度配对准确度和胜率来对AI和人类的反馈进行评估最终得到和策略分别在和的时间Tel02123183969RLAIFRLHF7173里比监督式微调SFT基准更受人类青睐而这两个胜率在统计学意义上没Emailyl11036haitongcom有显著差别同时当被要求直接比较RLAIF与RLHF的结果时人类对两者证书S0850517080008的偏好大致相同即50胜率我们认为这些结果表明RLAIF不依赖于联系人杨昊翊人类标注并且具有良好的扩展性故而拥有替代RLHF的潜力如果AI能够Tel02123185620代替人类进行强化学习未来大模型的训练速度有望大幅提升Emailyhy15080haitongcom请务必阅读正文之后的信息披露和法律声明行业研究信息服务行业2大模型被证实理论上能教会机器人对模糊指令做出回应具身智能发展或持续深化近日谷歌DeepMind和东京大学的研究团队共同发布了一篇论文SayTapLanguagetoQuadrupedalLocomotion论文中提出的交互式系统SayTap方法使用了大型语言模型可将自然语言指令转译成四足机器人的低层控制信号而且这些指令可以相当模糊近来大型语言模型LLM发展迅速已经展现出了执行高层规划的潜力然而对LLM来说理解低层指令依然很难比如关节角度目标或电机扭矩尤其是对于本身就不稳定必需高频控制信号的足式机器人因此大多数现有工作都会假设已为LLM提供了决定机器人行为的高层API而这就从根本上限制了系统的表现能力此研究中研究者提出了一种使用脚接触模式作为接口的方法该接口在自然语言中连接人类命令以及输出这些低级命令的运动控制器这就搭建出了一个四足机器人的交互式系统SayTap允许用户灵活地制作各种运动行为研究团队设计了一个LLM提示设计一个奖励函数以及一种将控制器暴露给接触模式的可行分布的方法最终的结果显示所提出的方法使四足机器人既能够遵循直接和精确的命令同时还能遵循自然语言中的非结构化和模糊指令从而促进人机交互例如当研究者给出好消息我们要去野餐了的指令时机器人表现出上蹿下跳的行为当研究者给出表现得地面好像很热的样子的命令时机器人快速地移动脚几乎不着地这些反应大多与预期一致我们认为这一研究结果展示了未来机器人应用的广阔可能性例如场景表演人类伴侣甚至工业和家庭中许多更具创造性的任务伴随大模型的持续迭代未来机器人和理解人类意图的能力也有望持续提升具身智能发展也有望持续深化风险提示AI技术发展不及预期的风险行业应用不及预期请务必阅读正文之后的信息披露和法律声明行业研究信息服务行业3信息披露分析师声明Table杨林Analyst计算机行业s本人具有中国证券业协会授予的证券投资咨询执业资格以勤勉的职业态度独立客观地出具本报告本报告所采用的数据和信息均来自市场公开信息本人不保证该等信息的准确性或完整性分析逻辑基于作者的职业理解清晰准确地反映了作者的研究观点结论不受任何第三方的授意或影响特此声明分析师负责的股票研究范围TableStock重点研究上市公司s新开普创业慧康航天宏图广联达用友网络银江技术商汤-W思维列控金溢科技中控技术荣旗科技汉得信息鼎捷软件金山办公光庭信息海康威视启明星辰新国都博彦科技久远银海美亚柏科太极股份德生科技软通动力数字政通新大陆安恒信息赛意信息宇信科技佳缘科技投资评级说明1投资评级的比较和评级标准类别评级说明以报告发布后的6个月内的市场表现优于大市预期个股相对基准指数涨幅在10以上为比较标准报告发布日后6个月内股票投资评中性预期个股相对基准指数涨幅介于-10与10之间的公司股价或行业指数的涨跌幅级弱于大市预期个股相对基准指数涨幅低于-10及以下相对同期市场基准指数的涨跌幅无评级对于个股未来6个月市场表现与基准指数相比无明确观点2市场基准指数的比较标准优于大市预期行业整体回报高于基准指数整体水平以上股市场以海通综指为基准香港市10A行业投资评场以恒生指数为基准美国市场以标中性预期行业整体回报介于基准指数整体水平-10与10之间级普或纳斯达克综合指数为基准500弱于大市预期行业整体回报低于基准指数整体水平-10以下法律声明本报告仅供海通证券股份有限公司以下简称本公司的客户使用本公司不会因接收人收到本报告而视其为客户在任何情况下本报告中的信息或所表述的意见并不构成对任何人的投资建议在任何情况下本公司不对任何人因使用本报告中的任何内容所引致的任何损失负任何责任本报告所载的资料意见及推测仅反映本公司于发布本报告当日的判断本报告所指的证券或投资标的的价格价值及投资收入可能会波动在不同时期本公司可发出与本报告所载资料意见及推测不一致的报告市场有风险投资需谨慎本报告所载的信息材料及结论只提供特定客户作参考不构成投资建议也没有考虑到个别客户特殊的投资目标财务状况或需要客户应考虑本报告中的任何意见或建议是否符合其特定状况在法律许可的情况下海通证券及其所属关联机构可能会持有报告中提到的公司所发行的证券并进行交易还可能为这些公司提供投资银行服务或其他服务本报告仅向特定客户传送未经海通证券研究所书面授权本研究报告的任何部分均不得以任何方式制作任何形式的拷贝复印件或复制品或再次分发给任何其他人或以任何侵犯本公司版权的其他方式使用所有本报告中使用的商标服务标记及标记均为本公司的商标服务标记及标记如欲引用或转载本文内容务必联络海通证券研究所并获得许可并需注明出处为海通证券研究所且不得对本文进行有悖原意的引用和删改根据中国证监会核发的经营证券业务许可海通证券股份有限公司的经营范围包括证券投资咨询业务请务必阅读正文之后的信息披露和法律声明
|
|