>> 浙商证券-计算机行业点评报告:OpenAI发布Whisper API,再添新收费产品-230302
| 上传日期: |
2023/3/4 |
大小: |
1544KB |
| 格式: |
pdf 共10页 |
来源: |
浙商证券 |
| 评级: |
看好 |
作者: |
刘雯蜀 |
| 行业名称: |
计算机 |
| 下载权限: |
此报告为加密报告 |
|
|
事件 北京时间3月2日,OpenAI宣布开放ChatGPTAPI,价格为每1000 tokens0.002美元,较GPT-3.5模型价格降低90%。同时,OpenAI还推出Whisper官方API,Whisper模型可实现语音-文本(Speech-to-Text)的跨模态任务,使用者可实现语音的转录和翻译,费用为每分钟0.006美元。 投资要点 微软宣布开放Whisper API接口,AI多模态进程加速 1、Whisper支持语音转录和翻译两项功能并接受各种语音格式,模型中、英、法、德、意、日等主流语言上取得85%以上的准确率,完全符合工业准确率标准,未来有望打开商业化空间; 2、Whisper模型根据参数量和语言不同,共有9种版本,可适应不同使用者的需求。在中文语料测试下,模型在语音识别、语气识别、自动断句等方面表现出色,可满足各类使用场景需求; 3、多模态将成为AI大模型发展的重要趋势,Whisper模型在跨模态任务上的出色表现,有望为AI大模型多模态化发展奠定重要基础。 Whisper模型拆解,性能优异应用场景丰富 1、Whisper模型的编码/解码器架构仍基于Transformer,通过不同大小和类型的数据输入,实现模型的缩放性能,以及各项语音-文本任务的泛化性和鲁棒性; 2、Whisper模型较之前的语音识别模型有多项改进,在识别准确率、断句、漏音等维度上均有显著优化。目前已有Speak为代表的产品使用Whisper API提升服务质量,未来看好Whisper在更多商业场景中的深度应用。 投资建议:关注具备底层算法模型核心技术优势的厂商 1、推荐标的:拓尔思(中文NLP龙头厂商),科大讯飞(智能语音处理及合成); 2、建议关注:谷歌(DeepMind),微软(ChatGPT,Whisper),Meta(OPT模型),百度(“文心”模型),腾讯; 风险提示 1、AI技术迭代不及预期的风险;2、AI商业化产品发布不及预期;3、政策不确定性带来的风险;4、下游市场不确定性带来的风险;
研究报告全文:证券研究报告行业点评计算机计算机报告日期年月日20230302OpenAI发布WhisperAPI再添新收费产品行业点评报告事件行业评级看好维持北京时间3月2日OpenAI宣布开放ChatGPTAPI价格为每1000tokens分析师刘雯蜀0002美元较GPT-35模型价格降低90同时OpenAI还推出Whisper官方执业证书号s1230523020002APIWhisper模型可实现语音-文本Speech-to-Text的跨模态任务使用者可实liuwenshu03stockecomcn现语音的转录和翻译费用为每分钟0006美元相关报告投资要点1人工智能行业深度潮起潮落拐点已过AIGC有望引领微软宣布开放WhisperAPI接口AI多模态进程加速人工智能商业化浪潮1Whisper支持语音转录和翻译两项功能并接受各种语音格式模型中英20230212法德意日等主流语言上取得85以上的准确率完全符合工业准确率标2拓尔思300229语义智准未来有望打开商业化空间能领军者大数据AI双轮驱动2Whisper模型根据参数量和语言不同共有9种版本可适应不同使用者的打开公司广阔成长空间需求在中文语料测试下模型在语音识别语气识别自动断句等方面表现20221129出色可满足各类使用场景需求3多模态将成为AI大模型发展的重要趋势Whisper模型在跨模态任务上的出色表现有望为AI大模型多模态化发展奠定重要基础Whisper模型拆解性能优异应用场景丰富1Whisper模型的编码解码器架构仍基于Transformer通过不同大小和类型的数据输入实现模型的缩放性能以及各项语音-文本任务的泛化性和鲁棒性2Whisper模型较之前的语音识别模型有多项改进在识别准确率断句漏音等维度上均有显著优化目前已有Speak为代表的产品使用WhisperAPI提升服务质量未来看好Whisper在更多商业场景中的深度应用投资建议关注具备底层算法模型核心技术优势的厂商1推荐标的拓尔思中文NLP龙头厂商科大讯飞智能语音处理及合成2建议关注谷歌DeepMind微软ChatGPTWhisperMetaOPT模型百度文心模型腾讯风险提示1AI技术迭代不及预期的风险2AI商业化产品发布不及预期3政策不确定性带来的风险4下游市场不确定性带来的风险httpwwwstockecomcn110请务必阅读正文之后的免责条款部分行业点评正文目录1微软宣布开放WhisperAPI接口AI多模态进程加速411OpenAI开放WhisperAPI端口AI商用空间持续打开412Whisper模型灵活多样可满足不同需求中文识别表现出色513AI模型有望从单模态走向多模态应用场景持续延伸62Whisper模型拆解性能优异应用场景丰富721Whisper模型简约不简单Transformer架构发挥重大作用722Whisper模型优势显著未来应用场景丰富83投资建议94风险提示9httpwwwstockecomcn210请务必阅读正文之后的免责条款部分行业点评图表目录图1Whisper模型在全球主流语种的语音识别错误率4图22022年中国智能语音产品成熟度曲线分布5图3Whisper在small模型下的识别结果6图4Whisper在medium模型下的识别结果6图5未来人工智能应用中的JinaAI光谱6图6多模态AI将融合各类型数据之间的界限提升AI解决任务的能力和范围7图7Whisper模型架构7图8Whisper采用基于Transformer的编码器解码器架构7图9Whisper相比wav2vec在不同数据集的词错误率上表现更加出色8图10Speak基于AI模型辅助用户英语学习9表1Whisper模型支持多种参数量和语种版本5httpwwwstockecomcn310请务必阅读正文之后的免责条款部分行业点评1微软宣布开放WhisperAPI接口AI多模态进程加速11OpenAI开放WhisperAPI端口AI商用空间持续打开OpenAI开放Whisper模型APIAI商业化进程加速推进北京时间2023年3月2日OpenAI宣布将允许第三方开发者通过API将ChatGPT集成到他们的应用程序和服务中并开放API允许用户使用语音到文本的AI模型Whisper对其开发人员服务条款进行了一些修改OpenAI在2022年9月开源了Whisper语音到文本Speech-to-Text模型经过一系列优化后向使用者开放API接口以调用模型定价为0006美元分钟Whisper支持语音转录和翻译两项功能并接受各种格式m4amp3mp4mpga等模型在全球98种语言进行语料训练并在中英法德意日等55种语言上取得了低于50的错误率WERworderrorrate达到语音转文字的工业准确率标准图1Whisper模型在全球主流语种的语音识别错误率资料来源Github浙商证券研究所Whisper模型标志着语音智能走向成熟未来在实际场景中的应用渗透率有望进一步加深根据艾瑞咨询绘制的2022年中国智能语音产品成熟度曲线国内语音智能在语音转写语音输入等领域已处于较为成熟的阶段已有规模化的产品应用而在语音合成自然语言处理和声纹识别等领域处于成熟度快速上升的阶段我们认为此次Whisper模型的大规模推广有望凭借其出色的性能和较低的服务成本对智能语音市场带来变革性的影响同时也看好OpenAI在WhisperChatGPT等AI模型的基础上推出多模态的AI大模型拓宽AI落地场景打开商业化空间httpwwwstockecomcn410请务必阅读正文之后的免责条款部分行业点评图22022年中国智能语音产品成熟度曲线分布资料来源艾瑞咨询浙商证券研究所12Whisper模型灵活多样可满足不同需求中文识别表现出色Whisper模型基于海量数据训练模型选择灵活多样可满足不同需求Whisper模型在68万小时标记音频数据上进行训练其中包括117万小时96种不同语言的演讲和125万小时从任意语言到英语的翻译数据训练数据集还包括从YouTube视频中提取的短语音片段的集合并根据视频标题和描述的语言进行标记带有额外的步骤以去除误报目前Whisper有9种模型分为纯英文和多语言其中四种只有英文版本开发者可以根据需求在速度和准确性之间进行权衡根据模型的大小内存要求和速度需求选择合适的模型版本最大的large模型版本拥有155亿参数量最小的tiny版本仅有3900万参数量但运行速度可达到large版本的32倍表1Whisper模型支持多种参数量和语种版本模型大小参数量纯英文模型多语种模型显存要求模型相对速度tiny39Mtinyentiny1GB32xbase74Mbaseenbase1GB16xsmall244Msmallensmall2GB6xmedium769Mmediumenmedium5GB2xlarge1550Mlarge10GB1x资料来源Github浙商证券研究所Whisper模型可较好地实现中文语料的转写并根据语义进行断句随着模型参数量的增加Whisper模型对中文语料的识别理解能力不断提高在small版本下Whisper识别中文的错别字以及语法错误很少而在medium版本下模型可以出色地完成断句并且能够判断说话者的语气我们认为随着模型在识别准确度转写实时性等维度上的性能进一步优化未来有望充分打开在各类语音-文本交互场景下的AI应用空间httpwwwstockecomcn510请务必阅读正文之后的免责条款部分行业点评图3Whisper在small模型下的识别结果图4Whisper在medium模型下的识别结果资料来源少数派浙商证券研究所资料来源少数派浙商证券研究所13AI模型有望从单模态走向多模态应用场景持续延伸AI模型将从单模态走向跨模态多模态未来AI应用空间将呈现爆炸式扩展开源神经搜索公司JinaAI曾描述了未来AI产品及应用的四大特征即跨模态cross-modal多模态Multi-modal神经搜索neuralsearch和生成式AICreativeAI相比于单模态AI模型多模态AI的应用空间将大幅延伸能够将文本语音图像以及音视频等数据信息进行综合处理分析完成跨模态的应用从而胜任真实世界中的各类复杂任务图5未来人工智能应用中的JinaAI光谱资料来源CSDN浙商证券研究所Whisper模型的应用标志着AI在跨模态任务上的突破性进展为多模态AI大模型的发展奠定良好基础目前单模态AI算法的两大弊端在于1任务只针对一种模态文本图像音频等2知识只能从一种模态学习并应用在这一种模态中视觉算法智能从图像中学习并应用于图像中而Whisper模型能够出色完成语音到文本的跨模态任务突破了不同模态数据之间的界限随着模型的不断发展我们有望看到AI任务在多模态之间的共享传输知识也能够从多模式中学习并应用到多种模式中去AI大模型朝多模态方向发展的进程有望加速httpwwwstockecomcn610请务必阅读正文之后的免责条款部分行业点评图6多模态AI将融合各类型数据之间的界限提升AI解决任务的能力和范围资料来源CSDN浙商证券研究所2Whisper模型拆解性能优异应用场景丰富21Whisper模型简约不简单Transformer架构发挥重大作用Whisper模型使用Transformer架构的seq2seq模型针对各种语音处理任务进行训练Whisper模型可完成多语言语音识别语音翻译口语识别和语音活动检测所有任务都被联合表示为解码器预测的令牌序列允许使用单个模型替换传统语音处理管道的许多不同阶段多任务训练格式则使用一组特殊标记作为任务说明符或分类目标Whisper模型工作中输入的音频被分割成30秒的小段转换为log-Mel频谱图然后传递到编码器解码器经过训练以预测相应的文字说明并与特殊的标记进行混合这些标记指导单一模型执行诸如语言识别短语级别的时间戳多语言语音转录和语音翻译等任务图7Whisper模型架构图8Whisper采用基于Transformer的编码器解码器架构资料来源Github浙商证券研究所资料来源OSCHINA浙商证券研究所httpwwwstockecomcn710请务必阅读正文之后的免责条款部分行业点评Whisper模型在编码过程中编码器首先使用一个包含两个卷积层的词干处理输入表示并使用GELU激活函数第二个卷积层的步幅为2然后将正弦位置嵌入添加到词干的输出中然后应用编码器Transformer块而在解码过程中Whisper模型使用了学习位置嵌入和绑定输入输出标记表示Whisper模型为改进缩放属性在不同的输入大小上进行了训练依靠数据集难解的多样性来促进泛化性和鲁棒性Whisper采用的训练数据中有约4382万小时占比约65的是英语音频和匹配的英语文本1257万小时占比约18非英语音频和英语文本1171万小时占比约17非英语音频和相应的文本非英语部分共包含98种不同语言使用这样一个大而多样的数据集可以提高对口音背景噪音和技术语言的鲁棒性这也使得模型能够变化出大小不同的版本并在基础性能上保持优秀的表现22Whisper模型优势显著未来应用场景丰富Whisper模型相较前几代语音识别模型优势明显看好未来在语音转录与翻译场景下的应用wav2vec2Conformer和Hubert等模型的发展推动了语音识别领域的发展这些模型可从原始音频中进行学习能够有效地使用未标记语音的大型数据集但Whisper模型以监督方式跨多个数据集和领域预训练的模型表现出更好的鲁棒性和对持有数据集的泛化除了以上优势之外Whisper模型能够检测清音区域并应用NLP技术在转录本中正确进行标点符号的输入同时模型是可扩展的允许从音频信号中提取转录本而无需将视频分成块或批次从而降低了漏音的风险而最直观的是Whisper模型在各类数据集上取得了更高的准确率其相比于wav2vec模型取得了目前最低的此错误率图9Whisper相比wav2vec在不同数据集的词错误率上表现更加出色资料来源阿里云社区浙商证券研究所Whisper可应用于教育办公医疗等多种场景市场前景广阔目前已有Speak使用Whisper模型为其产品服务赋能Speak是一款由人工智能驱动的语言学习应用程序专注于构建口语流畅性的最佳途径它们是韩国增长最快的英语应用程序并且已经在使用WhisperAPI为新的人工智能口语伴侣产品提供动力并迅速将其带到全球其他地区httpwwwstockecomcn810请务必阅读正文之后的免责条款部分行业点评Whisper对每个级别的语言学习者的人级准确性解锁了真正的开放式对话练习和高度准确的反馈图10Speak基于AI模型辅助用户英语学习资料来源Speak官网浙商证券研究所3投资建议关注具备底层算法模型核心技术优势的厂商1推荐标的拓尔思中文NLP龙头厂商科大讯飞智能语音处理及合成2建议关注谷歌DeepMind微软OpenAIChatGPTMetaOPT模型百度文心模型腾讯4风险提示1AI技术迭代不及预期的风险2AI商业化产品发布不及预期3政策不确定性带来的风险4下游市场不确定性带来的风险httpwwwstockecomcn910请务必阅读正文之后的免责条款部分行业点评股票投资评级说明以报告日后的6个月内证券相对于沪深300指数的涨跌幅为标准定义如下1买入相对于沪深300指数表现20以上2增持相对于沪深300指数表现10203中性相对于沪深300指数表现1010之间波动4减持相对于沪深300指数表现10以下行业的投资评级以报告日后的6个月内行业指数相对于沪深300指数的涨跌幅为标准定义如下1看好行业指数相对于沪深300指数表现10以上2中性行业指数相对于沪深300指数表现1010以上3看淡行业指数相对于沪深300指数表现10以下我们在此提醒您不同证券研究机构采用不同的评级术语及评级标准我们采用的是相对评级体系表示投资的相对比重建议投资者买入或者卖出证券的决定取决于个人的实际情况比如当前的持仓结构以及其他需要考虑的因素投资者不应仅仅依靠投资评级来推断结论法律声明及风险提示本报告由浙商证券股份有限公司已具备中国证监会批复的证券投资咨询业务资格经营许可证编号为Z39833000制作本报告中的信息均来源于我们认为可靠的已公开资料但浙商证券股份有限公司及其关联机构以下统称本公司对这些信息的真实性准确性及完整性不作任何保证也不保证所包含的信息和建议不发生任何变更本公司没有将变更的信息和建议向报告所有接收者进行更新的义务本报告仅供本公司的客户作参考之用本公司不会因接收人收到本报告而视其为本公司的当然客户本报告仅反映报告作者的出具日的观点和判断在任何情况下本报告中的信息或所表述的意见均不构成对任何人的投资建议投资者应当对本报告中的信息和意见进行独立评估并应同时考量各自的投资目的财务状况和特定需求对依据或者使用本报告所造成的一切后果本公司及或其关联人员均不承担任何法律责任本公司的交易人员以及其他专业人士可能会依据不同假设和标准采用不同的分析方法而口头或书面发表与本报告意见及建议不一致的市场评论和或交易观点本公司没有将此意见及建议向报告所有接收者进行更新的义务本公司的资产管理公司自营部门以及其他投资业务部门可能独立做出与本报告中的意见或建议不一致的投资决策本报告版权均归本公司所有未经本公司事先书面授权任何机构或个人不得以任何形式复制发布传播本报告的全部或部分内容经授权刊载转发本报告或者摘要的应当注明本报告发布人和发布日期并提示使用本报告的风险未经授权或未按要求刊载转发本报告的应当承担相应的法律责任本公司将保留向其追究法律责任的权利浙商证券研究所上海总部地址杨高南路729号陆家嘴世纪金融广场1号楼25层北京地址北京市东城区朝阳门北大街8号富华大厦E座4层深圳地址广东省深圳市福田区广电金融中心33层上海总部邮政编码200127上海总部电话862180108518上海总部传真862180106010浙商证券研究所httpswwwstockecomcnhttpwwwstockecomcn1010请务必阅读正文之后的免责条款部分
|
|