>> 国金证券-计算机行业深度研究:文心一言、GPT3.5及GPT-4的应用测评对比-230319
| 上传日期: |
2023/3/20 |
大小: |
6620KB |
| 格式: |
pdf 共32页 |
来源: |
国金证券 |
| 评级: |
强于大市 |
作者: |
孟灿,王倩雯 |
| 行业名称: |
计算机 |
| 下载权限: |
无限制-登录即可下载 |
|
|
投资逻辑 OpenAl于2023年3月14日发布最新版本多模态大模型GPT4及其AP;国内百度于3月16日发布生成式大模型“文心一言”并开放邀请测试。为对比国内外大模型在各领域的性能差异,我们对文心一言、GPT-3.5 (ChatGPT的原模型)和GPT-4的问答表现分别进行了测评。测评涉及常识和创作(文学/图片)、归纳和推理(演绎推理/情感推理/逻辑推理/主体信息抽取)、数学和代码、应用((AI助手/客服/办公协同/推荐/诗词理解)等方面。 在常识和创作类问题中,三大模型均能正确回答客观常识类问题;进行文学创作结果均能体现正面价值观,但文心一言的分词功能有待提升;目前GPT-4尚未开放图像生成外部测试,文心一言的图像生成能力较为出色。 在归纳和推理类问题中,文心一言在演绎推理、逻辑推理等领域表现略逊于GPT系列模型,但在归纳总结类任务中表现较好;三大模型在情感推理类问题中仍有提升空间。 在数学和代码类问题中,GPT-3.5有更好的数学能力表现;GPT-3.5及GPT4模型均完成了本文提出的代码生成问题,但并非最优解,文心一言代码问题识别能力有待加强。 在应用场景测试中,三大模型均能较好地完成AlI生活助手、售后客服、产品推荐、办公场景文本生成等任务,但在文言文和古诗词理解运用方面表现不佳。 我们认为随百度文心及OpenAlI合作生态伙伴数量快速增长、训练数据量和模型训练能力持续提升,各模型性能都有望实现进一步优化完善。 投资建议 文心一言、GPT-3.5、GPT-4三大模型在常识问答、文字生成等领域均有出色表现,其中,文心一言虽然在逻辑推理等任务中表现不及GPT-3.5、GPT-4,但已能够基本满足Al助手、售后客服、产品推荐等诸多场景需求。百度文心的开放应用将极大加速国内生成式Al模型的落地应用节奏,有望帮助生态伙伴实现用户体验提升和生产降本增效。我们建议关注在A领域进行持续布局且拥有成熟应用场景的公司,如万兴科技、汉得信息、凌志软件、同花顺、金山办公。 风险提示 海外基础软硬件使用受限;应用落地不及预期;行业竞争加剧风险;测评问题有限导致结果或有偏差。
研究报告全文:OpenAI于2023年3月14日发布最新版本多模态大模型GPT-4及其API国内百度于3月16日发布生成式大模型文心一言并开放邀请测试为对比国内外大模型在各领域的性能差异我们对文心一言GPT-35ChatGPT的原模型和GPT-4的问答表现分别进行了测评测评涉及常识和创作文学图片归纳和推理演绎推理情感推理逻辑推理主体信息抽取数学和代码应用AI助手客服办公协同推荐诗词理解等方面在常识和创作类问题中三大模型均能正确回答客观常识类问题进行文学创作结果均能体现正面价值观但文心一言的分词功能有待提升目前GPT-4尚未开放图像生成外部测试文心一言的图像生成能力较为出色在归纳和推理类问题中文心一言在演绎推理逻辑推理等领域表现略逊于GPT系列模型但在归纳总结类任务中表现较好三大模型在情感推理类问题中仍有提升空间在数学和代码类问题中GPT-35有更好的数学能力表现GPT-35及GPT-4模型均完成了本文提出的代码生成问题但并非最优解文心一言代码问题识别能力有待加强在应用场景测试中三大模型均能较好地完成AI生活助手售后客服产品推荐办公场景文本生成等任务但在文言文和古诗词理解运用方面表现不佳我们认为随百度文心及OpenAI合作生态伙伴数量快速增长训练数据量和模型训练能力持续提升各模型性能都有望实现进一步优化完善文心一言GPT-35GPT-4三大模型在常识问答文字生成等领域均有出色表现其中文心一言虽然在逻辑推理等任务中表现不及GPT-35GPT-4但已能够基本满足AI助手售后客服产品推荐等诸多场景需求百度文心的开放应用将极大加速国内生成式AI模型的落地应用节奏有望帮助生态伙伴实现用户体验提升和生产降本增效我们建议关注在AI领域进行持续布局且拥有成熟应用场景的公司如万兴科技汉得信息凌志软件同花顺金山办公海外基础软硬件使用受限应用落地不及预期行业竞争加剧风险测评问题有限导致结果或有偏差敬请参阅最后一页特别声明1行业深度研究内容目录1常识和创作32归纳和推理73数学和代码124现实应用场景测试175投资建议306风险提示30图表目录图表1三大模型测评结果综合对比3图表2常识类问题的回答对比4图表3文字创作问题的回答对比4图表4图像创作问题的回答对比6图表5演绎推理问题的回答对比7图表6情感推理问题的回答对比8图表7逻辑推理问题的回答对比9图表8归纳总结问题的回答对比10图表9数学问题的回答对比13图表10代码生成问题的回答对比14图表11安全应用问题的回答对比18图表12生活应用问题的回答对比19图表13客服场景问题的回答对比21图表14办公协同问题的回答对比22图表15推荐场景问题的回答对比26图表16诗词理解问题的回答对比28敬请参阅最后一页特别声明2行业深度研究文心一言开放测试后我们对文心一言GPT-35和GPT-4的问答表现分别进行了测评测评涉及常识和创作文学图片归纳和推理演绎推理情感推理逻辑推理主体信息抽取数学和代码应用AI助手客服办公协同推荐诗词理解等方面根据测试结果可以看出三大模型在客观问题问答方面都有出色表现但在数学计算代码生成情感理解和推理方面均有待提升对比来看文心一言在图像创作归纳总结等问题中表现较为出色但在逻辑推理领域还有待加强在具体应用中三大模型均能基本胜任AI助手售后客服产品推荐等场景需求但在文本修饰及古诗词理解领域仍有提升空间我们认为随百度文心及OpenAI合作生态伙伴数量快速增长训练数据量及模型训练水平持续提升各模型性能都有望进一步优化图表1三大模型测评结果综合对比应用领域文心一言GPT-35GPT-4常识类问题正确正确正确且更为严谨常识和文字创作分词错误正确正确且细节更丰富创作图像创作生成图像符合要求无法生成图像生成功能暂未开放演绎推理错误正确正确情感推理结果正确过程有偏差错误错误归纳和逻辑推理错误错误基本正确推理符合要求对未知内容直接符合要求可对未知内容进行归纳总结未能提取正确信息进行网页搜索推理多轮对话能力较强数字和数学计算错误正确错误代码代码生成错误未给出最优答案未给出最优答案模拟AI安全类问题符合要求符合要求符合要求助手生活类问题符合要求且给出可靠建议符合要求符合要求模拟AI退换货问题符合要求符合要求符合要求客服模拟办场景文档生成符合要求符合要求符合要求公助手文字修饰有待改进有待改进有待改进模拟推推荐理财产品符合要求符合要求符合要求荐助手及生日礼物教学辅古诗词理解基本正确部分内容错误部分内容错误助来源百度文心一言官网chatopenai官网国金证券研究所常识和创作部分我们分别对3个模型提出基于客观事实的常识问答给定主题的文字创作问题给定主题的图像创作问题以评价模型对已有知识的表述能力和图文生成能力常识题中国有多少个省3个模型都进行了正确的回答其中GPT-4生成的答案最为严谨和详细不仅说明了截止2021年由于GPT-4的知识截止2021年优先列举了省份且对具体省级行政区的名称进行了详尽的列示敬请参阅最后一页特别声明3行业深度研究图表2常识类问题的回答对比文心GPT-35生成的文字过长截图是进行了省略GPT-4来源百度文心一言官网chatopenai官网国金证券研究所文字创作题请写一个刘红发大财的故事从3个模型的回答来看文心的分词能力仍有改进之处没有对刘红和发大财进行很好的分词而是以刘红发为主角进行创作从情节设置的角度而言GPT-4的细节更加丰富转折也更多但由于生成token数的限制这个故事并没有写完此外3个模型的故事都体现了积极正面的价值观图表3文字创作问题的回答对比文心敬请参阅最后一页特别声明4行业深度研究GPT-35GPT-4敬请参阅最后一页特别声明5行业深度研究来源百度文心一言官网chatopenai官网国金证券研究所图像创作题请画一张古典美女的油画目前只有文心一言具备文生图的能力GPT-35依然是文生文GPT-4理论上可以输入文字和图片但目前图片输入的功能尚未对用户开放图表4图像创作问题的回答对比文心GPT-35敬请参阅最后一页特别声明6行业深度研究GPT-4来源百度文心一言官网chatopenai官网国金证券研究所我们分别向3个模型提供演绎推理情感推理基于具体场景的逻辑推理问题以及财务数据类的总结归纳问题用以评价各模型归纳推理能力演绎推理题假设在一个餐厅如果一个人点了牛排则他一定点了沙拉如果一个人没有点沙拉则他一定没有点牛排现在有一个人点了沙拉那么他是否一定点了牛排从本题回答来看文心在演绎推理方面的能力相对较弱GPT-35和4持平图表5演绎推理问题的回答对比文心GPT-35敬请参阅最后一页特别声明7行业深度研究GPT-4来源百度文心一言官网chatopenai官网国金证券研究所情感推理题情侣吵架后女朋友对男朋友说你没有错都是我的错请问女朋友是否认为自己有错只有文心对本题给出了正确的情感推理结果但它给出的推理过程有所偏差GPT-4和GPT-35给出了错误的情感推理结果但GPT-4给出了较为恰当的补充说明如果未来作为情感类助手可能3个模型依然都还有需要改进之处图表6情感推理问题的回答对比文心GPT-35GPT-4敬请参阅最后一页特别声明8行业深度研究来源百度文心一言官网chatopenai官网国金证券研究所逻辑推理题为什么我总是在最后一个地方找到丢失的物品GPT-4的逻辑推理能力相对较强它回答的第一段给出了正确的解释而文心和GPT-35都未能识别本题的逻辑谬误不过GPT-4的第二三段回答给出的解释也有些似是而非整体来看3个模型的逻辑推理能力均有待加强图表7逻辑推理问题的回答对比文心GPT-35GPT-4敬请参阅最后一页特别声明9行业深度研究来源百度文心一言官网chatopenai官网国金证券研究所归纳总结题问题一请提取下文主体信息并以表格方式输出1经恒生电子股份有限公司以下简称恒生电子或公司财务部门初步测算恒生电子预计2022年年度实现归属于上市公司股东的净利润约为108706万元人民币下同与上年同期相比将减少约37648万元减少比例约为25722预计2022年年度非经常性损益对公司净利润的影响金额约为-432万元预计2022年年度实现归属于上市公司股东的扣除非经常性损益的净利润约为109138万元与上年同期相比将增加约14481万元增加比例约为15303预计2022年年度公司实现营业收入约为650282万元与上年同期相比将增加约100624万元增加比例约为1831问题二请问恒生电子2021年的收入是多少从本题归纳总结的结果而言文心列示的表格更符合财务分析的需求而GPT-35没有抽出重点主体信息并进行归纳在多轮对话方面GPT-4展现出了更强的能力GPT-35和文心在联系上下文对话方面稍逊一筹不过文心采取了和NewBing一样的方式对于自己不知道的知识进行了直接搜索而GPT-35基于Instruct-GPT的数据未能给出正确答案图表8归纳总结问题的回答对比文心GPT-35敬请参阅最后一页特别声明10行业深度研究GPT-4敬请参阅最后一页特别声明11行业深度研究来源百度文心一言官网chatopenai官网国金证券研究所我们分别向3个模型提供线性方程求解问题和代码编写问题考察模型数理能力和代码生成能力数学题求解线性方程组3x2y82x-y1本题只有GPT-35算出了正确答案文心答案算错且没有给出具体运算过程GPT-4算对了x的值但是代入求解y值的时候出现了错误在数学能力方面当前模型依然有需要改进之处敬请参阅最后一页特别声明12行业深度研究图表9数学问题的回答对比文心GPT-35GPT-4敬请参阅最后一页特别声明13行业深度研究来源百度文心一言官网chatopenai官网国金证券研究所代码题用Python编写一个程序在一个无序数组中查找一个特定的值要求程序的时间复杂度为Ologn在本题的回答中文心一言没有准确理解到时间复杂度Ologn的需求GPT-35及GPT-4给出的代码为二分法搜索只有在面对有序数组时才能满足时间复杂度要求也非最佳答案整体来看三个模型在代码生成方面均有较大的改进空间GPT-35与GPT-4表现基本持平略优于文心一言图表10代码生成问题的回答对比文心敬请参阅最后一页特别声明14行业深度研究GPT-35敬请参阅最后一页特别声明15行业深度研究GPT-4敬请参阅最后一页特别声明16行业深度研究来源百度文心一言官网chatopenai官网国金证券研究所我们模拟AI生活助手AI售后客服办公场景助手产品推荐教学辅导等场景对3个模型进行问答用以评价模型在真实场景中应用的可行性AI生活助手安全类问题我收到公安局电话说我涉嫌洗钱要求将资金转移至安全账户我该怎么办3个模型都给出了正确的判断并提供了合理建议预计可以在反诈等方面进行很好的应用敬请参阅最后一页特别声明17行业深度研究图表11安全应用问题的回答对比文心GPT-35GPT-4敬请参阅最后一页特别声明18行业深度研究来源百度文心一言官网chatopenai官网国金证券研究所生活类问题如何赚到100万文心给出的回答质量明显较高给出了相对切实可靠的建议且具备一定幽默感而GPT-35和GPT-4的回答更加空泛一些但在安全提示方面进行了加强图表12生活应用问题的回答对比文心GPT-35敬请参阅最后一页特别声明19行业深度研究GPT-4来源百度文心一言官网chatopenai官网国金证券研究所售后客服场景助手问题一请你扮演售后客服帮我处理退换货的问题问题二我已经撕了吊牌了可以么总的来说3个模型都很好地完成了任务能够应用于客服场景相对而言GPT-35在角色扮演和客服对话场景的表现更加优秀文心和GPT-4的回答都更加格式化一些敬请参阅最后一页特别声明20
|
|