>> 长江证券-软件与服务行业AI产业跟踪:OpenAI发布Agent模式,AIAgent商业化落地与规模化进展有望加速-250720
| 上传日期: |
2025/7/21 |
大小: |
613KB |
| 格式: |
pdf 共5页 |
来源: |
长江证券 |
| 评级: |
看好 |
作者: |
宗建树 |
| 下载权限: |
此报告为加密报告 |
|
|
事件描述 7月18日凌晨,OpenAI介绍了即将推出的能够执行复杂、多工具任务的Agent模式,当前Agent模式集成于ChatGPT,目前已向OpenAIPro、Plus和Team计划的订阅用户开放,Pro用户每月400次调用,Plus和Team用户每月40次,企业版与教育版预计本月底前上线。 事件评论 产品侧拆解:本质是能够执行复杂、多工具任务的统一AIAgent,由Operator工具(浏览器级GUI自动化)和Deep Research(长链推理+信息整合)工具Agent化封装而来。Agent模式将GUI浏览器、文本浏览器、终端、API connector四大能力全部封装进一个端到端Transformer,由同一组参数调度所有工具,减少跨系统延迟和错误传递。从用户侧交付来看,Agent可以自动利用多种工具进行规划,帮助用户完成包括自动浏览用户日历、生成可编辑PPT、运行代码在内的多种复杂任务。Agent能够连接用户Gmail、GitHub获取信息并解决问题,使用API访问各种应用。 性能侧超越:四项“真实任务”SOTA,Agent能力逼近或超越人类。Agent模式下,(1)HLE测试得分41.6%,采用学习小组策略时提升至44.4%(o3 no tools得分20.3%),工具增益>纯模型增益;(2)数学:FrontierMath得分27.4%,远超o4-mini(19.3%);(3)网页浏览与信息检索:WebArena测试中Agent模式超越o3驱动的CUA模型;BrowseComp得分68.9%,高于Deep Research 17.4个pct。(4) SpreadsheetBench(模拟电子表格编辑)准确率达45.5%,接近人类水平。(5)DSBench数科测试中大幅超越人类专家。 训练与技术侧拆解:(1)技术架构方面,在沙盒化的虚拟计算机中处理任务,实现推理与执行流畅切换,从而独立完成复杂的多步骤任务;(2)强化学习方面,ChatGPT智能体能够动态学习并优化其工作方式,提高任务完成的速度和准确性。(3)强调安全性,构建多层安防体系,如操作授权机制、风险任务拦截、动态安全机制、隐私控制功能等。 能力侧上探:从“回答问题”到“交付结果”,我们认为,Agent模式能力的核心在于其形成的智能Agentic系统构建了“自主思考-工具选择-行动执行-动态优化”的完整闭环。从Agent模式对真实任务处理能力的各项基准测试评分来看,已有工具组合的融合,把“模型上限”拉升为“系统上限”,使AI在复杂知识工作场景具备了更强的可商业化的端到端交付能力,同时或为后续AIAgent规模化落地提供了可复制的技术范式,或有望加速AIAgent商业化落地与规模化推进的节奏。 当前Agent投资核心逻辑强化,视觉推理+工具调用的深度融合下,“模型即Agent”的探索不断推进,教育、医疗、企服等垂直场景的Agent落地周期有望提前,看好Agent商业化元年及投资机遇。建议关注:1)AIAgent相关厂商;2)中国推理算力产业链,重点推荐国内AI芯片领军寒武纪;3)云服务厂商方面,Agent应用有望落地,关注推理 风险提示 1、AI技术发展不及预期; 2、下游应用需求不及预期。
|
|