>> 长城证券-传媒行业:GPT-6 Astra发布,前沿模型能力持续提升-260915
| 上传日期: |
2026/9/15 |
大小: |
461KB |
| 格式: |
pdf 共3页 |
来源: |
长城证券 |
| 评级: |
强于大市 |
作者: |
侯宾,纪涵宇 |
| 行业名称: |
传媒 |
| 下载权限: |
此报告为加密报告 |
|
|
事件:OpenAI于9月4日正式发布GPT-6 Astra,该模型集中了OpenAI多年来在预训练、强化学习和对齐上的研究成果,在电脑操作、浏览器使用、软件工程、网络安全、科学研究和专业工作等领域全面刷新此前模型的能力。 GPT-6 Astra正式发布,端到端任务执行能力持续升级。OpenAI正式发布GPT-6Astra,该模型定价显著提升,Astra标准API为缓存输入/输入价格分别为1/10美元/百万Token、缓存写入价格为12.5美元/百万Token、输出价格为50美元/百万Token,输入和输出价格均为GPT-5.6 Sol的2.5倍,与Claude Fable 5相近。Astra新增异步工具调用、任务执行过程中的指令调整,以及在保留缓存的同时动态改变推理强度。Codex还将试验跨上下文窗口保存笔记和检索历史内容,进一步提升长周期Agent任务的连续性。此外,GPT-6 Astra复杂任务完成率显著提升(1)计算机操作:Astra在OSWorld 2.0上得分72.6%,高于GPT-5.6 Sol的65.7%,单项任务耗时降低约47%;在专业流程测试AutomationBench上得分41.4%,较GPT-5.6 Sol的18.1%提升明显;(2)科学推理:GPT-6 Astra在FrontierMath Tier4上取得97.6%,并协助研究人员改进两项长期未突破的素数间隔问题;(3)编程:Astra在Terminal-Bench 4.0上得分57.9%,高于GPT-5.6 Sol的37.3%和ClaudeFable 5.1的55.8%;(4)网络安全:Astra在ExploitBench上评分达到100%,在使用2026年6月至8月新漏洞构建的低污染测试集上得分亦远超GPT-5.6 Sol。整体而言,Astra整合了电脑及软件操作、推理、安全判断等能力,从而打造了模型完整的端到端执行能力,有望在日常工作、游戏开发、金融建模、电气工程等多样化场景中加速渗透。 GPT-6 Astra在ARC-AGI-3测试中评分高达99.9%,模型“悟性”大幅提升。GPT-6 Astra在ARC-AGI-3测试中评分高达99.9%,大幅超越GPT-5.6 Sol的7.8%,GPT-6 Astra在96%的测试关卡中使用的行动次数少于受测人类的中位数,行动效率已经达到甚至超过人类基准。我们认为与数学、代码或知识问答不同,ARC-AGI-3测试的核心是AI在面对一个此前从未见过的环境,能否通过探索、交互和试错,自行理解规则、发现目标并解决问题。尽管Standard harness与Provider Adaptiveharness结果存在差异,但是Astra模型规划能力客观上正在维持快速提升,带动AI可以承担的任务复杂度上限快速提升。 模型能力持续提升,关注应用以及云计算布局机会。模型能力持续提升,我们建议关注(1)应用端:此前Salesforce业绩超预期,同时AI业务Agentforce及Data 360合计ARR接近39亿美元,同比增长210%以上,宣布与Anthropic扩大合作,同时推出Claudeforce,我们认为以上合作有望将Claude模型能力与Salesforce积累的企业数据、业务逻辑、操作能力以及权限治理等体系结合,应用软件未来或将成为模型厂商生态合作方,验证了SaaS作为AI调用底座的价值;(2)云计算:我们认为随开放权重模型能力快速提升,云厂商可以依据客户对质量、延迟、成本等方面要求为客户提供对应的模型,模型分层策略带动产业话语权由头部模型厂商向下游CSP迁移;同时随着AI实际使用成本(cost/Mtok)大幅下降,在成本端具备经济效益之后,杰文斯悖论将带动云需求总量步入爆发增长阶段。 相关标的:(1)AI应用:迈富时、阜博集团、焦点科技、巨人网络、恺英网络、赤子城科技、第四范式、快手;(2)云计算/算力租赁:阿里巴巴、腾讯控股、金山云、粤港湾智算、协创数据、利通电子。 风险提示:AI应用商业化不及预期;AI吞噬SaaS叙事持续;AI技术发展不及预期;AI应用公司业绩不及预期。
|
|