研报下载就选股票报告网
您好,欢迎来到股票分析报告网!登录   忘记密码   注册
>> 国投证券-计算机行业周报:GPT-6 Astra发布,大模型加速迭代-260906
上传日期:   2026/9/6 大小:   707KB
格式:   pdf  共8页 来源:   国投证券
评级:   领先大市 作者:   赵阳,夏瀛韬,杨楠
行业名称:   计算机
下载权限:   无限制-登录即可下载
GPT-6 Astra发布,各项评分指标领先
  GPT-6 Astra发布,在多个测试集上实现评分领先。2026年9月4日,OpenAI正式发布GPT-6 Astra新一代旗舰模型。GPT-6 Astra汇集了OpenAI多年的研究成果和在预训练、强化学习和对齐领域的重大投入。Astra在计算机使用、浏览、软件工程、网络安全、科学和专业工作方面处于最先进水平。Astra以98%的分数接近FrontierMath Tier 4测试集的饱和能力水平,已经帮助解决了一些数学中长期存在的未解问题。Astra还在ARC-AGI-3测试集中拿到99.9%的得分,在ExploitBench漏洞利用测试中拿下100%满分。它还为AI对电脑和浏览器的使用开辟了新领域,以无与伦比的速度、准确性和判断力处理最具挑战性的专业工作。
  数理和逻辑推理能力方面,ARC-AGI-3测试AI在解决不熟悉的交互任务时的学习能力。GPT-6 Astra在评估中表现突出,得分高达99.9%,平均人类测试员得分为48%。数学上,Astra在FrontierMathTier4 v2测试集上达到97.6%(接近98%饱和分),Claude Fable 5的分数为90.2%。这是当前最难的数学测试集,被公认为人类顶尖数学家的难题高地。
  编程能力方面,Terminal-Bench 4.0测试AI在复杂的终端任务上的能力,包括软件工程、系统配置和数据分析。GPT-6 Astra得分57.9%创下新高,而GPT-5.6 Sol为37.3%,Claude Fable 5.1为55.8%,同时分别比这两个模型的每个任务预估API成本低约9%和63%。DeepSWE v1.1测试了在真实代码库中进行复杂的软件工程任务。GPT-6 Astra得分为74.1%,而GPT-5.6 Sol为72.7%,Claude Fable5.1为67.4%。
  GPT-6 Astra在Agent和Computer Use方面能力突出
  计算机使用方面,GPT-6 Astra在计算机使用速度、准确性和安全性方面领先。它可以处理繁琐的任务,比如填写在线表格、在CRM中更新客户记录以及整理日历。它可以在线进行研究,并在电子邮件或文档编辑器中草拟摘要。它可以分析科学数据,生成图表,创建网站,并进行前端质量保证检查,确保网站上的所有功能都能正常运行。它可以帮助你自主安装和测试软件,并排查屏幕上看到的问题。
  从测试集评分来看,Agent’s Last Exam测试Agent在真实软件中完成复杂专业任务的能力,从财务建模到工程和媒体制作。在测试比较中,GPT-6 Astra达到了新的高点,得分为59.3%,而Claude Opus5为55.5%,GPT-5.6 Sol为53.6%。OSWorld 2.0测试模型是否能通过运行计算机应用程序完成任务。Astra在输出token量远少于GPT-5.6 Sol的情况下,任务评分更高。
  风险提示:技术迭代不及预期;市场需求不及预期等。
  
 
Copyright © 2005 - 2021 Nxny.com All Rights Reserved 备案号:蜀ICP备15031742号-1