>> 国投证券-计算机行业周报:GPT-6 Astra发布,大模型加速迭代-260906
| 上传日期: |
2026/9/6 |
大小: |
707KB |
| 格式: |
pdf 共8页 |
来源: |
国投证券 |
| 评级: |
领先大市 |
作者: |
赵阳,夏瀛韬,杨楠 |
| 行业名称: |
计算机 |
| 下载权限: |
无限制-登录即可下载 |
|
|
GPT-6 Astra发布,各项评分指标领先 GPT-6 Astra发布,在多个测试集上实现评分领先。2026年9月4日,OpenAI正式发布GPT-6 Astra新一代旗舰模型。GPT-6 Astra汇集了OpenAI多年的研究成果和在预训练、强化学习和对齐领域的重大投入。Astra在计算机使用、浏览、软件工程、网络安全、科学和专业工作方面处于最先进水平。Astra以98%的分数接近FrontierMath Tier 4测试集的饱和能力水平,已经帮助解决了一些数学中长期存在的未解问题。Astra还在ARC-AGI-3测试集中拿到99.9%的得分,在ExploitBench漏洞利用测试中拿下100%满分。它还为AI对电脑和浏览器的使用开辟了新领域,以无与伦比的速度、准确性和判断力处理最具挑战性的专业工作。 数理和逻辑推理能力方面,ARC-AGI-3测试AI在解决不熟悉的交互任务时的学习能力。GPT-6 Astra在评估中表现突出,得分高达99.9%,平均人类测试员得分为48%。数学上,Astra在FrontierMathTier4 v2测试集上达到97.6%(接近98%饱和分),Claude Fable 5的分数为90.2%。这是当前最难的数学测试集,被公认为人类顶尖数学家的难题高地。 编程能力方面,Terminal-Bench 4.0测试AI在复杂的终端任务上的能力,包括软件工程、系统配置和数据分析。GPT-6 Astra得分57.9%创下新高,而GPT-5.6 Sol为37.3%,Claude Fable 5.1为55.8%,同时分别比这两个模型的每个任务预估API成本低约9%和63%。DeepSWE v1.1测试了在真实代码库中进行复杂的软件工程任务。GPT-6 Astra得分为74.1%,而GPT-5.6 Sol为72.7%,Claude Fable5.1为67.4%。 GPT-6 Astra在Agent和Computer Use方面能力突出 计算机使用方面,GPT-6 Astra在计算机使用速度、准确性和安全性方面领先。它可以处理繁琐的任务,比如填写在线表格、在CRM中更新客户记录以及整理日历。它可以在线进行研究,并在电子邮件或文档编辑器中草拟摘要。它可以分析科学数据,生成图表,创建网站,并进行前端质量保证检查,确保网站上的所有功能都能正常运行。它可以帮助你自主安装和测试软件,并排查屏幕上看到的问题。 从测试集评分来看,Agent’s Last Exam测试Agent在真实软件中完成复杂专业任务的能力,从财务建模到工程和媒体制作。在测试比较中,GPT-6 Astra达到了新的高点,得分为59.3%,而Claude Opus5为55.5%,GPT-5.6 Sol为53.6%。OSWorld 2.0测试模型是否能通过运行计算机应用程序完成任务。Astra在输出token量远少于GPT-5.6 Sol的情况下,任务评分更高。 风险提示:技术迭代不及预期;市场需求不及预期等。
|
|