研报下载就选股票报告网
您好,欢迎来到股票分析报告网!登录   忘记密码   注册
>> 西部证券-计算机行业点评:Anthropic发布Claude Mythos Preview,AI能力边界持续拓宽-260413
上传日期:   2026/4/13 大小:   344KB
格式:   pdf  共2页 来源:   西部证券
评级:   超配 作者:   郑宏达,卢可欣
行业名称:   计算机
下载权限:   此报告为加密报告
Anthropic发布新一代旗舰模型Claude Mythos Preview,性能出现代际跃迁,在代码能力、多模态能力、Agent端到端任务执行能力等测试中实现对Opus 4.6全方位超越。据《财富》杂志3月26日独家报道,一款名为"Claude Mythos"、内部代号"Capybara"的全新旗舰模型已完成训练并进入早期测试阶段,Anthropic官方将其性能提升描述为"代际跃迁",在编程、学术推理和网络安全等核心测试中全面超越现有最强版本Claude Opus 4.6。4月8日,Anthropic正式发布Claude Mythos Preview核心信息。在Anthropic披露的评估数据中,Mythos几乎在所有核心维度上都对前代进行了全方位碾压。在衡量模型复现漏洞利用方法的CyberGym基准测试中,Mythos得分为83.1%,而Opus 4.6仅为66.6%。在模拟真实世界软件修复任务的SWE-bench Pro测试中,Mythos得分77.8%,领先Opus 4.6约24个百分点。在经由人工验证的严苛代码测试SWE-bench Verified中,Mythos得到93.9%的近乎满分成绩,这意味着它写出的修复代码不仅正确,且符合高质量工程标准。即使面对非英语环境或复杂的视觉代码图表,Mythos的表现依然稳健,多语言得分为87.3%,而Opus 4.6为77.8%。在多模态SWE-bench内部测试中,Mythos得分59.0%,而Opus 4.6仅有27.1%。在Terminal-Bench 2.0(评估AI智能体在真实命令行环境下端到端执行能力)测试中,Mythos得分为82.0%,Opus 4.6为65.4%。在BrowseComp(评估大语言模型在实时互联网浏览场景下的信息检索和推理能力)复杂搜索测试中,Mythos得分86.9%,Opus 4.6为83.7%。
  Mythos模型带来了前所未有的网络安全风险敞口,Anthropic通过成立Project Glasswing产业联盟优先将其用于防御领域,有望开创AI安全新范式,相关厂商有望受益。Anthropic认为Mythos模型带来了“前所未有的网络安全风险”,但正是因为极其危险的攻击潜能,让它同样也具备着成为顶级数字防御者的资质。尽管Mythos为通用模型,并非专门针对网络安全用途,但它已被证实能轻易识别主要操作系统和网络浏览器的漏洞。Anthropic表示,该模型曾发现了OpenBSD(一个以安全性和严谨性著称的类Unix系统)中一个存在了27年、现已被修复的漏洞。为了将这些前沿能力转化为防御力量,Anthropic宣布成立名为"Project Glasswing"的行业联合项目,联合亚马逊、苹果、微软、思科等公司提供工具,将Claude Mythos Preview用于关键软件基础设施的漏洞扫描与修复。Anthropic表示,由于Mythos模型能力过于强大,目前暂无向公众开放的计划。Project Glasswing被定位为先发防御行动,在同等能力向更广泛行为者扩散之前,优先将其用于防御目的。
  建议关注:大模型监控:网宿科技、恒为科技(已覆盖)。
  风险提示:AI技术突破不及预期、应用落地不及预期、行业竞争加剧。
  
 
Copyright © 2005 - 2021 Nxny.com All Rights Reserved 备案号:蜀ICP备15031742号-1