>> 第一上海-AI行业大模型周报-250811
| 上传日期: |
2025/8/12 |
大小: |
322KB |
| 格式: |
pdf 共3页 |
来源: |
第一上海 |
| 评级: |
-- |
作者: |
陈晓霞,李倩,李京霖 |
| 下载权限: |
无限制-登录即可下载 |
|
|
Llama:Meta的TBD实验室牵头开发新版Llama模型 8月8日,据华尔街日报,Meta Platforms公司一个名为TBD实验室正在牵头开发最新版本的大语言模型Llama。上周,负责监督Meta超级智能实验室的首席人工智能官亚历山大·王在给员工的一份备忘录中写道,TBD实验室将与Meta的其他人工智能团队合作开展各种项目,包括即将发布的模型、模型推理能力的扩展和人工智能代理的开发。新的Llama项目由Jack Rae领导,他是从谷歌聘请到TBD实验室的。该项目模型还没有正式名称,但在内部被一些人称为Llama4.5和Llama 4。 ChatGPT:OpenAI推出GPT5 8月7日,OpenAI发布了其最新人工智能模型GPT-5。该公司将向所有人提供GPT-5,包括免费用户,如果免费用户达到使用上限,他们可以使用GPT-5 mini。OpenAI的Plus用户有更高的使用量,Pro用户可以无限制地访问GPT-5,ChatGPTEdu和ChatGPT企业用户将在8月6日大约一周后获得GPT-5的访问权限。模型提供400,000tokens(输入),128,000tokens(输出)的上下文窗口;测试集表现优异(HLE:30.7、GPQA:88.4、AIME25:100、LiveCodeBench:86.6(mini))。OpenAI表示,该模型在写作、编程和医疗保健等领域表现突出。编程方面,可用AI根据自然语言提示生成功能代码,从而加快开发速度。在创意写作方面,GPT-5能够处理结构复杂的写作任务。健康咨询方面,GPT-5能更积极地标记潜在健康问题,帮助用户解析医疗结果。 Claude:Anthropic发布Claude Opus 4.1 8月5日,Anthropic发布了Claude Opus 4.1,对Claude Opus 4在智能体任务、现实世界编码及推理能力上的升级。该版本现已向Claude付费用户、ClaudeCode用户开放,同时在其API、亚马逊Bedrock以及谷歌云Vertex AI平台上线,定价与Opus 4保持一致。据反馈,Claude Opus 4.1在多数能力上较Opus 4均有提升,其中多文件代码重构方面的性能提升尤为显著。该版本能精准定位大型代码库中的具体问题并修正,不会进行不必要的调整或引入漏洞。 Gemini:DeepMind推出世界模型Genie 3 8月4日,谷歌DeepMind宣布推出第三代通用世界模型Genie 3,给出文本提示,Genie 3可以生成动态世界,每秒24帧,并以720p的分辨率保持几分钟的一致性。与前代模型(如Genie 1/2)和视频生成模型(如Veo 2,Veo 3对直觉物理学的深刻理解)相比,Genie 3是第一个允许实时交互的世界模型,同时与Genie 2相比,其一致性和真实感也得到了提升。 核心能力:1、模拟世界的物理特性。2、模拟自然世界。3、动画和小说建模。4、探索不同地域与历史场景。5、突破实时性能的极限:在每一帧的自回归生成过程中,模型必须考虑先前生成的随时间增长的轨迹。例如,如果用户在一分钟后重新访问某个位置,则模型必须引用一分钟前的相关信息。6、长时程环境一致性。7、可提示的世界事件。 Grok:xAI宣布向全球所有用户免费开放Grok 4 8月11日,马斯克宣布Grok4现在对所有用户免费开放。免费用户每天可完成少量查询,超过限制则需要订阅。根据xAI官方介绍,有「自动」和「专家」两种运作模式,前者会根据查询复杂度智能切换运算资源,后者则全程使用Grok 4进行处理。此次免费政策推出时机耐人寻味,正值竞争对手OpenAI刚发布GPT-5并全面开放给各级用户使用之际。 Qwen:阿里巴巴发布Qwen-Image 8月4日,阿里巴巴发布了Qwen-Image。Qwen-Image在复杂文本渲染和高保真图像编辑上取得了突破。 核心亮点: 顶级的文本渲染能力:多语种高保真度渲染,尤其在处理复杂的中文(logographic languages)方面,表现远超现有模型。 高一致性的图像编辑:通过创新的多任务训练框架,Qwen-Image在编辑图像时,能完美保留非编辑区域的视觉细节和整体图像的语义连贯性。 全面的SOTA性能:在多项公开的图像生成和编辑基准测试中,Qwen-Image都展现了业界顶尖的性能,证明了其强大的综合实力。 开放生态:作为Qwen系列的一员,它是一个开源模型,为广大开发者和研究者提供了强大的工具。 模型架构:三位一体的协同作战 Qwen-Image总参数量达到了惊人的270亿(7BVLM + 20BMMDiT)。结构包括条件编码器负责理解用户的输入、图像分词器负责将高清图像压缩成紧凑的潜在表示,并在生成过程结束时将其解码回高清图像、多模态扩散变换器(MMDiT)负责在VAE的潜在空间中,根据Qwen2.5-VL提供的指引,从随机噪声中逐步生成目标图像。
|
|