>> 第一上海-AI行业大模型周报-251121
| 上传日期: |
2025/11/21 |
大小: |
499KB |
| 格式: |
pdf 共3页 |
来源: |
第一上海 |
| 评级: |
-- |
作者: |
李京霖,李倩,陈晓霞 |
| 下载权限: |
无限制-登录即可下载 |
|
|
AI大模型周报 Gemini:谷歌正式发布Gemini 3系列 11月18日,谷歌正式发布Gemini 3,并于发布首日立即在谷歌搜索、Gemini应用程序App及多个开发者平台同步上线。Gemini 3在全球AI模型LMArena排行榜上以1501分的历史最高分登顶,Humanity's Last Exam基准测试中获得37.5%的最高分,超越了GPT-5 Pro的31.64%。该模型擅长数学、多模态理解和事实准确性、代码生成等。同时推出了增强的推理模式Gemini 3 Deep Think,可进一步提升Gemini 3的性能。Gemini 3保留了跨模态信息综合能力,无缝处理文本、图像、视频、音频和代码等多种模态信息,并配备100万token的上下文窗口,定价为2美元/ 12美元(<20万个token)、4美元/ 18美元(>20万个token)。在智能体能力方面,Gemini 3能够在整整一年的模拟运营中保持一致的工具使用和决策能力,在不偏离任务的情况下实现更高回报。同时谷歌还推出了Gemini 3 Pro Image,可以根据文本提示生成和修改图片。它会使用推理功能“思考”提示,并检索实时数据(例如天气预报或股市图表),然后使用Google搜索进行事实依据核查,最后生成高保真图片,65k / 32k上下文窗口。 Gork:正式发布Grok 4.1 11月17日,xAI正式发布Grok 4.1。版本已面向grok.com、X平台以及iOS、Android应用的所有用户开放。马斯克称Grok 4.1把重点放在更快的响应、更高的事实准确性,以及更自然、更具个性的对话体验上了。官方数据显示:Grok4.1的幻觉率从12.09%降到4.22%,减少近三倍;得益于强化学习基础设施与新的奖励模型体系,Grok 4.1使用“前沿推理模型”作为奖励模型,模型能自主评估并快速迭代,不再过度依赖大规模人工标注。在EQ-Bench情感智能测试、创意写作评测中表现出色。Grok 4.1的上下文窗口最高可支持256,000 tokens,在Fast模式下可扩充至200万。能够更好地应对内容生产、长文档协作以及持续对话场景,减少上下文丢失,。情绪理解方面,新版本不再停留在前代安慰句式,而是主动延展情绪线索,体察用户失落背后的细节,不再只是识别悲伤,而是能够陪伴悲伤。 Qwen:千问APP正式上线 11月16日,千问APP在应用商店中上线。阿里巴巴官宣千问APP正式开启公测,免费开放,人人可用,网页端与PC版同步开放。千问APP搭载Qwen3-Max,是通义千问家族尺寸最大、能力最强的基础模型。援引阿里人士观点称,推出千问APP的时机“刚刚好”,因为Qwen3-Max模型已达全球领先,且集团内部的Agent生态(如淘宝、高德等)也到了可以被模型普遍调用的阶段。此次千问App的推出,阿里巴巴在AI变现策略上转向消费者(C端)市场。
|
|