研报下载就选股票报告网
您好,欢迎来到股票分析报告网!登录   忘记密码   注册
>> 长江证券-软件与服务行业AI产业跟踪:DeepSeek开源DeepSeek~OCR,持续关注AI大模型技术路径演进与商业化进展-251022
上传日期:   2025/10/23 大小:   617KB
格式:   pdf  共5页 来源:   长江证券
评级:   看好 作者:   宗建树
下载权限:   此报告为加密报告
事件描述
  10月20日DeepSeek开源DeepSeek-OCR模型,3B参数,专为实现高效视觉-文本压缩而设计的VLM,首次提出“上下文光学压缩(Contexts Optical Compression)”,通过文本转图像实现信息的高效压缩,目前已在Hugging Face开源。
  事件评论
  DeepSeek-OCR模型核心价值在于验证了视觉token可以更高效地表达信息。通过光学二维映射技术压缩长文本上下文可行性的初步探索,提供降本新思路。当文本token数量在视觉token的10倍以内(即压缩率<10×)时,模型的解码(5OCR)精度可达97%;即使在压缩率达到20×的情况下,OCR准确率仍保持在约60%。这一结果显示出,通过使用视觉模态作为文本信息的有效压缩媒介,在长上下文压缩和LLM的记忆遗忘机制等研究方向上具有相当潜力。
  应用价值高,在端到端模型测试中以最少的视觉token数达到了最先进的性能。OmniDocBench基准测试中,以100个视觉token超过GOT-OCR2.0(256token/页)的表现;以不到800个视觉token优于MinerU2.0(平均6000+token/页)。在实际生产环境中,每日可在单张A100-40GGPU生成超过20万页(200k+)LLM/VLM训练数据。多轮对话中,模型可以通过光学压缩的方式折叠旧对话内容,让过去的上下文以更低的计算成本被保留,从而在理论上实现无限上下文的架构。
  泛化能力强、应用场景广。(1)深度解析(OCR 2.0):模型能够对图表、几何图形、化学公式、自然图像进行深度解析,比如能将金融报告里的图表直接转成结构化数据,化学结构式转成SMILES格式,只需使用一个统一提示词(prompt)即可完成。(2)多语言识别:针对PDF文档支持近100种语言的识别。(3)通用视觉理解:具备一定程度的通用图像理解能力。我们认为,OCR模型的突破进一步扩展模型能力与场景的边界,有望DeepSeek-OCR成为文档智能领域的基础组件。
  架构突破,提出一种新的视觉编码结构DeepEncoder,实现高分辨率下高效提取视觉特征并显著减少视觉token数量。架构分为三部分:(1)核心是DeepEncoder,SAM-base(提局部特征)+CLIP-large(提全局语义)串联,中间有两层16x卷积模块,能把1024×1024输入从传统~4096个视觉token压缩到约256个token(支持多档分辨率模式)。(2)轻量MoE解码:文本解码器(DeepSeek-3B)使用MoE结构(64个专家,激活6个),实际推理只用到约570M参数,效率比全量3B模型高。训练流程上分两阶段,先单独训练DeepEncoder(视觉部分),再全模型联合训练(视觉+语言)。
  持续关注后续大模型视觉架构的演进。我们认为,当前成本依然是制约token消耗量的核心因素,OCR模型有望打破算力约束、重新定义大模型上下文处理方式的新路径。当前时点继续看好国产AI产业链,持续重点推荐铲子股和卡位优势显著的巨头本身。
  风险提示
  1、AI技术发展不及预期;
  2、下游应用需求不及预期。
  
 
Copyright © 2005 - 2021 Nxny.com All Rights Reserved 备案号:蜀ICP备15031742号-1