数据世界
产业资讯 宏观经济 企业动态 人物动态 科技数码 数据洞察 AI前沿 行业峰会 热点资讯

DeepSeek开源3B小模型DeepSeek-OCR,以“光学压缩”探索文本处理新路径

2025-10-21来源:快讯编辑:瑞雪

DeepSeek 团队近日开源了一款名为 DeepSeek-OCR 的 30 亿参数模型,通过创新的“光学压缩”技术,在保持高准确率的同时大幅降低文本处理所需的计算资源。该模型将视觉模态引入文本信息处理领域,为解决大语言模型(LLM)处理长文本时的计算瓶颈提供了新思路。

传统 LLM 在处理长文本时面临计算复杂度平方级增长的难题——序列长度每增加一倍,算力消耗将呈四倍增长。DeepSeek-OCR 的突破性在于将文本转换为图像进行压缩处理:通过视觉模态的“光学压缩”,模型用更少的视觉 Token 承载相同信息量。实验数据显示,该技术可实现 7-20 倍的 Token 压缩率,在 10 倍压缩下 OCR 准确率超过 97%,即使压缩 20 倍仍能保持 60% 准确率。

模型架构由编码器 DeepEncoder 和解码器 DeepSeek3B-MoE 组成。DeepEncoder 采用 SAM-base(8000 万参数)与 CLIP-large(3 亿参数)的串联结构,前者负责局部特征提取,后者进行全局信息整合。中间嵌入的 16× 卷积压缩器可将输入图像的 Token 数量大幅削减,例如 1024×1024 图像经处理后,进入全局注意力层的 Token 从 4096 个降至数百个。这种设计使模型既能处理高分辨率输入(支持 512×512 至 1280×1280 多分辨率),又有效控制了内存开销。

解码器部分采用混合专家(MoE)架构,64 个专家中激活 6 个,配合 2 个共享专家,实际激活参数约 5.7 亿。这种设计使 30 亿参数规模的模型兼具 300 亿参数模型的表达能力与 50 亿参数模型的推理效率。在 OmniDocBench 基准测试中,使用 100 个视觉 Token 的 DeepSeek-OCR 表现优于 GOT-OCR2.0(每页 256 个 Token),使用 800 个 Token 时则超越 MinerU2.0(平均每页超 6000 个 Token)。

数据构建方面,团队从互联网收集了 3000 万页多语言 PDF 文档(中英文占 2500 万页),通过粗标注(fitz 提取)和精标注(PP-DocLayout 等模型生成)结合的方式构建训练集。针对小语种数据,创新采用“模型飞轮”机制:先用版面分析模型检测文本区域,再用生成的数据训练 GOT-OCR2.0,最后用训练好的模型标注更多数据,形成数据生成闭环。模型还整合了 300 万条 Word 文档数据以提升公式识别能力,以及 2000 万条场景 OCR 数据(中英文各半)增强自然图像解析能力。

该模型不仅具备基础 OCR 功能,更实现了对复杂图像的结构化解析。通过统一提示词,可自动提取金融图表数据、转换化学结构式为 SMILES 格式、解析几何图形并生成密集描述。在 STEM 领域(如化学、物理、数学),这种能力可显著提升符号和图形密集型场景的处理效率。

研究团队还提出了一个颇具前瞻性的设想:通过光学压缩模拟人类遗忘机制。具体方案是将历史对话内容渲染为图像,通过逐步压缩图像尺寸实现信息模糊化——近期内容保持高分辨率,久远内容自然淡化。这种设计理论上可支撑“无限上下文”处理,使模型在保持近期上下文高保真的同时,降低历史上下文的计算资源占用。

目前,DeepSeek-OCR 已开源原生分辨率的 Tiny(64 Token)、Small、Base、Large 四档模式,以及动态分辨率的 Gundam 模式。在实际生产环境中,单块 A100-40G 显卡每日可生成超 20 万页训练数据,20 个节点(160 块 A100)的集群日处理量可达 3300 万页。团队强调,当前成果仅是起点,后续将开展数字-光学文本交替预训练、“大海捞针”测试等系统性研究,以全面验证光学压缩技术在上下文处理中的潜力。

iPhone 17系列中国市场激活量破千万 性能升级受消费者青睐
【环球网科技综合报道】11月14日消息,据科技博主@数码闲聊站披露,苹果 iPhone 17 系列本周在中国市场的激活量已突破1000万台,创下该系列上市以来的阶段性销量新高,印证了中国消费者对其产品升级的认…

2025-11-15

荣耀500 Pro配置揭秘:骁龙8至尊版加持 8000mAh大电池续航无忧
8000mAh的大电池相较于上一代的7200mAh也是大升级,这个容量在同档位的机型中也是相当领先的。在这波大电池普及浪潮当中,荣耀后续还有望在其他机型上使用10000mAh电池,对续航要求高的用户需要密切关…

2025-11-14

iPhone 17系列发售不到俩月,中国市场激活量破1000W,双十一销量也亮眼
11月14日,数码博主“数码闲聊站”发文透露iPhone17系列于本周完成中国市场激活1000W+。 iPhone17系列9月19日正式发售,如今距发售不到两个月。 该博主此前曾透露,截至11月2日,iPh…

2025-11-14

vivo S50系列12月将至:S50 Pro mini紧凑旗舰,S50配望远镜后摄
vivo S50系列,包括 vivo S50和S50 Pro mini 。预计将在12月发布。 vivo S50 Pro mini将是一款紧凑型旗舰手机,配备 6.31 英寸显示屏。 据传闻 它将配备高通骁…

2025-11-13

​华为nova 15系列或用2.5D护眼直屏,标准版中框材质有变,12月难见其踪​
【CNMO科技消息】11月13日,有数码博主爆料称,华为nova 15系列大概率将采用全切2.5D定制护眼直屏,且中框材质并非全系为金属。 据CNMO了解,相比传统2D屏幕,2.5D屏幕在工艺复杂度上更胜一筹…

2025-11-13

荣耀500系列亮相,“双超”升级点燃市场期待
荣耀终端近日动作频频,在宣布荣耀400系列全球发货量突破600万台后,又迅速官宣了荣耀500系列的发布计划。这款备受期待的新机系列于11月13日正式亮相,凭借多项创新设计引发市场热议,其外观设计与核心配置的全面升级,展现出荣耀数字系列向高端化进阶的坚定决心。

2025-11-13

高通“一体双生”双旗舰战略持续推进 本月骁龙8 Gen5将亮相搭档8 Elite Gen5
【CNMO科技消息】11月12日,有数码博主爆料称,高通将长期保持“一体双生”双旗舰战略,即在同一代推出两款定位不同的旗舰级SoC。该博主表示,骁龙8 Gen5移动平台的安兔兔跑分高于骁龙8至尊版。 据CN…

2025-11-13

iQOO Neo11深度评测:骁龙8至尊版搭配Q2芯片,2K屏+7500mAh续航再掀性能风暴
去年的iQOO Neo10 依靠骁龙8 Gen3与1.5K屏,可谓是在2K价位段打出了一记漂亮的性能铁拳。在《王者荣耀》中,Neo11能稳定144Hz超满帧运行,帧率曲线几乎是一条直线。无论是《王者荣耀》1…

2025-11-13

谷歌入局私有AI计算:融合云端与端侧AI,隐私保护或成行业新标杆
该平台的核心目标是服务 Pixel 10 及后续手机,在严格保障用户隐私的前提下,为 Magic Cue 等功能注入更强大的云端 AI能力,该媒体认为这标志着谷歌在端侧 AI 与云端 AI 的融合上迈出了…

2025-11-12

iPhone18系列配置大揭秘:2亿像素主摄、自研5G基带C2,还有哪些惊喜?
目前,iPhone18系列手机已经全面曝光了,不得不说,苹果的营销真的做到了“不动声色”,新旗舰刚发布,下一代旗舰又开始收割用户了,据说主要有以下提升: 1.芯片方面,采用台积电2nm制程工艺的全新A20芯片…

2025-11-12