网易首页 > 网易号 > 正文 申请入驻

刚刚,DeepSeek 又发新模型,小而美玩出新高度

0
分享至

就在刚刚,DeepSeek 开源了一个 3B 模型 DeepSeek-OCR。虽然体量不大,但模型思路创新的力度着实不小。

众所周知,当前所有 LLM 处理长文本时都面临一个绕不开的困境:计算复杂度是平方级增长的。序列越长,算力烧得越狠。

于是,DeepSeek 团队想到了一个好办法。既然一张图能包含大量文字信息,而且用的 Token 还少,那不如直接把文本转成图像?这就是所谓的「光学压缩」——用视觉模态来给文本信息「瘦身」。

而 OCR 正好天然适合验证这个思路,因为它本身就是在做「视觉→文本」的转换,而且效果还能量化评估。

论文显示,DeepSeek-OCR 的压缩率能达到 10 倍,OCR 准确率还能保持在 97% 以上。

啥意思呢?就是说,原本需要 1000 个文本 Token 才能表达的内容,现在只用 100 个视觉 Token 就搞定了。即使压缩率拉到 20 倍,准确率也还有 60% 左右,整体效果相当能打。

OmniDocBench 基准测试结果显示:

只用 100 个视觉 Token,就超过了 GOT-OCR2.0(每页 256 个 Token)的表现

用不到 800 个视觉 Token,干翻了 MinerU2.0(平均每页超过 6000 个 Token)

在实际生产中,一块 A100-40G 显卡就能每天生成超过 20 万页的 LLM/VLM 训练数据。20 个节点(160 块 A100)直接飙到每天 3300 万页。

DeepSeek-OCR 由两个核心组件组成:

DeepEncoder(编码器):负责图像特征提取和压缩

DeepSeek3B-MoE(解码器):负责从压缩后的视觉 Token 中重建文本

让我们来重点说说 DeepEncoder 这个引擎。

它的架构很巧妙,通过把 SAM-base(8000 万参数)和 CLIP-large(3 亿参数)串联起来,前者负责「窗口注意力」提取视觉特征,后者负责「全局注意力」理解整体信息。

中间还加了个 16×卷积压缩器,在进入全局注意力层之前把 Token 数量大幅砍掉。

举例而言,一张 1024×1024 的图像,会被切成 4096 个 patch token。但经过压缩器处理后,进入全局注意力层的 Token 数量会大幅减少。

这样的好处是,既保证了处理高分辨率输入的能力,又控制住了激活内存的开销。

而且 DeepEncoder 还支持多分辨率输入,从 512×512 的 Tiny 模式(64 个 Token)到 1280×1280 的 Large 模式(400 个 Token),一个模型全搞定。

目前开源版本支持的模式包括原生分辨率的 Tiny、Small、Base、Large 四档,还有动态分辨率的 Gundam 模式,灵活性拉满。

解码器用的是 DeepSeek-3B-MoE 架构。

别看只有 3B 参数,但采用了 MoE(混合专家)设计——64 个专家中激活 6 个,再加 2 个共享专家,实际激活参数约 5.7 亿。这也让模型既有 30 亿参数模型的表达能力,又保持了 5 亿参数模型的推理效率。

解码器的任务就是从压缩后的视觉 Token 中重建出原始文本,这个过程可以通过 OCR 风格的训练被紧凑型语言模型有效学习。

数据方面,DeepSeek 团队也是下了血本。

从互联网收集了 3000 万页多语言 PDF 数据,涵盖约 100 种语言,其中中英文占 2500 万页。

数据分两类:粗标注直接用 fitz 从 PDF 提取,主要训练少数语言的识别能力;精标注用 PP-DocLayout、MinerU、GOT-OCR2.0等模型生成,包含检测与识别交织的高质量数据。

对于少数语言,团队还搞了个「模型飞轮」机制——先用有跨语言泛化能力的版面分析模型做检测,再用 fitz 生成的数据训练 GOT-OCR2.0,然后用训练好的模型反过来标注更多数据,循环往复最终生成了 60 万条样本。

此外还有 300 万条 Word 文档数据,主要提升公式识别和 HTML 表格解析能力。

场景 OCR 方面,从 LAION 和 Wukong 数据集收集图像,用 PaddleOCR 标注,中英文各 1000 万条样本。

DeepSeek-OCR 不仅能识别文字,还具备「深度解析」能力,只需一个统一的提示词,就能对各种复杂图像进行结构化提取:

图表:金融研究报告中的图表可以直接提取为结构化数据

化学结构式:识别并转换为 SMILES 格式

几何图形:对平面几何图形进行复制和结构化解析

自然图像:生成密集描述(dense captions)

这在 STEM 领域的应用潜力巨大,尤其是化学、物理、数学等需要处理大量符号和图形的场景。


第一作者
Haoran Wei 此前曾供职于阶跃星辰,期间发布并开源了 GOT-OCR2.0 系统

值得注意的是,DeepSeek 团队在论文里还提出了一个脑洞大开的想法——用光学压缩模拟人类的遗忘机制。

人类的记忆会随时间衰退,越久远的事情记得越模糊。DeepSeek 团队想,那能不能让 AI 也这样?于是,他们的方案是:

1.

把超过第 k 轮的历史对话内容渲染成图像

2.

初步压缩,实现约 10 倍的 Token 减少

3.

对于更久远的上下文,继续缩小图像尺寸

4.

随着图像越来越小,内容也越来越模糊,最终达到「文本遗忘」的效果

这就很像人类记忆的衰退曲线,近期信息保持高保真度,久远记忆自然淡化。

虽然这还是个早期研究方向,但如果真能实现,对于处理超长上下文将是个巨大突破——近期上下文保持高分辨率,历史上下文占用更少计算资源,理论上可以支撑「无限上下文」。

简言之,DeepSeek-OCR 表面上是个 OCR 模型,但实际上是在探索一个更宏大的命题:能否用视觉模态作为 LLM 文本信息处理的高效压缩媒介?

初步答案是肯定的,7-20 倍的 Token 压缩能力已经展现出来了。

当然,团队也承认这只是个开始。单纯的 OCR 还不足以完全验证「上下文光学压缩」,后续还计划开展数字–光学文本交替预训练、「大海捞针」式测试,以及其他系统性评估。

不过不管怎么说,这在 VLM 和 LLM 的进化路上,又多了一条新赛道。

去年这个时候,大家还在卷怎么让模型「记得更多」。今年 DeepSeek 直接反其道行之,不如让模型学会「忘掉一些」。

确然,AI 的进化,有时候不是做加法,而是做减法。小而美,也能玩出大花样,DeepSeek-OCR 这个 3B 小模型就是最好的证明。


GitHub 主页:

http://github.com/deepseek-ai/DeepSeek-OCR

论文地址:

https://github.com/deepseek-ai/DeepSeek-OCR/blob/main/DeepSeek\_OCR\_paper.pdf

模型下载:

https://huggingface.co/deepseek-ai/DeepSeek-OCR

欢迎加入 APPSO AI 社群,一起畅聊 AI 产品,获取,解锁更多 AI 新知

我们正在招募伙伴

简历投递邮箱hr@ifanr.com

✉️ 邮件标题「姓名+岗位名称」(请随简历附上项目/作品或相关链接)

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
以军称打死杰哈德“努赫巴”部队一名指挥官

以军称打死杰哈德“努赫巴”部队一名指挥官

新华社
2026-07-28 23:48:15
美国动手了?鲁比奥:菲律宾转移仁爱礁伤员时,美海警牢牢挡住中国海警

美国动手了?鲁比奥:菲律宾转移仁爱礁伤员时,美海警牢牢挡住中国海警

阿龙聊军事
2026-07-25 14:06:38
内塔尼亚胡与特朗普在华盛顿举行会谈;伊朗处决两名男子 - 是1981年以来年以来最高水平

内塔尼亚胡与特朗普在华盛顿举行会谈;伊朗处决两名男子 - 是1981年以来年以来最高水平

一种观点
2026-07-28 15:51:02
林志颖儿子Kimi近照被吐槽不好看,林志颖回应:他本人帅的很

林志颖儿子Kimi近照被吐槽不好看,林志颖回应:他本人帅的很

可乐谈情感
2026-07-29 00:13:39
哈兰德回应大葱长得像自己:简直一模一样;此前晒“吃饭被吓到”梗图,笑到停不下来

哈兰德回应大葱长得像自己:简直一模一样;此前晒“吃饭被吓到”梗图,笑到停不下来

极目新闻
2026-07-26 17:51:56
詹皇降临费城:The Dunker Spot拆解勒布朗适配76人的野心与隐患

詹皇降临费城:The Dunker Spot拆解勒布朗适配76人的野心与隐患

星河漫山野
2026-07-29 02:03:25
日本熊本县受地震波及商场已确认数人死亡

日本熊本县受地震波及商场已确认数人死亡

澎湃新闻
2026-07-28 22:48:25
为什么女教师成了单身女的最重灾区?网友剖析一针见血,我明白了

为什么女教师成了单身女的最重灾区?网友剖析一针见血,我明白了

夜深爱杂谈
2026-04-27 22:11:39
33岁舞蹈女主演演出前遭车祸,疑脚被车辆辗轧,团队临时替换阵容,公司回应

33岁舞蹈女主演演出前遭车祸,疑脚被车辆辗轧,团队临时替换阵容,公司回应

黄河新闻网吕梁
2026-07-27 11:56:47
名嘴痛批勒布朗:你一个人,毁了乔丹科比们用扣篮大赛撑起的全明星周末

名嘴痛批勒布朗:你一个人,毁了乔丹科比们用扣篮大赛撑起的全明星周末

甜度百分百21
2026-07-29 02:01:17
新冠再次爆发,可能不发烧!医生:出现7个症状,别犹豫赶紧就医

新冠再次爆发,可能不发烧!医生:出现7个症状,别犹豫赶紧就医

坠入二次元的海洋
2026-07-18 12:44:04
碰见中国人就打?这个国家有多讨厌中国人,为何我们还要去旅游?

碰见中国人就打?这个国家有多讨厌中国人,为何我们还要去旅游?

至死不渝的爱情
2026-07-25 01:23:05
拒绝交易!全联盟唯一零引援,7首轮签当传家宝,36岁库里还在陪老板做白日梦

拒绝交易!全联盟唯一零引援,7首轮签当传家宝,36岁库里还在陪老板做白日梦

球童无忌
2026-07-28 22:31:13
战友卷走我200万,3年后我去注销银行卡,银行经理突然叫住我

战友卷走我200万,3年后我去注销银行卡,银行经理突然叫住我

千秋文化
2026-07-25 19:50:42
最近爆火的“崩阿姨”男主播让富婆大姐疯狂,这操作套路崩老头的小妹都看傻了

最近爆火的“崩阿姨”男主播让富婆大姐疯狂,这操作套路崩老头的小妹都看傻了

浪花妈妈
2026-07-29 00:12:32
性欲来了怎么化解?用这一招非常管用

性欲来了怎么化解?用这一招非常管用

神奇故事
2026-07-16 01:35:33
人伦大乱正在上演!并非个别家庭倒霉,几乎家家户户,变成了这样

人伦大乱正在上演!并非个别家庭倒霉,几乎家家户户,变成了这样

周哥一影视
2026-07-29 00:51:15
东莞一知名中学年检不合格!

东莞一知名中学年检不合格!

东莞好生活
2026-07-28 16:30:35
IFAB承认世界杯误用规则:VAR不得将犯规改判假摔,瑞士成最大受害者

IFAB承认世界杯误用规则:VAR不得将犯规改判假摔,瑞士成最大受害者

元气满分吖
2026-07-29 01:14:32
不服不行!恒大青训终于开花结果:5名18岁球员已在中超首发

不服不行!恒大青训终于开花结果:5名18岁球员已在中超首发

邱泽云
2026-07-28 22:29:05
2026-07-29 02:19:00
AppSo incentive-icons
AppSo
让智能手机更好用的秘密
6618文章数 26891关注度
往期回顾 全部

科技要闻

Kimi K3开放权重,想本地部署,200万元起

头条要闻

博主"听泉赏宝"炒股亏光父母积蓄遭拉黑 称"再玩剁手"

头条要闻

博主"听泉赏宝"炒股亏光父母积蓄遭拉黑 称"再玩剁手"

体育要闻

35岁德甲球星,退役半年后成了一名农民

娱乐要闻

43岁演员王凯去世!独居公寓无人知晓

财经要闻

潘老板的算盘全砸了,欠的25亿跑不了了

汽车要闻

宾利托卡尔重塑百年菱形美学,将于9月全球首秀

态度原创

游戏
亲子
教育
房产
数码

《铁拳》元老携手武术大师:给老外一点中国功夫震撼

亲子要闻

几年级能看出孩子是不是读书的料

教育要闻

地理学科,3大能力,90+的基本盘!

房产要闻

拿下百亩宅地!又一河北民企,重仓海南!

数码要闻

德商德静界推出带屏水冷新品,2.1寸圆屏可自定义

无障碍浏览 进入关怀版