一份文档解析模型,参数只有3.4B,吞吐却跑到2.57页/秒。Jina AI 发布的 jina-ocr-v1,把 OCR 这件事重新定义了一遍:它不是识别,是可预测的生成。
这个判断直接决定了架构选择。既然输出高度可预测,那就可以投机——用一个小模型先草拟 token,大模型再批量验证。这就是投机解码(Speculative Decoding)被引入文档解析的起点。
![]()
视觉端只留256个token
jina-ocr-v1 的视觉端做得极轻,单页图像经卷积压缩后只保留256个基础 token。解码器是 DeepSeek-3B MoE,视觉开销小,解码器的压力就小,整条链路的处理效率随之抬升。
真正提速的是 FastMTP 投机头。它递归起草 token,在 L4 GPU 上把速度翻倍,且精度无损。OCR 输出天然规整——公式、表格、段落都有强结构,这种可预测性正是投机解码最想要的土壤。
奖励不是0或1
训练走了三阶段后训练,其中用了稠密可验证奖励的 GRPO。针对公式、表格这类结构,奖励给的是部分得分,而不是简单的 0/1 判断。对模型来说,这提供了更有效的学习梯度:写对一半表格,也比全错更接近正确方向。
性能定位上,jina-ocr-v1 处在“质量-吞吐”帕累托前沿的低价高吞吐位置。它不是靠堆参数换质量,而是靠架构和训练策略,把吞吐拉到了同类模型前面。
把 OCR 当作可预测的生成任务,这个视角转换带来的收益很直接:更少的视觉 token、更快的解码、更细的训练信号。文档解析这条赛道,可能要从“谁识别得准”转向“谁吞吐得高”了。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.