一个只有4B参数的模型,在端到端文档解析赛道跑到了前面。这个成绩来自WeVisDoc的测评细节,由小互在推文中补充披露。
它的核心竞争力集中在两处:公式解析和表格解析。在这两个维度上,4B版本的表现优于其他端到端模型,这也是它能在端到端领域占据领先位置的主要原因。
![]()
纯文本场景的另一套标准
测评同时给出了一个提醒:端到端能力不完全代表一切。当文档以纯文字为主时,用户需要额外关注模型独立的文字识别成绩,也就是专项OCR测试指标。
换句话说,公式和表格是它的强项,纯文本OCR则是需要单独核对的另一张成绩单。两类场景的评判标准并不重合。
选型时该看什么
对准备接入文档解析能力的团队来说,这条测评信息指向一个具体的动作:先分清自己的文档构成。
- 公式、表格占比高 → 端到端能力是主要参考
- 纯文字文档为主 → 专项OCR指标更值得先看
4B的体量加上端到端领先的位置,让它在轻量部署场景里有了讨论价值。但纯文本这条线上的表现,测评没有给出更多细节,需要以专项测试结果为准。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.