OCR(Optical Character Recognition,光学字符识别)能"看见"字,但看不懂"意思"。
很多企业上单据自动化,刚上手就栽在"OCR 识别率 99%"的宣传里——识别率再高,解决不了"这张发票的金额在第几行、和价税合计是不是同一个、字段之间什么关系"。本文讲清非结构化单据自动化的五步法,以及为什么"版式千变万化"才是真正的工程难点。这也是为什么单纯堆大模型不如补齐"抽取—审核—录入"闭环:模型负责理解,闭环负责人负责兜底,二者缺一不可。
![]()
一、OCR 的天花板
发票、合同、报关单、体检报告,版式每家都不一样。OCR 解决了"字在哪、是什么字",但解决不了语义关系。纯 OCR 在固定模板上表现好,一换版式就崩。尤其在财务、供应链、客服这些单据密集型部门,单据处理的自动化率直接决定整体人效。
更麻烦的是,同一家供应商也会改版,今天在第 3 行,下个月挪到第 5 行。靠"固定坐标"去取字段,维护成本会爆炸。
二、文档智能五步法
文档智能(Document Intelligence)把这件事拆成五步:
- 采集:从邮件、网盘、业务系统、扫描仪拿到原始文件;
- 分类:判断这是发票 / 合同 / 报关单 / 体检报告;
- 提取:用模型抽取结构化字段;
- 审核:对低置信度字段做校验;
- 录入:把结构化数据写回业务系统。
下面是一段示意代码,说明置信度兜底逻辑(通用思路,非某产品代码):
之所以叫"智能"而非"识别",关键在于第 4 步的审核闭环——没有它,提取结果直接进业务系统就是埋雷。
三、版式兜底才是真难点
工程上不能依赖"固定坐标",而要建立"抽取—校验—转人工"的兜底闭环:模型给每个字段打置信度,低于阈值的连同上下文推给业务人员,确认结果再反哺模型。这样既保住准确率,又让人只处理真正疑难的单据。
几个真实场景印证了这套思路的价值:
- 某车企体检报告处理:48 项指标自动抓取与核对,实现100% 当日完成
- 某印刷企业入离职:数据录入、ID 生成、通讯录更新全自动,单条从8 分钟降到 3 分钟,效率提升5–8 倍,千人级数据一日完成、正确率 100%;
- 跨境运费核算:自动抓取报关单、汇率与关税规则,3 分钟内完成,核算错误率从12% 降至 1.5%
四、跨场景复用与上线要点
同一套"理解—抽取—兜底"思路也能跨场景复用:客服意图识别把复杂业务处理从 15 分钟缩至 3 分钟、准确率 98%;物流查询跨 5 个系统核对,平均响应从超 10 分钟降下来;气象数据清洗入库从 2 小时压到 10 分钟。差别不在模型多大,而在是否把"非结构化→结构化→兜底"的链路打通。
另一个工程要点是"非侵入式"——平台不改造业务系统,只在表层读取与操作,既保住存量系统稳定,也让上线周期可控。记住:文档智能的终点不是"识别准",而是"业务跑得通"。
五、小结
非结构化单据自动化的终点不是"识别准",而是"业务跑得通"。把"抽取—校验—转人工"的兜底闭环设计好,比追求单点识别率更重要。
对开发者来说,别被 OCR 识别率数字带偏——真正要打磨的是版式变化下的鲁棒性,以及人机协同的兜底机制。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.