上礼拜给老家寄体检报告,翻出一叠泛黄的化验单——全是手写加打印混排的玩意儿。拍照发微信?亲戚说字太小看不清;传网盘让闺女帮忙打字?她回我一句:“爸,这得识别啊,但你别传云端……咱家那张2016年的医保单,现在还躺在某厂服务器里呢。”话音刚落,我手就顿住了。那一刻才真明白:不是我们不用OCR,是压根不敢用。
![]()
后来翻GitHub冷门区,刷到一个更新停在2023年9月的项目:TrWebOCR。没广告、没登录页、没“欢迎使用XX云服务”的弹窗,就一行字——“All in your machine”。点进去看commit记录,最近一次合并是修复了中文顿号识别偏移的问题,作者署名带个邮箱后缀是@foxmail.com,看着像真人。镜像拉下来1.2GB,比我家NAS上跑着的Nextcloud还轻快。
我直接甩进群晖Container Manager,端口映射8089,顺手勾了“自动重启”。重启完连WiFi手机扫了下NAS局域网IP,页面弹出来那一刻,我愣了三秒——白底灰框,一个上传按钮,底下写着“支持JPG/PNG/BMP,最大20MB”。没有引导视频,没有新手教程,甚至没写“请先阅读文档”。我就把那张化验单截图拖进去,点了识别。5秒后,JSON里跳出7行文本,连“ALT 42 U/L”里的斜杠都对上了,坐标值精确到像素,置信度最低是0.81。
当然不是没坑。试繁体版《苹果日报》PDF截图时,把“臺”字认成“台”,但保住了“北”字结构;横拍的发票斜着放,它自己转正了再切字,连“¥”符号都没丢;可一旦碰上竖排的旧式药方,“君”字和“臣”字上下叠着排,它直接当两行空白放过。有次识别会议纪要照片,右侧插图被框进文字区域,输出全是“[]”,我只好掏出Photoshop手动裁掉右1/4——这事儿干得挺土,但真管用。
API调用更让我上头。写了个Py脚本往本地发POST请求,不到十行,识别结果直接塞进Excel表格。后来索性配上Python watchdog,监控NAS一个文件夹,新PDF扔进去,自动转图→识别→存TXT。上周五晚上11点,它默默处理完43份合同扫描件,我睡醒发现文件夹里多出43个同名.TXT,第一行全是“甲方:_________”。
它不吃AVX指令集,老i5-4590能跑;不挑系统,我试过Ubuntu 20.04和CentOS 7.9,连Docker Desktop for Mac都溜得起来。唯一让人捏把汗的是——服务裸奔在局域网,没设密码。有天我忘了关端口,用手机浏览器输错地址,误进隔壁同事电脑的JupyterLab登录页……这事之后,我连夜配了Nginx反向代理,加了基础认证,密码设成“trwebocr2023!”——带感叹号那种。
社区确实安静,issue区最新一条是问“能不能加粤语模型”,作者回:“Tr引擎暂不支持音节建模,但欢迎PR”。没人喊“生态共建”,也没人推付费企业版。就那么放着,像台老式收音机,插上电,调对频,就能听清字。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.