银行流水上的外文内容,OCR认不认?

说实话,中英混排可以一次识别,结果按语种分段出。表格+金额,列对齐是难点。混排文档盯两点:英文单词别被拆成单个字母(原图字距太宽会这样,先收一收),专业术语和缩写识别完人工过一遍。批量跑之前,先抽查两三张结果。
这事是怎么一回事
OCR 结果必须校对,尤其数字、标点、专有名词。「差不多对」和「能直接用」之间,隔着一遍人工检查,这步省不得。
这问题在用户里出现频率不低,解决路径已经很成熟了。
上手这么办
- 中英混排可一次识别到这一步基本成型,剩下的就是微调。
- 字距太宽英文会被拆字母批量的话这步对所有选中图生效,先抽查再跑全量。
- 术语缩写人工复核参数别死记,按参考值设完看效果再调。

过来人提醒
- 涉密文件别用在线识别,本地工具更稳妥
- 金额、日期、编号这三类必须人工复核,0 和 O、1 和 l 错一个都麻烦
- 识别结果别直接用,从头到尾过一遍再交付
本文涉及:银行流水 识别、银行流水 OCR、图片转文字(银行流水 识别)。
同类问题:银行流水分辨率低,OCR还有救吗?
干这行十几年,这情况见多了,字小模糊的图先救再认:用增强功能拉高清晰度和对比,有条件的做无损放大,让正文字高够到 20 像素以上再喂 OCR。表格+金额,列对齐是难点。原图实在救不动的,重新拍、重新扫是唯一正解。拿不准先拿一张试,顺手了再批量。
这事是怎么一回事
赶时间直接看第二节步骤;想弄明白原理,第一节值得读一遍。
这类问题没有一键解,但按步骤排查,绝大多数十分钟内收工。
上手这么办
- 先增强放大再识别别小看这步,十个失败里有八个栽在这。
- 字高 20 像素是道坎手快的也别跳,养成习惯省得翻车。
- 救不动就重拍重扫做完另存新文件,原图留着好返工。

过来人提醒
- 扫描或拍照奔着 300DPI 去,字太小先放大再识别
- 英文数字混排留意全角半角,识别结果常给你全角字符
- 涉密文件别用在线识别,本地工具更稳妥
本文涉及:银行流水 识别、银行流水 OCR、图片转文字(银行流水 识别)。
