繁体文档里有英文混排,能一起识别吗?

一句话,中英混排可以一次识别,结果按语种分段出。选对语种再识别,简繁混排容易串。混排文档盯两点:英文单词别被拆成单个字母(原图字距太宽会这样,先收一收),专业术语和缩写识别完人工过一遍。真要还搞不定,带上版本号找官方客服,排查更快。
这事是怎么一回事
本文按公开资料整理,版本更新后界面可能微调,但思路不变。
这类问题没有一键解,但按步骤排查,绝大多数十分钟内收工。
上手这么办
- 中英混排可一次识别这步要报错,回头查原图坏没坏、磁盘满不满。
- 字距太宽英文会被拆字母参数别死记,按参考值设完看效果再调。
- 术语缩写人工复核批量的话这步对所有选中图生效,先抽查再跑全量。

过来人提醒
- 竖排、手写目前识别率都不理想,重要内容老老实实人工录
- 扫描或拍照奔着 300DPI 去,字太小先放大再识别
- 英文数字混排留意全角半角,识别结果常给你全角字符
本文涉及:繁体文档 识别、繁体文档 OCR、图片转文字(繁体文档 识别)。
同类问题:繁体文档字太小太模糊,还能识别吗?
字小模糊的图先救再认:用增强功能拉高清晰度和对比,有条件的做无损放大,让正文字高够到 20 像素以上再喂 OCR。选对语种再识别,简繁混排容易串。原图实在救不动的,重新拍、重新扫是唯一正解。真要还搞不定,带上版本号找官方客服,排查更快。
这事是怎么一回事
本文按公开资料整理,版本更新后界面可能微调,但思路不变。
赶时间直接看第二节步骤;想弄明白原理,第一节值得读一遍。
上手这么办
- 先增强放大再识别效果能实时预览,不满意撤了重来就是。
- 字高 20 像素是道坎做完另存新文件,原图留着好返工。
- 救不动就重拍重扫手快的也别跳,养成习惯省得翻车。

过来人提醒
- 识别前先把无关区域裁掉,干扰少了准确率立马上来
- 表格识别完重点对数字列,错位漏格是最常见的坑
- 竖排、手写目前识别率都不理想,重要内容老老实实人工录
本文涉及:繁体文档 识别、繁体文档 OCR、图片转文字(繁体文档 识别)。
