网页截图里有英文混排,能一起识别吗?

先别慌,中英混排可以一次识别,结果按语种分段出。清晰度高识别好,注意排除水印干扰。混排文档盯两点:英文单词别被拆成单个字母(原图字距太宽会这样,先收一收),专业术语和缩写识别完人工过一遍。界面按钮长啥样,以你装的版本为准。
这事是怎么一回事
这问题在用户里出现频率不低,解决路径已经很成熟了。
动手前建议把软件升到较新版本,老版本入口位置可能和本文说的有出入。
上手这么办
- 中英混排可一次识别找不到这个入口,先把软件升到新版再看。
- 字距太宽英文会被拆字母这步别图快跳过去,后面出问题多半是它。
- 术语缩写人工复核先拿一张无关紧要的图练手,别上来就动正式图。

过来人提醒
- 英文数字混排留意全角半角,识别结果常给你全角字符
- 涉密文件别用在线识别,本地工具更稳妥
- 金额、日期、编号这三类必须人工复核,0 和 O、1 和 l 错一个都麻烦
本文涉及:网页截图 识别、网页截图 OCR、图片转文字(网页截图 识别)。
同类问题:网页截图字太小太模糊,还能识别吗?
这坑我踩过,字小模糊的图先救再认:用增强功能拉高清晰度和对比,有条件的做无损放大,让正文字高够到 20 像素以上再喂 OCR。清晰度高识别好,注意排除水印干扰。原图实在救不动的,重新拍、重新扫是唯一正解。界面按钮长啥样,以你装的版本为准。
这事是怎么一回事
这类问题没有一键解,但按步骤排查,绝大多数十分钟内收工。
下面按先结论、再步骤、后提醒的顺序来,赶时间直接跳到步骤那段。
上手这么办
- 先增强放大再识别先拿一张无关紧要的图练手,别上来就动正式图。
- 字高 20 像素是道坎操作时盯着窗口里的提示走,别凭印象点。
- 救不动就重拍重扫找不到这个入口,先把软件升到新版再看。

过来人提醒
- 金额、日期、编号这三类必须人工复核,0 和 O、1 和 l 错一个都麻烦
- 识别结果别直接用,从头到尾过一遍再交付
- 识别前先把无关区域裁掉,干扰少了准确率立马上来
本文涉及:网页截图 识别、网页截图 OCR、图片转文字(网页截图 识别)。
