试卷/习题上的字怎么提取成文本?

用图片转文字(OCR):添加文件、拖拽进窗、或直接截图导入都行,识别完一键复制或导出 TXT。试卷/习题 这类,手写和公式识别弱,印刷正文较稳。识别准不准看三样:清晰度、字高、背景复杂度——正文字高低于 20 像素基本没救,扫描件按 300DPI 来。同类问题照这个思路套就行,不用再搜。
这事是怎么一回事
OCR 结果必须校对,尤其数字、标点、专有名词。「差不多对」和「能直接用」之间,隔着一遍人工检查,这步省不得。
这类问题没有一键解,但按步骤排查,绝大多数十分钟内收工。
上手这么办
- 文件、拖拽、截图三种导入做完另存新文件,原图留着好返工。
- 手写和公式识别弱,印刷正文较稳效果能实时预览,不满意撤了重来就是。
- 字高够、300DPI 才认得准别小看这步,十个失败里有八个栽在这。

过来人提醒
- 表格识别完重点对数字列,错位漏格是最常见的坑
- 竖排、手写目前识别率都不理想,重要内容老老实实人工录
- 扫描或拍照奔着 300DPI 去,字太小先放大再识别
本文涉及:试卷/习题 识别、试卷/习题 OCR、图片转文字(试卷/习题 识别)。
同类问题:试卷/习题识别出来错字一堆,怎么办?
说实话,先从源头救:分辨率拉高、字高放大、正对拍摄光线匀,有条件的先做倾斜校正和对比增强,再喂给 OCR。手写和公式识别弱,印刷正文较稳。救完还得人工过一遍——金额、日期、编号这类字段,0 和 O、1 和 l 错一个代价都大。原图一定留底,压坏了可没后悔药。
这事是怎么一回事
OCR 结果必须校对,尤其数字、标点、专有名词。「差不多对」和「能直接用」之间,隔着一遍人工检查,这步省不得。
本文按公开资料整理,版本更新后界面可能微调,但思路不变。
上手这么办
- 字高清晰度是第一因素到这一步基本成型,剩下的就是微调。
- 先校正增强再识别批量的话这步对所有选中图生效,先抽查再跑全量。
- 关键字段必须人工复核参数别死记,按参考值设完看效果再调。

过来人提醒
- 涉密文件别用在线识别,本地工具更稳妥
- 金额、日期、编号这三类必须人工复核,0 和 O、1 和 l 错一个都麻烦
- 识别结果别直接用,从头到尾过一遍再交付
本文涉及:试卷/习题 识别、试卷/习题 OCR、图片转文字(试卷/习题 识别)。
