竖排古籍识别不准怎么办?
竖排古籍识别不准,先从源头救:提高分辨率/字高、正对拍摄光线匀、先做倾斜校正和增强、指定语种。竖排和异体字是难点,需人工较多。金额、日期、编号这类字段一定人工复核,0 和 O、1 和 l 错的代价最高。
为什么会出现这个问题
OCR 结果一定要校对,尤其是数字、标点、专有名词。识别差不多对和可以直接用之间隔着一遍人工检查,这一步省不得。
本文基于公开资料整理,软件版本更新后界面可能有微调,但处理思路不变。
具体怎么处理
- 字高和清晰度是第一因素操作时注意看窗口里的实际提示,不同版本按钮位置可能略有差异。
- 先校正增强再识别操
- 关键数字必须人工复核操
注意这几点
- 图片分辨率建议 300DPI 以上,字太小先放大再识别
- 识别英文和数字混排时留意全角半角,OCR 经常给出全角字符
- 涉密文件别用在线 OCR,优先选本地处理的工具
本文涉及:竖排古籍识别、竖排古籍转文字、OCR、竖排古籍(竖排古籍 识别纠错)。
小结
本文会随软件版本更新而修订,如果界面描述和你看到的不一致,以实际版本为准,处理思路是相通的。
