书籍/资料能批量识别文字吗?
多张 书籍/资料 可以用批量 OCR 一次导入识别,可以添加文件上传,也可以拖拽文件到窗口,或用截图方式导入;结果能一键复制或导出 TXT。但 整页扫描 300DPI,注意书脊阴影,批量出来的结果更要抽查关键字段。清晰度和字高不够的,批量也救不回,先把图拍清楚/扫到 300DPI 再上。
为什么会出现这个问题
本文基于公开资料整理,软件版本更新后界面可能有微调,但处理思路不变。
下面按先说结论、再给步骤、最后列注意点的顺序展开,着急的话可以直接看步骤部分。
具体怎么处理
- 批量 OCR 一次导入多张批量处理时这一步会对所有选中图生效,先抽查一两张的结果。
- 结果抽查关键字段批
- 清晰度不够批量也没用批
注意这几点
- 识别前先裁剪掉无关区域,干扰内容少了准确率明显上升
- 表格识别后重点核对数字列,错位和漏格是最常见的问题
- 竖排、手写体的识别率目前都不理想,重要内容建议人工录入
本文涉及:书籍/资料识别、书籍/资料转文字、OCR、书籍/资料(书籍/资料 批量识别)。
小结
到这里问题应该已经解决了。这类操作做一次就有经验,下次再遇到同类需求可以直接套用同样的流程。
