试题/错题上的文字怎么提取出来?
试题/错题提取文字用 OCR 文字识别:可以添加文件上传,也可以拖拽文件到窗口,或用截图方式导入;结果能一键复制或导出 TXT。试题/错题公式和图形识别弱,正文较稳。识别准不准官方归因于图片清晰度、文字大小、背景复杂度——最关键是字高,正文字高低于 20 像素基本救不回,扫描件建议 300DPI。
为什么会出现这个问题
很多 OCR 失败其实是输入图的问题:分辨率太低、有阴影、字太小。先用看图软件把图放大看看清不清楚,图都不清楚,换什么引擎都白搭。
下面按先说结论、再给步骤、最后列注意点的顺序展开,着急的话可以直接看步骤部分。
具体怎么处理
- 可以添加文件上传,也可以拖拽文件到窗口,或用截图方式导入;结果能一键复制或导出 TXT批量处理时这一步会对所有选中图生效,先抽查一两张的结果。
- 公式和图形识别弱,正文较稳批
- 字高够、300DPI 才认得准批
注意这几点
- 识别英文和数字混排时留意全角半角,OCR 经常给出全角字符
- 涉密文件别用在线 OCR,优先选本地处理的工具
- 识别前先裁剪掉无关区域,干扰内容少了准确率明显上升
本文涉及:试题/错题识别、试题/错题转文字、OCR、试题/错题(试题/错题 OCR 识别)。
小结
照上面的步骤走完,试题/错题上的文字怎么提取出来?基本就能解决。如果还有异常,优先怀疑原图本身或系统环境,换个文件、换台设备交叉验证,是最快的定位办法。
