表格 OCR 靠什么对齐
识别软件先找表格线(横线竖线),用线把画面切成单元格网格,再往每个格子里填识别出的文字。线清楚,格子就齐;线模糊或缺失,软件只能「猜」列边界,一猜就错。
所以同样一张表,有清晰框线的识别率九成以上,无线表(靠空白对齐的那种设计风表格)识别率腰斩——没有线,就没有对齐的锚。
错位三大元凶
截图分辨率低:表格线只有 1 像素,糊成了断续的灰影,切割全乱。无线设计:网页表格常用斑马纹和留白代替框线,人看着舒服,机器看着抓瞎。合并单元格:跨行跨列的大格子打破网格规律,软件按普通格切,内容就串列。
还有斜线表头、嵌套表格,都是表格识别的天堑——看到这些,先做好手工整理的心理准备。
实操:把成功率拉满
截图用高清:网页放大到 125%-150% 再截,表格线变粗变清楚,识别率肉眼可见地提升。
识别后必校:先扫一眼列数对不对、每列的数据类型纯不纯(数字列混进文字,多半是串列了)。错位的列在 Excel 里剪切重排,比重新录入快。
什么时候该绕开 OCR
能复制就不识别:网页、PDF 里的表格,先试试能不能直接选中复制——能复制的表格是「真文字」,比任何 OCR 都准。
PDF 转 Excel:用专门的 PDF 工具(它读的是 PDF 内部的文字坐标,不靠图像识别),准确率碾压截图 OCR。截图 OCR 是没办法的办法,别当成首选。
识别后进 Excel 的修表流程
错位的表格进了 Excel,先别急着拖列。第一步检查整体结构:看哪几列数据集体右移了一格,用「剪切+插入剪切的单元格」整段挪回去,比一格一格拖快得多。先把结构性大错修完,再管零散小错,顺序反了会重复劳动。还有一种常见错位是整行下沉:表头下面空出一行、末行数据被顶出表外,选中空行整行删除即可,别一个个单元格往上搬。结构理顺了再谈细节,骨架歪着就修皮肉,修完也是白修。
表头最容易错位,因为合并单元格和双行标题 OCR 还原不了。建议干脆删掉识别出来的表头,手工重打一遍,正文保留识别结果。一张 20 列的表,重打表头两分钟,修一个错位的合并表头要半小时,这笔账很好算。重打表头时顺手把层级简化,双行标题压成一行,用「类别-项目」的拼法命名,比如「三季度-销售额」,后续筛选排序都更顺手。新表头命名别超过十个字,太长的标题会换行显示,又把列宽撑得乱七八糟。
数字列要做体检:选中整列看状态栏的求和与计数,计数小于行数,说明有文本型数字混进来。用查找替换把全角数字转成半角,再统一设为数值格式。带货币符号、千分位逗号的单元格重点看,它们是错位和串列的高发区。日期列也要查,OCR 把日期里的 5 认成 S 的不少见,排序一下日期列,排不进时间序列的条目就是问题户,逐条回图核对。体检完把各列格式刷一遍,数值右对齐、文本左对齐,扫一眼格式就知道还有没有漏网之鱼。
修完最后一步是抽样核对:随机挑五行对照原截图逐格检查。五行全对,错误率一般可控;发现两处以上错,说明原图质量问题大,回去重拍截图比继续修更省时间。修表的套路记下来,下批同结构的表格直接套用,越修越快。这类表格如果每周都要处理,把修好的成品另存为模板,列宽、格式、表头都保留,下次识别结果往里一填,只修数据不重修结构。
表格识别出来的错位别急着整列重打,修表有章法。打开 Excel 先扫一遍结构,看是整列偏移还是个别单元格串位,整列偏移最常见,往往是表头有合并单元格把列对齐带歪了。修法分三步:先把表头合并单元格全部取消,让每列各就各位;然后找出内容串了格的行,把挤在一个格里的两段文字用数据菜单里的分列功能切开,按空格或逗号做分隔符;最后抽查合计行,把几列数字拉一遍求和,和原表对不上就说明还有漏网的错位。想少修表,识别前把截图裁到只剩表体,页眉页脚和水印都会干扰分栏线判断。表格线清晰的扫描件比手机翻拍的屏幕照好认太多,能扫就别拍。
