为什么单语模式切碎英文
中文按「字」切分:每个汉字一个方块,识别引擎习惯了一个方块一个识别单元。纯中文模式下,引擎拿这套逻辑切英文,把每个字母当一个「字」——单词被拆成孤立的字母,空格位置也乱猜。
英文识别需要按「单词」处理:字母聚合成词,词间留空格。这是两种完全不同的切割算法,所以语言模式是 OCR 识别前最重要的开关。
正确的语言设置
识别前找「识别语言/语种」选项:纯中文文档选中文,纯英文选英文,混排文档选「中英混排/Chinese+English」。选错模式,准确率掉一半不是夸张。
部分工具的「自动检测语言」在混排文档上表现不错,但中英比例悬殊时(比如全中文里夹几个英文品牌名),自动模式可能漏切英文——手动指定混排更稳。
混排文档的其他坑
全角半角混乱:中文段落里夹的英文和数字,有的字体全角有的半角,识别结果里标点符号全角半角乱跳。识别后用「全角转半角」批处理一遍,文档立刻清爽。
竖排中文+横排英文(古籍、日式文档):通用 OCR 基本投降,这种特殊排版找支持竖排的专门工具。
外语种扩展
日文、韩文、法德西等语种,同理要选对应语言包——拿中文引擎认日文,假名全成乱码。多语言文档逐段识别:按语种分块截图,每块用对应语言识别,再拼回一起。
长期处理外语文档的,装一个多语言 OCR 工具(语言包几十种的那种),一次配好,终身受益。
识别后的英文空格与换行修复
英文被切碎的典型后遗症是单词中间多出空格,满屏都是碎片。别一个个删,先在编辑器里开正则,用「字母+空格+字母」的模式定位碎片,人工确认后合并。全文自动替换风险大,因为碎片和正常单词空格长得一样,逐条过一遍更稳。没有正则功能的编辑器也有土办法:先搜两个字母夹一个空格的短组合,命中率高、误伤少,半小时能清完一份十页文档。
混排文档的换行也常被搞乱:中文一句没说完就断行,英文单词被截成两半带连字符。整理时先合并明显断错的中文行,再处理英文连字符,把行尾横杠删掉、两半单词拼回去,注意别把 well-known 这类真实连字符误删。判断方法很简单:删掉横杠拼出来的词在词典里查得到就是碎片,本身就是复合词就保留,拿不准就对照原图看一眼,三秒钟的事。段落末的自然换行别合并,那是作者本来的分段意图,合并了全文就成了一堵墙。
中英文之间的空格规范顺便统一:技术文档习惯在中英交界处留一个半角空格,识别结果往往全丢或乱加。挑定一个风格,用替换批量执行。数字和单位之间同理,300 dpi 和 300dpi 选一种坚持到底,文档立刻显得专业一截。百分号、货币符号也顺手规范,50% 和 50 % 混着出现最显粗糙,这些细节不花多少时间,却让整篇文档的观感上一个档次。规范完顺手把全角空格也清掉,它们藏在句子里最难察觉,查找替换一次全灭。
标点切换别忘:识别结果里中文句子夹英文半角逗号很常见,用「半角逗号+汉字」的组合把它们揪出来换成全角,引号也统一成中文样式。最后通读时把注意力放在中英交界处,九成的残留问题都藏在这些缝里。通读完把文档放一夜再看一遍,新鲜眼睛能抓到熟视无睹的错误,这份文档要是对外发的,隔夜复检这道工序别省。实在等不了隔夜,就倒着从结尾往前读,打破阅读惯性,错漏更容易浮出水面。
混排文档识别完,英文部分的烂摊子有固定几类,按方抓药就行。第一类是单词内部被插了空格,important 变成 im portant,这种不好一刀切,建议开着原图逐段扫读,看到碎词手动并上;第二类是词与词之间空格丢了连成一片,或者反过来插了双空格,双空格好办,查找两个空格替换成一个,连按几次直到查不到为止;第三类是行尾断词,原文里的连字符该删,机器常留着,搜连字符加段落标记的组合逐个确认。预防也有招:识别设置里语言同时勾中文和英文,只勾中文引擎会把拉丁字母当中文偏旁硬切。文档里代码和网址多的段落,识别后优先人工过,这两类机器最容易切得稀碎。
