把图片上的文字变成能复制粘贴的文本,这件事听着简单,实际用起来经常翻车:识别出来的字东倒西歪,标点全错,数字和字母互相认错。多数时候问题不在识别引擎,而在喂给它的那张图。搞清楚影响识别率的几个变量,再对症处理,准确率能有肉眼可见的提升。
决定识别率的三个变量
第一个是分辨率,文字高度至少要占 20 个像素以上,越小越容易糊成一团。第二个是清晰度,对焦虚了、有噪点、有阴影,都会让笔画断裂。第三个也是最容易被忽略的,是排版——单栏横排的印刷体最好认,多栏、竖排、带表格、混排公式的难度成倍上升。
所以动手之前先问自己一句:这张图能不能变得更“干净”?裁掉多余的白边、把歪掉的页面转正、去掉手指和阴影,这几步几乎不花时间,但收益最大。
三类素材分别怎么处理
屏幕截图是最省事的,本身清晰、字体标准,直接识别准确率通常就很高,注意别用带压缩的聊天软件转发过一遍就行。扫描件要看参数,低于 200 DPI 的先重新扫,灰度模式比彩色模式更适合纯文字。手机拍照最容易出问题:务必正对着拍、把四边拍全、避免手抖和反光,拍完先转正和裁边再识别。
表格和特殊内容是难点
表格是最容易识别错位的内容,单元格一乱,数据就全对不上号。如果原图是表格,建议先确认工具是否支持表格还原,导出后务必逐列核对一遍数字。手写体、艺术字、盖章上的字、公式符号,准确率都会明显下降,这类内容不要指望一次成型,做好手工补录的心理准备。
识别完务必校对
OCR 最典型的错误是有规律的:数字 0 和字母 O、数字 1 和字母 l、中文“末”和“未”这类形近字,以及中英文标点混用。把这些易错项单独过一遍,比全文逐字读要高效得多。涉及金额、日期、编号的内容,必须逐条核对,错一个数字后果可能很严重。
如果要处理的是整份扫描文档,更省事的路线是先用PDF转Word把整份文档转成可编辑文件,段落和样式都能保留,比一页页截图再识别快得多。遇到的是数据报表,则可以直接用PDF转Excel,连表格结构一起还原,省掉重新录入的功夫。