图片转文字之前,先检查这张图是否适合识别
识别前检查扫描件的清晰度、倾斜、反光和裁剪范围,先试转一页,再批量处理,并对照原图核查文字与表格。
文字识别出错,不一定是选错了工具。同一页内容,拍摄角度、光线和文字大小稍有变化,识别结果就可能不同。
OCR 接收到的是图片中的像素,而不是纸面上的原文。输入时已经模糊、缺失或被遮住的笔画,不能指望在转换时自动补正确。与其反复识别同一张问题图片,先检查来源,往往更省时间。
先判断是拍摄问题,还是排版问题
识别失败有不同表现:有时是单字错误,有时字基本正确,段落顺序却乱了。两者需要不同的处理。
| 图片中的问题 | 可能出现的结果 | 优先处理 |
|---|---|---|
| 失焦、抖动、小字过小 | 笔画混淆,数字识别错误 | 重新拍摄或获取更清晰的原件 |
| 反光、遮挡、过曝 | 局部文字缺失 | 调整光线或移除遮挡后重拍 |
| 页面倾斜、透视变形 | 行顺序混乱,部分区域漏识别 | 调整拍摄角度或校正文档 |
| 多栏、复杂表格、图文混排 | 阅读顺序与结构错误 | 分区域处理,并人工整理 |
判断时可以放大原图,检查出错位置。如果人眼也无法确定某个字符,继续换识别设置未必能解决问题。
拍清楚整页,比把文件拍得很大更重要
一张十几兆的照片,也可能只有中央几行清楚。文件体积大,并不代表整页文字都具备足够的可读性。
拍摄时,尽量让页面平整,让镜头正对纸面,并让文档占据画面主要区域。拍完后不要只看缩略图,还应检查四角、页边和字号最小的部分。
如果页面上方清楚、下方模糊,或者靠近书脊的文字发生弯曲,单纯提高导出质量不会修正这些问题。能重新拍摄时,通常应先改善拍摄条件。
对扫描仪生成的文件,可以从合适的扫描分辨率开始;但对已有照片,仅修改 DPI 数值不会增加实际笔画信息。更有意义的是查看文字本身是否由足够清楚的像素构成。
裁掉无关区域,但不要贴着字裁
桌面纹理、旁边的纸张、黑色扫描边框,都可能混进识别范围。适当裁剪,可以让输入内容更明确。
使用图片裁剪时,应保留完整文字区域及少量边距,不要把裁剪框紧贴第一行或最后一个字符。表格还应保留表头、单位和必要注释,否则即使数字识别正确,也可能失去解释它们的依据。
倾斜也值得单独检查。文字行明显歪斜时,识别引擎对行的划分可能受到影响。Tesseract 的图像质量指南将倾斜校正和合理边距列为改善输入的相关措施。
不过,旋转与透视校正不是同一件事。页面拍成梯形时,仅把图片转正,并不能让各处文字恢复一致的比例。
反光和缺失笔画,不适合靠增强来猜
有些问题可以通过调整亮度改善,有些则意味着原始信息已经没有被记录下来。
纸面阴影较重时,文字可能仍然存在,只是与背景的区别不明显;反光把一片区域照成纯白时,那里可能已经没有可用的笔画。
同样,过强的黑白处理可能让细笔画消失,或者让相邻笔画粘在一起。处理后的页面更“干净”,不代表更适合识别。
AI 放大也不应当成为确认原文的依据。增强后的字符可能更像一个清楚的字,却未必就是原来的字。对于金额、编号和人名,能获取清晰来源时,应优先获取来源,而不是根据增强结果补写。
先用一页试出问题,再处理整批
批量识别前,可以选一张具有代表性的图片:既包含正文,也包含小字、数字或表格。先看它能否得到可用结果,再决定是否处理全部文件。
正文材料可以使用图片转 Word;主要内容是表格时,可以使用图片转 Excel。选择输出形式,有助于后续整理,但并不保证原版式完整重建。
试转后,不仅要读第一段,还应检查页面中间和末尾。连续阅读顺畅,也不代表编号、日期和小数点都正确。
如果同一类错误反复出现,例如页边总漏字、某一列总错位,先回到输入图片查原因。直接把整批文件跑完,可能只是把同一个问题复制到更多结果里。
识别前后,各做一次检查
识别前,确认这些基础条件:
- 页面完整,方向正确。
- 小字和四角清楚,没有明显抖动。
- 重要区域没有反光、遮挡或过曝。
- 裁剪范围合理,保留必要边距和说明。
- 使用清晰原图,而不是多次转发、截图或压缩后的版本。
识别后,再对照原图核查正文顺序、漏行,以及金额、日期、编号和专有名词。表格还需要检查每个值是否落在正确的行列。
DocCrunch 的图片转 Word在浏览器本地进行文字识别,但处理位置不会改变核对的必要性。原图负责提供依据,识别工具负责减少输入工作,最后的校对负责确认结果。
把输入准备好,通常比在错误结果上逐字修补更有效。需要保留的也不只是转换后的文档,还有那份能够随时对照的清晰原图。
推荐 DocCrunch 工具
以下工具均可在浏览器本地处理,无需上传服务器。