Перед преобразованием изображения в текст проверьте его пригодность для OCR
Проверьте резкость, наклон, блики и обрезку перед OCR. Испытайте одну страницу и сверьте распознанный текст и таблицы с оригиналом.
Ошибки распознавания не всегда означают неверно выбранный инструмент. Угол съёмки, освещение и размер букв могут менять результат одной и той же страницы.
OCR получает пиксели, а не текст на бумаге. Размытые, отсутствующие или закрытые штрихи не обязательно будут дополнены правильно. Проверить источник часто полезнее, чем многократно обрабатывать проблемное изображение.
Различайте съёмку и вёрстку
Иногда неверны отдельные символы; иногда слова правильны, но абзацы перепутаны. Нужны разные меры.
| Проблема | Возможный результат | Первый шаг |
|---|---|---|
| Расфокусировка, смаз, мелкий текст | Путаница штрихов и цифр | Переснять или получить более чёткий источник |
| Блики, перекрытие, пересвет | Пропуски текста в отдельных местах | Исправить свет или убрать помехи и переснять |
| Наклон, перспектива | Неверный порядок строк, пропущенные области | Улучшить угол или исправить изображение документа |
| Колонки, сложные таблицы, смешанная вёрстка | Неверный порядок чтения и структура | Обрабатывать по областям и упорядочивать вручную |
Увеличьте место ошибки в оригинале. Если человек тоже не различает символ, смена настроек может не помочь.
Чёткость всей страницы важнее размера файла
Фото на десятки мегабайт может иметь лишь несколько чётких строк в центре. Размер не гарантирует читаемость всего листа.
Расправьте страницу, направьте камеру прямо и заполните документом большую часть кадра. Проверьте углы, края и самый мелкий текст, а не только миниатюру.
Размытый низ или изгиб текста у корешка не исправляются повышением качества экспорта. По возможности улучшите условия и переснимите.
Для сканера выберите подходящее разрешение. Изменение одного значения DPI у готового фото не добавляет штрихов. Важна чёткость реальных пикселей букв.
Уберите лишнее, но не обрезайте вплотную к тексту
Стол, соседние листы и тёмные края скана могут попасть в распознавание. Подходящая обрезка уточняет область.
Через обрезку изображения оставьте весь текст и небольшой отступ, не прижимая рамку к первой строке или последнему символу. Сохраняйте заголовки, единицы и примечания таблиц для понимания цифр.
Проверьте наклон: сильно скошенные строки мешают сегментации. Руководство Tesseract по качеству рассматривает выравнивание и разумные поля.
Поворот не равен исправлению перспективы. Он не делает пропорции букв равномерными на трапециевидном снимке страницы.
Не угадывайте отсутствующие штрихи с помощью улучшения
Часть проблем исправляется яркостью; другие означают, что информация не была записана.
В тени текст может сохраняться при низком контрасте. Белый от блика участок может не содержать пригодных штрихов.
Слишком жёсткая чёрно-белая обработка также удаляет тонкие линии или сливает их. Чистый вид не гарантирует лучший OCR.
ИИ-увеличение не подтверждает исходный текст. Более разборчивый символ может оказаться другим. Для сумм, кодов и имён ищите чёткий источник вместо заполнения по улучшенной картинке.
Сначала испытайте одну страницу
Выберите типичный лист с основным текстом, мелкими буквами, числами или таблицей. Оцените пригодность результата до обработки всего набора.
Изображение в Word подходит для текста, изображение в Excel — для таблиц. Формат облегчает работу, но не гарантирует полного восстановления вёрстки.
Проверьте середину и конец страницы. Связное чтение не доказывает правильность кодов, дат и десятичных разделителей.
Если края постоянно теряют буквы или столбец смещается, вернитесь к входному изображению. Пакетная обработка может лишь размножить ошибку.
Проверяйте до и после распознавания
До OCR убедитесь:
- Страница полная и правильно ориентирована.
- Мелкие буквы и углы чёткие, без заметного смаза.
- Важные области без бликов, помех и пересвета.
- Обрезка оставляет нужные поля и пояснения.
- Используется чёткий оригинал, не многократно пересланная, снятая с экрана или сжатая копия.
После сверьте абзацы, пропущенные строки, суммы, даты, коды и имена собственные. В таблицах проверьте строку и столбец каждого значения.
DocCrunch: изображение в Word распознаёт локально в браузере. Это не отменяет сверку: источник даёт основание, OCR сокращает ввод, а вычитка подтверждает результат.
Подготовка входа часто эффективнее исправления каждого символа. Храните чёткое исходное изображение вместе с преобразованным документом для дальнейшего сравнения.
Рекомендуемые инструменты DocCrunch
Эти инструменты по возможности работают локально в браузере, поэтому файлы не нужно загружать на сервер.