Перейти к основному содержимому
← Назад в блог
5 мин чтенияDocCrunch Team

Конвертация PDF в Word не восстанавливает исходный документ

Различия между текстовым слоем, OCR сканов и восстановлением вёрстки. Выбор способа конвертации и проверка текста, таблиц, чисел и оформления.

PDF в Wordтекстовый слой PDFOCR скановпроверка конвертации PDF

После конвертации PDF в Word текст может редактироваться, но документ ещё не готов к передаче. Абзацы разбиваются, столбцы смещаются, колонтитулы попадают в основной текст. Ранее упорядоченное содержимое требует новой организации.

Это не обязательно ошибка конвертации. PDF сохраняет вид страниц, а Word нужны редактируемые абзацы, таблицы и стили. Конвертер должен восстановить эти структуры по доступным данным. Исходные связи редактирования не всегда полностью хранятся в PDF.

Прежде чем выбирать экспорт, определите, что есть в файле и что нужно получить.

Сначала проверьте текстовый слой

Два одинаковых на вид PDF могут различаться внутри. Документ, экспортированный программой, обычно содержит текстовые объекты. Скан может быть только изображением страницы. Некоторые сканы уже имеют слой текста, распознанного OCR.

Тип файла Обычное содержимое Подходящий способ
PDF, созданный цифровым способом Текст, изображения и сведения о размещении Попробовать прямое извлечение
Скан только из изображений Страницы без извлекаемого текста Использовать OCR
Скан с OCR Изображения и распознанный текстовый слой Извлечь и проверить ошибки распознавания

Для начальной проверки выделите фрагмент, вставьте в редактор обычного текста и найдите слово внутри PDF.

Читаемый скопированный текст означает наличие хотя бы части пригодных данных. Искажённые символы, неверный порядок или выделение только всей картинки требуют дальнейшей проверки. Тест помогает выбрать путь, но не гарантирует весь текст документа.

Извлечение текста не обязательно сохраняет структуру

Для файлов с текстовым слоем DocCrunch PDF в Word извлекает существующий текст и упорядочивает его по страницам и расположению.

Визуально цельная строка может состоять из независимых фрагментов. Абзац может храниться частями из-за переносов, колонок или смены страниц. Конвертеру нужно определить, что следует объединить.

Распространённые результаты:

  • Один связный абзац превращается в несколько коротких.
  • Меняется порядок чтения двух колонок.
  • Колонтитулы или номера страниц попадают в основной текст.
  • Пробелы и отступы приблизительно воспроизводят расположение.

Для получения текста на редактирование это может быть приемлемо. Восстановление стилей, позиций изображений и разбивки по страницам требует времени на вёрстку.

OCR распознаёт сканы, но не восстанавливает весь макет

В скане из изображений нет готового текста. Сначала нужно распознать символы.

Инструменты PDF в Word и Excel в DocCrunch сейчас не выполняют OCR напрямую на страницах только с изображениями. Экспортируйте нужные страницы через PDF в изображения, затем используйте изображение в Word или изображение в Excel.

Скан с OCR-слоем можно попробовать извлечь напрямую. Слой не гарантирует правильность: видимая страница показывает исходное изображение, а скопированный текст может содержать прежние ошибки распознавания.

Наклон, блики, низкий контраст, мелкие символы, печати и рукописные пометки поверх текста увеличивают число ошибок. Используйте чёткий исходный скан и избегайте сильного сжатия перед OCR, которое может удалить нужные детали.

Проверяйте содержимое и положение в таблицах

Ошибка таблицы — не только неверно прочитанный знак. Правильная сумма в чужом столбце или одна запись, разделённая на две строки, может изменить смысл.

PDF в Excel позволяет попробовать извлечь таблицы с текстовым слоем. Сложные заголовки, объединённые ячейки, переходы между страницами и неравномерные промежутки требуют проверки.

Сначала структура. Сопоставьте заголовки со столбцами, убедитесь, что строка остаётся одной записью, и проверьте пропуски или повторы на стыках страниц.

Затем значения. Проверьте десятичные разделители, минусы, проценты, даты, единицы и ведущие нули идентификаторов. Выясните, не сохранены ли числа как текст.

Аккуратная на вид таблица не обязательно готова к вычислениям или импорту.

Объём проверки зависит от назначения

Для нескольких фрагментов важны точность и порядок чтения; исходная разбивка на страницы может быть не нужна.

Для дальнейшего редактирования всего документа проверьте соединение абзацев, уровни заголовков, нумерацию списков и таблицы перед применением единых стилей. Так проще поддерживать документ, чем исправлять пробелы построчно.

Для официальной передачи дополнительно проверьте страницы, изображения, примечания и разрывы. Экспортируйте новый PDF и сравните с источником страницу за страницей.

Суммы, счета, даты, имена и артикулы требуют сверки с оригиналом. Проверки орфографии недостаточно; правдоподобное оформление не доказывает правильность данных.

Сохраните оригинал и создайте рабочую копию

Полученный Word или Excel лучше считать рабочей копией, а не прямой заменой PDF.

Исходник сохраняет базу для проверки после нескольких преобразований. Если пригодный текстовый слой существует, извлекайте из оригинала, а не превращайте страницы сначала в сжатые изображения с последующим OCR.

Практичная последовательность: определить тип файла, выбрать извлечение или распознавание, проверить содержание, организовать структуру и завершить вёрстку.

Конвертация экономит время повторного ввода. Точность информации и пригодность структуры всё равно требуют проверки.

Рекомендуемые инструменты DocCrunch

Эти инструменты по возможности работают локально в браузере, поэтому файлы не нужно загружать на сервер.