Почему после сжатия PDF текст больше не копируется?
Как растеризация связана с текстовым слоем PDF и что проверить после сжатия: копирование, поиск, ссылки, формы и пригодность для дальнейшей работы.
После сжатия PDF страницы могут выглядеть почти так же, но текст перестаёт выделяться, а поиск не находит видимые слова. Причина не обязательно в программе просмотра: при сжатии целые страницы могли превратиться в изображения.
Размер файла и чёткость — не единственные критерии. Нужно проверить, сохранились ли исходные функции документа.
Одинаковый вид не означает одинаковое хранение
Страница PDF может одновременно содержать текст, изображения, векторную графику и ссылки. На экране виден результат их сочетания.
Текстовые объекты обычно позволяют выделять, копировать и искать текст. Буквы внутри изображения — пиксели: сходство с текстом не делает их напрямую извлекаемыми.
У сканированного документа под видимым изображением также может быть текстовый слой, созданный OCR. Поэтому PDF, похожий на фотографию, иногда поддерживает поиск и копирование.
Если при сжатии сохраняется только внешний вид и каждая страница вставляется в новый PDF как изображение, этот слой может исчезнуть. Документ остаётся читаемым, но хранит содержимое иначе.
Сжимать PDF можно разными способами
Они изменяют разные составляющие файла.
| Способ | Главное изменение | На что обратить внимание |
|---|---|---|
| Реорганизация структуры | Хранение объектов и данных | Экономия может быть небольшой; функции всё равно нужно проверить |
| Сжатие изображений внутри страниц | Разрешение или качество кодирования | Детализация изображений может снизиться без обязательного изменения текста |
| Превращение целых страниц в изображения | Хранение содержимого страницы | Текстовые объекты, векторы и интерактивность могут не сохраниться |
Третий способ называют растеризацией. Страницы визуализируются, после чего PDF собирается из изображений. Для некоторых файлов экономия значительна, но последствия не ограничиваются небольшой потерей чёткости.
Сжатие PDF в DocCrunch сейчас создаёт структурно пересохранённую версию и версию из изображений страниц, затем выбирает меньшую. Если обе не меньше исходного файла, возвращается оригинал.
Выбранный способ зависит от содержимого. Нельзя считать, что любой результат сохранит копируемый текст.
Высокое качество не гарантирует текстовый слой
Чёткость описывает внешний вид, а текстовый слой — структуру файла.
Изображение страницы высокого разрешения может быть очень чётким, но не давать выделять текст напрямую. И наоборот, PDF с текстовыми объектами может позволять копирование даже при размытых иллюстрациях.
Уровни сжатия DocCrunch влияют на качество изображений и масштаб рендеринга при пересборке страниц. Отдельной настройки, всегда сохраняющей текстовый слой, сейчас нет. Поэтому самый чёткий режим не гарантирует выделение текста.
Если нужны поиск, цитирование или последующее преобразование в редактируемый документ, проверьте эти функции, а не только края букв при увеличении.
Измениться может не только копирование
После превращения страниц в изображения проверьте функции, основанные на отдельных объектах.
- Поиск: видимые слова могут больше не находиться.
- Ссылки: адрес останется видимым, но область нажатия может исчезнуть.
- Формы: поле может сохранить вид, но перестать принимать ввод.
- Увеличение: у текста и векторных линий могут появиться пиксельные края.
- Дальнейшее преобразование: ранее извлекаемый текст может снова потребовать OCR.
Некоторые программы просмотра автоматически распознают текст на изображениях и всё равно позволяют его выделять. Это не доказывает наличие текстового слоя в самом PDF: другая программа может вести себя иначе.
Если понадобится Word, сохраните исходный PDF и используйте PDF в Word для оригинала. Текущий инструмент DocCrunch в основном извлекает существующий текст и не выполняет OCR сканированных страниц напрямую.
Сначала определите, что должно сохраниться
Для документа только для чтения пересборка страниц в изображения может быть приемлемой. Проверьте мелкий текст, диаграммы и тонкие линии.
Если нужны поиск, заполнение форм или дальнейшая конвертация, включите их в требования к сжатию. Меньший файл не всегда лучше подходит для передачи.
Необязательно начинать со снижения качества. Если нужны лишь некоторые страницы, используйте удаление страниц PDF, затем проверьте размер. Уменьшение не обязательно будет пропорциональным, но иногда это позволяет избежать ненужной пересборки оставшихся страниц в изображения.
Если доступен исходный документ, можно уменьшить в нём слишком крупные иллюстрации и заново экспортировать PDF. Так вы работаете с объёмными элементами, не превращая всю страницу в изображение.
Проверьте результат под реальную задачу
После скачивания:
- Убедитесь в правильном количестве, порядке и полноте страниц.
- Увеличьте мелкий текст, тонкие линии, диаграммы и светлые элементы.
- Скопируйте фрагмент в редактор обычного текста.
- Найдите несколько заведомо присутствующих слов, в том числе на поздних страницах.
- Проверьте нужные ссылки и формы, а также фактический размер файла.
Если текст оригинала нельзя было копировать, сжатие не сделает его автоматически редактируемым. Для этого нужно распознавание текста.
После сжатия PDF сохраняйте и уменьшенный файл, и оригинал. Копия для отправки может не подходить для дальнейшего редактирования, поиска или конвертации. Раздельное хранение исходника и версии для передачи упрощает последующую работу.
Рекомендуемые инструменты DocCrunch
Эти инструменты по возможности работают локально в браузере, поэтому файлы не нужно загружать на сервер.