Aller au contenu principal
← Retour au blog
5 min de lectureDocCrunch Team

Pourquoi ne peut-on plus copier le texte après avoir compressé un PDF ?

Comprenez la rastérisation et la couche de texte d’un PDF, puis vérifiez copie, recherche, liens et formulaires après compression.

compression PDFcouche de texte PDFtexte PDF impossible à copierrastérisation PDF

Après compression, un PDF peut sembler inchangé alors que son texte n’est plus sélectionnable et que la recherche ne trouve plus les mots visibles. Le lecteur n’est pas forcément en cause : les pages ont peut-être été transformées en images.

La taille et la netteté ne suffisent pas pour juger le résultat. Il faut aussi vérifier que les fonctions du document ont été conservées.

Une page identique à l’écran peut être stockée autrement

Une page PDF peut réunir du texte, des images, des éléments vectoriels et des liens. L’écran en affiche le résultat combiné.

Les objets texte permettent généralement la sélection, la copie et la recherche. Les lettres présentes dans une image ne sont que des pixels : leur apparence ne les rend pas directement extractibles.

Un document numérisé peut aussi posséder une couche de texte issue d’un OCR sous l’image visible. Un PDF d’apparence photographique peut donc permettre la copie et la recherche.

Si la compression ne conserve que le rendu visuel et place une image de chaque page dans un nouveau PDF, cette couche peut disparaître. Le document reste lisible, mais son contenu est stocké autrement.

Plusieurs méthodes permettent de compresser un PDF

Elles ne modifient pas toutes les mêmes éléments.

Méthode Modification principale Point d’attention
Réorganiser la structure Stockage des objets et des données Gain parfois limité ; fonctions à vérifier
Compresser les images des pages Résolution ou qualité d’encodage Perte possible de détails sans nécessairement toucher au texte
Transformer les pages entières en images Stockage du contenu des pages Texte, vecteurs et fonctions interactives peuvent disparaître

La troisième méthode est appelée rastérisation. Elle calcule le rendu des pages, puis reconstruit le PDF avec des images. Le gain peut être important, mais les conséquences dépassent une légère perte de netteté.

DocCrunch Compression PDF produit actuellement une version réenregistrée au niveau de la structure et une version reconstruite à partir d’images, puis choisit la plus petite. Si aucune n’est plus légère que l’original, il renvoie le fichier original.

La méthode retenue dépend donc du contenu. Tous les résultats ne conservent pas nécessairement du texte copiable.

Le réglage de netteté ne garantit pas une couche de texte

La netteté concerne l’apparence ; la couche de texte concerne la structure du fichier.

Une image de page en haute résolution peut être très nette sans offrir de texte directement sélectionnable. À l’inverse, un PDF contenant des objets texte peut permettre la copie même si ses illustrations sont floues.

Les préréglages de DocCrunch influencent la qualité des images et l’échelle de rendu lors de la reconstruction. Il n’existe actuellement aucune option distincte garantissant toujours la conservation de la couche de texte. Choisir le préréglage le plus net ne suffit donc pas.

Pour un document destiné à la recherche, à la citation ou à une conversion ultérieure, testez ces fonctions plutôt que de seulement examiner les contours des lettres au zoom.

La copie n’est pas la seule fonction concernée

Après conversion des pages en images, vérifiez les fonctions qui reposaient sur des objets distincts.

  • Recherche : les mots visibles peuvent ne plus être trouvés.
  • Liens : une adresse peut rester visible sans zone cliquable.
  • Formulaires : un champ peut garder son apparence sans accepter de saisie.
  • Zoom : texte et traits vectoriels peuvent présenter des bords pixellisés.
  • Conversion ultérieure : un texte auparavant extractible peut nécessiter un nouvel OCR.

Certains lecteurs reconnaissent automatiquement le texte des images et permettent malgré tout de le sélectionner. Cela ne prouve pas que le PDF conserve sa couche de texte ; un autre lecteur peut se comporter différemment.

Si une conversion en Word est prévue, conservez le PDF original et utilisez PDF vers Word sur celui-ci. L’outil actuel de DocCrunch extrait principalement le texte existant et n’effectue pas directement d’OCR sur les pages numérisées.

Décidez ce qui doit être conservé avant de réduire la taille

Pour un document uniquement destiné à la lecture, une reconstruction en images peut convenir. Vérifiez les petits caractères, les graphiques et les traits fins.

Si la recherche, les formulaires ou les conversions restent nécessaires, intégrez-les aux critères de compression. Un fichier plus petit n’est pas automatiquement mieux adapté à la livraison.

Réduire la qualité n’est pas toujours la première étape. Si seules certaines pages sont utiles, utilisez Supprimer des pages PDF, puis vérifiez la taille. Le gain n’est pas forcément proportionnel au nombre de pages retirées, mais cela peut éviter une reconstruction inutile des pages conservées.

Si le document source est disponible, vous pouvez aussi y réduire les illustrations trop grandes et exporter un nouveau PDF. Vous intervenez ainsi sur les éléments volumineux sans transformer toute la page en image.

Testez le résultat selon son usage réel

Après téléchargement :

  1. Vérifiez le nombre, l’ordre et le contenu des pages.
  2. Zoomez sur les petits caractères, traits fins, graphiques et éléments pâles.
  3. Copiez un passage dans un éditeur de texte brut.
  4. Recherchez plusieurs mots connus, y compris dans les dernières pages.
  5. Testez les liens et formulaires utiles, puis vérifiez la taille réelle.

Si le texte de l’original n’était pas copiable, la compression ne le rendra pas automatiquement modifiable. Cela relève de la reconnaissance de texte.

Après la compression PDF, conservez l’original autant que le résultat réduit. Une copie adaptée à l’envoi ne convient pas forcément à l’édition, à la recherche ou à la conversion. Séparer la version à transmettre de la source facilite les opérations suivantes.

Outils DocCrunch recommandés

Ces outils s’exécutent localement dans le navigateur lorsque c’est possible, sans envoyer les fichiers au serveur.