Vai al contenuto principale
← Torna al blog
5 min di letturaDocCrunch Team

Perché il testo non si può più copiare dopo aver compresso un PDF?

Scopri come rasterizzazione e livello di testo influiscono su copia, ricerca, collegamenti e moduli, e verifica il PDF dopo la compressione.

compressione PDFlivello di testo PDFtesto PDF non copiabilerasterizzazione PDF

Dopo la compressione, le pagine di un PDF possono sembrare identiche, ma il testo non è più selezionabile e la ricerca non trova parole visibili. Non è necessariamente un problema del lettore: la compressione potrebbe aver trasformato intere pagine in immagini.

Dimensioni e nitidezza non bastano a valutare il risultato. Occorre verificare anche le funzioni del documento.

Una pagina può apparire uguale ma essere memorizzata diversamente

Una pagina PDF può contenere testo, immagini, grafica vettoriale e collegamenti. Sullo schermo vediamo il loro risultato combinato.

Gli oggetti di testo consentono normalmente selezione, copia e ricerca. Le lettere dentro un’immagine sono pixel: l’aspetto di testo non le rende direttamente estraibili.

Un documento scansionato può inoltre avere un livello di testo generato dall’OCR sotto l’immagine visibile. Anche un PDF dall’aspetto fotografico può quindi permettere copia e ricerca.

Se la compressione conserva soltanto l’aspetto e inserisce l’immagine di ogni pagina in un nuovo PDF, quel livello può scomparire. Il documento resta leggibile, ma il contenuto viene memorizzato in un altro modo.

Esistono diversi modi di comprimere un PDF

Metodi diversi modificano elementi diversi.

Metodo Modifica principale Cosa verificare
Riorganizzare la struttura Memorizzazione di oggetti e dati Riduzione talvolta limitata; funzioni da controllare
Comprimere le immagini nelle pagine Risoluzione o qualità di codifica Possibile perdita di dettagli senza necessariamente modificare il testo
Convertire intere pagine in immagini Memorizzazione del contenuto delle pagine Testo, vettori e interattività potrebbero non essere conservati

Il terzo metodo si chiama rasterizzazione. Esegue il rendering delle pagine, poi ricostruisce il PDF con immagini. Per alcuni file il risparmio è notevole, ma gli effetti non si limitano a una minore nitidezza.

DocCrunch Comprimi PDF genera attualmente una versione risalvata a livello strutturale e una ricostruita con immagini delle pagine, scegliendo la più piccola. Se nessuna è più leggera dell’originale, restituisce il file originale.

La scelta dipende quindi dal contenuto. Non si può presumere che ogni risultato mantenga testo copiabile.

La qualità più nitida non garantisce il livello di testo

La nitidezza riguarda l’aspetto; il livello di testo riguarda la struttura del file.

L’immagine di una pagina ad alta risoluzione può essere molto nitida senza consentire la selezione diretta del testo. Al contrario, un PDF con oggetti di testo può consentire la copia anche con illustrazioni sfocate.

Le impostazioni di DocCrunch influenzano qualità delle immagini e scala di rendering durante la ricostruzione. Attualmente manca un’opzione separata che garantisca sempre il mantenimento del livello di testo. Scegliere la qualità più nitida non basta.

Se servono ricerca, citazioni o conversioni successive, prova queste funzioni invece di controllare soltanto i bordi delle lettere ingrandite.

Non cambia soltanto la copia

Quando le pagine diventano immagini, controlla le funzioni basate su oggetti distinti.

  • Ricerca: le parole visibili potrebbero non essere più trovate.
  • Collegamenti: un indirizzo può restare visibile senza l’area cliccabile.
  • Moduli: un campo può mantenere l’aspetto senza accettare dati.
  • Zoom: testo e linee vettoriali possono mostrare bordi a pixel.
  • Conversioni successive: il testo prima estraibile può richiedere nuovamente OCR.

Alcuni lettori riconoscono automaticamente il testo nelle immagini e permettono comunque di selezionarlo. Questo non dimostra che il PDF mantenga il livello di testo: un altro lettore potrebbe comportarsi diversamente.

Se è prevista una conversione in Word, conserva il PDF originale e usa PDF in Word su quello. L’attuale strumento DocCrunch estrae principalmente testo esistente e non esegue direttamente OCR sulle pagine scansionate.

Decidi cosa conservare prima di ridurre le dimensioni

Per un documento destinato solo alla lettura, la ricostruzione in immagini può essere accettabile. Controlla testi piccoli, grafici e linee sottili.

Se servono ricerca, compilazione o conversioni, includile tra i requisiti della compressione. Un file più piccolo non è automaticamente migliore da consegnare.

Ridurre la qualità non è sempre il primo passo. Se servono solo alcune pagine, usa Elimina pagine PDF, poi verifica le dimensioni. La riduzione potrebbe non essere proporzionale, ma può evitare la ricostruzione superflua delle pagine conservate.

Se hai il documento sorgente, puoi anche ridimensionare le illustrazioni troppo grandi ed esportare un nuovo PDF. Così intervieni sui contenuti voluminosi senza trasformare tutta la pagina in immagine.

Prova il risultato per l’uso previsto

Dopo il download:

  1. Verifica numero, ordine e contenuto delle pagine.
  2. Ingrandisci testi piccoli, linee sottili, grafici ed elementi chiari.
  3. Copia un passaggio in un editor di testo semplice.
  4. Cerca alcune parole note, anche nelle pagine successive.
  5. Prova collegamenti e moduli necessari e controlla le dimensioni effettive.

Se il testo originale non era copiabile, la compressione non lo renderà automaticamente modificabile. Per questo serve il riconoscimento del testo.

Dopo la compressione PDF, conserva anche l’originale. Una copia adatta all’invio potrebbe non esserlo per modifiche, ricerche o conversioni. Tenere separata la versione da consegnare dalla sorgente semplifica il lavoro successivo.

Strumenti DocCrunch consigliati

Questi strumenti vengono eseguiti localmente nel browser quando possibile, senza caricare i file sul server.