Vai al contenuto principale
← Torna al blog
5 min di letturaDocCrunch Team

Prima di convertire un’immagine in testo, verifica che sia adatta all’OCR

Controlla sfocatura, inclinazione, riflessi e ritaglio prima dell’OCR. Prova una pagina e confronta testo e tabelle con l’originale.

preparazione immagini OCRriconoscimento scansioniimmagine in Wordimmagine in Excel

Gli errori di riconoscimento non indicano necessariamente uno strumento sbagliato. Angolo, luce e dimensioni del testo possono cambiare il risultato della stessa pagina.

L’OCR riceve pixel, non il testo sulla carta. Tratti sfocati, mancanti o coperti non vengono necessariamente ricostruiti correttamente. Controllare la fonte spesso evita tentativi ripetuti sulla stessa immagine problematica.

Distingui acquisizione e impaginazione

A volte sono sbagliati i caratteri; altre volte le parole sono corrette ma i paragrafi fuori ordine. Servono interventi diversi.

Problema Possibile risultato Primo intervento
Sfocatura, mosso, testo minuscolo Tratti confusi e cifre errate Rifotografare o ottenere una fonte migliore
Riflessi, ostacoli, sovraesposizione Testo mancante localmente Correggere luce o ostacoli e ripetere
Inclinazione, prospettiva deformata Righe disordinate o zone omesse Migliorare l’angolo o correggere l’immagine
Colonne, tabelle complesse, contenuto misto Ordine e struttura errati Elaborare per zone e riordinare manualmente

Ingrandisci la zona dell’errore nell’originale. Se neppure tu distingui il carattere, cambiare impostazioni potrebbe non bastare.

Una pagina tutta leggibile vale più di un file pesante

Una foto di molti megabyte può avere poche righe nitide al centro. Il peso non garantisce leggibilità ovunque.

Tieni il foglio piatto, la fotocamera di fronte e il documento ben presente nell’inquadratura. Controlla poi angoli, margini e caratteri piccoli, non solo la miniatura.

Un fondo pagina sfocato o testo curvo vicino alla rilegatura non si corregge aumentando la qualità di esportazione. Migliora la ripresa se puoi rifarla.

Con lo scanner scegli una risoluzione adeguata. In una foto esistente, cambiare solo il valore DPI non aggiunge tratti. Conta la chiarezza dei pixel delle lettere.

Ritaglia le distrazioni senza stringere sul testo

Scrivania, fogli vicini e bordi scuri possono entrare nel riconoscimento. Un ritaglio corretto delimita il contenuto.

Con Ritaglia immagine, conserva tutta l’area testuale e un piccolo margine. Non tagliare a ridosso della prima riga o dell’ultimo carattere. Mantieni intestazioni, unità e note delle tabelle per dare significato ai numeri.

Controlla l’inclinazione: righe molto oblique ostacolano la segmentazione. La guida Tesseract alla qualità include raddrizzamento e margini ragionevoli.

Rotazione e correzione prospettica non sono equivalenti. Girare una pagina trapezoidale non uniforma le proporzioni dei caratteri.

Non indovinare i tratti mancanti con il miglioramento d’immagine

Alcuni difetti migliorano con la luminosità; altri indicano informazioni mai registrate.

Sotto un’ombra il testo può esserci con poco contrasto. Una zona bianca per riflesso potrebbe non contenere tratti utilizzabili.

Un bianco e nero aggressivo può cancellare tratti fini o unirli. Una pagina più pulita non è automaticamente migliore per l’OCR.

L’ingrandimento IA non conferma il testo originale: un carattere più leggibile può essere sbagliato. Per importi, codici e nomi cerca una fonte chiara anziché completare dal risultato migliorato.

Prova una pagina prima dell’intero lotto

Scegli una pagina rappresentativa con testo, caratteri piccoli, numeri o tabelle. Controlla che il risultato sia utile prima di elaborare tutto.

Usa Immagine in Word per il testo e Immagine in Excel per le tabelle. Il formato facilita l’organizzazione, senza garantire una ricostruzione completa dell’impaginazione.

Esamina anche centro e fine pagina. Una lettura scorrevole non prova la correttezza di date, identificativi e decimali.

Se ricorrono omissioni ai margini o colonne spostate, torna all’immagine in ingresso. Elaborare l’intero lotto può soltanto moltiplicare l’errore.

Controlla prima e dopo il riconoscimento

Prima dell’OCR verifica:

  • Pagina completa e orientata correttamente.
  • Caratteri piccoli e angoli nitidi, senza mosso evidente.
  • Zone importanti senza riflessi, ostacoli o sovraesposizione.
  • Ritaglio con margini e spiegazioni necessari.
  • Originale chiaro, non una copia inoltrata, catturata o compressa più volte.

Dopo confronta ordine, righe mancanti, importi, date, codici e nomi propri con la fonte. Nelle tabelle verifica riga e colonna di ogni valore.

DocCrunch Immagine in Word esegue il riconoscimento localmente nel browser. Ciò non elimina la verifica: la fonte dà il riferimento, l’OCR riduce la digitazione e la revisione conferma il risultato.

Preparare l’ingresso è spesso più efficace che correggere ogni carattere. Conserva l’immagine nitida insieme al documento convertito per poterli sempre confrontare.

Strumenti DocCrunch consigliati

Questi strumenti vengono eseguiti localmente nel browser quando possibile, senza caricare i file sul server.