Avant de convertir une image en texte, vérifiez si elle convient à l’OCR
Vérifiez flou, inclinaison, reflets et recadrage avant l’OCR. Testez une page avant le lot, puis comparez textes et tableaux avec l’original.
Des erreurs de reconnaissance ne signifient pas forcément que l’outil est mal choisi. L’angle de prise de vue, l’éclairage ou la taille des caractères peuvent modifier le résultat d’une même page.
L’OCR reçoit des pixels, pas le texte sur le papier. Des traits flous, absents ou masqués ne seront pas nécessairement rétablis correctement. Vérifier la source évite souvent de retraiter inutilement la même image.
Distinguer les problèmes de capture et de mise en page
Parfois les caractères sont erronés ; parfois les mots sont corrects mais les paragraphes désordonnés. Les solutions diffèrent.
| Problème | Résultat possible | Première action |
|---|---|---|
| Flou, bougé, caractères minuscules | Traits confondus, chiffres incorrects | Reprendre la photo ou obtenir une meilleure source |
| Reflets, obstacle, surexposition | Texte manquant localement | Corriger l’éclairage ou l’obstacle et reprendre |
| Inclinaison, perspective déformée | Lignes désordonnées, zones oubliées | Modifier l’angle ou corriger l’image |
| Colonnes, tableaux complexes, contenu mixte | Ordre et structure incorrects | Traiter par zones et organiser manuellement |
Zoomez sur l’endroit concerné dans l’original. Si vous ne pouvez pas identifier le caractère, changer les réglages ne suffira pas forcément.
Une page entièrement nette compte plus qu’un fichier lourd
Une photo de plusieurs mégaoctets peut n’avoir que quelques lignes nettes au centre. Son poids ne garantit pas sa lisibilité complète.
Gardez la page plane, l’appareil face au papier et le document largement présent dans le cadre. Vérifiez ensuite les coins, les bords et les plus petits caractères, pas seulement la miniature.
Un bas de page flou ou du texte courbé près d’une reliure ne se corrige pas avec une qualité d’export supérieure. Améliorez la prise de vue si vous pouvez recommencer.
Au scanner, choisissez une résolution adaptée. Pour une photo existante, changer simplement la valeur DPI n’ajoute aucun trait. Regardez plutôt si les lettres disposent de pixels suffisamment nets.
Recadrer sans coller aux caractères
Le bureau, les feuilles voisines et les bordures sombres peuvent entrer dans la reconnaissance. Un recadrage adapté clarifie la zone utile.
Avec Recadrer une image, gardez tout le texte et une petite marge, sans coller à la première ligne ou au dernier caractère. Conservez les en-têtes, unités et notes des tableaux pour préserver le sens des chiffres.
Vérifiez aussi l’inclinaison. Des lignes très penchées gênent leur segmentation. Le guide de qualité Tesseract présente le redressement et des marges raisonnables comme améliorations possibles.
Mais rotation et correction de perspective diffèrent : tourner une page trapézoïdale ne rend pas les proportions des caractères uniformes.
Ne pas deviner les traits manquants grâce à l’amélioration d’image
Certains défauts répondent à un réglage de luminosité ; d’autres signifient que l’information n’a pas été enregistrée.
Le texte sous une ombre peut subsister avec peu de contraste. Une zone devenue blanche par reflet peut ne contenir aucun trait exploitable.
Un noir et blanc trop agressif peut effacer les traits fins ou les fusionner. Une page visuellement propre n’est pas forcément meilleure pour l’OCR.
L’agrandissement IA ne permet pas de confirmer le texte d’origine. Un caractère plus lisible peut être incorrect. Pour montants, identifiants et noms, cherchez une source plus claire plutôt que de compléter selon l’image améliorée.
Tester une page avant tout le lot
Choisissez une page représentative avec texte courant, petits caractères, chiffres ou tableau. Vérifiez son résultat avant de tout traiter.
Image vers Word convient au texte suivi ; Image vers Excel aux tableaux. Le format facilite l’organisation, sans garantir une reconstruction complète de la mise en page.
Lisez aussi le milieu et la fin. Un texte fluide ne prouve pas l’exactitude des dates, identifiants et séparateurs décimaux.
Si les erreurs reviennent au même endroit, comme une marge oubliée ou une colonne décalée, examinez l’entrée. Traiter tout le lot peut multiplier le même défaut.
Vérifier avant et après la reconnaissance
Avant l’OCR, confirmez :
- Page complète et correctement orientée.
- Petits caractères et coins nets, sans bougé évident.
- Zones importantes sans reflet, obstacle ni surexposition.
- Recadrage conservant marges et explications nécessaires.
- Original clair, plutôt qu’une copie retransmise, capturée ou compressée plusieurs fois.
Après conversion, comparez ordre des paragraphes, lignes manquantes, montants, dates, identifiants et noms propres à l’original. Dans les tableaux, contrôlez la ligne et la colonne de chaque valeur.
Image vers Word de DocCrunch effectue l’OCR localement dans le navigateur. Cela ne dispense pas de vérifier : la source fournit la référence, l’OCR réduit la saisie et la relecture confirme le résultat.
Préparer l’entrée est souvent plus efficace que réparer chaque caractère. Conservez l’image nette avec le document converti pour pouvoir toujours les comparer.
Outils DocCrunch recommandés
Ces outils s’exécutent localement dans le navigateur lorsque c’est possible, sans envoyer les fichiers au serveur.