Commencez par une numérisation lisible
Capturez le texte imprimé avec une lumière homogène, un cadrage complet et le moins de flou possible. Faites pivoter la numérisation pour obtenir une orientation lisible. Un pli sombre ou un reflet peut masquer des lettres avant même le début de l’OCR. Si l’image source est de mauvaise qualité, la refaire est souvent plus utile que d’essayer de corriger le texte extrait ensuite.
Lancer la reconnaissance de texte
Les fonctionnalités publiées de l’app incluent l’OCR pour extraire le texte des documents et l’export TXT. Utilisez le flux d’extraction de texte pour la numérisation dont vous avez besoin. Une image PDF et du texte extrait sont deux résultats différents : conservez la numérisation d’origine quand l’apparence ou la mise en page du document compte.
Relisez avant de réutiliser
Comparez le texte extrait avec la source, surtout les noms, les dates, les points décimaux et les numéros de référence. L’OCR peut confondre des lettres et des chiffres similaires, et il peut ne pas préserver les colonnes ou les tableaux complexes. Corrigez les erreurs avant de coller le texte dans un autre document. Ne partez jamais du principe que la reconnaissance a vérifié le contenu de l’original.