Un PDF issu d’un scanner peut n’être qu’une succession d’images. Vous pouvez le lire à l’écran, mais rechercher un nom, sélectionner une phrase ou exploiter son texte devient difficile. L’OCR ajoute une couche de texte ; le préparer avant reconnaissance permet d’éviter de traiter inutilement certaines pages.
Le modèle prêt à l’emploi enchaîne le nettoyage du scan puis l’OCR pour produire un PDF recherchable.
Ouvrir ce Pipeline prêt à l’emploi
Pourquoi nettoyer avant l’OCR ?
Un dossier numérisé peut contenir des pages blanches, des scans intermédiaires ou des pages mal orientées. Les corriger avant la reconnaissance réduit le travail inutile et évite d’OCRiser du contenu qui sera ensuite supprimé.
Pour un besoin ponctuel, vous pouvez utiliser directement Supprimer les pages blanches, Supprimer des pages PDF ou Pivoter des pages PDF. Le Pipeline devient intéressant lorsque ces préparations et l’OCR doivent former une seule recette.
Ce que fait l’OCR
La reconnaissance optique de caractères analyse l’image des pages pour identifier les caractères et créer une couche textuelle exploitable. OCRiser un PDF peut être utilisé seul lorsque le document est déjà prêt.
L’OCR n’est pas infaillible. Sa qualité dépend notamment de la résolution, de la netteté, de l’orientation, du contraste, de la langue et de la complexité de la mise en page.
OCR et extraction de texte ne répondent pas au même problème
Un PDF natif peut déjà contenir du texte sélectionnable. Dans ce cas, l’OCR est souvent inutile : il vaut mieux exploiter le texte présent plutôt que tenter de le reconnaître à nouveau depuis le rendu visuel.
À l’inverse, sur un scan sans couche textuelle, l’extraction classique ne peut pas inventer les caractères absents. C’est précisément là que l’OCR est utile.
Le guide PDF : comprendre le format et bien manipuler ses documents détaille cette différence entre PDF natif et PDF scanné.