Comment rendre un PDF scanné consultable avec l'OCR
Découvrez le fonctionnement de l'OCR, les facteurs de précision et comment rendre un PDF scanné consultable et copiable dans votre navigateur.

Équipe éditoriale et technique · 4 mai 2026 · 8 min de lecture
Un PDF numérisé est une photographie numérique d'un document. Les pages sont des images. Vous ne pouvez pas sélectionner du texte, rechercher un mot, copier une phrase ou transmettre le contenu à un outil de traitement de texte. Pour la recherche d'informations, un PDF numérisé est essentiellement opaque.
L'OCR (reconnaissance optique de caractères) résout ce problème en analysant ces images et en construisant une couche de texte qui se superpose au contenu visuel. Le résultat : un PDF identique en apparence à la numérisation d'origine, mais contenant une couche de texte invisible qui rend tout sélectionnable, consultable et copiable.
Comment fonctionne l'OCR
LuraPDF utilise Tesseract.js, la version compilée pour le navigateur de Tesseract — l'un des moteurs OCR open source les plus précis, maintenu par Google et développé à l'origine par HP Labs. Tesseract utilise un modèle de réseau neuronal (basé sur LSTM) entraîné sur des millions de pages de documents dans des dizaines de langues.
Le pipeline OCR :
- Rendu des pages : chaque page PDF est rendue en image sur un canevas à haute résolution (300+ DPI pour une meilleure précision)
- Prétraitement : amélioration de l'image — binarisation, réduction du bruit, redressement (correction des numérisations inclinées)
- Analyse de la mise en page : détection des zones de texte, des colonnes, des tableaux et des éléments non textuels
- Reconnaissance des caractères : le réseau neuronal classe chaque caractère à partir des régions de texte segmentées
- Post-traitement : scoring par modèle de langue pour distinguer les caractères similaires (par ex. « l » et « 1 », « O » et « 0 »)
- Écriture PDF : le texte reconnu est intégré sous forme de couche de texte invisible, positionnée précisément au-dessus des caractères visuels correspondants
La couche de texte invisible est ce qui rend le résultat consultable. L'apparence visuelle de la page reste l'image de numérisation d'origine — vous voyez exactement ce que vous avez numérisé, mais le texte en dessous est désormais lisible par machine.
Ce qui influe sur la précision de l'OCR
La précision varie considérablement selon la qualité de l'entrée :
Résolution de numérisation
300 DPI est le minimum pour une précision fiable. En dessous de 200 DPI, la reconnaissance des caractères se dégrade sensiblement. Si vous numérisez des documents pour l'OCR, numérisez toujours à 300 DPI ou plus.
Les documents numérisés à 150 DPI ou moins devraient être renumérisés à une résolution supérieure avant l'OCR. Lancer l'OCR sur des numérisations basse résolution donne de mauvais résultats, quelle que soit la qualité du moteur.
Qualité de la police et de l'impression
- Texte imprimé (sortie d'imprimante laser, livres typographiés) : 98–99 % de précision avec des originaux propres
- Écriture manuscrite soignée avec des caractères lisibles : 85–95 %
- Texte pâle ou estompé : 80–95 % selon le contraste
- Papier carbone : 60–85 %
- Vieux journaux / machine à écrire : 90–95 % avec des numérisations propres
- Écriture cursive : 40–70 % — l'OCR par réseau neuronal peine avec le cursif
Orientation de la page
Les pages fortement inclinées ou pivotées nuisent à la précision. La plupart des moteurs OCR, dont Tesseract, détectent et corrigent automatiquement les légères rotations (jusqu'à ~10 degrés). Les pages très inclinées doivent d'abord être corrigées manuellement avec Rotation PDF.
Langue
Tesseract prend en charge plus de 100 langues. L'outil OCR de LuraPDF détecte automatiquement l'anglais. Pour les scripts non latins ou les documents non anglophones, la sélection de la langue améliore considérablement la précision.
Comment utiliser l'OCR sur un PDF avec LuraPDF
- Ouvrez l'outil OCR : accédez à LuraPDF OCR PDF
- Importez le PDF numérisé : faites glisser et déposez votre fichier
- Sélectionnez la langue (si ce n'est pas l'anglais) : choisissez la langue principale du document
- Cliquez sur « Lancer l'OCR » : le traitement s'effectue page par page dans votre navigateur. La durée varie selon la longueur du document — une numérisation de 20 pages prend généralement 30 à 90 secondes sur un ordinateur moderne.
- Téléchargez le PDF consultable : le résultat est un PDF contenant les images de numérisation d'origine et une couche de texte intégrée
Vérifier le résultat
Après l'OCR, vérifiez la précision :
- Sélectionnez du texte sur la page — le texte doit être sélectionnable exactement au-dessus des caractères imprimés
- Recherchez (Ctrl+F / Cmd+F) un mot courant — il doit être trouvé
- Copiez un paragraphe et collez-le dans un éditeur de texte — le résultat doit être lisible
Si la précision est faible, vérifiez d'abord la qualité de la numérisation d'entrée avant d'essayer d'autres outils.
Quand exécuter l'OCR avant d'autres opérations
L'OCR débloque des opérations LuraPDF supplémentaires qui ne fonctionnent pas sur des PDF purement composés d'images :
- Compresser le PDF après l'OCR : une fois le texte extrait, les zones d'image peuvent parfois être compressées plus agressivement
- PDF en Word après l'OCR : convertir un PDF ayant subi l'OCR en Word donne un texte modifiable ; convertir une numérisation brute donne un fichier Word avec des images intégrées
- Rédiger le PDF après l'OCR : la rédaction basée sur le texte fonctionne correctement sur les documents traités par OCR
- Rechercher et extraire : trouvez et copiez des informations spécifiques sans ressaisir le texte
Confidentialité : l'OCR s'exécute dans votre navigateur
Tesseract.js exécute l'intégralité du processus OCR localement via WebAssembly. Vos documents numérisés — qui contiennent souvent des dossiers médicaux, des relevés financiers, des documents juridiques ou des informations personnelles identifiables — ne quittent jamais votre appareil. Aucun serveur distant ne traite votre fichier.
C'est un avantage majeur par rapport aux services OCR en cloud qui reçoivent nécessairement une copie de tout ce que vous traitez.
Limites de l'OCR dans le navigateur
Temps de traitement
Tesseract.js est plus lent que le Tesseract natif pour bureau ou les API OCR en cloud. Comptez environ 3 à 8 secondes par page selon votre matériel. Un document de 50 pages peut prendre plusieurs minutes.
Tableaux
Tesseract reconnaît le contenu des tableaux, mais ne reconstruit pas la structure du tableau dans la couche de texte du PDF — le texte sera dans l'ordre de lecture, mais la structure des cellules ne sera pas préservée. Pour une extraction structurée de tableaux, convertissez le PDF traité par OCR en Word et reformatez le tableau manuellement.
Notation mathématique
Les équations de style LaTeX et les symboles mathématiques ont une précision moindre. Les modèles Tesseract sont optimisés pour le texte en langage naturel.
Écriture manuscrite
Comme mentionné, la précision pour l'écriture cursive est limitée. L'écriture en lettres détachées donne de meilleurs résultats. Pour les documents manuscrits importants, vérifiez chaque page manuellement.
Foire aux questions
Le texte reconnu par l'OCR ne correspond pas aux caractères — est-ce un bug ? Cela peut arriver avec des numérisations très inclinées. Les positions du texte sont calculées à partir des positions détectées des caractères, mais si la géométrie de la page n'est pas standard, l'alignement peut dériver. Essayez de faire pivoter le PDF pour corriger l'inclinaison avant de lancer l'OCR.
Puis-je appliquer l'OCR uniquement à certaines pages ? LuraPDF traite toutes les pages. Si vous avez uniquement besoin de l'OCR sur des pages spécifiques, extrayez d'abord ces pages avec Extraire des pages PDF, lancez l'OCR, puis fusionnez éventuellement les résultats.
L'OCR modifie-t-il l'apparence visuelle de mon document numérisé ? Non. Les images de numérisation d'origine sont conservées intactes. Seule une couche de texte invisible est ajoutée.
Puis-je appliquer l'OCR à un PDF qui contient déjà des pages textuelles et des pages numérisées ? Oui — Tesseract traite les pages basées sur des images et ajoute une couche de texte. Les pages qui disposent déjà d'une couche de texte ne sont pas affectées.
Mon document est en arabe / chinois / japonais — l'OCR fonctionnera-t-il ? Oui, mais sélectionnez la bonne langue dans l'outil avant de lancer. La précision de Tesseract pour les langues CJK et les langues s'écrivant de droite à gauche est bonne, mais varie davantage selon la qualité de la numérisation que pour les documents en écriture latine.
L'OCR transforme des archives verrouillées de documents numérisés en informations accessibles, consultables et exploitables. Un classeur plein de contrats numérisés devient une base de données interrogeable. Une pile de dossiers médicaux devient un document dans lequel vous pouvez réellement naviguer. Le processus prend de quelques secondes à quelques minutes et s'exécute entièrement sur votre appareil.