Rendre un PDF scanné consultable (OCR)
Ajoutez une couche de texte cachée aux pages scannées pour pouvoir rechercher, sélectionner et copier leur texte. Les pages restent visuellement identiques.
Traité sur notre serveur, puis supprimé
Déposez un PDF scanné ici
Ou glissez-le n'importe où sur cette page. Jusqu'à 10 Mo.
Envoyé à notre serveur pour cette seule tâche, puis supprimé. Jamais conservé ni journalisé.
Un PDF jusqu'à 10 Mo, 10 pages maximum par tâche, texte en anglais. Traité sur notre serveur, puis supprimé. 10 tâches gratuites sur le serveur par jour et par personne, partagées entre tous les outils serveur. Pour des tâches plus grosses : l'API OCR PDF (payante à l'appel).
Comment rendre un PDF consultable
- Choisissez un PDF scanné de 10 Mo maximum ou glissez-le sur la page.
- Vérifiez les pages à lire : toutes pour les fichiers courts, ou jusqu'à 10 à la fois.
- Cliquez sur Rendre consultable, puis téléchargez le PDF. Vous pouvez aussi copier ou enregistrer le texte reconnu.
Ce que fait l'OCR sur un PDF scanné
Un scanner ou une application de numérisation sur téléphone enregistre chaque page comme une image. Vous pouvez la lire, mais pas votre ordinateur : la recherche ne trouve rien et vous ne pouvez pas copier une phrase. La reconnaissance optique de caractères (OCR) analyse l'image, repère les lettres et les mots, et les écrit dans le PDF sous forme de texte invisible placé exactement par-dessus les mots que vous voyez.
Notre serveur rend chaque page choisie entre 200 et 300 dpi, la lit avec le moteur open source Tesseract et place le texte par-dessus la page d'origine sans la modifier. Le texte reconnu s'affiche aussi ici, pour que vous puissiez le copier tout de suite.
Astuces
- Numérisez à 300 dpi en noir et blanc ou en niveaux de gris pour une précision optimale.
- Des pages à l'envers ou couchées ? Redressez-les d'abord avec Faire pivoter un PDF (dans votre navigateur).
- Vous avez une photo ou une capture d'écran plutôt qu'un PDF ? Utilisez Image en texte (OCR).
Questions fréquentes
Mon PDF est-il envoyé sur un serveur ?
Oui. Contrairement à la plupart des outils de ce site, celui-ci fonctionne sur notre serveur : votre PDF est envoyé via HTTPS, lu par le moteur OCR, et la copie consultable est renvoyée directement à votre navigateur. Le fichier n'existe sur le serveur que pendant la tâche, en mémoire et dans un dossier temporaire privé qui est supprimé dès la fin de la tâche. Nous ne conservons ni le PDF, ni le résultat, ni le texte reconnu, et nous ne journalisons jamais le contenu des fichiers.
Que change l'OCR dans mon PDF ?
Rien de visible. Chaque page est lue par le moteur OCR open source Tesseract, et les mots trouvés sont placés par-dessus la page sous forme de texte invisible, aux bons endroits. La page d'origine reste dessous, intacte : le PDF a le même aspect, mais devient consultable, sélectionnable et copiable.
Pourquoi seulement 10 pages à la fois ?
Lire une page prend quelques secondes de temps serveur, et chaque tâche doit se terminer en une minute environ. Pour un document plus long, relancez l'outil sur le fichier téléchargé avec les pages suivantes, par exemple 11-20. Les pages déjà traitées sont conservées telles quelles.
Quelles langues sont prises en charge ?
L'anglais, ainsi que les autres langues écrites avec les mêmes lettres latines sans accents, avec une précision moindre. Les lettres accentuées (donc la plupart des textes en français) et les autres écritures ne sont pas encore reconnues de façon fiable.
Mes pages contiennent déjà du texte. Que se passe-t-il ?
Les pages qui contiennent déjà du texte sont ignorées : un PDF créé par un traitement de texte reste donc tel quel. Cochez Lire aussi les pages qui ont déjà du texte pour les passer quand même à l'OCR, par exemple quand un scan a une mauvaise couche de texte.
Quelle est la précision ?
Les scans propres et droits, à une résolution normale, donnent de très bons résultats. Les photos prises de biais, l'impression pâle ou floue, l'écriture manuscrite et les tableaux complexes entraînent plus d'erreurs. Vérifiez les noms et les chiffres avant de vous y fier.
Y a-t-il une limite ?
Des fichiers jusqu'à 10 Mo, 10 pages maximum par tâche, et 10 tâches gratuites sur le serveur par jour et par personne, partagées entre tous nos outils serveur. Seules les tâches réussies sont comptées, et le compteur est remis à zéro à minuit UTC. Pour des tâches plus grosses : l'API OCR PDF, payante à l'appel.
Qu'est-ce que la vérification anti-robot ?
Avant chaque tâche, Cloudflare Turnstile vérifie que c'est une personne, et non un robot, qui utilise l'outil. Elle est généralement invisible ; parfois, elle vous demande de cocher une case.