TanodTools
FR

PDF en texte

Extrayez le texte d'un PDF page par page, puis copiez-le ou enregistrez-le dans un fichier .txt. Un PDF scanné n'a pas de texte à extraire : utilisez alors OCR PDF.

Vos fichiers ne quittent jamais votre appareil

Déposez un PDF ici

Ou glissez-le n'importe où sur cette page.

Ouvert sur cet appareil. Rien n'est envoyé.

Un PDF à la fois, jusqu'à 200 Mo et 500 pages. L'outil lit le texte qui est enregistré dans le PDF. Un PDF scanné n'est constitué que d'images de pages et ne contient donc aucun texte : utilisez alors OCR PDF. Les tableaux et les colonnes sont restitués ligne par ligne, et les PDF protégés par mot de passe ne peuvent pas être ouverts.

Comment extraire le texte d'un PDF

  1. Choisissez un fichier PDF ou glissez-le sur la page.
  2. Patientez un instant pendant la lecture de chaque page. Choisissez toutes les pages ou une plage comme 1-3, 5, et indiquez si vous voulez marquer le début de chaque page.
  3. Cliquez sur Télécharger .txt, ou copiez tout le texte, ou copiez une seule page depuis la liste.

D'où vient le texte d'un PDF ?

Un PDF créé par un traitement de texte, un navigateur ou un logiciel de création graphique enregistre ses mots sous forme de texte : chaque suite de lettres est associée à une police et à une position sur la page. C'est ce texte enregistré que lit cet outil. Votre navigateur ouvre le fichier avec pdf.js, demande à chaque page son texte, puis remet ces suites de lettres en lignes dans l'ordre où le fichier les présente. Il ne tient jamais compte de l'aspect de la page à l'écran.

Un PDF scanné, c'est autre chose. Un scanner ou l'appareil photo d'un téléphone produit une image de chaque page, et le PDF ne contient que ces images : il n'y a donc aucun texte à lire. Vous voyez des mots, mais le fichier ne les contient pas. Reconvertir ces images en texte est une tâche à part, appelée reconnaissance optique de caractères, que réalise OCR PDF. Les pages sans texte sont signalées dans la liste située sous la zone de texte, pour que vous puissiez distinguer les scans des pages normales dans un fichier mixte.

Le résultat est du texte brut, sans mise en forme. Les retours à la ligne sont ceux du PDF, et une ligne vide est ajoutée quand l'écart entre deux lignes est nettement plus grand que l'espacement habituel de la page : c'est ainsi que les paragraphes et les titres sont séparés. Les ligatures que certaines polices utilisent pour des paires de lettres comme fi et fl sont reconverties en lettres séparées, et les traits d'union conditionnels invisibles sont supprimés.

Astuces

  • Les pages scannées apparaissent comme des pages sans texte. Traitez-les avec OCR PDF et lisez le résultat.
  • Collez le texte dans Supprimer les sauts de ligne pour transformer les lignes empilées en paragraphes continus.
  • Vous n'avez besoin que de certaines pages sous forme de PDF ? Utilisez Extraire des pages d'un PDF pour les découper, et Compteur de mots pour compter ce que vous avez copié.

Questions fréquentes

Mon PDF est-il envoyé ?

Non. Votre navigateur lit le texte avec la bibliothèque open source pdf.js, sur votre appareil. Rien n'est envoyé à un serveur, et le texte disparaît quand vous fermez l'onglet.

Pourquoi n'ai-je obtenu aucun texte, ou le texte de certaines pages seulement ?

L'outil lit le texte qui est enregistré dans le PDF. Un PDF scanné enregistre chaque page sous forme d'image, sans texte derrière : il n'y a donc rien à lire. C'est aussi le cas des pages scannées ajoutées à un document par ailleurs ordinaire. Utilisez OCR PDF pour reconnaître les lettres dans les images. Les pages sans texte sont signalées dans la liste page par page.

La mise en forme est-elle conservée ?

Non. Vous obtenez du texte brut : des lettres, des chiffres et des sauts de ligne. Les polices, les couleurs, les images et la mise en page ne sont pas reprises. Les retours à la ligne sont ceux du PDF, et une ligne vide est ajoutée quand l'écart entre deux lignes est plus grand que d'habitude, comme entre deux paragraphes.

Comment recoller les lignes coupées pour former des paragraphes ?

Collez le texte dans Supprimer les sauts de ligne. Cet outil recolle les lignes à l'intérieur de chaque paragraphe, conserve les lignes vides entre les paragraphes et peut réparer les mots coupés par un tiret en fin de ligne.

Pourquoi une partie du texte est-elle dans le désordre ou coupée en morceaux bizarres ?

Le texte est extrait dans l'ordre où le PDF l'enregistre : c'est en général l'ordre de lecture, mais pas toujours. Les tableaux, les pages à plusieurs colonnes et les PDF exportés depuis des logiciels de création graphique peuvent produire un texte mélangé, et certains PDF enregistrent le texte en morceaux qui ne correspondent pas aux mots que vous voyez.

Cela fonctionne-t-il avec d'autres langues que l'anglais ?

Oui. Le texte est lu en Unicode : vous récupérez donc aussi les lettres accentuées, le cyrillique, le grec, l'hindi, le chinois et les autres écritures, à condition que le PDF ait une véritable couche de texte. Si un PDF utilise des polices configurées de façon inhabituelle, le copier-coller donne des caractères illisibles dans n'importe quel programme ; passer le fichier à l'OCR est en général la solution.