TanodTools
IT

Da PDF a testo

Estrai il testo da un PDF pagina per pagina, poi copialo o salvalo come file .txt. Un PDF scansionato non contiene testo da estrarre: in quel caso usa OCR PDF.

I tuoi file non lasciano mai il tuo dispositivo

Rilascia qui un PDF

Oppure trascinalo in un punto qualsiasi di questa pagina.

Aperto su questo dispositivo. Non viene caricato nulla.

Un PDF alla volta, fino a 200 MB e 500 pagine. Lo strumento legge il testo memorizzato nel PDF. Un PDF scansionato è fatto solo di immagini delle pagine e non ha testo, quindi serve invece OCR PDF. Tabelle e colonne vengono estratte riga per riga, e i PDF protetti da password non possono essere aperti.

Come estrarre il testo da un PDF

  1. Scegli un file PDF, oppure trascinalo sulla pagina.
  2. Attendi qualche istante mentre ogni pagina viene letta. Scegli tutte le pagine o un intervallo come 1-3, 5 e decidi se segnare dove inizia ogni pagina.
  3. Premi Scarica .txt, oppure copia tutto il testo, oppure copia solo quello di una pagina dall'elenco.

Da dove arriva il testo di un PDF

Un PDF creato da un programma di videoscrittura, da un browser o da un programma di grafica memorizza le parole come testo: ogni sequenza di lettere è associata a un font e a una posizione nella pagina. Lo strumento legge proprio questo testo memorizzato. Il tuo browser apre il file con pdf.js, chiede a ogni pagina il suo testo e ricompone le sequenze in righe, nell'ordine in cui il file le elenca. Non guarda mai l'aspetto della pagina sullo schermo.

Un PDF scansionato è un'altra cosa. Uno scanner o la fotocamera di un telefono produce un'immagine di ogni pagina, e il PDF contiene soltanto quelle immagini, quindi non c'è testo da leggere: vedi delle parole, ma il file non le contiene. Trasformare di nuovo le immagini in testo è un lavoro diverso, chiamato riconoscimento ottico dei caratteri, e lo svolge OCR PDF. Le pagine senza testo sono segnalate nell'elenco sotto la casella di testo, così in un file misto puoi distinguere le scansioni dalle pagine normali.

Il risultato è testo semplice, senza formattazione. Le righe finiscono dove finiscono nel PDF, e viene aggiunta una riga vuota dove lo spazio tra due righe è nettamente maggiore della normale interlinea di quella pagina: è così che si separano paragrafi e titoli. Le legature che alcuni font usano per coppie come fi e fl vengono scomposte di nuovo in lettere separate, e i trattini facoltativi invisibili vengono eliminati.

Consigli

  • Le pagine scansionate compaiono come pagine senza testo. Esegui OCR PDF su quelle pagine e leggi il risultato.
  • Incolla il testo in Rimuovi interruzioni di riga per trasformare le righe spezzate in paragrafi continui.
  • Ti servono solo alcune pagine come PDF? Con Estrai pagine da PDF le isoli, e con Conta parole conti quello che hai copiato.

Domande frequenti

Il mio PDF viene caricato?

No. Il tuo browser legge il testo con la libreria open source pdf.js, sul tuo dispositivo. Non viene inviato nulla a un server e il testo sparisce quando chiudi la scheda.

Perché non ottengo testo, o lo ottengo solo da alcune pagine?

Lo strumento legge il testo memorizzato nel PDF. Un PDF scansionato salva ogni pagina come immagine, senza alcun testo sottostante, quindi non c'è nulla da leggere. Lo stesso vale per le pagine scansionate inserite in un documento altrimenti normale. Usa OCR PDF per riconoscere le lettere nelle immagini. Le pagine senza testo sono segnalate nell'elenco pagina per pagina.

La formattazione viene mantenuta?

No. Ottieni testo semplice: lettere, numeri e interruzioni di riga. Font, colori, immagini e impaginazione non vengono inclusi. Le righe vanno a capo dove vanno a capo nel PDF, e viene aggiunta una riga vuota dove lo spazio tra due righe è più grande del solito, come tra un paragrafo e l'altro.

Come unisco le righe spezzate in paragrafi?

Incolla il testo in Rimuovi interruzioni di riga. Lo strumento unisce le righe all'interno di ogni paragrafo, mantiene le righe vuote tra un paragrafo e l'altro e può ricomporre le parole spezzate da un trattino a fine riga.

Perché alcune parti del testo sono in un ordine strano o spezzate in frammenti insoliti?

Il testo esce nell'ordine in cui è memorizzato nel PDF, che di solito è l'ordine di lettura ma non sempre. Tabelle, pagine su più colonne e PDF esportati da programmi di grafica possono uscire in disordine, e alcuni PDF memorizzano il testo in frammenti che non corrispondono alle parole che vedi.

Funziona con lingue diverse dall'inglese?

Sì. Il testo viene letto come Unicode, quindi lettere accentate, cirillico, greco, hindi, cinese e altre scritture vengono estratti, purché il PDF abbia un livello di testo corretto. Se un PDF usa una configurazione dei font insolita, copiando si ottengono caratteri senza senso in qualsiasi programma; la soluzione di solito è usare l'OCR.