TanodTools
IT

Rendi ricercabile un PDF scansionato (OCR)

Aggiungi un livello di testo nascosto alle pagine scansionate, così puoi cercare, selezionare e copiare il loro testo. Le pagine hanno esattamente lo stesso aspetto.

Elaborato sul nostro server, poi cancellato

Rilascia qui un PDF scansionato

Oppure trascinalo in un punto qualsiasi di questa pagina. Fino a 10 MB.

Inviato al nostro server solo per questa operazione, poi cancellato. Mai conservato né registrato.

Controllo delle operazioni gratuite di oggi sul server…

Un PDF fino a 10 MB, fino a 10 pagine per operazione, testo in inglese. Elaborato sul nostro server, poi cancellato. 10 operazioni gratuite sul server al giorno per persona, condivise da tutti gli strumenti che usano il server. Per lavori più grandi: la API PDF OCR (a pagamento per chiamata).

Come rendere ricercabile un PDF

  1. Scegli un PDF scansionato fino a 10 MB, oppure trascinalo sulla pagina.
  2. Controlla le pagine da leggere: tutte per i file brevi, oppure fino a 10 alla volta.
  3. Premi Rendi ricercabile, poi scarica il PDF. Puoi anche copiare o salvare il testo riconosciuto.

Cosa fa l'OCR a un PDF scansionato

Uno scanner o un'app del telefono salva ogni pagina come immagine. Tu puoi leggerla, ma il tuo computer no: la ricerca non trova nulla e non puoi copiare una frase. Il riconoscimento ottico dei caratteri (OCR) osserva l'immagine, individua lettere e parole e le scrive nel PDF come testo invisibile posizionato esattamente sopra le parole che vedi.

Il nostro server elabora ogni pagina scelta a 200-300 dpi, la legge con il motore open source Tesseract e sovrappone il testo alla pagina originale senza modificarla. Il testo riconosciuto viene mostrato anche qui, così puoi copiarlo subito.

Consigli

  • Scansiona a 300 dpi in bianco e nero o in scala di grigi per ottenere la massima precisione.
  • Pagine capovolte o di lato? Ruotale prima con Ruota PDF (nel tuo browser).
  • Hai una foto o uno screenshot invece di un PDF? Usa Da immagine a testo (OCR).

Domande frequenti

Il mio PDF viene caricato?

Sì. A differenza della maggior parte degli strumenti di questo sito, questo funziona sul nostro server: il tuo PDF viene inviato via HTTPS, letto dal motore OCR, e la copia ricercabile torna direttamente al tuo browser. Il file esiste sul server solo mentre l'operazione è in corso, in memoria e in una cartella temporanea privata che viene cancellata appena l'operazione termina. Non conserviamo il PDF, il risultato né il testo riconosciuto, e non registriamo mai il contenuto dei file.

Cosa cambia l'OCR nel mio PDF?

Nulla di visibile. Ogni pagina viene letta dal motore OCR open source Tesseract, e le parole trovate vengono sovrapposte alla pagina come testo invisibile nei punti giusti. La pagina originale resta sotto, intatta, quindi il PDF ha lo stesso aspetto ma diventa ricercabile, selezionabile e copiabile.

Perché solo 10 pagine alla volta?

Leggere una pagina richiede alcuni secondi di tempo del server, e ogni operazione deve finire in circa un minuto. Per un documento più lungo, riesegui lo strumento sul file scaricato con le pagine successive, per esempio 11-20. Le pagine già elaborate restano come sono.

Quali lingue funzionano?

L'inglese, e altre lingue scritte con le stesse lettere latine senza accenti, con minore precisione. Le lettere accentate e le altre scritture non vengono ancora riconosciute in modo affidabile.

Le mie pagine contengono già del testo. Cosa succede?

Le pagine che contengono già testo vengono saltate, quindi un PDF creato da un programma di videoscrittura resta com'è. Spunta Leggi anche le pagine che hanno già testo per applicare comunque l'OCR, per esempio quando una scansione ha un cattivo livello di testo.

Quanto è preciso?

Le scansioni pulite e dritte a risoluzione normale vengono molto bene. Foto scattate di sbieco, stampe sbiadite o sfocate, scrittura a mano e tabelle complesse producono più errori. Controlla nomi e numeri prima di fidartene.

Ci sono dei limiti?

File fino a 10 MB, fino a 10 pagine per operazione e 10 operazioni gratuite sul server al giorno per persona, condivise da tutti i nostri strumenti che usano il server. Contano solo le operazioni riuscite, e il conteggio si azzera a mezzanotte UTC. Per lavori più grandi: la API PDF OCR, a pagamento per chiamata.

Cos'è il controllo anti-bot?

Prima che un'operazione parta, Cloudflare Turnstile verifica che a usare lo strumento sia una persona e non un bot. Di solito è invisibile; a volte ti chiede di spuntare una casella.