TanodTools
PT

PDF para texto

Extraia o texto de um PDF, página por página, e depois copie ou salve em um arquivo .txt. Um PDF digitalizado não tem texto para extrair; nesse caso, use o OCR de PDF.

Seus arquivos nunca saem do seu dispositivo

Solte um PDF aqui

Ou arraste para qualquer lugar desta página.

Aberto neste dispositivo. Nada é enviado.

Um PDF por vez, de até 200 MB e 500 páginas. A ferramenta lê o texto que está armazenado no PDF. Um PDF digitalizado é feito só de imagens das páginas e não tem texto, então precisa do OCR de PDF. Tabelas e colunas saem linha por linha, e PDFs protegidos por senha não podem ser abertos.

Como extrair texto de um PDF

  1. Escolha um arquivo PDF ou arraste-o para a página.
  2. Aguarde um instante enquanto cada página é lida. Escolha todas as páginas ou um intervalo, como 1-3, 5, e se quer marcar onde cada página começa.
  3. Clique em Baixar .txt, copie todo o texto ou copie uma única página da lista.

De onde vem o texto de um PDF

Um PDF criado por um editor de texto, um navegador ou um programa de design guarda suas palavras como texto: cada sequência de letras vem com uma fonte e uma posição na página. É esse texto guardado que a ferramenta lê. O seu navegador abre o arquivo com a pdf.js, pede o texto de cada página e monta as sequências de volta em linhas, na ordem em que o arquivo as lista. Em nenhum momento ele olha como a página aparece na tela.

Um PDF digitalizado é diferente. Um scanner ou a câmera do celular produz uma imagem de cada página, e o PDF guarda só essas imagens, então não há texto para ler: você vê palavras, mas o arquivo não as contém. Transformar as imagens de volta em texto é outro trabalho, chamado de reconhecimento óptico de caracteres (OCR), que o OCR de PDF faz. As páginas sem texto são marcadas na lista abaixo da caixa de texto, para você distinguir as digitalizadas das normais em um arquivo misto.

O resultado é texto simples, sem formatação. As linhas terminam onde terminam no PDF, e uma linha em branco é inserida onde o espaço entre duas linhas é claramente maior que o espaçamento normal daquela página; é assim que parágrafos e títulos ficam separados. As ligaduras que algumas fontes usam para pares como fi e fl voltam a ser letras separadas, e os hifens opcionais invisíveis são descartados.

Dicas

Perguntas frequentes

Meu PDF é enviado?

Não. O seu navegador lê o texto com a biblioteca de código aberto pdf.js, no seu dispositivo. Nada é enviado a um servidor, e o texto desaparece quando você fecha a aba.

Por que não apareceu texto, ou apareceu só o de algumas páginas?

A ferramenta lê o texto que está armazenado no PDF. Um PDF digitalizado guarda cada página como uma imagem, sem texto por trás, então não há nada para ler. O mesmo vale para páginas digitalizadas inseridas em um documento que, fora isso, é normal. Use o OCR de PDF para reconhecer as letras nas imagens. As páginas sem texto são sinalizadas na lista página por página.

A formatação é mantida?

Não. Você recebe texto simples: letras, números e quebras de linha. Fontes, cores, imagens e o layout da página ficam de fora. As linhas quebram onde quebram no PDF, e uma linha em branco é inserida onde o espaço entre duas linhas é maior que o normal, como entre parágrafos.

Como junto as linhas quebradas em parágrafos?

Cole o texto em Remover quebras de linha. Essa ferramenta junta as linhas dentro de cada parágrafo, mantém as linhas em branco entre os parágrafos e pode corrigir palavras divididas por hífen no fim de uma linha.

Por que parte do texto aparece fora de ordem ou dividido em pedaços estranhos?

O texto sai na ordem em que o PDF o armazena, que em geral é a ordem de leitura, mas nem sempre. Tabelas, páginas com várias colunas e PDFs exportados de programas de design podem sair embaralhados, e alguns PDFs guardam o texto em pedaços que não correspondem às palavras que você vê.

Funciona com outros idiomas além do inglês?

Sim. O texto é lido como Unicode, então letras acentuadas, cirílico, grego, híndi, chinês e outros sistemas de escrita saem normalmente, desde que o PDF tenha uma camada de texto adequada. Se um PDF usa uma configuração de fontes incomum, copiar o texto gera caracteres ilegíveis em qualquer programa; a solução mais comum é aplicar OCR ao arquivo.