PDF para texto
Extraia o texto de um PDF, página por página, e depois copie ou salve em um arquivo .txt. Um PDF digitalizado não tem texto para extrair; nesse caso, use o OCR de PDF.
Seus arquivos nunca saem do seu dispositivo
Solte um PDF aqui
Ou arraste para qualquer lugar desta página.
Aberto neste dispositivo. Nada é enviado.
- Páginas
- 0
- Com texto
- 0
- Palavras
- 0
- Caracteres
- 0
Página por página
| Página | Palavras | Caracteres | Copiar |
|---|
Um PDF por vez, de até 200 MB e 500 páginas. A ferramenta lê o texto que está armazenado no PDF. Um PDF digitalizado é feito só de imagens das páginas e não tem texto, então precisa do OCR de PDF. Tabelas e colunas saem linha por linha, e PDFs protegidos por senha não podem ser abertos.
Como extrair texto de um PDF
- Escolha um arquivo PDF ou arraste-o para a página.
- Aguarde um instante enquanto cada página é lida. Escolha todas as páginas ou um intervalo, como 1-3, 5, e se quer marcar onde cada página começa.
- Clique em Baixar .txt, copie todo o texto ou copie uma única página da lista.
De onde vem o texto de um PDF
Um PDF criado por um editor de texto, um navegador ou um programa de design guarda suas palavras como texto: cada sequência de letras vem com uma fonte e uma posição na página. É esse texto guardado que a ferramenta lê. O seu navegador abre o arquivo com a pdf.js, pede o texto de cada página e monta as sequências de volta em linhas, na ordem em que o arquivo as lista. Em nenhum momento ele olha como a página aparece na tela.
Um PDF digitalizado é diferente. Um scanner ou a câmera do celular produz uma imagem de cada página, e o PDF guarda só essas imagens, então não há texto para ler: você vê palavras, mas o arquivo não as contém. Transformar as imagens de volta em texto é outro trabalho, chamado de reconhecimento óptico de caracteres (OCR), que o OCR de PDF faz. As páginas sem texto são marcadas na lista abaixo da caixa de texto, para você distinguir as digitalizadas das normais em um arquivo misto.
O resultado é texto simples, sem formatação. As linhas terminam onde terminam no PDF, e uma linha em branco é inserida onde o espaço entre duas linhas é claramente maior que o espaçamento normal daquela página; é assim que parágrafos e títulos ficam separados. As ligaduras que algumas fontes usam para pares como fi e fl voltam a ser letras separadas, e os hifens opcionais invisíveis são descartados.
Dicas
- As páginas digitalizadas aparecem como páginas sem texto. Passe-as pelo OCR de PDF e leia o resultado.
- Cole o texto em Remover quebras de linha para transformar as linhas empilhadas em parágrafos corridos.
- Precisa de apenas algumas páginas como PDF? Extrair páginas de PDF separa essas páginas, e o Contador de palavras conta o que você copiou.
Perguntas frequentes
Meu PDF é enviado?
Não. O seu navegador lê o texto com a biblioteca de código aberto pdf.js, no seu dispositivo. Nada é enviado a um servidor, e o texto desaparece quando você fecha a aba.
Por que não apareceu texto, ou apareceu só o de algumas páginas?
A ferramenta lê o texto que está armazenado no PDF. Um PDF digitalizado guarda cada página como uma imagem, sem texto por trás, então não há nada para ler. O mesmo vale para páginas digitalizadas inseridas em um documento que, fora isso, é normal. Use o OCR de PDF para reconhecer as letras nas imagens. As páginas sem texto são sinalizadas na lista página por página.
A formatação é mantida?
Não. Você recebe texto simples: letras, números e quebras de linha. Fontes, cores, imagens e o layout da página ficam de fora. As linhas quebram onde quebram no PDF, e uma linha em branco é inserida onde o espaço entre duas linhas é maior que o normal, como entre parágrafos.
Como junto as linhas quebradas em parágrafos?
Cole o texto em Remover quebras de linha. Essa ferramenta junta as linhas dentro de cada parágrafo, mantém as linhas em branco entre os parágrafos e pode corrigir palavras divididas por hífen no fim de uma linha.
Por que parte do texto aparece fora de ordem ou dividido em pedaços estranhos?
O texto sai na ordem em que o PDF o armazena, que em geral é a ordem de leitura, mas nem sempre. Tabelas, páginas com várias colunas e PDFs exportados de programas de design podem sair embaralhados, e alguns PDFs guardam o texto em pedaços que não correspondem às palavras que você vê.
Funciona com outros idiomas além do inglês?
Sim. O texto é lido como Unicode, então letras acentuadas, cirílico, grego, híndi, chinês e outros sistemas de escrita saem normalmente, desde que o PDF tenha uma camada de texto adequada. Se um PDF usa uma configuração de fontes incomum, copiar o texto gera caracteres ilegíveis em qualquer programa; a solução mais comum é aplicar OCR ao arquivo.