PDF a texto
Saca el texto de un PDF, página por página, y luego cópialo o guárdalo como archivo .txt. Un PDF escaneado no tiene texto que sacar: para esos casos, usa OCR de PDF.
Tus archivos nunca salen de tu dispositivo
Suelta un PDF aquí
O arrástralo a cualquier parte de esta página.
Se abre en este dispositivo. No se sube nada.
- Páginas
- 0
- Con texto
- 0
- Palabras
- 0
- Caracteres
- 0
Página por página
| Página | Palabras | Caracteres | Copiar |
|---|
Un PDF a la vez, de hasta 200 MB y 500 páginas. Esta herramienta lee el texto que está guardado en el PDF. Un PDF escaneado solo contiene imágenes de las páginas y no tiene texto, así que para esos archivos hay que usar OCR de PDF. Las tablas y las columnas salen línea por línea, y los PDF protegidos con contraseña no se pueden abrir.
Cómo extraer el texto de un PDF
- Elige un archivo PDF o arrástralo a la página.
- Espera un momento mientras se lee cada página. Elige todas las páginas o un rango, como 1-3, 5, y si quieres marcar dónde empieza cada página.
- Pulsa Descargar .txt, copia todo el texto o copia solo una página de la lista.
De dónde sale el texto de un PDF
Un PDF creado con un procesador de textos, un navegador o un programa de diseño guarda sus palabras como texto: cada fragmento de letras viene con una fuente y una posición en la página. Ese texto guardado es lo que lee esta herramienta. Tu navegador abre el archivo con pdf.js, le pide a cada página su texto y vuelve a juntar los fragmentos en líneas, en el orden en que los enumera el archivo. En ningún momento mira cómo se ve la página en pantalla.
Un PDF escaneado es distinto. Un escáner o la cámara de un celular producen una imagen de cada página, y el PDF contiene solo esas imágenes, así que no hay texto que leer: tú ves palabras, pero el archivo no las contiene. Convertir las imágenes de nuevo en texto es otro trabajo, llamado reconocimiento óptico de caracteres, y lo hace OCR de PDF. Las páginas sin texto se marcan en la lista que está debajo del cuadro de texto, para que puedas distinguir los escaneos de las páginas normales en un archivo mixto.
El resultado es texto sin formato. Las líneas terminan en los mismos puntos que en el PDF, y se agrega una línea en blanco donde el espacio entre dos líneas es claramente mayor que el espaciado habitual de esa página, que es como se separan los párrafos y los títulos. Las ligaduras que algunas fuentes usan para pares como fi y fl se convierten de nuevo en letras separadas, y los guiones suaves invisibles se eliminan.
Consejos
- Las páginas escaneadas aparecen como páginas sin texto. Pásalas por OCR de PDF y lee el resultado.
- Pega el texto en Eliminar saltos de línea para convertir las líneas apiladas en párrafos continuos.
- ¿Solo necesitas algunas páginas como PDF? Extraer páginas de un PDF las separa, y el Contador de palabras cuenta lo que copiaste.
Preguntas frecuentes
¿Se sube mi PDF?
No. Tu navegador lee el texto con la biblioteca de código abierto pdf.js, en tu dispositivo. No se envía nada a ningún servidor, y el texto desaparece cuando cierras la pestaña.
¿Por qué no obtuve texto, o solo el de algunas páginas?
La herramienta lee el texto que está guardado en el PDF. Un PDF escaneado guarda cada página como una imagen, sin ningún texto detrás, así que no hay nada que leer. Lo mismo pasa con las páginas escaneadas que se agregan a un documento por lo demás normal. Usa OCR de PDF para reconocer las letras de las imágenes. Las páginas sin texto se señalan en la lista por páginas.
¿Se conserva el formato?
No. Obtienes texto sin formato: letras, números y saltos de línea. Las fuentes, los colores, las imágenes y el diseño de la página no se incluyen. Las líneas se cortan en los mismos puntos que en el PDF, y se agrega una línea en blanco donde el espacio entre dos líneas es mayor de lo normal, como entre párrafos.
¿Cómo puedo unir las líneas cortadas para formar párrafos?
Pega el texto en Eliminar saltos de línea. Esa herramienta une las líneas dentro de cada párrafo, conserva las líneas en blanco entre párrafos y puede arreglar las palabras cortadas con guion al final de una línea.
¿Por qué hay texto en un orden extraño o dividido en fragmentos raros?
El texto sale en el orden en que lo guarda el PDF, que normalmente es el orden de lectura, pero no siempre. Las tablas, las páginas con varias columnas y los PDF exportados desde programas de diseño pueden salir desordenados, y algunos PDF guardan el texto en fragmentos que no coinciden con las palabras que ves.
¿Funciona con otros idiomas además del inglés?
Sí. El texto se lee como Unicode, así que salen las letras con tilde, el cirílico, el griego, el hindi, el chino y otros sistemas de escritura, siempre que el PDF tenga una capa de texto correcta. Si un PDF usa una configuración de fuentes poco habitual, al copiar el texto salen caracteres ilegibles en cualquier programa; lo habitual para arreglarlo es aplicarle OCR.