TanodTools
DE

PDF in Text umwandeln

Holen Sie den Text Seite für Seite aus einem PDF, kopieren Sie ihn oder speichern Sie ihn als .txt-Datei. Ein gescanntes PDF enthält keinen Text, den man herausholen könnte: Verwenden Sie dafür PDF-OCR.

Ihre Dateien verlassen nie Ihr Gerät

PDF hier ablegen

Oder ziehen Sie es an eine beliebige Stelle dieser Seite.

Wird auf diesem Gerät geöffnet. Nichts wird hochgeladen.

Ein PDF auf einmal, bis 200 MB und bis 500 Seiten. Gelesen wird der Text, der im PDF gespeichert ist. Ein gescanntes PDF besteht nur aus Seitenbildern und enthält keinen Text; dafür brauchen Sie stattdessen PDF-OCR. Tabellen und Spalten kommen Zeile für Zeile heraus, und passwortgeschützte PDFs können nicht geöffnet werden.

So extrahieren Sie Text aus einem PDF

  1. Wählen Sie eine PDF-Datei aus oder ziehen Sie sie auf die Seite.
  2. Warten Sie einen Moment, während jede Seite gelesen wird. Wählen Sie alle Seiten oder einen Bereich wie 1-3, 5 und legen Sie fest, ob die Seitenanfänge markiert werden sollen.
  3. Klicken Sie auf .txt herunterladen, kopieren Sie den gesamten Text oder kopieren Sie eine einzelne Seite aus der Liste.

Woher der Text in einem PDF stammt

Ein PDF, das von einer Textverarbeitung, einem Browser oder einem Designprogramm erzeugt wurde, speichert seine Wörter als Text: Jede Zeichenfolge kommt mit einer Schrift und einer Position auf der Seite. Genau diesen gespeicherten Text liest dieses Tool. Ihr Browser öffnet die Datei mit pdf.js, fragt von jeder Seite den Text ab und setzt die Zeichenfolgen in der Reihenfolge, in der die Datei sie aufführt, wieder zu Zeilen zusammen. Wie die Seite auf dem Bildschirm aussieht, bleibt dabei völlig außen vor.

Bei einem gescannten PDF ist das anders. Ein Scanner oder eine Handykamera erzeugt von jeder Seite ein Bild, und das PDF enthält nur diese Bilder, sodass es keinen Text zu lesen gibt: Sie sehen Wörter, aber die Datei enthält sie nicht. Die Bilder wieder in Text zu verwandeln ist eine andere Aufgabe, die optische Zeichenerkennung (OCR); sie übernimmt PDF-OCR. Seiten ohne Text sind in der Liste unter dem Textfeld markiert, sodass Sie in einer gemischten Datei Scans von normalen Seiten unterscheiden können.

Das Ergebnis ist reiner Text ohne Formatierung. Zeilen enden dort, wo sie im PDF enden, und eine Leerzeile wird eingefügt, wo der Abstand zwischen zwei Zeilen deutlich größer ist als der übliche Zeilenabstand auf der Seite; so werden Absätze und Überschriften voneinander getrennt. Ligaturen, die manche Schriften für Buchstabenpaare wie fi und fl verwenden, werden wieder in einzelne Buchstaben zerlegt, und unsichtbare bedingte Trennstriche werden entfernt.

Tipps

  • Gescannte Seiten erscheinen als Seiten ohne Text. Wenden Sie darauf PDF-OCR an und lesen Sie das Ergebnis.
  • Fügen Sie den Text in Zeilenumbrüche entfernen ein, um aus den untereinander stehenden Zeilen fließende Absätze zu machen.
  • Sie brauchen nur einige Seiten als PDF? PDF-Seiten extrahieren schneidet sie heraus, und Wörter zählen zählt den kopierten Text.

Häufige Fragen

Wird mein PDF hochgeladen?

Nein. Ihr Browser liest den Text auf Ihrem Gerät mit der Open-Source-Bibliothek pdf.js. Nichts wird an einen Server gesendet, und der Text ist weg, sobald Sie den Tab schließen.

Warum erhalte ich keinen Text oder nur von einigen Seiten?

Das Tool liest den Text, der im PDF gespeichert ist. Ein gescanntes PDF speichert jede Seite als Bild, ohne Text dahinter, sodass es nichts zu lesen gibt. Dasselbe gilt für gescannte Seiten, die in ein sonst normales Dokument eingefügt wurden. Mit PDF-OCR erkennen Sie die Buchstaben in den Bildern. Seiten ohne Text sind in der Liste „Seite für Seite“ gekennzeichnet.

Bleibt die Formatierung erhalten?

Nein. Sie erhalten reinen Text: Buchstaben, Ziffern und Zeilenumbrüche. Schriften, Farben, Bilder und das Seitenlayout bleiben außen vor. Zeilen brechen an denselben Stellen um wie im PDF, und eine Leerzeile wird eingefügt, wo der Abstand zwischen zwei Zeilen größer ist als sonst, etwa zwischen Absätzen.

Wie füge ich die umbrochenen Zeilen zu Absätzen zusammen?

Fügen Sie den Text in Zeilenumbrüche entfernen ein. Das Tool verbindet die Zeilen innerhalb jedes Absatzes, behält die Leerzeilen zwischen den Absätzen bei und kann Wörter reparieren, die am Zeilenende durch einen Bindestrich getrennt sind.

Warum steht manchmal Text in seltsamer Reihenfolge oder ist in merkwürdige Stücke zerteilt?

Der Text kommt in der Reihenfolge heraus, in der das PDF ihn speichert. Das ist meist die Lesereihenfolge, aber nicht immer. Tabellen, Seiten mit mehreren Spalten und PDFs, die aus Designprogrammen exportiert wurden, können durcheinander herauskommen, und manche PDFs speichern Text in Stücken, die nicht zu den Wörtern passen, die Sie sehen.

Funktioniert es auch mit anderen Sprachen als Englisch?

Ja. Der Text wird als Unicode gelesen, daher kommen Buchstaben mit Akzenten oder Umlauten, Kyrillisch, Griechisch, Hindi, Chinesisch und andere Schriftsysteme korrekt heraus, sofern das PDF eine ordentliche Textebene hat. Verwendet ein PDF eine ungewöhnliche Schriftkonfiguration, entstehen beim Kopieren in jedem Programm unleserliche Zeichen; der übliche Ausweg ist, das PDF per OCR lesen zu lassen.