PDF na tekst
Wyciągnij tekst z pliku PDF strona po stronie, a potem skopiuj go albo zapisz jako plik .txt. Zeskanowany PDF nie ma tekstu do wydobycia: w takim przypadku użyj narzędzia OCR dla PDF.
Twoje pliki nigdy nie opuszczają Twojego urządzenia
Upuść plik PDF tutaj
Lub przeciągnij go w dowolne miejsce na tej stronie.
Otwierane na tym urządzeniu. Nic nie jest przesyłane.
- Strony
- 0
- Z tekstem
- 0
- Słowa
- 0
- Znaki
- 0
Strona po stronie
| Strona | Słowa | Znaki | Kopiuj |
|---|
Jeden plik PDF naraz, do 200 MB i do 500 stron. Narzędzie odczytuje tekst zapisany w pliku PDF. Zeskanowany PDF to same obrazy stron i takiego tekstu nie zawiera, więc w jego przypadku trzeba zamiast tego użyć narzędzia OCR dla PDF. Tabele i kolumny są zapisywane wiersz po wierszu, a plików PDF chronionych hasłem nie można otworzyć.
Jak wyodrębnić tekst z pliku PDF
- Wybierz plik PDF albo przeciągnij go na stronę.
- Poczekaj chwilę, aż każda strona zostanie odczytana. Wybierz wszystkie strony albo zakres, na przykład 1-3, 5, i zdecyduj, czy oznaczać początek każdej strony.
- Naciśnij Pobierz .txt, skopiuj cały tekst albo skopiuj jedną stronę z listy.
Skąd bierze się tekst w pliku PDF
PDF wygenerowany przez edytor tekstu, przeglądarkę lub program do projektowania zapisuje słowa jako tekst: każdy ciąg liter ma przypisaną czcionkę i położenie na stronie. Właśnie ten zapisany tekst odczytuje to narzędzie. Przeglądarka otwiera plik za pomocą pdf.js, pobiera tekst z każdej strony i składa te ciągi liter z powrotem w wiersze, w kolejności, w jakiej wymienia je plik. Nigdy nie sprawdza, jak strona wygląda na ekranie.
Zeskanowany PDF to coś innego. Skaner lub aparat w telefonie tworzy obraz każdej strony, a plik PDF zawiera tylko te obrazy, więc nie ma tekstu do odczytania: widzisz słowa, ale plik ich nie zawiera. Zamiana obrazów z powrotem na tekst to osobne zadanie, zwane optycznym rozpoznawaniem znaków, które wykonuje narzędzie OCR dla PDF. Strony bez tekstu są oznaczone na liście pod polem tekstowym, dzięki czemu w pliku zawierającym zarówno skany, jak i zwykłe strony łatwo je odróżnić.
Wynikiem jest zwykły tekst bez formatowania. Wiersze kończą się tam, gdzie kończą się w pliku PDF, a pusty wiersz jest dodawany tam, gdzie odstęp między dwoma wierszami jest wyraźnie większy niż zwykły odstęp na danej stronie; w ten sposób oddziela się akapity i nagłówki. Ligatury, których niektóre czcionki używają dla par liter, takich jak fi i fl, są zamieniane z powrotem na osobne litery, a niewidoczne miękkie łączniki są pomijane.
Wskazówki
- Zeskanowane strony pojawią się jako strony bez tekstu. Przepuść je przez narzędzie OCR dla PDF i odczytaj wynik.
- Wklej tekst do narzędzia Usuń podziały wierszy, aby zamienić wiersze ułożone jeden pod drugim w płynące akapity.
- Potrzebujesz tylko niektórych stron jako PDF? Narzędzie Wyodrębnij strony z PDF je wytnie, a Licznik słów policzy skopiowany tekst.
Najczęstsze pytania
Czy mój plik PDF jest przesyłany?
Nie. Przeglądarka odczytuje tekst na Twoim urządzeniu, za pomocą biblioteki pdf.js o otwartym kodzie źródłowym. Nic nie jest wysyłane na serwer, a tekst znika po zamknięciu karty.
Dlaczego wynik jest pusty albo zawiera tekst tylko z niektórych stron?
Narzędzie odczytuje tekst zapisany w pliku PDF. Zeskanowany PDF przechowuje każdą stronę jako obraz, za którym nie ma żadnego tekstu, więc nie ma czego odczytać. To samo dotyczy zeskanowanych stron dodanych do dokumentu, który poza tym jest zwykły. Użyj narzędzia OCR dla PDF, aby rozpoznać litery na obrazach. Strony bez tekstu są oznaczone na liście strona po stronie.
Czy formatowanie jest zachowywane?
Nie. Dostajesz zwykły tekst: litery, cyfry i podziały wierszy. Czcionki, kolory, obrazy i układ strony są pomijane. Wiersze łamią się tam, gdzie łamią się w pliku PDF, a pusty wiersz pojawia się tam, gdzie odstęp między dwoma wierszami jest większy niż zwykle, na przykład między akapitami.
Jak połączyć połamane wiersze w akapity?
Wklej tekst do narzędzia Usuń podziały wierszy. Łączy ono wiersze wewnątrz każdego akapitu, zachowuje puste wiersze między akapitami i potrafi naprawić wyrazy podzielone myślnikiem na końcu wiersza.
Dlaczego część tekstu jest w dziwnej kolejności albo pocięta na dziwne fragmenty?
Tekst jest podawany w kolejności, w jakiej zapisano go w pliku PDF. Zwykle jest to kolejność czytania, ale nie zawsze. Tabele, strony z kilkoma kolumnami i pliki PDF wyeksportowane z programów do projektowania graficznego mogą wyjść pomieszane, a niektóre pliki PDF zapisują tekst we fragmentach, które nie pasują do widocznych słów.
Czy działa z innymi językami niż angielski?
Tak. Tekst jest odczytywany jako Unicode, więc litery z ogonkami i akcentami, cyrylica, alfabet grecki, hindi, znaki chińskie i inne pisma trafiają do wyniku, o ile plik PDF ma prawidłową warstwę tekstową. Jeśli PDF używa nietypowej konfiguracji czcionek, kopiowanie w dowolnym programie daje nieczytelne znaki; zwykle pomaga przepuszczenie takiego pliku przez OCR.