PDF в текст
Извлеките текст из PDF постранично, затем скопируйте его или сохраните в файл .txt. В отсканированном PDF нет текста, который можно извлечь: для таких файлов используйте инструмент «Распознавание текста в PDF (OCR)».
Ваши файлы никогда не покидают устройство
Перетащите сюда PDF
Или перетащите его в любое место этой страницы.
Открывается на этом устройстве. Ничего не загружается.
- Страницы
- 0
- С текстом
- 0
- Слова
- 0
- Символы
- 0
По страницам
| Страница | Слова | Символы | Копировать |
|---|
Один PDF за раз, до 200 МБ и до 500 страниц. Инструмент читает текст, сохранённый в самом PDF. Отсканированный PDF состоит лишь из картинок страниц и текста не содержит, поэтому для него нужен инструмент «Распознавание текста в PDF (OCR)». Таблицы и колонки выводятся строка за строкой. PDF, защищённые паролем, открыть нельзя.
Как извлечь текст из PDF
- Выберите файл PDF или перетащите его на страницу.
- Подождите немного, пока прочитается каждая страница. Выберите все страницы или диапазон, например 1-3, 5, и укажите, нужно ли отмечать начало каждой страницы.
- Нажмите Скачать .txt либо скопируйте весь текст или только одну страницу из списка.
Откуда берётся текст в PDF
PDF, созданный в текстовом редакторе, браузере или программе для дизайна, хранит слова в виде текста: каждый фрагмент записан вместе со шрифтом и положением на странице. Именно этот сохранённый текст и читает инструмент. Ваш браузер открывает файл с помощью pdf.js, запрашивает у каждой страницы её текст и собирает фрагменты в строки в том порядке, в каком они перечислены в файле. Как страница выглядит на экране, инструмент не учитывает.
Отсканированный PDF устроен иначе. Сканер или камера телефона создаёт картинку каждой страницы, и в PDF хранятся только эти картинки, поэтому читать нечего: вы видите слова, а в файле их нет. Превращение картинок обратно в текст — это другая задача, которая называется оптическим распознаванием символов; её выполняет инструмент «Распознавание текста в PDF (OCR)». Страницы без текста отмечены в списке под полем с текстом, чтобы в смешанном файле можно было отличить сканы от обычных страниц.
Результат — простой текст без форматирования. Строки заканчиваются там же, где и в PDF, а пустая строка добавляется там, где промежуток между двумя строками заметно больше обычного интервала на этой странице: так отделяются абзацы и заголовки. Лигатуры, которые некоторые шрифты используют для пар вроде fi и fl, снова превращаются в отдельные буквы, а невидимые мягкие переносы отбрасываются.
Советы
- Отсканированные страницы отображаются как страницы без текста. Обработайте их в инструменте «Распознавание текста в PDF (OCR)» и прочитайте результат.
- Вставьте текст в «Удалить переносы строк», чтобы превратить стопку коротких строк в связные абзацы.
- Нужны только некоторые страницы, но в виде PDF? Их вырежет «Извлечь страницы из PDF», а «Подсчёт слов» посчитает то, что вы скопировали.
Вопросы и ответы
Загружается ли мой PDF?
Нет. Ваш браузер читает текст библиотекой pdf.js с открытым исходным кодом прямо на вашем устройстве. Ничего не отправляется на сервер, а когда вы закрываете вкладку, текст исчезает.
Почему текст не извлёкся или извлёкся только с некоторых страниц?
Инструмент читает текст, сохранённый в самом PDF. В отсканированном PDF каждая страница хранится как картинка, текста за ней нет, и читать нечего. То же касается отсканированных страниц, добавленных в обычный документ. Чтобы распознать буквы на картинках, воспользуйтесь инструментом «Распознавание текста в PDF (OCR)». Страницы без текста отмечены в списке по страницам.
Сохраняется ли форматирование?
Нет. Вы получаете простой текст: буквы, цифры и переносы строк. Шрифты, цвета, изображения и макет страницы не сохраняются. Строки переносятся там же, где в PDF, а пустая строка добавляется там, где промежуток между двумя строками больше обычного, например между абзацами.
Как склеить разорванные строки в абзацы?
Вставьте текст в «Удалить переносы строк». Этот инструмент склеивает строки внутри каждого абзаца, сохраняет пустые строки между абзацами и умеет восстанавливать слова, разделённые переносом в конце строки.
Почему часть текста идёт в странном порядке или разбита на непонятные куски?
Текст выводится в том порядке, в каком он хранится в PDF: обычно это порядок чтения, но не всегда. Таблицы, страницы с несколькими колонками и PDF, экспортированные из программ для дизайна, могут выйти перемешанными, а некоторые PDF хранят текст кусками, которые не совпадают с видимыми на странице словами.
Работает ли это с другими языками, не только с английским?
Да. Текст читается как Unicode, поэтому буквы с диакритическими знаками, кириллица, греческий, хинди, китайский и другие письменности извлекаются, если в PDF есть нормальный текстовый слой. Если в PDF необычно настроены шрифты, при копировании в любой программе получатся нечитаемые символы; обычно помогает распознавание текста (OCR).