TanodTools
RU

PDF в текст

Извлеките текст из PDF постранично, затем скопируйте его или сохраните в файл .txt. В отсканированном PDF нет текста, который можно извлечь: для таких файлов используйте инструмент «Распознавание текста в PDF (OCR)».

Ваши файлы никогда не покидают устройство

Перетащите сюда PDF

Или перетащите его в любое место этой страницы.

Открывается на этом устройстве. Ничего не загружается.

Один PDF за раз, до 200 МБ и до 500 страниц. Инструмент читает текст, сохранённый в самом PDF. Отсканированный PDF состоит лишь из картинок страниц и текста не содержит, поэтому для него нужен инструмент «Распознавание текста в PDF (OCR)». Таблицы и колонки выводятся строка за строкой. PDF, защищённые паролем, открыть нельзя.

Как извлечь текст из PDF

  1. Выберите файл PDF или перетащите его на страницу.
  2. Подождите немного, пока прочитается каждая страница. Выберите все страницы или диапазон, например 1-3, 5, и укажите, нужно ли отмечать начало каждой страницы.
  3. Нажмите Скачать .txt либо скопируйте весь текст или только одну страницу из списка.

Откуда берётся текст в PDF

PDF, созданный в текстовом редакторе, браузере или программе для дизайна, хранит слова в виде текста: каждый фрагмент записан вместе со шрифтом и положением на странице. Именно этот сохранённый текст и читает инструмент. Ваш браузер открывает файл с помощью pdf.js, запрашивает у каждой страницы её текст и собирает фрагменты в строки в том порядке, в каком они перечислены в файле. Как страница выглядит на экране, инструмент не учитывает.

Отсканированный PDF устроен иначе. Сканер или камера телефона создаёт картинку каждой страницы, и в PDF хранятся только эти картинки, поэтому читать нечего: вы видите слова, а в файле их нет. Превращение картинок обратно в текст — это другая задача, которая называется оптическим распознаванием символов; её выполняет инструмент «Распознавание текста в PDF (OCR)». Страницы без текста отмечены в списке под полем с текстом, чтобы в смешанном файле можно было отличить сканы от обычных страниц.

Результат — простой текст без форматирования. Строки заканчиваются там же, где и в PDF, а пустая строка добавляется там, где промежуток между двумя строками заметно больше обычного интервала на этой странице: так отделяются абзацы и заголовки. Лигатуры, которые некоторые шрифты используют для пар вроде fi и fl, снова превращаются в отдельные буквы, а невидимые мягкие переносы отбрасываются.

Советы

Вопросы и ответы

Загружается ли мой PDF?

Нет. Ваш браузер читает текст библиотекой pdf.js с открытым исходным кодом прямо на вашем устройстве. Ничего не отправляется на сервер, а когда вы закрываете вкладку, текст исчезает.

Почему текст не извлёкся или извлёкся только с некоторых страниц?

Инструмент читает текст, сохранённый в самом PDF. В отсканированном PDF каждая страница хранится как картинка, текста за ней нет, и читать нечего. То же касается отсканированных страниц, добавленных в обычный документ. Чтобы распознать буквы на картинках, воспользуйтесь инструментом «Распознавание текста в PDF (OCR)». Страницы без текста отмечены в списке по страницам.

Сохраняется ли форматирование?

Нет. Вы получаете простой текст: буквы, цифры и переносы строк. Шрифты, цвета, изображения и макет страницы не сохраняются. Строки переносятся там же, где в PDF, а пустая строка добавляется там, где промежуток между двумя строками больше обычного, например между абзацами.

Как склеить разорванные строки в абзацы?

Вставьте текст в «Удалить переносы строк». Этот инструмент склеивает строки внутри каждого абзаца, сохраняет пустые строки между абзацами и умеет восстанавливать слова, разделённые переносом в конце строки.

Почему часть текста идёт в странном порядке или разбита на непонятные куски?

Текст выводится в том порядке, в каком он хранится в PDF: обычно это порядок чтения, но не всегда. Таблицы, страницы с несколькими колонками и PDF, экспортированные из программ для дизайна, могут выйти перемешанными, а некоторые PDF хранят текст кусками, которые не совпадают с видимыми на странице словами.

Работает ли это с другими языками, не только с английским?

Да. Текст читается как Unicode, поэтому буквы с диакритическими знаками, кириллица, греческий, хинди, китайский и другие письменности извлекаются, если в PDF есть нормальный текстовый слой. Если в PDF необычно настроены шрифты, при копировании в любой программе получатся нечитаемые символы; обычно помогает распознавание текста (OCR).