Сделайте отсканированный PDF доступным для поиска (OCR)
Добавьте скрытый текстовый слой на отсканированные страницы, чтобы их текст можно было искать, выделять и копировать. Страницы выглядят точно так же.
Обрабатывается на нашем сервере, затем удаляется
Перетащите сюда отсканированный PDF
Или перетащите его в любое место этой страницы. До 10 МБ.
Отправляется на наш сервер только для этой задачи, затем удаляется. Никогда не хранится и не записывается в журналы.
Один PDF до 10 МБ, до 10 страниц за задачу, текст на английском. Обрабатывается на нашем сервере, затем удаляется. 10 бесплатных серверных задач в день на человека, общих для всех серверных инструментов. Для больших задач есть API распознавания текста в PDF (оплата за вызов).
Как сделать PDF доступным для поиска
- Выберите отсканированный PDF размером до 10 МБ или перетащите его на страницу.
- Укажите страницы для распознавания: все, если файл небольшой, или до 10 за раз.
- Нажмите Сделать доступным для поиска и скачайте PDF. Распознанный текст можно также скопировать или сохранить.
Что OCR делает со сканом PDF
Сканер или мобильное приложение сохраняет каждую страницу как картинку. Вы можете её прочитать, а компьютер нет: поиск ничего не находит, и скопировать предложение нельзя. Оптическое распознавание символов (OCR) просматривает картинку, находит буквы и слова и записывает их в PDF невидимым текстом, точно наложенным на видимые вами слова.
Наш сервер отображает каждую выбранную страницу с разрешением от 200 до 300 dpi, распознаёт её с помощью механизма Tesseract с открытым исходным кодом и накладывает текст поверх исходной страницы, не изменяя её. Распознанный текст показывается и здесь, так что его можно сразу скопировать.
Советы
- Для лучшей точности сканируйте с разрешением 300 dpi в чёрно-белом режиме или в оттенках серого.
- Страницы перевёрнуты или лежат на боку? Сначала поверните их в инструменте Повернуть PDF (в браузере).
- Вместо PDF у вас фото или снимок экрана? Воспользуйтесь инструментом Изображение в текст (OCR).
Вопросы и ответы
Загружается ли мой PDF?
Да. В отличие от большинства инструментов на этом сайте, этот работает на нашем сервере: ваш PDF отправляется по HTTPS, обрабатывается механизмом OCR, а копия с поиском сразу отправляется обратно в ваш браузер. Файл существует на сервере только пока выполняется задача, в памяти и во временной закрытой папке, которая удаляется в тот же момент, когда задача завершается. Мы не храним ни PDF, ни результат, ни распознанный текст и никогда не записываем содержимое файлов в журналы.
Что OCR меняет в моём PDF?
Ничего заметного. Каждую страницу читает механизм OCR с открытым исходным кодом Tesseract, а найденные слова накладываются на страницу невидимым текстом в нужных местах. Исходная страница остаётся под ним нетронутой, поэтому PDF выглядит так же, но в нём становится возможным поиск, выделение и копирование.
Почему только по 10 страниц за раз?
На распознавание страницы уходит несколько секунд серверного времени, а каждая задача должна уложиться примерно в минуту. Для более длинного документа запустите инструмент снова на скачанном файле и укажите следующие страницы, например 11-20. Уже обработанные страницы остаются как есть.
Какие языки поддерживаются?
Английский, а также другие языки, которые пишутся теми же латинскими буквами без диакритических знаков, но с меньшей точностью. Буквы с диакритикой и другие алфавиты пока распознаются ненадёжно.
На моих страницах уже есть текст. Что произойдёт?
Страницы, где уже есть текст, пропускаются, поэтому PDF, созданный текстовым редактором, остаётся как есть. Отметьте Распознавать страницы, где уже есть текст, чтобы всё равно распознать их, например если у скана плохой текстовый слой.
Насколько точное распознавание?
Чистые ровные сканы в обычном разрешении распознаются очень хорошо. Фото под углом, бледная или размытая печать, рукописный текст и сложные таблицы дают больше ошибок. Проверяйте имена и числа, прежде чем на них полагаться.
Есть ли ограничения?
Файлы до 10 МБ, до 10 страниц за задачу и 10 бесплатных серверных задач в день на человека, общих для всех наших серверных инструментов. Учитываются только успешные задачи, а счётчик сбрасывается в полночь по UTC. Для больших задач есть API распознавания текста в PDF с оплатой за вызов.
Что такое проверка, что вы не робот?
Перед запуском задачи Cloudflare Turnstile проверяет, что инструментом пользуется человек, а не бот. Обычно она незаметна; иногда просит поставить галочку.