Скан договора, страница из книги или сфотографированная справка в PDF выглядят как обычный документ, но текст в них нельзя выделить, скопировать или найти через поиск — потому что это не текст, а картинка. Чтобы это исправить, нужно распознавание текста, или OCR.
Почему в сканах нет текста
PDF может хранить страницу двумя принципиально разными способами: как настоящий текст (символы с шрифтом и координатами) или как изображение — фотографию или скан страницы, упакованные в PDF-обёртку. Во втором случае для компьютера это просто картинка, даже если человеку она читается как обычный текст. Именно такие файлы и требуют OCR.
Как распознать текст в PDF онлайн
Инструмент OCR для PDF рендерит каждую страницу в изображение, а затем распознаёт текст движком Tesseract OCR на русском и английском языках. Загрузите файл, выберите формат результата и скачайте готовый файл — обработка идёт полностью на сервере.
Два формата результата
- TXT — чистый извлечённый текст без разметки и оформления. Подходит, если нужен только сам текст: скопировать, найти нужный фрагмент, обработать дальше.
- PDF с текстовым слоем — тот же документ, что и на входе, но с невидимым слоем распознанного текста поверх изображений страниц. Выглядит как оригинал, но текст можно выделять, копировать и искать через Ctrl+F — удобно, когда важно сохранить внешний вид документа.
От чего зависит качество распознавания
Точность OCR напрямую зависит от качества скана: чёткий, ровно отсканированный печатный текст распознаётся почти без ошибок. Смазанные, повёрнутые или сфотографированные под углом страницы дают больше ошибок. Рукописный текст распознаётся заметно хуже печатного — Tesseract OCR ориентирован в первую очередь на печать.
Итог
OCR превращает «немой» скан в документ с настоящим текстом — для копирования, поиска или дальнейшей обработки. Результат в TXT удобен для работы с самим текстом, а PDF с текстовым слоем сохраняет внешний вид оригинала, добавляя возможность искать и копировать.