Главная Блог Как распознать текст в отсканированном PDF (OCR)

Как распознать текст в отсканированном PDF (OCR)

По теме статьи: Распознать текст в PDF (OCR) — онлайнОткрыть конвертер →

Скан договора, страница из книги или сфотографированная справка в PDF выглядят как обычный документ, но текст в них нельзя выделить, скопировать или найти через поиск — потому что это не текст, а картинка. Чтобы это исправить, нужно распознавание текста, или OCR.

Почему в сканах нет текста

PDF может хранить страницу двумя принципиально разными способами: как настоящий текст (символы с шрифтом и координатами) или как изображение — фотографию или скан страницы, упакованные в PDF-обёртку. Во втором случае для компьютера это просто картинка, даже если человеку она читается как обычный текст. Именно такие файлы и требуют OCR.

Как распознать текст в PDF онлайн

Инструмент OCR для PDF рендерит каждую страницу в изображение, а затем распознаёт текст движком Tesseract OCR на русском и английском языках. Загрузите файл, выберите формат результата и скачайте готовый файл — обработка идёт полностью на сервере.

Два формата результата

  • TXT — чистый извлечённый текст без разметки и оформления. Подходит, если нужен только сам текст: скопировать, найти нужный фрагмент, обработать дальше.
  • PDF с текстовым слоем — тот же документ, что и на входе, но с невидимым слоем распознанного текста поверх изображений страниц. Выглядит как оригинал, но текст можно выделять, копировать и искать через Ctrl+F — удобно, когда важно сохранить внешний вид документа.

От чего зависит качество распознавания

Точность OCR напрямую зависит от качества скана: чёткий, ровно отсканированный печатный текст распознаётся почти без ошибок. Смазанные, повёрнутые или сфотографированные под углом страницы дают больше ошибок. Рукописный текст распознаётся заметно хуже печатного — Tesseract OCR ориентирован в первую очередь на печать.

Итог

OCR превращает «немой» скан в документ с настоящим текстом — для копирования, поиска или дальнейшей обработки. Результат в TXT удобен для работы с самим текстом, а PDF с текстовым слоем сохраняет внешний вид оригинала, добавляя возможность искать и копировать.

← Все статьи