Распознать текст в PDF (OCR) — онлайн
Распознайте текст в PDF (в том числе в отсканированных страницах) с помощью Tesseract OCR — на русском и английском.
Распознавание текста (OCR) в PDF нужно, когда документ — это набор картинок, а не текст: скан договора, страница из книги, сфотографированная справка. В таком PDF нельзя выделить и скопировать текст или найти его через поиск, потому что текстового слоя внутри файла просто нет.
Чтобы распознать текст в PDF, загрузите файл в окно выше, выберите формат результата и скачайте готовый файл. Каждая страница рендерится в изображение, затем распознаётся движком Tesseract OCR на русском и английском языках. Обработка идёт полностью на сервере, исходный файл удаляется сразу после конвертации.
Доступны два формата результата. TXT — это чистый извлечённый текст без разметки, удобный для копирования, поиска или дальнейшей обработки. PDF (с текстовым слоем) — это тот же документ, что и на входе, только с невидимым слоем распознанного текста поверх изображений страниц: выглядит как оригинал, но текст можно выделять, копировать и искать через Ctrl+F. Качество распознавания зависит от чёткости скана — рукописный текст, сильно смазанные или повёрнутые страницы распознаются хуже, чем чёткий печатный текст. Максимальный размер файла — 25 МБ.