Распознать текст в PDF
Добавьте к сканированному пдф текстовый слой: страница выглядит так же, но текст можно выделить, скопировать и найти поиском. Русский, казахский и английский.
Частые задачи с этим инструментом
Что такое OCR и что он делает с файлом
Отсканированный документ — это не текст, а фотография текста. Внутри PDF лежит картинка страницы, и для компьютера она ничем не отличается от снимка кошки: там нет ни слов, ни букв, только пиксели. Поэтому поиск по такому файлу ничего не находит, а выделить абзац мышью невозможно — выделять нечего.
OCR (optical character recognition, оптическое распознавание символов) читает эту картинку и составляет по ней текст. Мы не заменяем изображение: распознанные слова кладутся ПОД него невидимым слоем, буква к букве на свои места. Внешне страница не меняется ни на пиксель — те же пятна от копира, та же печать, тот же почерк на полях. Но теперь Ctrl+F находит слово, а мышь выделяет строку.
Важно понимать, чего OCR не делает: он не превращает скан в редактируемый документ. Отредактировать текст прямо на странице не получится — изображение по-прежнему главное, а текстовый слой лежит под ним для поиска и копирования. Если нужен именно редактируемый файл, распознайте документ здесь, а потом скопируйте текст или прогоните результат через «PDF в Word».
Как распознать текст в PDF
- Перетащите сканированный PDF в окно или нажмите, чтобы выбрать его на устройстве. Ограничения: до 20 страниц и до 30 МБ.
- Отметьте языки, которые есть в документе: русский, казахский, английский или их сочетание. Лишние языки лучше снять — они замедляют работу и добавляют ошибок.
- При необходимости включите «Исправить поворот страниц», если скан лежит боком, и «Выровнять перекос», если лист положили на стекло криво.
- Нажмите «Распознать текст». Файл уйдёт на наш сервер: замер на нашей машине — 21 секунда на двадцать страниц, то есть около секунды на лист. Плотный цветной скан идёт дольше.
- Скачайте результат и проверьте: откройте файл и попробуйте найти в нём слово через Ctrl+F. Инструмент сразу показывает, сколько символов удалось распознать.
Что делает инструмент
- Добавляет невидимый текстовый слой под изображение страницы — внешний вид документа не меняется.
- Распознаёт русский, казахский и английский, в том числе вместе в одном документе.
- Казахский язык поддержан по-настоящему: на сервере стоит казахская модель Tesseract, а не «кириллица вообще».
- Пропускает страницы, где текст уже есть, вместо того чтобы падать на них с ошибкой.
- По желанию разворачивает страницы, лежащие боком, и выравнивает перекос от кривого скана.
- Честно показывает, сколько символов распознано: ноль означает, что скан не читается, и мы говорим об этом прямо.
- Не пережимает изображения: результат остаётся обычным PDF без конвертации в PDF/A.
- Работает на ocrmypdf с движком Tesseract — том же, что стоит за большинством платных OCR-сервисов.
Когда это нужно
Договоры и акты из архива
Сканы за несколько лет, в которых нужно найти один пункт или одну сумму. После распознавания поиск работает по всему файлу.
Документы на казахском
Справки, выписки и госбумаги с қ, ғ, ң, ү, ұ, һ, ө, і. Казахская модель различает их, тогда как распознавание «русским» превращает их в похожие русские буквы.
Книги и методички
Отсканированное учебное пособие, по которому невозможно искать. С текстовым слоем цитата находится за секунду.
Фотографии документов с телефона
Собранные в PDF снимки паспорта, чека или анкеты. Качество распознавания зависит от того, насколько ровно и резко сняты страницы.
Подготовка к переносу в Word
Скан без текстового слоя в Word превращается в набор картинок. Сначала распознавание, потом конвертация — и текст будет на месте.
Требование сдать искомый PDF
Часть тендерных площадок и электронных архивов принимает только документы, по которым работает поиск.
От чего зависит качество распознавания
OCR не даёт стопроцентной точности ни у нас, ни у кого-либо ещё. Результат определяется тем, что вы загрузили, и вот честная шкала.
- 300 DPI, ровный скан с планшетного сканера — результат хороший: обычный печатный текст распознаётся почти без ошибок.
- 150 DPI — заметно хуже: путаются похожие символы, чаще всего «и/н», «п/л», «rn/m» и цифры 0/O, 1/l.
- Фотография со стола под углом, с тенью от руки или бликом — плохо. Буквы по краям снимка растянуты, и распознавание сыплется именно там.
- Рукописный текст не распознаётся вовсе. Tesseract обучен на печатных шрифтах, и почерк для него — шум.
- Печати, водяные знаки и линии таблиц поверх букв дают лишние символы: движок видит их как часть текста.
- Мелкий шрифт меньше 8 пунктов на низком разрешении почти всегда читается неправильно — тут поможет только пересканировать выше.
Что происходит с файлом
- Это серверный инструмент. В отличие от большинства инструментов сайта, файл покидает браузер: распознавание невозможно выполнить на устройстве пользователя, для него нужны движок Tesseract и языковые модели.
- Загруженный PDF записывается во временный файл на нашем сервере в Алматы, обрабатывается и удаляется сразу после того, как ответ отдан — включая случаи, когда обработка завершилась ошибкой или была прервана.
- Мы не храним ни исходный файл, ни результат, ни распознанный текст. Никакой базы документов, никаких отложенных задач очистки — файл живёт ровно столько, сколько идёт ваш запрос.
- Регистрация не нужна, файл ни с каким аккаунтом не связывается.
- Передача идёт только по HTTPS.
- Инструменты сайта, работающие целиком в браузере, помечены отдельно — там файл действительно не уходит никуда. Здесь уходит, и мы пишем это прямо.
Если что-то пошло не так
- Распознано ноль символов
- Движок не нашёл на страницах ничего, что счёл бы буквами. Чаще всего дело в разрешении или в том, что страница снята под углом. Пересканируйте на 300 DPI или переснимите сверху при ровном свете. Рукописный текст не распознаётся в принципе.
- Пишет, что в файле уже есть текстовый слой
- Значит документ уже искомый и OCR ему не нужен. Проверьте: откройте файл и нажмите Ctrl+F. Если поиск работает — всё в порядке, распознавать нечего.
- В файле больше 20 страниц
- Это наш предел, и он выведен из замера: двадцать страниц занимают 21 секунду при пике памяти 75 МБ, что оставляет четырёхкратный запас до нашего таймаута в 90 секунд. Стостраничный скан в этот запас уже не влезет и занял бы вместе с собой весь сервер. Разделите документ инструментом «Разделить PDF» и распознайте части по очереди.
- Казахские буквы превратились в русские
- Скорее всего, отмечен только русский язык. Включите казахский — модель специально обучена на қ, ғ, ң, ү, ұ, һ, ө, і. Если в документе оба языка, отметьте оба.
- Много ошибок в распознанном тексте
- Снимите лишние языки: каждый добавленный язык даёт движку больше вариантов и больше поводов ошибиться. Если это не помогло, дело в качестве скана — см. блок о разрешении выше.
- Сервер отвечает «занято»
- OCR — самая тяжёлая операция на сайте, поэтому мы выполняем её строго по одному документу за раз. Подождите минуту и повторите: очередь не копится, чтобы никто не ждал вслепую.
- Текст выделяется со сдвигом
- Так и есть: текстовый слой накладывается по координатам, найденным движком, и на кривом скане они смещаются. Скопированный текст при этом остаётся правильным.
- Файл защищён паролем
- Сначала снимите защиту в инструменте «Снять пароль». Зашифрованный PDF нельзя даже открыть на чтение, не расшифровав.
Частые вопросы
- Что такое OCR простыми словами?
- Это чтение текста с картинки. Скан — это фотография страницы, в которой для компьютера нет ни одной буквы. OCR распознаёт буквы и записывает их в файл невидимым слоем, чтобы работали поиск и копирование.
- Скан станет редактируемым?
- Нет. Изображение страницы остаётся главным, а текст ложится под него для поиска и копирования. Отредактировать слово прямо на странице не выйдет. Если нужен редактируемый документ, распознайте файл здесь, а потом конвертируйте его в Word.
- Поддерживается ли казахский язык?
- Да, и это редкость: на сервере установлена казахская модель Tesseract, а не общая кириллическая. Она различает қ, ғ, ң, ү, ұ, һ, ө, і. Языки можно комбинировать — например, казахский вместе с русским для документа на двух языках.
- Насколько точно распознавание?
- Зависит от скана, и обещать сто процентов было бы враньём. Ровный скан 300 DPI даёт хороший результат, 150 DPI — заметно хуже, фотография под углом — плохой. Рукописный текст не распознаётся вообще.
- Файл загружается на сервер?
- Да. Это серверный инструмент: распознавание требует движка Tesseract и языковых моделей, в браузере его выполнить нельзя. Файл пишется во временный файл, обрабатывается и удаляется сразу после ответа — в том числе если обработка сорвалась.
- Сколько страниц можно распознать за раз?
- До 20 страниц и до 30 МБ. Ограничение честное, а не маркетинговое: одна страница занимает 2–5 секунд процессорного времени, и без предела один большой файл занял бы сервер на минуты.
- Изменится ли внешний вид страниц?
- Нет, если не включать дополнительные опции. Текстовый слой невидим, изображение не пережимается. Опции «Исправить поворот» и «Выровнять перекос» вид меняют осознанно — первая разворачивает страницу, вторая перерисовывает изображение под правильным углом.
- Сколько времени занимает распознавание?
- 2–5 секунд на страницу, то есть документ на 20 страниц — около минуты. Дольше всего идут плотные страницы с мелким шрифтом и таблицами.
- Что будет со страницами, где текст уже есть?
- Они пропускаются без изменений. Смешанный документ — часть страниц текстовая, часть сканированная — обрабатывается нормально: распознаются только сканы.
Похожие инструменты
Читайте также
- PDF в Word: топ-5 способов конвертации в 2026
- Как сжать PDF без потери качества: полное руководство
- Как объединить PDF файлы онлайн без потери качества
- Электронная подпись PDF: правовая база в России и Казахстане
- Извлечение текста из PDF: OCR vs прямое извлечение
- Электронная подпись PDF онлайн
- PDF редактор онлайн: что можно без Acrobat
- Защита PDF паролем: как и зачем
- Все руководства →
Распознавание есть у всех крупных сервисов — сравнить условия помогает разбор лимитов iLovePDF.