Перейти к содержимому
pdftools.kz
Конвертация

Распознать текст в PDF

Добавьте к сканированному пдф текстовый слой: страница выглядит так же, но текст можно выделить, скопировать и найти поиском. Русский, казахский и английский.

Сервер · удаление сразудо 20 страниц и 30 МБбез регистрации

Частые задачи с этим инструментом

Что такое OCR и что он делает с файлом

Отсканированный документ — это не текст, а фотография текста. Внутри PDF лежит картинка страницы, и для компьютера она ничем не отличается от снимка кошки: там нет ни слов, ни букв, только пиксели. Поэтому поиск по такому файлу ничего не находит, а выделить абзац мышью невозможно — выделять нечего.

OCR (optical character recognition, оптическое распознавание символов) читает эту картинку и составляет по ней текст. Мы не заменяем изображение: распознанные слова кладутся ПОД него невидимым слоем, буква к букве на свои места. Внешне страница не меняется ни на пиксель — те же пятна от копира, та же печать, тот же почерк на полях. Но теперь Ctrl+F находит слово, а мышь выделяет строку.

Важно понимать, чего OCR не делает: он не превращает скан в редактируемый документ. Отредактировать текст прямо на странице не получится — изображение по-прежнему главное, а текстовый слой лежит под ним для поиска и копирования. Если нужен именно редактируемый файл, распознайте документ здесь, а потом скопируйте текст или прогоните результат через «PDF в Word».

Как распознать текст в PDF

  1. Перетащите сканированный PDF в окно или нажмите, чтобы выбрать его на устройстве. Ограничения: до 20 страниц и до 30 МБ.
  2. Отметьте языки, которые есть в документе: русский, казахский, английский или их сочетание. Лишние языки лучше снять — они замедляют работу и добавляют ошибок.
  3. При необходимости включите «Исправить поворот страниц», если скан лежит боком, и «Выровнять перекос», если лист положили на стекло криво.
  4. Нажмите «Распознать текст». Файл уйдёт на наш сервер: замер на нашей машине — 21 секунда на двадцать страниц, то есть около секунды на лист. Плотный цветной скан идёт дольше.
  5. Скачайте результат и проверьте: откройте файл и попробуйте найти в нём слово через Ctrl+F. Инструмент сразу показывает, сколько символов удалось распознать.

Что делает инструмент

  • Добавляет невидимый текстовый слой под изображение страницы — внешний вид документа не меняется.
  • Распознаёт русский, казахский и английский, в том числе вместе в одном документе.
  • Казахский язык поддержан по-настоящему: на сервере стоит казахская модель Tesseract, а не «кириллица вообще».
  • Пропускает страницы, где текст уже есть, вместо того чтобы падать на них с ошибкой.
  • По желанию разворачивает страницы, лежащие боком, и выравнивает перекос от кривого скана.
  • Честно показывает, сколько символов распознано: ноль означает, что скан не читается, и мы говорим об этом прямо.
  • Не пережимает изображения: результат остаётся обычным PDF без конвертации в PDF/A.
  • Работает на ocrmypdf с движком Tesseract — том же, что стоит за большинством платных OCR-сервисов.

Когда это нужно

Договоры и акты из архива

Сканы за несколько лет, в которых нужно найти один пункт или одну сумму. После распознавания поиск работает по всему файлу.

Документы на казахском

Справки, выписки и госбумаги с қ, ғ, ң, ү, ұ, һ, ө, і. Казахская модель различает их, тогда как распознавание «русским» превращает их в похожие русские буквы.

Книги и методички

Отсканированное учебное пособие, по которому невозможно искать. С текстовым слоем цитата находится за секунду.

Фотографии документов с телефона

Собранные в PDF снимки паспорта, чека или анкеты. Качество распознавания зависит от того, насколько ровно и резко сняты страницы.

Подготовка к переносу в Word

Скан без текстового слоя в Word превращается в набор картинок. Сначала распознавание, потом конвертация — и текст будет на месте.

Требование сдать искомый PDF

Часть тендерных площадок и электронных архивов принимает только документы, по которым работает поиск.

От чего зависит качество распознавания

OCR не даёт стопроцентной точности ни у нас, ни у кого-либо ещё. Результат определяется тем, что вы загрузили, и вот честная шкала.

  • 300 DPI, ровный скан с планшетного сканера — результат хороший: обычный печатный текст распознаётся почти без ошибок.
  • 150 DPI — заметно хуже: путаются похожие символы, чаще всего «и/н», «п/л», «rn/m» и цифры 0/O, 1/l.
  • Фотография со стола под углом, с тенью от руки или бликом — плохо. Буквы по краям снимка растянуты, и распознавание сыплется именно там.
  • Рукописный текст не распознаётся вовсе. Tesseract обучен на печатных шрифтах, и почерк для него — шум.
  • Печати, водяные знаки и линии таблиц поверх букв дают лишние символы: движок видит их как часть текста.
  • Мелкий шрифт меньше 8 пунктов на низком разрешении почти всегда читается неправильно — тут поможет только пересканировать выше.

Что происходит с файлом

  • Это серверный инструмент. В отличие от большинства инструментов сайта, файл покидает браузер: распознавание невозможно выполнить на устройстве пользователя, для него нужны движок Tesseract и языковые модели.
  • Загруженный PDF записывается во временный файл на нашем сервере в Алматы, обрабатывается и удаляется сразу после того, как ответ отдан — включая случаи, когда обработка завершилась ошибкой или была прервана.
  • Мы не храним ни исходный файл, ни результат, ни распознанный текст. Никакой базы документов, никаких отложенных задач очистки — файл живёт ровно столько, сколько идёт ваш запрос.
  • Регистрация не нужна, файл ни с каким аккаунтом не связывается.
  • Передача идёт только по HTTPS.
  • Инструменты сайта, работающие целиком в браузере, помечены отдельно — там файл действительно не уходит никуда. Здесь уходит, и мы пишем это прямо.

Если что-то пошло не так

Распознано ноль символов
Движок не нашёл на страницах ничего, что счёл бы буквами. Чаще всего дело в разрешении или в том, что страница снята под углом. Пересканируйте на 300 DPI или переснимите сверху при ровном свете. Рукописный текст не распознаётся в принципе.
Пишет, что в файле уже есть текстовый слой
Значит документ уже искомый и OCR ему не нужен. Проверьте: откройте файл и нажмите Ctrl+F. Если поиск работает — всё в порядке, распознавать нечего.
В файле больше 20 страниц
Это наш предел, и он выведен из замера: двадцать страниц занимают 21 секунду при пике памяти 75 МБ, что оставляет четырёхкратный запас до нашего таймаута в 90 секунд. Стостраничный скан в этот запас уже не влезет и занял бы вместе с собой весь сервер. Разделите документ инструментом «Разделить PDF» и распознайте части по очереди.
Казахские буквы превратились в русские
Скорее всего, отмечен только русский язык. Включите казахский — модель специально обучена на қ, ғ, ң, ү, ұ, һ, ө, і. Если в документе оба языка, отметьте оба.
Много ошибок в распознанном тексте
Снимите лишние языки: каждый добавленный язык даёт движку больше вариантов и больше поводов ошибиться. Если это не помогло, дело в качестве скана — см. блок о разрешении выше.
Сервер отвечает «занято»
OCR — самая тяжёлая операция на сайте, поэтому мы выполняем её строго по одному документу за раз. Подождите минуту и повторите: очередь не копится, чтобы никто не ждал вслепую.
Текст выделяется со сдвигом
Так и есть: текстовый слой накладывается по координатам, найденным движком, и на кривом скане они смещаются. Скопированный текст при этом остаётся правильным.
Файл защищён паролем
Сначала снимите защиту в инструменте «Снять пароль». Зашифрованный PDF нельзя даже открыть на чтение, не расшифровав.

Частые вопросы

Что такое OCR простыми словами?
Это чтение текста с картинки. Скан — это фотография страницы, в которой для компьютера нет ни одной буквы. OCR распознаёт буквы и записывает их в файл невидимым слоем, чтобы работали поиск и копирование.
Скан станет редактируемым?
Нет. Изображение страницы остаётся главным, а текст ложится под него для поиска и копирования. Отредактировать слово прямо на странице не выйдет. Если нужен редактируемый документ, распознайте файл здесь, а потом конвертируйте его в Word.
Поддерживается ли казахский язык?
Да, и это редкость: на сервере установлена казахская модель Tesseract, а не общая кириллическая. Она различает қ, ғ, ң, ү, ұ, һ, ө, і. Языки можно комбинировать — например, казахский вместе с русским для документа на двух языках.
Насколько точно распознавание?
Зависит от скана, и обещать сто процентов было бы враньём. Ровный скан 300 DPI даёт хороший результат, 150 DPI — заметно хуже, фотография под углом — плохой. Рукописный текст не распознаётся вообще.
Файл загружается на сервер?
Да. Это серверный инструмент: распознавание требует движка Tesseract и языковых моделей, в браузере его выполнить нельзя. Файл пишется во временный файл, обрабатывается и удаляется сразу после ответа — в том числе если обработка сорвалась.
Сколько страниц можно распознать за раз?
До 20 страниц и до 30 МБ. Ограничение честное, а не маркетинговое: одна страница занимает 2–5 секунд процессорного времени, и без предела один большой файл занял бы сервер на минуты.
Изменится ли внешний вид страниц?
Нет, если не включать дополнительные опции. Текстовый слой невидим, изображение не пережимается. Опции «Исправить поворот» и «Выровнять перекос» вид меняют осознанно — первая разворачивает страницу, вторая перерисовывает изображение под правильным углом.
Сколько времени занимает распознавание?
2–5 секунд на страницу, то есть документ на 20 страниц — около минуты. Дольше всего идут плотные страницы с мелким шрифтом и таблицами.
Что будет со страницами, где текст уже есть?
Они пропускаются без изменений. Смешанный документ — часть страниц текстовая, часть сканированная — обрабатывается нормально: распознаются только сканы.

Похожие инструменты

Читайте также

Распознавание есть у всех крупных сервисов — сравнить условия помогает разбор лимитов iLovePDF.