Перейти к содержимому
pdftools.kz

Что такое OCR

OCR — распознавание символов: программа смотрит на картинку, находит на ней формы букв и записывает их как текст. Он нужен ровно там, где текста в файле нет — то есть скану. Документ, напечатанный в PDF из Word или 1С, уже содержит символы, и распознавать в нём нечего. Наши инструменты OCR не выполняют: извлечение текста читает готовый слой и прямо сообщает, если слоя в документе нет.

Локально в браузеребез регистрации

Коротко о цифрах

OCR у нас нет
инструмент извлечения читает готовый слой и сообщает, если его нет
Как проверяется документ
выборка из первой, средней и последней страницы
Критерий
считаются непустые текстовые элементы, пустые строки в счёт не идут
Работает со сканом
сжатие, обрезка, поворот, объединение, разделение, экспорт в JPG
Не работает со сканом
поиск, извлечение текста, редактирование, конвертация в текстовый DOCX

Текстовый слой и распознавание — не одно и то же

Текстовый слой — это символы, записанные в файле кодами, вместе с координатами и ссылкой на шрифт. Он появляется при печати документа в PDF и никуда не девается: поиск по такому файлу работает мгновенно, потому что искать надо в тексте, а не в пикселях. Распознавание же — обратная задача: восстановить символы по картинке, и оно всегда приблизительно, потому что зависит от качества скана, языка и шрифта.

Бывает и промежуточный случай — гибридный файл, где картинка страницы лежит сверху, а под ней невидимым слоем прошит результат распознавания. Такой документ выглядит как скан, но по нему ищется текст. Обычно он получается из сканеров и МФУ с включённым распознаванием.

Как понять, нужен ли распознаватель

  1. Откройте документ в просмотрщике и попробуйте выделить абзац мышью. Выделяется — текстовый слой есть.
  2. Если выделение ведёт себя как рамка поверх картинки, извлеките текст: пустой результат подтверждает, что перед вами скан.
  3. Наш редактор проверяет то же самое автоматически: берёт первую, среднюю и последнюю страницы и считает на них непустые текстовые элементы.
  4. Если элементов нет, инструмент говорит прямо: текстового слоя нет, распознавание не поддерживается — вместо того чтобы отдать пустой файл и промолчать.

Что можно сделать со сканом без OCR

  • Сжать до нужного размера, обрезать поля, повернуть страницы, объединить или разделить подшивку, разложить несколько страниц на лист.
  • Экспортировать страницы в JPG или PNG и работать с ними как с изображениями.
  • Подписать визуальной подписью или поставить водяной знак — это рисование поверх, тексту оно не мешает.
  • Чего сделать нельзя: найти слово, извлечь абзац, отредактировать текст, получить корректный DOCX с текстом вместо картинок.

Частые вопросы

Почему при извлечении текста получился пустой файл?

Значит, в документе нет текстового слоя: страницы — это изображения. Извлекать нечего, и инструмент говорит об этом прямо, а не отдаёт пустой результат с зелёной галочкой об успехе.

Можно ли сделать скан доступным для поиска на вашем сайте?

Нет, распознавания у нас нет. Для этого нужен отдельный инструмент с OCR: результат он вшивает в файл невидимым слоем поверх исходной картинки, и после этого поиск начинает работать.

Почему в моём скане текст всё-таки находится?

Скорее всего, сканер или МФУ распознали страницу при съёмке и вшили результат невидимым слоем под изображение. Внешне это скан, но текстовый слой в нём уже есть.

Насколько точно распознавание в принципе?

Зависит от исходника: чистый печатный текст на 300 точках на дюйм распознаётся почти без ошибок, а мятая копия, рукописный текст или мелкий шрифт на сером фоне дают промахи, которые придётся вычитывать.

Рядом