Что такое OCR
OCR — распознавание символов: программа смотрит на картинку, находит на ней формы букв и записывает их как текст. Он нужен ровно там, где текста в файле нет — то есть скану. Документ, напечатанный в PDF из Word или 1С, уже содержит символы, и распознавать в нём нечего. Наши инструменты OCR не выполняют: извлечение текста читает готовый слой и прямо сообщает, если слоя в документе нет.
Коротко о цифрах
- OCR у нас нет
- инструмент извлечения читает готовый слой и сообщает, если его нет
- Как проверяется документ
- выборка из первой, средней и последней страницы
- Критерий
- считаются непустые текстовые элементы, пустые строки в счёт не идут
- Работает со сканом
- сжатие, обрезка, поворот, объединение, разделение, экспорт в JPG
- Не работает со сканом
- поиск, извлечение текста, редактирование, конвертация в текстовый DOCX
Текстовый слой и распознавание — не одно и то же
Текстовый слой — это символы, записанные в файле кодами, вместе с координатами и ссылкой на шрифт. Он появляется при печати документа в PDF и никуда не девается: поиск по такому файлу работает мгновенно, потому что искать надо в тексте, а не в пикселях. Распознавание же — обратная задача: восстановить символы по картинке, и оно всегда приблизительно, потому что зависит от качества скана, языка и шрифта.
Бывает и промежуточный случай — гибридный файл, где картинка страницы лежит сверху, а под ней невидимым слоем прошит результат распознавания. Такой документ выглядит как скан, но по нему ищется текст. Обычно он получается из сканеров и МФУ с включённым распознаванием.
Как понять, нужен ли распознаватель
- Откройте документ в просмотрщике и попробуйте выделить абзац мышью. Выделяется — текстовый слой есть.
- Если выделение ведёт себя как рамка поверх картинки, извлеките текст: пустой результат подтверждает, что перед вами скан.
- Наш редактор проверяет то же самое автоматически: берёт первую, среднюю и последнюю страницы и считает на них непустые текстовые элементы.
- Если элементов нет, инструмент говорит прямо: текстового слоя нет, распознавание не поддерживается — вместо того чтобы отдать пустой файл и промолчать.
Что можно сделать со сканом без OCR
- Сжать до нужного размера, обрезать поля, повернуть страницы, объединить или разделить подшивку, разложить несколько страниц на лист.
- Экспортировать страницы в JPG или PNG и работать с ними как с изображениями.
- Подписать визуальной подписью или поставить водяной знак — это рисование поверх, тексту оно не мешает.
- Чего сделать нельзя: найти слово, извлечь абзац, отредактировать текст, получить корректный DOCX с текстом вместо картинок.
Частые вопросы
Почему при извлечении текста получился пустой файл?
Значит, в документе нет текстового слоя: страницы — это изображения. Извлекать нечего, и инструмент говорит об этом прямо, а не отдаёт пустой результат с зелёной галочкой об успехе.
Можно ли сделать скан доступным для поиска на вашем сайте?
Нет, распознавания у нас нет. Для этого нужен отдельный инструмент с OCR: результат он вшивает в файл невидимым слоем поверх исходной картинки, и после этого поиск начинает работать.
Почему в моём скане текст всё-таки находится?
Скорее всего, сканер или МФУ распознали страницу при съёмке и вшили результат невидимым слоем под изображение. Внешне это скан, но текстовый слой в нём уже есть.
Насколько точно распознавание в принципе?
Зависит от исходника: чистый печатный текст на 300 точках на дюйм распознаётся почти без ошибок, а мятая копия, рукописный текст или мелкий шрифт на сером фоне дают промахи, которые придётся вычитывать.