Перейти к содержимому
pdftools.kz
Конвертация

Распознавание не нашло текст

Пустой результат — это не сбой без объяснения: распознанные символы считаются, и если их ноль, файл помечается как оставшийся без текстового слоя. Дальше нужно определить, какая из шести причин ваша. Мелкое разрешение, страница крупнее 25 мегапикселей, зашифрованный документ, рукописный оригинал, уже существующий текстовый слой и снимок под углом лечатся по-разному, а два случая из шести вообще не лечатся распознавателем.

Сервер · удаление сразудо 30 МБбез регистрации

Коротко о цифрах

Признак пустого результата
распознано ноль символов, слой не добавлен
Потолок размера страницы
25 Мпикс; A4 при 600 DPI — 34,8 Мпикс и пропускается
Потолок времени на страницу
30 секунд, дальше страница идёт без слоя
Зашифрованный файл
отклоняется до начала работы
Файл с готовым слоем
отвечаем, что распознавать в нём нечего

Шесть причин по убыванию частоты

  • Скан слишком мелкий. На 150 точках на дюйм высота буквы кегля 10 — около 21 пикселя, и тонкие штрихи сливаются; на 300 их вдвое больше.
  • Страница крупнее 25 мегапикселей пропускается целиком. Такое даёт съёмка на 600 DPI: A4 при этом разрешении — 34,8 мегапикселя.
  • Файл зашифрован — он отклоняется до начала работы, распознавать нечего, пока стоит пароль.
  • Оригинал рукописный. Движок обучен на печатных шрифтах, и на рукописи он не ошибается, а просто не находит букв.
  • Текстовый слой уже был — такие страницы пропускаются нетронутыми, и новых символов в файле не появляется.
  • Снимок сделан под углом или с бликом: буквы искажены перспективой, строки идут по дуге, контраст плавает по кадру.

Что делать по каждой причине

  1. Посмотрите на исходник в масштабе 100%: если буквы рассыпаются на отдельные точки, пересканируйте на 300 DPI.
  2. Слишком крупный скан уменьшите разрешением — 300 DPI достаточно, а 600 только съедает лимит.
  3. С зашифрованного файла снимите пароль и повторите обработку.
  4. Рукописный текст придётся набрать руками: распознавателя для него у нас нет.
  5. Проверьте, нет ли слоя уже: поиск по видимому слову ответит на это за секунду.
  6. Снимок телефона переснимите сверху, при равномерном свете, положив лист на однотонную поверхность.

Отдельно про частичный результат

Бывает, что текст нашёлся на большей части страниц, а несколько остались пустыми. На каждую страницу отведено 30 секунд: если распознаватель за это время не справился — например, страница плотная и очень шумная, — она остаётся в документе без слоя, а остальные обрабатываются как обычно. Это осознанное решение: одна тяжёлая страница не должна отнимать результат у девятнадцати остальных.

Второй источник частичного результата — смешанный документ. Там, где текст уже был, распознавание не работает по определению, и в итоговом файле поиск ведёт себя неоднородно: часть страниц ищется идеально, часть — с ошибками распознавания. Это нормально и не означает, что обработка прошла неудачно.

Частые вопросы

Файл скачался, но поиск по нему по-прежнему не работает. Значит, ничего не сделано?

Значит, распознано ноль символов, и об этом сообщается отдельно. Документ отдаётся вам в любом случае, но текстового слоя в нём нет — смотрите на разрешение исходника, это самая частая причина.

Почему крупный скан обрабатывается хуже мелкого?

Страница крупнее двадцати пяти мегапикселей пропускается целиком, потому что её растр не помещается в память сервера. Разрешение выше трёхсот точек на дюйм точности почти не добавляет, а лимит расходует полностью.

Распозналась половина страниц. Можно ли доделать остальные?

Выделите их в отдельный файл и отправьте повторно: на маленьком документе каждой странице достанется всё то же время, но без соседей, которые тянут общее ограничение в девяносто секунд.

Фотография документа с телефона подойдёт?

Подойдёт, если снимок сделан строго сверху, при ровном освещении и без бликов. Съёмка под углом искажает форму букв перспективой, а тень от руки сажает контраст ровно там, где движку нужны чёткие границы.

Рядом

Частые задачи с этим инструментом