Перейти к содержимому
pdftools.kz
Конвертация

Как проверить качество распознавания

Проверять надо всегда: распознанный текст — это предположение движка, а не содержимое файла. Три проверки занимают пять минут. Первая: сколько символов вообще распознано — ноль означает, что слоя нет. Вторая: извлеките слой в TXT и прочитайте начало документа глазами. Третья: поищите в PDF контрольное слово с той страницы, которая выглядит хуже всех. Ошибки почти всегда сосредоточены там, где скан бледный или шрифт мелкий.

Локально в браузередо 1 ГБбез регистрации

Коротко о цифрах

Счётчик символов
возвращается число распознанных знаков
Ноль знаков
файл отдаётся, но текстового слоя в нём нет
Полная картина слоя
извлечение текста в TXT показывает его целиком
Самое дорогое место ошибки
цифры, фамилии и номера — их не поймать по смыслу
Признак проблемы с исходником
испорчено каждое второе-третье слово по всему документу

Три проверки по возрастанию усилий

  1. Посмотрите на число распознанных символов. Ноль — слоя нет, дальше проверять нечего, надо разбираться с исходником.
  2. Откройте PDF и поищите слово, которое хорошо видно на первой странице. Не нашлось — слой лёг не туда или не лёг вовсе.
  3. Извлеките текст в TXT: так вы увидите весь слой сразу, а не через прорезь поиска.
  4. Прочитайте первые два абзаца и сверьте их с картинкой. Ошибки распределены неравномерно, но их характер виден уже на этом объёме.
  5. Отдельно проверьте страницы, которые выглядят хуже остальных: бледные, с наклоном, с мелкими сносками.

Что проверять в первую очередь

  • Цифры: номера договоров, суммы, даты. Ошибка в цифре не бросается в глаза и не ловится по смыслу.
  • Фамилии и топонимы: у них нет словарного контекста, который подсказал бы движку правильный вариант.
  • Казахские буквы ә, ғ, қ, ң, ө, ұ, ү, һ, і — они промахиваются чаще прочих.
  • Границы страниц: последняя строка листа часто обрезана сканером и распознаётся хуже середины.
  • Колонтитулы и штампы: мелкий шрифт поверх линий даёт мусорные символы посреди осмысленного текста.

Как понять, стоит ли пересканировать

Оценка простая и не требует процентов. Если в первых двух абзацах ошибки единичные и заметны сразу — качество рабочее, документ пригоден и для поиска, и для чтения. Если каждое второе-третье слово испорчено, дело не в настройках распознавания, а в исходнике: он либо мельче трёхсот точек на дюйм, либо это копия с копии, либо снимок под углом.

Отдельный признак — равномерность. Ошибки, размазанные ровно по всему документу, указывают на общее качество скана. Ошибки, собранные на двух-трёх страницах, означают проблему именно с ними: перекос при подаче листа, тень от переплёта, замятый угол. В этом случае дешевле пересканировать эти страницы, а не весь документ.

Частые вопросы

Как понять, что распознано ноль символов?

Об этом сообщается отдельно: файл отдаётся, но помечается как оставшийся без текстового слоя. Проверить можно и вручную — извлечение текста из такого документа вернёт пустой результат ровно так же, как из исходного скана.

Сколько ошибок считается нормой?

Единичные опечатки на страницу — нормальный результат для чистого скана, и поиск с ними работает. Если испорчено каждое второе-третье слово, документ бесполезен, и надо возвращаться к исходнику, а не вычитывать текст.

Почему ошибки собрались на нескольких страницах, а на остальных их нет?

Обычно это дефект сканирования именно этих листов: перекос при подаче, тень от переплёта, замятый угол или бледная печать. Пересканируйте только их и распознайте отдельным файлом, целый документ трогать не нужно.

Можно ли доверять поиску как проверке?

Как быстрой — да, как единственной — нет. Поиск подтверждает, что слово распозналось верно, но молчит обо всём остальном тексте. Полную картину даёт только извлечение слоя в TXT и чтение глазами.

Рядом

Частые задачи с этим инструментом