Как проверить качество распознавания
Проверять надо всегда: распознанный текст — это предположение движка, а не содержимое файла. Три проверки занимают пять минут. Первая: сколько символов вообще распознано — ноль означает, что слоя нет. Вторая: извлеките слой в TXT и прочитайте начало документа глазами. Третья: поищите в PDF контрольное слово с той страницы, которая выглядит хуже всех. Ошибки почти всегда сосредоточены там, где скан бледный или шрифт мелкий.
Коротко о цифрах
- Счётчик символов
- возвращается число распознанных знаков
- Ноль знаков
- файл отдаётся, но текстового слоя в нём нет
- Полная картина слоя
- извлечение текста в TXT показывает его целиком
- Самое дорогое место ошибки
- цифры, фамилии и номера — их не поймать по смыслу
- Признак проблемы с исходником
- испорчено каждое второе-третье слово по всему документу
Три проверки по возрастанию усилий
- Посмотрите на число распознанных символов. Ноль — слоя нет, дальше проверять нечего, надо разбираться с исходником.
- Откройте PDF и поищите слово, которое хорошо видно на первой странице. Не нашлось — слой лёг не туда или не лёг вовсе.
- Извлеките текст в TXT: так вы увидите весь слой сразу, а не через прорезь поиска.
- Прочитайте первые два абзаца и сверьте их с картинкой. Ошибки распределены неравномерно, но их характер виден уже на этом объёме.
- Отдельно проверьте страницы, которые выглядят хуже остальных: бледные, с наклоном, с мелкими сносками.
Что проверять в первую очередь
- Цифры: номера договоров, суммы, даты. Ошибка в цифре не бросается в глаза и не ловится по смыслу.
- Фамилии и топонимы: у них нет словарного контекста, который подсказал бы движку правильный вариант.
- Казахские буквы ә, ғ, қ, ң, ө, ұ, ү, һ, і — они промахиваются чаще прочих.
- Границы страниц: последняя строка листа часто обрезана сканером и распознаётся хуже середины.
- Колонтитулы и штампы: мелкий шрифт поверх линий даёт мусорные символы посреди осмысленного текста.
Как понять, стоит ли пересканировать
Оценка простая и не требует процентов. Если в первых двух абзацах ошибки единичные и заметны сразу — качество рабочее, документ пригоден и для поиска, и для чтения. Если каждое второе-третье слово испорчено, дело не в настройках распознавания, а в исходнике: он либо мельче трёхсот точек на дюйм, либо это копия с копии, либо снимок под углом.
Отдельный признак — равномерность. Ошибки, размазанные ровно по всему документу, указывают на общее качество скана. Ошибки, собранные на двух-трёх страницах, означают проблему именно с ними: перекос при подаче листа, тень от переплёта, замятый угол. В этом случае дешевле пересканировать эти страницы, а не весь документ.
Частые вопросы
Как понять, что распознано ноль символов?
Об этом сообщается отдельно: файл отдаётся, но помечается как оставшийся без текстового слоя. Проверить можно и вручную — извлечение текста из такого документа вернёт пустой результат ровно так же, как из исходного скана.
Сколько ошибок считается нормой?
Единичные опечатки на страницу — нормальный результат для чистого скана, и поиск с ними работает. Если испорчено каждое второе-третье слово, документ бесполезен, и надо возвращаться к исходнику, а не вычитывать текст.
Почему ошибки собрались на нескольких страницах, а на остальных их нет?
Обычно это дефект сканирования именно этих листов: перекос при подаче, тень от переплёта, замятый угол или бледная печать. Пересканируйте только их и распознайте отдельным файлом, целый документ трогать не нужно.
Можно ли доверять поиску как проверке?
Как быстрой — да, как единственной — нет. Поиск подтверждает, что слово распозналось верно, но молчит обо всём остальном тексте. Полную картину даёт только извлечение слоя в TXT и чтение глазами.