Как исправить ошибки после OCR
Первое, что нужно принять: ошибки распознавания сидят в невидимом слое под изображением, а само изображение остаётся нетронутым. Поэтому любая правка слоя изменит то, что находит поиск, но не то, что вы видите на странице — картинка не редактируется в принципе. Отсюда три рабочих пути: пересканировать и распознать заново, вычитать извлечённый текст отдельным файлом или принять ошибки, если поиск и так попадает.
Коротко о цифрах
- Где живут ошибки
- в невидимом слое под изображением страницы
- Что меняет правка слоя
- результаты поиска, но не картинку страницы
- Самый дешёвый путь
- пересканировать на 300 DPI и распознать заново
- Где вычитывать
- в TXT после извлечения текста, а не в самом PDF
- Что не чинится вообще
- рукописный фрагмент и страница без слоя — там распознавания не было
Три пути и когда какой выбирать
- Пересканировать оригинал на 300 DPI и распознать заново. Самый дешёвый путь, если оригинал под рукой: одна операция вместо часа вычитки.
- Извлечь текст в TXT и вычитать его в текстовом редакторе. Годится, когда нужен именно текст — для пересылки, цитирования или переноса в другой документ.
- Оставить как есть. Если ошибки единичные и поиск по фамилиям и номерам срабатывает, документ уже выполняет свою задачу.
- Тупиковый путь: пытаться править картинку страницы. Видимая часть — растр, отдельных букв в нём нет, и текстовый редактор их там не найдёт.
Порядок вычитки, если текст всё-таки нужен
- Извлеките текст распознанного PDF в TXT — слой выгрузится целиком, вместе с переносами строк.
- Прочитайте документ подряд, держа рядом исходный PDF для сверки сомнительных мест.
- Начните с цифр и имён собственных: там ошибка дороже всего и её не поймать по смыслу.
- Отдельно проверьте казахские буквы ә, ғ, қ, ң, ө, ұ, ү, һ, і — они промахиваются чаще прочих.
- Сохраните вычитанный текст отдельным файлом: он и будет надёжной версией, а PDF останется как образ оригинала.
Что исправить нельзя
Не исправляется то, чего не было. Страница, распознавание которой не уложилось в отведённые тридцать секунд, и страница крупнее двадцати пяти мегапикселей остаются в документе вообще без текстового слоя. Править там нечего: нужно уменьшить разрешение или разделить документ и распознать проблемные листы отдельно.
Не исправляется рукописный фрагмент. Он не распознан не из-за ошибки в настройках, а потому что подходящей модели нет вовсе, и вычитка тут не поможет — текст придётся набрать. То же с подписями и печатями: это графика, и текстом она не станет ни при каких условиях.
Частые вопросы
Почему нельзя просто исправить букву прямо на странице?
Потому что видимая страница — это изображение, а не текст. Буква в нём состоит из пикселей и не является отдельным объектом, поэтому текстовый редактор её не найдёт и заменить не сможет, сколько ни выделяй.
Если исправить невидимый слой, изменится ли вид документа?
Нет, и это главное свойство такого файла. Слой прозрачный и лежит под картинкой: правка в нём повлияет на поиск, копирование и извлечение текста, но страница на экране останется точно такой же, как была.
Что быстрее — вычитать текст или пересканировать документ?
Почти всегда пересканировать, если оригинал доступен. Скан на трёхстах точках на дюйм и повторное распознавание занимают минуты, а вычитка десяти страниц с плотным текстом — час внимательной работы.
Можно ли исправить только несколько страниц?
Да, и это разумный подход. Выделите проблемные листы в отдельный файл, пересканируйте их и распознайте заново, а затем объедините с остальным документом — трогать удавшиеся страницы незачем.