Документы на казахском языке в PDF: почему не ищется и не копируется
Причин ровно три, и они лечатся по-разному. Первая: текста в файле нет вовсе — это скан, картинка страницы, и искать в ней нечего. Вторая: текст есть, но у шрифта нет таблицы соответствия символам, поэтому копирование возвращает набор чужих букв. Третья: документ сделан в доюникодном шрифте, где казахские буквы сидели на позициях латиницы. Определить свою причину можно за минуту.
Коротко о цифрах
- Извлечение текста
- целиком в браузере, пустой результат означает скан
- Языки распознавания
- русский, казахский, английский — по отдельности или вместе
- Потолок распознавания
- 20 страниц и 30 МБ на один файл
- Признак битого шрифта
- на экране текст читается, а в буфер обмена приходит другой набор символов
- Чего не чиним
- таблицу соответствия в чужом файле — её восстанавливают только распознаванием
Как отличить одну причину от другой
- Попробуйте выделить строку мышью. Выделяется целыми прямоугольниками страницы, а не по буквам — перед вами скан.
- Скопируйте выделенное в любой текстовый редактор. Пришли те же слова — с текстовым слоем всё в порядке.
- Пришла латиница или бессмысленные символы вместо ә, ғ, қ, ң, ө, ұ, ү, һ, і — виноват шрифт и его таблица соответствия.
- Поиск не находит слово, которое вы видите на экране, хотя копирование работает — проверьте раскладку и то, какими символами набрано слово в файле.
- Прогоните файл через извлечение текста: пустой результат подтверждает скан, мусор подтверждает проблему со шрифтом.
Что делать в каждом случае
Скан лечится распознаванием: текстовый слой добавляется поверх изображения, после чего документ ищется и копируется. Казахский язык распознавания поддержан наравне с русским и английским, а работает распознавание на сервере, потому что в браузере такой словарь не поместился бы.
Сломанная таблица соответствия шрифта не чинится вообще — это дефект того файла, который вам прислали. Практический выход тот же: распознать страницы заново, получив текст из изображения, а не из битой таблицы. Заодно проверьте, тот ли это документ: иногда мусор при копировании выдаёт документ, собранный из чужих кусков.
Доюникодные шрифты — наследство девяностых и начала двухтысячных, когда казахские буквы размещали на кодовых позициях других алфавитов. На экране текст выглядит правильно, а внутри файла лежат совсем другие символы. Такой документ проще пересобрать заново, чем чинить.
Что мы делаем и чего не делаем
- Извлечение текста достаёт из файла ровно то, что в нём записано, и не пытается угадать, что имелось в виду.
- Распознавание работает с изображением страницы и потому не зависит от того, каким шрифтом набран оригинал.
- Редактор PDF правит существующий текстовый слой; на скане ему работать не с чем, и он честно об этом сообщает.
- Перевод текста мы не делаем, орфографию не проверяем и латиницу в кириллицу не перекладываем.
Частые вопросы
Почему поиск не находит слово, которое я вижу на странице?
Либо на странице изображение, а не текст, либо слово записано другими символами, чем вы набираете. Проверьте копированием: если в буфер приходит не то, что на экране, поиск в этом файле не заработает никакими настройками.
Можно ли вернуть текстовый слой скану на казахском?
Да, распознаванием. Оно проходит по изображению страницы и кладёт под него текст, после чего документ ищется и копируется обычным образом. Качество зависит от исходника: ровный контрастный скан распознаётся заметно лучше снятого под углом.
Почему после копирования казахские буквы превращаются в латиницу?
Так ведут себя старые шрифты, в которых казахские буквы занимали кодовые позиции других алфавитов. Файл выглядит правильно, но хранит другие символы. Исправить это в готовом документе нельзя, текст придётся набрать или распознать заново.
Сохранится ли казахский текст при переводе PDF в Word?
Если в файле есть настоящий текстовый слой — да, символы перенесутся как есть. Если это скан, то в документе окажутся картинки страниц, а не текст: сначала распознавание, потом преобразование, иначе редактировать будет нечего.