Перейти к содержимому
pdftools.kz
Конвертация

Документы на казахском языке в PDF: почему не ищется и не копируется

Причин ровно три, и они лечатся по-разному. Первая: текста в файле нет вовсе — это скан, картинка страницы, и искать в ней нечего. Вторая: текст есть, но у шрифта нет таблицы соответствия символам, поэтому копирование возвращает набор чужих букв. Третья: документ сделан в доюникодном шрифте, где казахские буквы сидели на позициях латиницы. Определить свою причину можно за минуту.

Локально в браузередо 1 ГБбез регистрации

Коротко о цифрах

Извлечение текста
целиком в браузере, пустой результат означает скан
Языки распознавания
русский, казахский, английский — по отдельности или вместе
Потолок распознавания
20 страниц и 30 МБ на один файл
Признак битого шрифта
на экране текст читается, а в буфер обмена приходит другой набор символов
Чего не чиним
таблицу соответствия в чужом файле — её восстанавливают только распознаванием

Как отличить одну причину от другой

  1. Попробуйте выделить строку мышью. Выделяется целыми прямоугольниками страницы, а не по буквам — перед вами скан.
  2. Скопируйте выделенное в любой текстовый редактор. Пришли те же слова — с текстовым слоем всё в порядке.
  3. Пришла латиница или бессмысленные символы вместо ә, ғ, қ, ң, ө, ұ, ү, һ, і — виноват шрифт и его таблица соответствия.
  4. Поиск не находит слово, которое вы видите на экране, хотя копирование работает — проверьте раскладку и то, какими символами набрано слово в файле.
  5. Прогоните файл через извлечение текста: пустой результат подтверждает скан, мусор подтверждает проблему со шрифтом.

Что делать в каждом случае

Скан лечится распознаванием: текстовый слой добавляется поверх изображения, после чего документ ищется и копируется. Казахский язык распознавания поддержан наравне с русским и английским, а работает распознавание на сервере, потому что в браузере такой словарь не поместился бы.

Сломанная таблица соответствия шрифта не чинится вообще — это дефект того файла, который вам прислали. Практический выход тот же: распознать страницы заново, получив текст из изображения, а не из битой таблицы. Заодно проверьте, тот ли это документ: иногда мусор при копировании выдаёт документ, собранный из чужих кусков.

Доюникодные шрифты — наследство девяностых и начала двухтысячных, когда казахские буквы размещали на кодовых позициях других алфавитов. На экране текст выглядит правильно, а внутри файла лежат совсем другие символы. Такой документ проще пересобрать заново, чем чинить.

Что мы делаем и чего не делаем

  • Извлечение текста достаёт из файла ровно то, что в нём записано, и не пытается угадать, что имелось в виду.
  • Распознавание работает с изображением страницы и потому не зависит от того, каким шрифтом набран оригинал.
  • Редактор PDF правит существующий текстовый слой; на скане ему работать не с чем, и он честно об этом сообщает.
  • Перевод текста мы не делаем, орфографию не проверяем и латиницу в кириллицу не перекладываем.

Частые вопросы

Почему поиск не находит слово, которое я вижу на странице?

Либо на странице изображение, а не текст, либо слово записано другими символами, чем вы набираете. Проверьте копированием: если в буфер приходит не то, что на экране, поиск в этом файле не заработает никакими настройками.

Можно ли вернуть текстовый слой скану на казахском?

Да, распознаванием. Оно проходит по изображению страницы и кладёт под него текст, после чего документ ищется и копируется обычным образом. Качество зависит от исходника: ровный контрастный скан распознаётся заметно лучше снятого под углом.

Почему после копирования казахские буквы превращаются в латиницу?

Так ведут себя старые шрифты, в которых казахские буквы занимали кодовые позиции других алфавитов. Файл выглядит правильно, но хранит другие символы. Исправить это в готовом документе нельзя, текст придётся набрать или распознать заново.

Сохранится ли казахский текст при переводе PDF в Word?

Если в файле есть настоящий текстовый слой — да, символы перенесутся как есть. Если это скан, то в документе окажутся картинки страниц, а не текст: сначала распознавание, потом преобразование, иначе редактировать будет нечего.

Рядом

Частые задачи с этим инструментом