PDF для переводчика
Работа переводчика с PDF упирается в один вопрос: есть ли в файле текст. Документ, выгруженный из редактора, отдаёт текстовый слой целиком, вместе с переносами строк. Скан не отдаёт ничего — там изображения страниц, и никакое извлечение не найдёт в них букв. Между этими крайностями лежит третий случай: текст есть, но казахские буквы в нём собраны из базовой буквы и отдельного знака, и поиск их не находит.
Коротко о цифрах
- Переносы строк
- берутся из признака конца строки, а не из расстояний между словами
- Нормализация
- разложенные казахские буквы собираются в единый символ, лигатуры разбираются
- Скан
- текстового слоя нет, извлечение вернёт пустой файл
- Конвертация в редактируемый документ
- серверная операция, до 25 МБ на файл
- Языки распознавания
- русский, казахский, английский
Три состояния исходника
- Текстовый PDF: слой есть, извлечение отдаёт содержимое с сохранёнными переносами строк — конец строки берётся из признака, который выдаёт движок чтения, а не угадывается по расстояниям.
- Скан: текстового слоя нет вовсе. Извлечение вернёт пустой файл, и это точное описание содержимого, а не сбой инструмента.
- Смешанный документ: часть страниц набрана, часть вклеена сканом. Проверять надо каждую, потому что по первой странице такой файл не отличить от обычного.
- Документ с формами: значения полей живут отдельно от страницы, и до запечатывания они могут не попасть в извлечённый текст.
Казахские буквы и почему их иногда не видно
Одна и та же казахская буква записывается двумя способами: как единый символ и как сочетание базовой буквы с диакритическим знаком. Выглядят они одинаково, а для поиска это разные строки — набрав слово в форме поиска, вы не найдёте его в тексте, собранном другим способом. Многие генераторы PDF выдают именно разложенную форму.
Поэтому извлечённый текст приводится к единой нормальной форме: разложенные сочетания собираются в единый символ, а склеенные латинские лигатуры разбираются обратно на буквы. После этого поиск и подстановка в кошке работают предсказуемо, а глоссарий перестаёт промахиваться мимо очевидных совпадений.
Когда нужен Word, а когда достаточно текста
- Если нужен только смысл — берите текстовый слой: он извлекается в браузере и отдаёт содержимое без оформления.
- Если перевод должен лечь в ту же вёрстку — конвертируйте в редактируемый документ и правьте там, а в PDF возвращайте уже готовый перевод.
- Двухколоночную вёрстку проверяйте первым делом: колонки — главный источник перемешанных строк при любом извлечении.
- Двуязычный документ разделите на языки заранее, иначе абзацы разных языков в выгрузке чередуются и путают память переводов.
- Скан отправляйте на распознавание: наши языки распознавания — русский, казахский и английский.
Частые вопросы
Почему в извлечённом тексте перемешались строки?
Почти наверняка страница свёрстана в две колонки. Порядок строк в файле идёт так, как их записал генератор, и он не обязан совпадать с тем порядком, в котором вы читаете страницу глазами.
Поиск не находит казахское слово, хотя оно на странице. В чём дело?
Буква записана как база плюс отдельный диакритический знак, а вы ищете единый символ. Выглядят они одинаково, но это разные последовательности, и совпадения не будет без приведения к общей форме.
Что выбрать для перевода: текст или конвертацию в редактируемый документ?
Текст быстрее и точнее по содержанию, конвертация сохраняет структуру и оформление. Если перевод возвращается в ту же вёрстку, второй путь экономит время на переносе таблиц и заголовков.
Как перевести нотариально заверенный скан?
Сначала распознаванием получить текстовый слой, затем работать как с обычным документом. Прямого извлечения тут не будет: в скане нет ни одной буквы, только изображение страницы.