Перейти к содержимому
pdftools.kz
Популярное

PDF для переводчика

Работа переводчика с PDF упирается в один вопрос: есть ли в файле текст. Документ, выгруженный из редактора, отдаёт текстовый слой целиком, вместе с переносами строк. Скан не отдаёт ничего — там изображения страниц, и никакое извлечение не найдёт в них букв. Между этими крайностями лежит третий случай: текст есть, но казахские буквы в нём собраны из базовой буквы и отдельного знака, и поиск их не находит.

Сервер · удаление сразудо 25 МБбез регистрации

Коротко о цифрах

Переносы строк
берутся из признака конца строки, а не из расстояний между словами
Нормализация
разложенные казахские буквы собираются в единый символ, лигатуры разбираются
Скан
текстового слоя нет, извлечение вернёт пустой файл
Конвертация в редактируемый документ
серверная операция, до 25 МБ на файл
Языки распознавания
русский, казахский, английский

Три состояния исходника

  • Текстовый PDF: слой есть, извлечение отдаёт содержимое с сохранёнными переносами строк — конец строки берётся из признака, который выдаёт движок чтения, а не угадывается по расстояниям.
  • Скан: текстового слоя нет вовсе. Извлечение вернёт пустой файл, и это точное описание содержимого, а не сбой инструмента.
  • Смешанный документ: часть страниц набрана, часть вклеена сканом. Проверять надо каждую, потому что по первой странице такой файл не отличить от обычного.
  • Документ с формами: значения полей живут отдельно от страницы, и до запечатывания они могут не попасть в извлечённый текст.

Казахские буквы и почему их иногда не видно

Одна и та же казахская буква записывается двумя способами: как единый символ и как сочетание базовой буквы с диакритическим знаком. Выглядят они одинаково, а для поиска это разные строки — набрав слово в форме поиска, вы не найдёте его в тексте, собранном другим способом. Многие генераторы PDF выдают именно разложенную форму.

Поэтому извлечённый текст приводится к единой нормальной форме: разложенные сочетания собираются в единый символ, а склеенные латинские лигатуры разбираются обратно на буквы. После этого поиск и подстановка в кошке работают предсказуемо, а глоссарий перестаёт промахиваться мимо очевидных совпадений.

Когда нужен Word, а когда достаточно текста

  1. Если нужен только смысл — берите текстовый слой: он извлекается в браузере и отдаёт содержимое без оформления.
  2. Если перевод должен лечь в ту же вёрстку — конвертируйте в редактируемый документ и правьте там, а в PDF возвращайте уже готовый перевод.
  3. Двухколоночную вёрстку проверяйте первым делом: колонки — главный источник перемешанных строк при любом извлечении.
  4. Двуязычный документ разделите на языки заранее, иначе абзацы разных языков в выгрузке чередуются и путают память переводов.
  5. Скан отправляйте на распознавание: наши языки распознавания — русский, казахский и английский.

Частые вопросы

Почему в извлечённом тексте перемешались строки?

Почти наверняка страница свёрстана в две колонки. Порядок строк в файле идёт так, как их записал генератор, и он не обязан совпадать с тем порядком, в котором вы читаете страницу глазами.

Поиск не находит казахское слово, хотя оно на странице. В чём дело?

Буква записана как база плюс отдельный диакритический знак, а вы ищете единый символ. Выглядят они одинаково, но это разные последовательности, и совпадения не будет без приведения к общей форме.

Что выбрать для перевода: текст или конвертацию в редактируемый документ?

Текст быстрее и точнее по содержанию, конвертация сохраняет структуру и оформление. Если перевод возвращается в ту же вёрстку, второй путь экономит время на переносе таблиц и заголовков.

Как перевести нотариально заверенный скан?

Сначала распознаванием получить текстовый слой, затем работать как с обычным документом. Прямого извлечения тут не будет: в скане нет ни одной буквы, только изображение страницы.

Рядом

Частые задачи с этим инструментом