Перейти к содержимому
pdftools.kz
Популярное

После конвертации разъехалось форматирование

Внутри PDF нет ни абзацев, ни ячеек, ни колонок. Там записано другое: поставить такой-то шрифт, перейти в такую-то точку страницы и нарисовать такую-то строку. Конвертер в редактируемый формат вынужден догадываться, где кончился абзац и начался следующий, что здесь таблица, а что — просто ровный столбик текста. На простой вёрстке догадка почти всегда верна, на сложной — почти всегда нет.

Сервер · удаление сразудо 25 МБбез регистрации

Коротко о цифрах

Чего нет внутри PDF
абзацев, ячеек и колонок — только позиции строк на странице
Как находятся таблицы
по линиям рамок; таблица без рамок распадается на абзацы
Скан на входе
на выходе изображение: распознавания у нас нет
Обратная конвертация
выполняется на сервере, недоступный там шрифт заменяется ближайшим
Что переносится точнее всего
сплошной текст без колонок, таблиц и колонтитулов

Что ломается чаще всего

  • Таблицы без видимых рамок: границы ячеек определяются по линиям, и там, где линий нет, таблица распадается на отдельные абзацы.
  • Многоколоночная вёрстка: конвертер читает строки слева направо через всю страницу и склеивает соседние колонки в одну кашу.
  • Колонтитулы и номера страниц: они попадают в основной текст, потому что в файле ничем от него не отличаются.
  • Точное положение картинок: изображение привязывается к абзацу, а в исходнике оно стояло по координатам.
  • Переносы и разрывы строк: там, где в PDF был мягкий перенос, в тексте остаётся дефис посреди слова.

Как получить лучший результат

  1. Проверьте, есть ли в исходнике текстовый слой: если это скан, на выходе будет картинка, потому что распознавания у нас нет.
  2. Если исходный документ существует в офисном формате, конвертируйте из него, а не из PDF: обратный путь всегда точнее.
  3. Для файлов с плотными таблицами сначала попробуйте извлечь текст и посмотреть, как он ложится строками.
  4. После конвертации сразу проверьте таблицы и колонки, а не начало документа: первые страницы обычно выглядят прилично.
  5. Сложную вёрстку иногда быстрее пересобрать вручную по извлечённому тексту, чем править результат догадки.

Обратное направление и его особенности

Когда офисный документ превращается в PDF, теряется другое. Конвертация выполняется на сервере, и шрифт, которого там нет, заменяется на ближайший — ровно тот же механизм подстановки, из-за которого разъезжается вёрстка при просмотре. Поэтому файл, собранный из документа с редким шрифтом, стоит открыть и просмотреть целиком, а не отправлять сразу.

Второе отличие — привязка к странице. Офисный редактор перевёрстывает текст под размер листа и настройки печати, а PDF фиксирует результат навсегда. Значит, лишний абзац, добавленный после конвертации в исходник, сдвинет всё содержимое, и старый PDF перестанет соответствовать документу.

Частые вопросы

Почему таблица превратилась в набор абзацев?

Потому что в файле не было таблицы — были линии и текст рядом с ними. Конвертер собирает ячейки по видимым границам, и когда рамок нет, собирать нечего: остаются строки, идущие одна за другой.

Можно ли конвертировать без потерь вообще?

Только если исходный документ сохранился в редактируемом формате. Обратное преобразование всегда восстановление по следам, а не чтение исходной структуры, поэтому часть решений о вёрстке принимается заново и не совпадает с оригиналом.

На выходе получилась картинка вместо текста. Что не так?

На входе был скан. В таком PDF нет ни одного текстового фрагмента, конвертировать нечего, и содержимое переносится как изображение. Текст в нём может появиться только после распознавания, которого у нас нет.

Стоит ли конвертировать туда и обратно?

Нет. Каждый проход добавляет собственные догадки о структуре, и после второго преобразования расхождение с оригиналом складывается. Храните исходный документ в редактируемом виде, а PDF считайте конечной формой.

Рядом

Частые задачи с этим инструментом