После конвертации разъехалось форматирование
Внутри PDF нет ни абзацев, ни ячеек, ни колонок. Там записано другое: поставить такой-то шрифт, перейти в такую-то точку страницы и нарисовать такую-то строку. Конвертер в редактируемый формат вынужден догадываться, где кончился абзац и начался следующий, что здесь таблица, а что — просто ровный столбик текста. На простой вёрстке догадка почти всегда верна, на сложной — почти всегда нет.
Коротко о цифрах
- Чего нет внутри PDF
- абзацев, ячеек и колонок — только позиции строк на странице
- Как находятся таблицы
- по линиям рамок; таблица без рамок распадается на абзацы
- Скан на входе
- на выходе изображение: распознавания у нас нет
- Обратная конвертация
- выполняется на сервере, недоступный там шрифт заменяется ближайшим
- Что переносится точнее всего
- сплошной текст без колонок, таблиц и колонтитулов
Что ломается чаще всего
- Таблицы без видимых рамок: границы ячеек определяются по линиям, и там, где линий нет, таблица распадается на отдельные абзацы.
- Многоколоночная вёрстка: конвертер читает строки слева направо через всю страницу и склеивает соседние колонки в одну кашу.
- Колонтитулы и номера страниц: они попадают в основной текст, потому что в файле ничем от него не отличаются.
- Точное положение картинок: изображение привязывается к абзацу, а в исходнике оно стояло по координатам.
- Переносы и разрывы строк: там, где в PDF был мягкий перенос, в тексте остаётся дефис посреди слова.
Как получить лучший результат
- Проверьте, есть ли в исходнике текстовый слой: если это скан, на выходе будет картинка, потому что распознавания у нас нет.
- Если исходный документ существует в офисном формате, конвертируйте из него, а не из PDF: обратный путь всегда точнее.
- Для файлов с плотными таблицами сначала попробуйте извлечь текст и посмотреть, как он ложится строками.
- После конвертации сразу проверьте таблицы и колонки, а не начало документа: первые страницы обычно выглядят прилично.
- Сложную вёрстку иногда быстрее пересобрать вручную по извлечённому тексту, чем править результат догадки.
Обратное направление и его особенности
Когда офисный документ превращается в PDF, теряется другое. Конвертация выполняется на сервере, и шрифт, которого там нет, заменяется на ближайший — ровно тот же механизм подстановки, из-за которого разъезжается вёрстка при просмотре. Поэтому файл, собранный из документа с редким шрифтом, стоит открыть и просмотреть целиком, а не отправлять сразу.
Второе отличие — привязка к странице. Офисный редактор перевёрстывает текст под размер листа и настройки печати, а PDF фиксирует результат навсегда. Значит, лишний абзац, добавленный после конвертации в исходник, сдвинет всё содержимое, и старый PDF перестанет соответствовать документу.
Частые вопросы
Почему таблица превратилась в набор абзацев?
Потому что в файле не было таблицы — были линии и текст рядом с ними. Конвертер собирает ячейки по видимым границам, и когда рамок нет, собирать нечего: остаются строки, идущие одна за другой.
Можно ли конвертировать без потерь вообще?
Только если исходный документ сохранился в редактируемом формате. Обратное преобразование всегда восстановление по следам, а не чтение исходной структуры, поэтому часть решений о вёрстке принимается заново и не совпадает с оригиналом.
На выходе получилась картинка вместо текста. Что не так?
На входе был скан. В таком PDF нет ни одного текстового фрагмента, конвертировать нечего, и содержимое переносится как изображение. Текст в нём может появиться только после распознавания, которого у нас нет.
Стоит ли конвертировать туда и обратно?
Нет. Каждый проход добавляет собственные догадки о структуре, и после второго преобразования расхождение с оригиналом складывается. Храните исходный документ в редактируемом виде, а PDF считайте конечной формой.