Перейти к содержимому
pdftools.kz
Конвертация

Формат DOCX

DOCX — это ZIP-архив: переименуйте файл в .zip, распакуйте — и увидите word/document.xml с текстом, отдельные файлы стилей и папку media с картинками. Формат описан открытым стандартом ECMA-376, он же ISO/IEC 29500, поэтому его читают Word 2007 и новее, LibreOffice Writer, Google Документы и мобильные редакторы. Наш конвертер принимает .docx до 25 МБ и печатает его в PDF на сервере, где работает LibreOffice.

Сервер · удаление сразудо 25 МБбез регистрации

Коротко о цифрах

Первые байты
50 4B 03 04 — сигнатура ZIP, сервер проверяет её до работы
Стандарт
ECMA-376, он же ISO/IEC 29500 — спецификация опубликована
Предел загрузки
25 МБ на файл, не более 10 конвертаций за 10 минут с адреса
Чем печатает сервер
LibreOffice внутри Gotenberg, ожидание ответа до 60 секунд
Условие для PDF → DOCX
в среднем от 30 знаков текста на страницу, OCR нет

Что лежит внутри файла

Внутри обычный ZIP. Текст абзацев хранится в word/document.xml, оформление вынесено в word/styles.xml, нумерация — в numbering.xml, изображения лежат целыми файлами в word/media, а связи между всем этим описаны в отдельных .rels. Отсюда практическое следствие: повреждённый DOCX часто удаётся вскрыть архиватором и достать хотя бы текст и картинки, даже когда Word отказывается его открывать.

Первые четыре байта такого файла — 50 4B 03 04, сигнатура ZIP. Наш сервер сверяет именно их перед конвертацией: расширение подделывается переименованием за секунду, а начало файла — нет. Если внутри не архив, конвертация не начнётся, и вы получите сообщение о несовпадении содержимого с расширением вместо непонятной ошибки из недр LibreOffice.

Что теряется при переводе в PDF

  • Редактируемость: PDF фиксирует результат, а не источник — вернуть документ в DOCX можно только распознаванием структуры, и это уже другая операция.
  • Шрифты, которых нет на сервере, заменяются похожими. Метрики у замены другие, поэтому строки набираются иначе и разрывы страниц уезжают на абзац-другой.
  • Поля вроде номера страницы или даты вычисляются в момент конвертации и застывают: PDF не пересчитает их завтра.
  • Макросы не переносятся вообще — в PDF попадает только то, что они уже успели нарисовать в документе.
  • Примечания на полях и разметку исправлений лучше не оставлять на волю конвертера: примите или отклоните правки заранее.

Как перевести DOCX в PDF

  1. Откройте конвертер Word → PDF и перетащите файл: принимаются .docx размером до 25 МБ.
  2. Убедитесь, что документ не защищён паролем — зашифрованный файл LibreOffice открыть не сможет.
  3. Нажмите кнопку конвертации: файл уходит на наш сервер в Алматы, там его печатает LibreOffice.
  4. Дождитесь ответа — на него отведено 60 секунд; тяжёлые документы с сотнями изображений укладываются в это время не всегда.
  5. Скачайте PDF и проверьте два места: перенос строк в заголовках и границы таблиц — именно там видна подстановка шрифта.

Обратный путь: PDF → DOCX

Обратная конвертация работает у нас отдельным сервисом на pdf2docx и требует текстового слоя. Проверка считает символы по всему документу и делит на число страниц: если выходит меньше тридцати знаков на страницу, файл отклоняется с объяснением, что это скан и распознавания у нас нет.

Порог именно средний, а не постраничный, — иначе договор с парой отсканированных приложений отвергался бы целиком. А скан, у которого весь «текст» — колонцифра в углу, честно отсекается до конвертации: иначе на выходе получился бы .docx из картинок страниц, который невозможно редактировать.

Частые вопросы

Чем DOCX отличается от DOC?

Устройством, а не возрастом. DOCX — ZIP-архив с XML-файлами, который открывается любым архиватором. DOC — двоичный контейнер OLE, где данные разложены по потокам со смещениями и читаются только специальной библиотекой.

Почему после конвертации разъехались строки?

Скорее всего, шрифта из документа на сервере нет и LibreOffice подставил похожий. У замены другая ширина знаков, поэтому строка набирается иначе, а следом уезжают переносы и разрывы страниц.

Что делать с файлом .docm?

Наш конвертер его не примет: в списке разрешённых расширений только .docx. Сохраните копию как обычный .docx — в PDF макросы всё равно не переносятся, там остаётся только уже нарисованный ими результат.

Можно ли вернуть PDF обратно в DOCX?

Да, если в PDF есть текстовый слой: у нас это отдельный инструмент на pdf2docx с лимитом 25 МБ. Скан без распознавания он отклонит, потому что OCR в этом сервисе не предусмотрен.

Рядом

Частые задачи с этим инструментом