Формат DOCX
DOCX — это ZIP-архив: переименуйте файл в .zip, распакуйте — и увидите word/document.xml с текстом, отдельные файлы стилей и папку media с картинками. Формат описан открытым стандартом ECMA-376, он же ISO/IEC 29500, поэтому его читают Word 2007 и новее, LibreOffice Writer, Google Документы и мобильные редакторы. Наш конвертер принимает .docx до 25 МБ и печатает его в PDF на сервере, где работает LibreOffice.
Коротко о цифрах
- Первые байты
- 50 4B 03 04 — сигнатура ZIP, сервер проверяет её до работы
- Стандарт
- ECMA-376, он же ISO/IEC 29500 — спецификация опубликована
- Предел загрузки
- 25 МБ на файл, не более 10 конвертаций за 10 минут с адреса
- Чем печатает сервер
- LibreOffice внутри Gotenberg, ожидание ответа до 60 секунд
- Условие для PDF → DOCX
- в среднем от 30 знаков текста на страницу, OCR нет
Что лежит внутри файла
Внутри обычный ZIP. Текст абзацев хранится в word/document.xml, оформление вынесено в word/styles.xml, нумерация — в numbering.xml, изображения лежат целыми файлами в word/media, а связи между всем этим описаны в отдельных .rels. Отсюда практическое следствие: повреждённый DOCX часто удаётся вскрыть архиватором и достать хотя бы текст и картинки, даже когда Word отказывается его открывать.
Первые четыре байта такого файла — 50 4B 03 04, сигнатура ZIP. Наш сервер сверяет именно их перед конвертацией: расширение подделывается переименованием за секунду, а начало файла — нет. Если внутри не архив, конвертация не начнётся, и вы получите сообщение о несовпадении содержимого с расширением вместо непонятной ошибки из недр LibreOffice.
Что теряется при переводе в PDF
- Редактируемость: PDF фиксирует результат, а не источник — вернуть документ в DOCX можно только распознаванием структуры, и это уже другая операция.
- Шрифты, которых нет на сервере, заменяются похожими. Метрики у замены другие, поэтому строки набираются иначе и разрывы страниц уезжают на абзац-другой.
- Поля вроде номера страницы или даты вычисляются в момент конвертации и застывают: PDF не пересчитает их завтра.
- Макросы не переносятся вообще — в PDF попадает только то, что они уже успели нарисовать в документе.
- Примечания на полях и разметку исправлений лучше не оставлять на волю конвертера: примите или отклоните правки заранее.
Как перевести DOCX в PDF
- Откройте конвертер Word → PDF и перетащите файл: принимаются .docx размером до 25 МБ.
- Убедитесь, что документ не защищён паролем — зашифрованный файл LibreOffice открыть не сможет.
- Нажмите кнопку конвертации: файл уходит на наш сервер в Алматы, там его печатает LibreOffice.
- Дождитесь ответа — на него отведено 60 секунд; тяжёлые документы с сотнями изображений укладываются в это время не всегда.
- Скачайте PDF и проверьте два места: перенос строк в заголовках и границы таблиц — именно там видна подстановка шрифта.
Обратный путь: PDF → DOCX
Обратная конвертация работает у нас отдельным сервисом на pdf2docx и требует текстового слоя. Проверка считает символы по всему документу и делит на число страниц: если выходит меньше тридцати знаков на страницу, файл отклоняется с объяснением, что это скан и распознавания у нас нет.
Порог именно средний, а не постраничный, — иначе договор с парой отсканированных приложений отвергался бы целиком. А скан, у которого весь «текст» — колонцифра в углу, честно отсекается до конвертации: иначе на выходе получился бы .docx из картинок страниц, который невозможно редактировать.
Частые вопросы
Чем DOCX отличается от DOC?
Устройством, а не возрастом. DOCX — ZIP-архив с XML-файлами, который открывается любым архиватором. DOC — двоичный контейнер OLE, где данные разложены по потокам со смещениями и читаются только специальной библиотекой.
Почему после конвертации разъехались строки?
Скорее всего, шрифта из документа на сервере нет и LibreOffice подставил похожий. У замены другая ширина знаков, поэтому строка набирается иначе, а следом уезжают переносы и разрывы страниц.
Что делать с файлом .docm?
Наш конвертер его не примет: в списке разрешённых расширений только .docx. Сохраните копию как обычный .docx — в PDF макросы всё равно не переносятся, там остаётся только уже нарисованный ими результат.
Можно ли вернуть PDF обратно в DOCX?
Да, если в PDF есть текстовый слой: у нас это отдельный инструмент на pdf2docx с лимитом 25 МБ. Скан без распознавания он отклонит, потому что OCR в этом сервисе не предусмотрен.