PDF в Word на телефоне
Девятнадцать инструментов сайта работают в браузере, но перевод PDF в Word — не из них: файл действительно загружается на сервер, потому что распознавание структуры документа делает отдельная служба. Отсюда три ограничения, которых нет у остальных: файл не больше 25 МБ, ожидание не дольше 110 секунд и обязательный текстовый слой в исходнике. Скан без текста конвертер честно отклонит, а не отдаст пустой документ.
Коротко о цифрах
- Куда уходит файл
- на наш сервер — это серверный инструмент
- Предел размера
- 25 МБ
- Предел ожидания
- 110 секунд, включая загрузку
- Порог текста
- в среднем не менее 30 символов на страницу
- Распознавание картинок
- не выполняется, скан отклоняется
Почему сканы отклоняются, а не конвертируются
Служба конвертации извлекает текстовый слой, который уже лежит в PDF, и не занимается распознаванием картинок. Проверка идёт до начала работы: считается общее количество непробельных символов и делится на число страниц. Если в среднем выходит меньше тридцати символов на страницу, документ отклоняется с прямым объяснением про отсутствующий текстовый слой.
Проверка появилась не на ровном месте. Раньше достаточно было любого символа на любой странице, и скан с одним номером страницы в углу проходил дальше. Служба тратила минуты, а пользователь получал двадцатимегабайтный DOCX с картинками вместо текста — файл, который нельзя редактировать, после ожидания, за которое браузер успевал сдаться.
Отдельно проверяются пароль и повреждение: защищённый документ и нечитаемый файл получают свой код ошибки, а не общее «что-то пошло не так».
Что учесть на мобильном интернете
- Секундомер в 110 секунд включает и загрузку файла, поэтому на медленной сети большой PDF рискует не успеть.
- Наш сервер стоит в Алматы и отвечает по HTTP/3: соединение переживает переход с Wi-Fi на мобильную сеть, потому что не привязано к паре адресов.
- Если очередь на конвертацию длиннее пяти запросов, сервер честно скажет, что занят, вместо того чтобы держать вас в ожидании.
- Готовый DOCX телефон сам не откроет: нужен офисный редактор, иначе файл просто ляжет в загрузки.
- Если нужен только текст, а не форматирование, извлечение текста делается прямо в браузере и без всяких лимитов на сервер.
Порядок действий
- Проверьте вес PDF: больше 25 МБ конвертер не примет, и лучше узнать это до загрузки.
- Убедитесь, что документ не скан: попробуйте выделить в нём текст в любой читалке.
- Откройте инструмент, добавьте файл и дождитесь ответа сервера.
- Если пришёл отказ про текстовый слой — документ является картинкой, и конвертация в редактируемый Word невозможна.
- Скачайте DOCX и откройте его в офисном приложении телефона.
- Если файл слишком тяжёлый, сначала уберите лишние страницы, а не сжимайте документ: сжатие превращает текст в картинки и делает конвертацию невозможной.
Частые вопросы
Почему нельзя сделать конвертацию в Word прямо в браузере?
Потому что разбор структуры документа — таблиц, колонок и стилей — делает отдельная служба, которой нужен серверный процесс. Все инструменты, которым хватает браузера, у нас работают именно в браузере.
Мой PDF — фотография документа. Что делать?
Такой файл в редактируемый Word не превратится: в нём нет текста, есть только пиксели. Понадобится распознавание, которого у нас нет, либо набор текста вручную с готового изображения.
Сжать PDF перед конвертацией, чтобы уложиться в 25 МБ?
Так делать не нужно: сжатие растрирует страницы, то есть уничтожает тот самый текстовый слой, ради которого затевается конвертация. Лучше удалить ненужные страницы и отправить документ по частям.
Файл загрузился, но конвертация оборвалась. В чём причина?
Скорее всего, суммарное время превысило сто десять секунд: этот предел выставлен чуть ниже серверного, чтобы вы получили понятное сообщение, а не молчаливый обрыв соединения.