PDF для налоговой отчётности: вес меньше, текст на месте
У документов для налоговой есть особенность, о которой вспоминают поздно: их читают не только глазами. По ним ищут суммы, из них копируют реквизиты, их прогоняют через выгрузку. Обычное сжатие превращает страницы в картинки, и всё перечисленное перестаёт работать — текст исчезает, остаётся изображение текста. Если исходник не скан, начинайте с оптимизации структуры: она уменьшает вес, не трогая шрифты.
Коротко о цифрах
- Оптимизация структуры
- серверный qpdf, текстовый слой и шрифты сохраняются
- Сжатие до размера
- растеризация страниц, текстовый слой теряется полностью
- Проверка наличия текста
- извлечение текста возвращает пустой результат на скане
- Языки распознавания
- русский, казахский, английский; до 20 страниц в одном файле
- Диапазон растеризации
- 72–300 DPI, целевой размер подбирается не более чем за 7 проходов
Два способа уменьшить вес и их цена
Оптимизация структуры работает с внутренним устройством файла: пересобирает потоки, убирает мусор, приводит объекты в порядок. Шрифты, текст и разметка остаются нетронутыми, документ по-прежнему ищется и копируется. Выигрыш скромнее, чем от растеризации, зато бесплатный по качеству.
Сжатие с целевым размером идёт другим путём: страницы рисуются заново как изображения с подобранным разрешением и качеством JPEG. Отсюда огромный выигрыш в весе и полная потеря текстового слоя. Для скана это ничего не меняет — там текста и не было. Для декларации, выгруженной из учётной программы, это шаг назад.
Как понять, есть ли в файле текст
- Откройте документ и попробуйте выделить строку мышью. Выделяется по буквам — текстовый слой есть.
- Поищите по файлу любое слово из документа. Ничего не нашлось при том, что слово видно на экране, — перед вами картинка.
- Прогоните файл через извлечение текста: пустой результат означает скан без распознавания.
- Если текст есть — уменьшайте вес оптимизацией структуры и не растеризуйте без нужды.
- Если текста нет и он нужен — распознавание добавит текстовый слой; казахский, русский и английский поддерживаются, потолок 20 страниц на файл.
Что уточнять, а что решать самому
- Формат и предельный вес вложения устанавливает принимающая система — смотрите её требования, а не сторонние советы.
- Нужен ли текстовый слой, решает то, как документ будут использовать: для архива хватит картинки, для сверки — нет.
- Разбивать многостраничную выгрузку на части или отправлять целиком, тоже определяет форма подачи.
- Сохранность реквизитов проверяйте глазами: суммы и ИИН на пережатом скане расплываются раньше, чем крупный текст.
Частые вопросы
Почему после сжатия по документу перестал работать поиск?
Потому что сжатие до целевого размера рисует страницы заново как изображения. Буквы остались видимыми, но перестали быть буквами с точки зрения программы. Если поиск нужен, уменьшайте вес оптимизацией структуры — она шрифты не трогает.
Какой вес вложения примет система?
Это определяет сама принимающая система, и цифры у разных сервисов разные. Посмотрите ограничение в форме отправки или уточните у принимающей стороны, а затем подгоняйте файл под названную величину.
Можно ли сначала сжать, а потом вернуть текст распознаванием?
Можно, но это худший из путей: распознавание восстановит текст по уже испорченной картинке и наделает ошибок в цифрах. Правильный порядок — сохранить исходный текстовый слой, а распознавание применять только к тому, что изначально было сканом.
Что делать, если файл всё равно слишком тяжёлый?
Сначала уберите лишние страницы — вес делится между ними, и это самый сильный рычаг. Затем оптимизируйте структуру. И только если этого не хватило, соглашайтесь на растеризацию, понимая, что взамен теряете поиск по документу.