Как сжать сканированный PDF
Скан — единственный случай, когда наше сжатие обходится без жертв: текстового слоя в нём и так нет, а страница и до обработки была картинкой. Значит, ползунок можно опускать смело. Качество 50 даёт 186 DPI и JPEG 0.63 — этого достаточно, чтобы прочитать документ с экрана. Перед началом стоит убедиться, что распознавания в файле действительно не было: иначе вы потеряете поиск, сами того не заметив.
Коротко о цифрах
- Качество 25
- 129 DPI, JPEG 0.46
- Качество 50
- 186 DPI, JPEG 0.63
- Проверка текстового слоя
- извлечение текста: пустой результат означает, что распознавания не было
- Цена разрешения
- 600 DPI против 300 — вчетверо больше пикселей на ту же страницу
- Память на страницу
- A4 при 300 DPI ≈8,7 Мпикс ≈33 МБ; iOS Safari убивает вкладку около 1 ГБ
Сначала проверьте, есть ли текстовый слой
- Прогоните файл через извлечение текста.
- Если результат пустой или в нём один мусор — распознавания не было, скан чистый.
- Если текст извлёкся — это уже не просто скан, и сжатие уничтожит поиск по документу.
- Во втором случае сохраните исходник и решайте, что вам важнее: вес или возможность искать по тексту.
Какое разрешение действительно нужно
Триста точек на дюйм нужны для печати, а не для чтения. Документ, который будут смотреть на экране или отправлять по почте, спокойно живёт на 150–200 DPI: буквы остаются чёткими, а вес падает кратно, потому что число пикселей растёт как квадрат разрешения. Разница между 200 и 300 DPI на одной и той же странице — это в 2,25 раза больше пикселей ради того, чего глаз на экране не увидит.
На нашей шкале это качество примерно 35–55: 152 DPI и JPEG 0.53 на одном конце этого отрезка, 197 DPI и JPEG 0.66 на другом. Начинайте с середины и двигайтесь вниз, пока текст не начнёт замыливаться.
Что съедает вес в сканах
- Цвет. Три канала вместо одного — это втрое больше данных на пиксель ещё до всякого сжатия, а бумага почти всегда серая, а не цветная.
- Шум бумаги. Фон скана неоднороден, и JPEG вынужден кодировать каждую крапинку вместо ровной заливки — именно поэтому скан сжимается хуже экранного документа.
- Поля. Пустая рамка вокруг документа занимает столько же пикселей, сколько текст; обрезка убирает её целиком.
- Разрешение сканера. Если оригинал снят на 600 DPI, в нём вчетверо больше пикселей на ту же площадь, чем при 300, — иногда проще пересканировать.
Частые вопросы
Почему скан весит больше обычного PDF при том же числе страниц?
Потому что в нём нет текста — только пиксели. Страница с буквами хранится как несколько килобайт команд рисования, а её скан как изображение целиком, включая шум бумажного фона.
Не испортит ли сжатие читаемость печатей и подписей?
На среднем качестве печати остаются узнаваемыми, но тонкие линии подписи могут потерять волосяные штрихи. Если документ нужен как доказательство, проверьте результат перед отправкой.
Что делать, если скан после сжатия стал больше?
Значит, страницы были чёрно-белыми и хранились по одному биту на пиксель, а JPEG хранит восемь. Инструмент в этом случае возвращает исходный файл нетронутым.
Стоит ли сканировать в цвете, если документ чёрно-белый?
Нет. Оттенки серого дают тот же результат для чтения и втрое меньше данных на пиксель. Цвет нужен только там, где важны печать, голограмма или цветная пометка.