Как сделать скан поисковым
Ctrl+F по скану не находит ничего не потому, что документ защищён, а потому, что искать не в чем: страница целиком состоит из пикселей. Поисковым файл делает распознавание — оно записывает найденные символы прозрачным слоем ровно под изображением. После этого поиск, выделение и копирование работают, а страница выглядит как раньше: вывод идёт обычным PDF, изображения не пережимаются, оптимизация применяется только без потерь.
Коротко о цифрах
- Причина молчащего поиска
- в скане нет кодов символов, только пиксели
- Где оказывается слой
- прозрачным текстом под изображением страницы
- Формат вывода
- обычный PDF, без превращения в PDF/A
- Оптимизация
- только без потерь, изображения не пережимаются
- Готовые текстовые страницы
- пропускаются и остаются нетронутыми
Почему поиск молчит на скане
Поиск в просмотрщике сравнивает введённую строку с кодами символов, записанными в файле. У документа, напечатанного в PDF из редактора, эти коды есть с самого начала. У скана их нет вообще: сканер положил на страницу одну картинку, и никакой информации о буквах в файле не появилось. Отсюда типичный ложный вывод — «файл защищён от копирования», хотя защиты в нём нет и снимать нечего.
Промежуточный случай встречается часто: многие МФУ распознают страницу прямо при сканировании и вшивают слой сами. Такой файл выглядит как скан, но поиск по нему работает. Прежде чем распознавать заново, стоит это проверить — повторная обработка документа, где слой уже есть, ничего не даст.
Проверка и обработка по шагам
- Откройте файл и нажмите Ctrl+F, поищите слово, которое точно видно на первой странице.
- Нашлось — слой уже есть, распознавание не нужно.
- Не нашлось — попробуйте выделить абзац мышью: если выделяется рамка вместо строк, перед вами картинка.
- Отправьте файл на распознавание, выбрав языки страниц.
- Скачайте результат и повторите поиск тем же словом — теперь он должен сработать.
- Проверьте второй-третий страницы: слой мог не лечь там, где скан особенно бледный.
Что меняется в файле, а что нет
- Меняется: появляется текстовый слой, работает поиск, выделение, копирование и извлечение текста в TXT.
- Не меняется: картинка страницы, её разрешение, цвета, поля и порядок листов.
- Не меняется формат вывода: обычный PDF, а не PDF/A — иначе изображения пришлось бы переписать заново.
- Не меняются страницы, где текст уже был: они пропускаются нетронутыми.
- Не появляется возможность редактировать написанное: видимое остаётся изображением.
Частые вопросы
Поиск не работает — значит, документ защищён?
Почти никогда. Защита от копирования — это флаг прав в файле, а молчащий поиск чаще всего означает отсутствие текстового слоя. Проверьте выделением: рамка поверх страницы вместо строк подтверждает, что перед вами скан.
Мой скан ищется, хотя я его не распознавал. Как так?
Скорее всего, распознал сканер или многофункциональное устройство: у большинства современных моделей эта опция включена по умолчанию, и слой вшивается прямо при сканировании, ещё до того как файл попал к вам.
Изменится ли внешний вид страниц после обработки?
Нет. Мы отдаём обычный PDF и применяем только оптимизацию без потерь, поэтому изображения страниц остаются теми же байтами. Слой прозрачный и лежит под картинкой, а не поверх неё.
Можно ли распознать сразу несколько сканов и сложить их в один файл?
Да, но порядок обратный: сначала объедините сканы в один PDF, а потом отправляйте на распознавание. Так вы уложитесь в один запрос вместо нескольких и не упрётесь в ограничение по числу обращений.