Перейти к содержимому
pdftools.kz
Конвертация

Как сделать скан поисковым

Ctrl+F по скану не находит ничего не потому, что документ защищён, а потому, что искать не в чем: страница целиком состоит из пикселей. Поисковым файл делает распознавание — оно записывает найденные символы прозрачным слоем ровно под изображением. После этого поиск, выделение и копирование работают, а страница выглядит как раньше: вывод идёт обычным PDF, изображения не пережимаются, оптимизация применяется только без потерь.

Сервер · удаление сразудо 30 МБбез регистрации

Коротко о цифрах

Причина молчащего поиска
в скане нет кодов символов, только пиксели
Где оказывается слой
прозрачным текстом под изображением страницы
Формат вывода
обычный PDF, без превращения в PDF/A
Оптимизация
только без потерь, изображения не пережимаются
Готовые текстовые страницы
пропускаются и остаются нетронутыми

Почему поиск молчит на скане

Поиск в просмотрщике сравнивает введённую строку с кодами символов, записанными в файле. У документа, напечатанного в PDF из редактора, эти коды есть с самого начала. У скана их нет вообще: сканер положил на страницу одну картинку, и никакой информации о буквах в файле не появилось. Отсюда типичный ложный вывод — «файл защищён от копирования», хотя защиты в нём нет и снимать нечего.

Промежуточный случай встречается часто: многие МФУ распознают страницу прямо при сканировании и вшивают слой сами. Такой файл выглядит как скан, но поиск по нему работает. Прежде чем распознавать заново, стоит это проверить — повторная обработка документа, где слой уже есть, ничего не даст.

Проверка и обработка по шагам

  1. Откройте файл и нажмите Ctrl+F, поищите слово, которое точно видно на первой странице.
  2. Нашлось — слой уже есть, распознавание не нужно.
  3. Не нашлось — попробуйте выделить абзац мышью: если выделяется рамка вместо строк, перед вами картинка.
  4. Отправьте файл на распознавание, выбрав языки страниц.
  5. Скачайте результат и повторите поиск тем же словом — теперь он должен сработать.
  6. Проверьте второй-третий страницы: слой мог не лечь там, где скан особенно бледный.

Что меняется в файле, а что нет

  • Меняется: появляется текстовый слой, работает поиск, выделение, копирование и извлечение текста в TXT.
  • Не меняется: картинка страницы, её разрешение, цвета, поля и порядок листов.
  • Не меняется формат вывода: обычный PDF, а не PDF/A — иначе изображения пришлось бы переписать заново.
  • Не меняются страницы, где текст уже был: они пропускаются нетронутыми.
  • Не появляется возможность редактировать написанное: видимое остаётся изображением.

Частые вопросы

Поиск не работает — значит, документ защищён?

Почти никогда. Защита от копирования — это флаг прав в файле, а молчащий поиск чаще всего означает отсутствие текстового слоя. Проверьте выделением: рамка поверх страницы вместо строк подтверждает, что перед вами скан.

Мой скан ищется, хотя я его не распознавал. Как так?

Скорее всего, распознал сканер или многофункциональное устройство: у большинства современных моделей эта опция включена по умолчанию, и слой вшивается прямо при сканировании, ещё до того как файл попал к вам.

Изменится ли внешний вид страниц после обработки?

Нет. Мы отдаём обычный PDF и применяем только оптимизацию без потерь, поэтому изображения страниц остаются теми же байтами. Слой прозрачный и лежит под картинкой, а не поверх неё.

Можно ли распознать сразу несколько сканов и сложить их в один файл?

Да, но порядок обратный: сначала объедините сканы в один PDF, а потом отправляйте на распознавание. Так вы уложитесь в один запрос вместо нескольких и не упрётесь в ограничение по числу обращений.

Рядом

Частые задачи с этим инструментом