PDF и программы чтения с экрана
Программа чтения с экрана озвучивает не картинку страницы, а текстовый слой и структурные теги: заголовки, списки, таблицы, альтернативные подписи к изображениям и порядок чтения. Отсюда две честные оговорки. Теги мы не добавляем — разметку задаёт та программа, в которой документ создавался. И наоборот: сжатие с растеризацией делает документ немым, потому что текстового слоя после него в файле не остаётся.
Коротко о цифрах
- Что озвучивает читалка
- текстовый слой и структурные теги, а не изображение страницы
- Чего мы не делаем
- не добавляем теги, заголовки и подписи к картинкам
- Что ломает доступность
- растеризация при сжатии: текстовый слой исчезает целиком
- Проверка
- извлечение текста в браузере: пусто — значит текста в файле нет
- Что даёт распознавание
- текстовый слой поверх скана, но не структурные теги
Проверка за одну минуту
- Прогоните файл через извлечение текста — обработка идёт в браузере, документ никуда не отправляется.
- Пусто и есть сообщение об отсутствии текстового слоя — перед вами скан, и читалке озвучивать нечего.
- Текст извлёкся связными абзацами — базовый уровень доступности есть: документ хотя бы читаемый.
- Текст извлёкся, но кусками не в том порядке — вероятно, в документе не задан порядок чтения, и читалка озвучит его так же вперемешку.
- Повторите проверку на итоговой версии после всех правок: сжатие и растеризация меняют результат целиком.
Что ломает доступность
- Сжатие с растеризацией: страницы становятся картинками, текст исчезает вместе с возможностью его озвучить.
- «Защита от копирования» через перевод в изображения: у неё та же цена, только заплаченная сознательно.
- Скан без распознавания: файл выглядит документом, но внутри него только пиксели.
- Текст, набранный картинками, — плакаты, инфографика, схемы с подписями внутри изображения.
- Многоколоночная вёрстка без заданного порядка чтения: озвучивание перескакивает между колонками.
Что делаем мы и чего не делаем
Не делаем главного: не размечаем документ. Мы не добавляем теги заголовков, не расставляем альтернативные подписи к картинкам и не задаём порядок чтения. Разметка рождается в исходной программе — в текстовом редакторе, где вы применили стили заголовков, а не увеличили шрифт вручную. Инструмент, который обещает «сделать PDF доступным» одной кнопкой, обещает то, чего не умеет.
Помогаем с двумя вещами. Первая — проверка: извлечение текста за минуту показывает, есть ли в файле что озвучивать. Вторая — предупреждение о цене операций: перед сжатием документа, который читают с экрана, стоит остановиться и решить, нужна ли растеризация вообще. Распознавание скана вернёт текстовый слой, но тегов не создаст — это уровень «читаемо», а не «размечено».
Частые вопросы
Достаточно ли распознать скан, чтобы документ стал доступным?
Это необходимый минимум, но не полная доступность. Появляется текст, который можно озвучить, однако заголовки, таблицы и порядок чтения остаются неразмеченными, и навигация по документу не работает.
Почему после сжатия читалка замолчала?
Сжатие перерисовало страницы картинками, и текстового слоя в файле не осталось. Для документа, который читают с экрана, выбирайте перезапись структуры вместо растеризации.
Можете добавить альтернативные подписи к картинкам?
Нет, мы этого не умеем и не будем утверждать обратное. Подписи задаются в программе, где документ создавался, до выгрузки его в PDF.
Что доступнее для сайта — PDF или обычная страница?
Обычная страница: у неё заголовки, списки и подписи к изображениям есть по устройству формата. PDF уместен там, где важна печатная форма документа, а не удобство чтения с экрана.