Перейти к содержимому
pdftools.kz

Что такое доступный PDF

Доступный PDF — документ, который человек с нарушением зрения может прочитать программой чтения с экрана так же полно, как зрячий глазами. Для этого файлу мало содержать текст: нужен явно заданный порядок чтения, роли элементов, описания картинок, заголовки таблиц и указание языка. Проверка на скорую руку выглядит так: попробуйте выделить абзац мышью. Не выделяется — перед вами изображение страницы, и никакая программа чтения с ним не справится.

Локально в браузеребез регистрации

Коротко о цифрах

Проверка за пять секунд
текст выделяется мышью — значит, он есть в файле
Что нужно программе чтения
порядок и роли из дерева тегов, а не координаты на странице
Скан без распознавания
ноль символов в файле: читать нечего
Что убивает доступность необратимо
растеризация страниц при сжатии
Чего не делаем мы
не создаём теги, описания изображений и порядок чтения

Из чего складывается доступность

  • Настоящий текст вместо картинки текста — без этого остальное не имеет смысла.
  • Дерево структуры: заголовки, абзацы, списки, ячейки таблиц с их ролями.
  • Порядок чтения, заданный явно, а не выведенный из расположения на странице.
  • Текстовые описания изображений; декоративные картинки, наоборот, помечаются как несущественные, чтобы их не зачитывали.
  • Язык документа и язык отдельных фрагментов — для двуязычных документов это не формальность, а разница между речью и набором звуков.
  • Заголовок документа и осмысленное имя, которое программа произносит при открытии файла.

Почему скан — самый недоступный документ

Отсканированная страница — это одна большая картинка. В файле нет ни одного символа, поэтому программе чтения нечего произносить: она сообщит о пустой странице. Ни размер файла, ни разрешение скана, ни его качество на это не влияют.

Единственный способ сделать такой документ читаемым — распознавание, которое добавляет текстовый слой поверх изображения. Но распознавание решает только первую задачу из шести: слой появляется, а структура, порядок и описания картинок — нет. Доступность и наличие текста — не одно и то же, и подменять одно другим нечестно.

Что можно и чего нельзя сделать нашими инструментами

Мы не расставляем теги, не пишем описания к изображениям и не задаём порядок чтения — таких инструментов у нас нет, и притворяться иначе бессмысленно. Зато есть три вещи, которые реально в вашей власти. Первая: не ухудшать. Если у документа есть текстовый слой, не прогоняйте его через сжатие с растеризацией — оно превратит текст в пиксели необратимо.

Вторая: для уменьшения веса брать оптимизацию структуры, а не перерисовку страниц. Она перекладывает объекты внутри файла и не трогает ни текст, ни шрифты, поэтому документ после неё остаётся ровно таким же читаемым, каким был. Третья: проверить, есть ли текст вообще. Извлечение текста возвращает пустой результат ровно там, где страницы — картинки, и это самый быстрый способ понять, с чего начинать.

Частые вопросы

Достаточно ли распознавания, чтобы документ стал доступным?

Нет. Распознавание даёт текстовый слой, но не даёт ни структуры, ни ролей, ни описаний картинок. Это необходимый первый шаг из нескольких, а не решение задачи целиком.

Как быстро понять, что документ недоступен?

Попробуйте выделить абзац и скопировать его. Если ничего не выделяется — страницы являются картинками. Если текст копируется вперемежку, порядок чтения не задан, и программа чтения выдаст ту же кашу.

Влияет ли доступность на размер файла?

Почти нет. Дерево тегов и описания картинок — это текстовые данные, они весят единицы килобайт на фоне изображений и встроенных шрифтов. Экономить на них бессмысленно даже ради веса.

Обязателен ли доступный формат для моих документов?

Это зависит от того, кому вы их сдаёте: требования отличаются у площадок, ведомств и заказчиков. Уточняйте у принимающей стороны, какой именно стандарт и какие проверки она применяет.

Рядом