Как перевести PDF в текстовый файл
Результат — обычный .txt в кодировке UTF-8, причём в начало файла добавляется метка кодировки: без неё Блокнот на Windows и мастер импорта в Excel регулярно принимают кириллицу за другую кодировку и показывают вопросительные знаки. Страницы разделяются пустой строкой, переносы внутри абзацев сохраняются. Всё остальное оформление исчезает — плоский текст не умеет хранить ни таблиц, ни колонок, ни начертаний.
Коротко о цифрах
- Формат результата
- .txt в UTF-8 с меткой кодировки в начале файла
- Разделение страниц
- пустая строка между страницами
- Что теряется
- таблицы, колонки, начертания, изображения
- Где обрабатывается
- в браузере, документ не уходит на сервер
- Имя файла
- берётся из исходного, расширение меняется на .txt
Что происходит со структурой
Таблица превращается в последовательность строк: значения ячеек идут одно за другим в том порядке, в каком они были записаны в файл. Иногда это ровные строки, которые легко разобрать по разделителю, иногда — перемешанные обрывки, если генератор писал ячейки не по порядку чтения.
Двухколоночная вёрстка — самый неприятный случай. Порядок текста в PDF задаётся не тем, как страница выглядит, а тем, как её записали. Поэтому колонки могут выйти либо аккуратно одна за другой, либо чередующимися строками поперёк обеих. Если результат выглядит перепутанным, попробуйте сначала разрезать страницы пополам обрезкой и обработать половины по отдельности.
Колонтитулы, номера страниц и сноски вклиниваются в текст на своих местах — они такие же надписи, как остальные, и отличить их автоматически не от чего. Проще всего вычистить их поиском и заменой уже в текстовом редакторе.
Что делать с готовым файлом
- Импорт в Excel: если ячейки вышли ровными строками, используйте мастер импорта с разделителем — точкой с запятой, табуляцией или несколькими пробелами.
- Вычитка в Word: вставьте текст и включите отображение непечатаемых знаков, чтобы увидеть лишние переносы строк и убрать их одной заменой.
- Поиск по большому документу: .txt открывается мгновенно и ищется любым редактором, тогда как многостраничный PDF на телефоне открывается долго.
- Дальнейшая обработка скриптом: плоский текст в UTF-8 читается любым языком без библиотек для PDF.
Порядок работы
- Загрузите PDF в инструмент извлечения текста — обработка идёт во вкладке, файл никуда не отправляется.
- Дождитесь прохода по страницам и посмотрите, не появился ли список пропущенных.
- Просмотрите текст в окне: сразу видно, ровно ли легли таблицы и колонки.
- Скачайте .txt или скопируйте нужный фрагмент прямо из окна, если файл целиком не нужен.
- Откройте файл в редакторе и уберите повторяющиеся колонтитулы поиском и заменой.
Частые вопросы
Зачем в начале файла метка кодировки?
Она подсказывает программе, что перед ней UTF-8. Без неё стандартный Блокнот и мастер импорта в Excel нередко угадывают кодировку неправильно, и кириллица с казахскими буквами превращается в вопросительные знаки или иероглифы.
Почему строки таблицы перемешались?
Порядок текста в PDF определяется порядком записи, а не внешним видом страницы. Если генератор писал ячейки по столбцам, а не по строкам, плоский текст повторит именно эту последовательность, и её придётся разбирать вручную.
Можно ли получить текст только с нескольких страниц?
Извлеките нужные страницы отдельным PDF, а затем обработайте его. Так вы не будете ждать прохода по всему документу и получите ровно тот фрагмент, который нужен, без ручной чистки.
Чем это отличается от конвертации в Word?
Текстовый файл сохраняет только слова, зато делает это в браузере и без искажений. Конвертация в Word пытается восстановить абзацы и таблицы, идёт на сервере и на сложной вёрстке ошибается.