Перейти к содержимому
pdftools.kz
Конвертация

Как перевести PDF в текстовый файл

Результат — обычный .txt в кодировке UTF-8, причём в начало файла добавляется метка кодировки: без неё Блокнот на Windows и мастер импорта в Excel регулярно принимают кириллицу за другую кодировку и показывают вопросительные знаки. Страницы разделяются пустой строкой, переносы внутри абзацев сохраняются. Всё остальное оформление исчезает — плоский текст не умеет хранить ни таблиц, ни колонок, ни начертаний.

Локально в браузередо 1 ГБбез регистрации

Коротко о цифрах

Формат результата
.txt в UTF-8 с меткой кодировки в начале файла
Разделение страниц
пустая строка между страницами
Что теряется
таблицы, колонки, начертания, изображения
Где обрабатывается
в браузере, документ не уходит на сервер
Имя файла
берётся из исходного, расширение меняется на .txt

Что происходит со структурой

Таблица превращается в последовательность строк: значения ячеек идут одно за другим в том порядке, в каком они были записаны в файл. Иногда это ровные строки, которые легко разобрать по разделителю, иногда — перемешанные обрывки, если генератор писал ячейки не по порядку чтения.

Двухколоночная вёрстка — самый неприятный случай. Порядок текста в PDF задаётся не тем, как страница выглядит, а тем, как её записали. Поэтому колонки могут выйти либо аккуратно одна за другой, либо чередующимися строками поперёк обеих. Если результат выглядит перепутанным, попробуйте сначала разрезать страницы пополам обрезкой и обработать половины по отдельности.

Колонтитулы, номера страниц и сноски вклиниваются в текст на своих местах — они такие же надписи, как остальные, и отличить их автоматически не от чего. Проще всего вычистить их поиском и заменой уже в текстовом редакторе.

Что делать с готовым файлом

  • Импорт в Excel: если ячейки вышли ровными строками, используйте мастер импорта с разделителем — точкой с запятой, табуляцией или несколькими пробелами.
  • Вычитка в Word: вставьте текст и включите отображение непечатаемых знаков, чтобы увидеть лишние переносы строк и убрать их одной заменой.
  • Поиск по большому документу: .txt открывается мгновенно и ищется любым редактором, тогда как многостраничный PDF на телефоне открывается долго.
  • Дальнейшая обработка скриптом: плоский текст в UTF-8 читается любым языком без библиотек для PDF.

Порядок работы

  1. Загрузите PDF в инструмент извлечения текста — обработка идёт во вкладке, файл никуда не отправляется.
  2. Дождитесь прохода по страницам и посмотрите, не появился ли список пропущенных.
  3. Просмотрите текст в окне: сразу видно, ровно ли легли таблицы и колонки.
  4. Скачайте .txt или скопируйте нужный фрагмент прямо из окна, если файл целиком не нужен.
  5. Откройте файл в редакторе и уберите повторяющиеся колонтитулы поиском и заменой.

Частые вопросы

Зачем в начале файла метка кодировки?

Она подсказывает программе, что перед ней UTF-8. Без неё стандартный Блокнот и мастер импорта в Excel нередко угадывают кодировку неправильно, и кириллица с казахскими буквами превращается в вопросительные знаки или иероглифы.

Почему строки таблицы перемешались?

Порядок текста в PDF определяется порядком записи, а не внешним видом страницы. Если генератор писал ячейки по столбцам, а не по строкам, плоский текст повторит именно эту последовательность, и её придётся разбирать вручную.

Можно ли получить текст только с нескольких страниц?

Извлеките нужные страницы отдельным PDF, а затем обработайте его. Так вы не будете ждать прохода по всему документу и получите ровно тот фрагмент, который нужен, без ручной чистки.

Чем это отличается от конвертации в Word?

Текстовый файл сохраняет только слова, зато делает это в браузере и без искажений. Конвертация в Word пытается восстановить абзацы и таблицы, идёт на сервере и на сложной вёрстке ошибается.

Рядом

Частые задачи с этим инструментом