Перейти к содержимому
pdftools.kz

Формат TXT

В файле .txt нет ни шрифтов, ни абзацев, ни разметки — только последовательность байтов и переводы строк. Поэтому единственное, что может пойти не так, идёт не так постоянно: программа-читатель угадывает кодировку. Наш инструмент извлечения текста из PDF отдаёт .txt в UTF-8 и специально дописывает в начало метку порядка байтов, иначе Блокнот и Excel на русской или казахской системе прочитают файл как CP1251.

Локально в браузеребез регистрации

Коротко о цифрах

Что мы дописываем
U+FEFF в начало .txt при выгрузке текста из PDF
Зачем
без метки Блокнот и Excel читают файл как CP1251
Почему нельзя иначе
параметр charset остаётся в браузере, в файл не попадает
Переводы строк
0D 0A в Windows, 0A в macOS и Linux
Обратный маршрут
TXT → PDF напрямую нет: HTML → PDF берёт .html и .htm

Почему мы дописываем BOM

Метка порядка байтов — это символ U+FEFF в самом начале файла. Формально в UTF-8 он не нужен, но на практике именно он говорит Блокноту и Excel, что перед ними Unicode, а не однобайтовая кодовая страница. Без него казахские ә, і, ң, ғ, ү, ұ, қ, ө, һ превращаются в набор случайных символов ещё до того, как вы успеете что-то заподозрить.

Указать кодировку иначе, к сожалению, некуда: параметр charset у скачиваемого объекта — это метаданные браузера, в сам файл он не попадает. На диске остаётся голая последовательность байтов, и подсказкой служит только BOM.

Две вещи, которые ломают текстовый файл

  • Кодировка: UTF-8 против CP1251. Открылось мойвой — попробуйте открыть файл заново, явно указав кодировку.
  • Переводы строк: Windows пишет пару байт 0D 0A, macOS и Linux — один 0A.
  • Старый Блокнот показывал файл с одиночными 0A одной длинной строкой; современные редакторы это уже понимают.
  • Ни шрифта, ни размера, ни жирного начертания в TXT нет — сохранять там оформление бессмысленно.
  • Табуляция выглядит по-разному в разных программах: для таблиц надёжнее формат CSV, а не выравнивание пробелами.

Как получить PDF из TXT

  1. Прямого конвертера TXT → PDF у нас нет — маршрут HTML → PDF принимает только .html и .htm.
  2. Первый обход: откройте текст в Word или LibreOffice Writer, задайте шрифт и поля, сохраните как .docx.
  3. Загрузите .docx в конвертер Word → PDF: до 25 МБ, печать идёт на сервере.
  4. Второй обход: оберните текст в файл .html тегом <pre>, чтобы сохранить переносы строк как есть.
  5. Замените в тексте символы < и & их HTML-эквивалентами, иначе часть строк исчезнет при разборе.
  6. Загрузите .html в наш конвертер: страница A4 размером 8,27 × 11,69 дюйма и поля 0,4 дюйма выставлены заранее, предел файла — 10 МБ.

Частые вопросы

Почему вместо казахских букв в TXT кракозябры?

Файл сохранён в UTF-8, а программа читает его как однобайтовую кодовую страницу. Откройте текст заново с явным выбором UTF-8 или пересохраните файл с меткой порядка байтов в начале.

Что такое BOM и мешает ли он?

Это три служебных байта в начале файла, обозначающих Unicode. Человеку они не видны, но некоторые парсеры считают их частью первой строки, поэтому в программном разборе метку принято отбрасывать явно.

Можно ли превратить TXT в PDF на вашем сайте?

Напрямую нет: такого инструмента у нас нет, и обещать его мы не будем. Рабочих обхода два — через .docx в конвертере Word и через .html в конвертере HTML.

Сохранится ли оформление, если сохранить документ как TXT?

Нет, и это свойство формата, а не ошибка. Останется только текст: шрифты, начертания, таблицы и картинки в текстовом файле хранить негде, там есть лишь байты и переводы строк.

Рядом