Формат TXT
В файле .txt нет ни шрифтов, ни абзацев, ни разметки — только последовательность байтов и переводы строк. Поэтому единственное, что может пойти не так, идёт не так постоянно: программа-читатель угадывает кодировку. Наш инструмент извлечения текста из PDF отдаёт .txt в UTF-8 и специально дописывает в начало метку порядка байтов, иначе Блокнот и Excel на русской или казахской системе прочитают файл как CP1251.
Коротко о цифрах
- Что мы дописываем
- U+FEFF в начало .txt при выгрузке текста из PDF
- Зачем
- без метки Блокнот и Excel читают файл как CP1251
- Почему нельзя иначе
- параметр charset остаётся в браузере, в файл не попадает
- Переводы строк
- 0D 0A в Windows, 0A в macOS и Linux
- Обратный маршрут
- TXT → PDF напрямую нет: HTML → PDF берёт .html и .htm
Почему мы дописываем BOM
Метка порядка байтов — это символ U+FEFF в самом начале файла. Формально в UTF-8 он не нужен, но на практике именно он говорит Блокноту и Excel, что перед ними Unicode, а не однобайтовая кодовая страница. Без него казахские ә, і, ң, ғ, ү, ұ, қ, ө, һ превращаются в набор случайных символов ещё до того, как вы успеете что-то заподозрить.
Указать кодировку иначе, к сожалению, некуда: параметр charset у скачиваемого объекта — это метаданные браузера, в сам файл он не попадает. На диске остаётся голая последовательность байтов, и подсказкой служит только BOM.
Две вещи, которые ломают текстовый файл
- Кодировка: UTF-8 против CP1251. Открылось мойвой — попробуйте открыть файл заново, явно указав кодировку.
- Переводы строк: Windows пишет пару байт 0D 0A, macOS и Linux — один 0A.
- Старый Блокнот показывал файл с одиночными 0A одной длинной строкой; современные редакторы это уже понимают.
- Ни шрифта, ни размера, ни жирного начертания в TXT нет — сохранять там оформление бессмысленно.
- Табуляция выглядит по-разному в разных программах: для таблиц надёжнее формат CSV, а не выравнивание пробелами.
Как получить PDF из TXT
- Прямого конвертера TXT → PDF у нас нет — маршрут HTML → PDF принимает только .html и .htm.
- Первый обход: откройте текст в Word или LibreOffice Writer, задайте шрифт и поля, сохраните как .docx.
- Загрузите .docx в конвертер Word → PDF: до 25 МБ, печать идёт на сервере.
- Второй обход: оберните текст в файл .html тегом <pre>, чтобы сохранить переносы строк как есть.
- Замените в тексте символы < и & их HTML-эквивалентами, иначе часть строк исчезнет при разборе.
- Загрузите .html в наш конвертер: страница A4 размером 8,27 × 11,69 дюйма и поля 0,4 дюйма выставлены заранее, предел файла — 10 МБ.
Частые вопросы
Почему вместо казахских букв в TXT кракозябры?
Файл сохранён в UTF-8, а программа читает его как однобайтовую кодовую страницу. Откройте текст заново с явным выбором UTF-8 или пересохраните файл с меткой порядка байтов в начале.
Что такое BOM и мешает ли он?
Это три служебных байта в начале файла, обозначающих Unicode. Человеку они не видны, но некоторые парсеры считают их частью первой строки, поэтому в программном разборе метку принято отбрасывать явно.
Можно ли превратить TXT в PDF на вашем сайте?
Напрямую нет: такого инструмента у нас нет, и обещать его мы не будем. Рабочих обхода два — через .docx в конвертере Word и через .html в конвертере HTML.
Сохранится ли оформление, если сохранить документ как TXT?
Нет, и это свойство формата, а не ошибка. Останется только текст: шрифты, начертания, таблицы и картинки в текстовом файле хранить негде, там есть лишь байты и переводы строк.