Как разбить PDF по главам
Границы глав задаются вручную: по закладкам инструмент не режет, потому что в файле их может не быть вовсе, а в сканах их не бывает почти никогда. Порядок такой: открыть документ, выписать первую и последнюю страницу каждой главы, а потом вырезать главы по одной — режим диапазонов собирает один файл за проход, сколько бы диапазонов вы ни перечислили.
Коротко о цифрах
- Деление по закладкам
- не поддерживается, границы задаются вручную
- Режим диапазонов
- один файл за проход, сколько бы диапазонов ни ввели
- Имя результата
- имя_исходника_extracted.pdf
- Закладки в главах
- не появятся
- Метаданные
- заголовок, автор, тема и создатель переносятся
Как быстро найти границы глав
- Если в файле есть дерево закладок, откройте его боковой панелью просмотрщика: рядом с каждым пунктом видна страница, на которую он ведёт.
- Если закладок нет, но есть оглавление на бумаге, помните про сдвиг: в книгах нумерация обычно начинается после титула и предисловия, и «страница 7» в оглавлении — это восьмой или девятый лист файла.
- Для скана без оглавления вытащите текстовый слой и найдите в нём заголовки — так границы находятся быстрее, чем перелистыванием.
- У скана без текстового слоя останется только пролистать документ: распознавания текста у нас нет, и придумывать его не будем.
Почему главы вырезаются по одной
Режим диапазонов устроен как вырезка, а не как деление: он берёт все перечисленные страницы и складывает их в ОДИН документ. Запись «1-12, 13-40» даст не две главы, а один файл на сорок страниц — ровно то же, что «1-40». Разделитель между главами в результат не записывается, потому что его негде хранить.
Поэтому глава = проход. Ввели «1-12», сохранили, переименовали в chapter-01. Ввели «13-40», сохранили, переименовали. На книге из десяти глав это десять коротких заходов, зато имена и содержимое получаются ровно теми, что нужны, а не «безымянный_extracted (3)».
Что теряется при разбивке
- Закладки: в вырезанной главе их не будет, даже если в исходнике они были — дерево лежит в каталоге документа и при пересборке не воспроизводится.
- Внутренние отсылки вида «см. с. 87» остаются текстом и продолжают ссылаться на старую нумерацию всей книги.
- Нумерация, напечатанная на страницах, не пересчитывается: глава, начинавшаяся с 13-й страницы, так и откроется числом 13 в углу.
- Метаданные документа — заголовок, автор, тема — переносятся в каждую главу, так что имя книги в свойствах файла сохранится.
Частые вопросы
Почему сервис не может разрезать книгу по закладкам сам?
Потому что закладки есть далеко не у всех файлов: у сканов их не бывает, у документов из офисных программ они часто пустые, а во многих книгах закладками отмечены не главы, а произвольные места. Автоматика на таком материале режет не там.
Как понять, где кончается глава, если оглавления нет?
Извлеките текстовый слой и поищите в нём повторяющиеся заголовки — «Глава», «Раздел», номера. Каждое совпадение подскажет примерную страницу, а точную границу останется уточнить, пролистав пару листов вокруг найденного места.
Можно ли одним заходом получить архив из всех глав?
Только если главы совпадают со страницами, то есть в постраничном режиме. Для настоящих глав разной длины архива не получится: каждый диапазон требует отдельного прохода, потому что вырезка складывает всё перечисленное в один документ.
Стоит ли резать книгу на главы ради веса?
Обычно нет: сумма глав получится тяжелее исходника, потому что общие шрифты встроятся в каждый файл заново. Резать на главы имеет смысл ради удобства чтения и отправки, а для уменьшения веса лучше подходит сжатие.