PDF для научной работы
Научную работу читают не только люди: её проверяют системы, которым нужен текст, а не картинка страницы. Поэтому главное требование к готовому PDF — сохранённый текстовый слой. Конвертация из редактора его сохраняет, скан и фотография страницы — нет. Второе требование касается формул: они переносятся как содержимое страницы, а не как исходный код, и проверять их надо глазами, а не полагаться на успешное завершение конвертации.
Коротко о цифрах
- Главный признак пригодности
- текст выделяется мышью на любой странице
- Переносы строк при извлечении
- берутся из признака конца строки
- Нормализация текста
- разложенные казахские буквы собираются, лигатуры разбираются
- Предел конвертации
- 25 МБ и 60 секунд на файл
- Оформление по требованиям вуза
- не проверяется
Что проверить сразу после конвертации
- Выделите текст мышью на случайной странице: если он не выделяется, работа стала изображением и проверку не пройдёт.
- Пролистайте формулы: подстрочные и надстрочные индексы съезжают чаще остального, особенно при подстановке шрифта.
- Проверьте сноски внизу страниц — при смене шрифта они первыми переезжают на следующий лист.
- Просмотрите таблицы: широкие таблицы ведут себя так же, как в любом другом документе, и требуют настройки до выгрузки.
- Убедитесь, что список литературы не разорван посередине записи, а нумерация ссылок совпадает с текстом.
- Соберите основную часть и приложения в один файл, если сдаётся один документ.
Почему текстовый слой важнее оформления
Текстовый слой — это то, что позволяет искать по работе, цитировать её без перепечатки и проверять автоматически. Извлечение отдаёт его с сохранёнными переносами строк: конец строки берётся из признака, который выдаёт движок чтения, а не угадывается по расстояниям, поэтому абзацы не слипаются в одну строку.
Дополнительно текст приводится к единой нормальной форме. Это важнее, чем кажется: одна и та же казахская буква записывается либо единым символом, либо как база плюс отдельный диакритический знак, и поиск по такому тексту промахивается мимо очевидных совпадений. Латинские лигатуры, которые генератор отдаёт склеенными, разбираются обратно на отдельные буквы.
Ограничения и честные оговорки
- Конвертация выполняется на сервере: файл до 25 МБ, 60 секунд на обработку, не более десяти конвертаций за десять минут с одного адреса.
- Шрифты берутся из набора на сервере: редкая гарнитура заменяется на близкую, и вёрстка, свёрстанная впритык, может сдвинуться.
- Мы не проверяем оформление по требованиям вашей организации: поля, интервалы и правила оформления списка литературы задаёт она, а не формат файла.
- Мы не создаём закладки и оглавление с переходами — они формируются в редакторе и переносятся вместе с документом.
- Работа, собранная из сканов, машиночитаемой не станет: текстового слоя в ней нет, и появиться ему неоткуда без распознавания.
Частые вопросы
Почему нельзя сдавать работу сканом?
В скане нет текстового слоя — это изображения страниц. Любая автоматическая проверка увидит пустой документ, а процитировать оттуда фрагмент можно будет только перепечатав его вручную.
Формулы после конвертации выглядят иначе. Что случилось?
Скорее всего, подставлен другой шрифт: индексы и знаки операций смещаются от смены гарнитуры сильнее обычного текста. Проверяйте формулы глазами, успешное завершение конвертации этого не гарантирует.
Как быстро проверить, что текстовый слой на месте?
Выделить мышью абзац на случайной странице и попробовать скопировать его. Если выделение не появляется или копируется пустота, работа стала набором изображений и требует пересборки.
Поиск не находит казахское слово в моей работе. Почему?
Буква записана как база с отдельным диакритическим знаком, а вы ищете единый символ. Выглядят они одинаково, но это разные последовательности, и без приведения к общей форме совпадения не будет.