PDF ішіндегі мәтінді тану
Тану сканды өңделетін құжатқа айналдырмайды — ол бет суретінің астына көрінбейтін мәтін қабатын төсейді. Файл сырттай сол күйінде қалады, соңғы пикселіне дейін, бірақ ондағы мәтін енді тінтуірмен бөлектеніп, көшіріліп, іздеуден табылады. Бұл жұмысты біздің серверде tesseract 4.1.1 үстіндегі ocrmypdf 13.4 атқарады, тілдері rus, kaz және eng. Шектер алдын ала айтылады: бір файлға 20 беттен және 30 МБ-тан аспайды, әр бетке шамамен 2–5 секунд.
Сандар туралы қысқаша
- Файлға не қосылады
- бет суретінің астындағы көрінбейтін мәтін қабаты
- Қозғалтқыш
- tesseract 4.1.1 үстіндегі ocrmypdf 13.4.0
- Тілдер
- rus, kaz, eng — жеке де, бірге де
- Бір файлдың шегі
- 20 бет және 30 МБ
- Жылдамдық
- бетіне шамамен 2–5 секунд
Файлмен нақты не болады
Скан беті — бір үлкен сурет. Онда таңбалар жоқ: іздеу әріптердің кодтарын іздейді, ал суретте пиксельдер жатыр, олардың арасынан табатын ештеңе жоқ. Тану суретке қарап әріп пішіндерін тауып, тапқанын координаттарымен бірге кәдімгі мәтін етіп жазады — әрпі суретте тұрған дәл сол жерге. Қабат мөлдір етіліп, суреттің астына кетеді, сондықтан көзге көрінетін ештеңе өзгермейді.
Бұдан бірден қабылдаған жөн салдар шығады: танудан кейін де құжатты өңдей алмайсыз. Экранда көрініп тұрғаны — қағаздың фотосуреті, мәтін емес. Өзгеретіні басқа: Ctrl+F жұмыс істей бастайды, абзац тінтуірмен бөлектенеді, ал мәтінді шығару бос файл беруін қояды. Шарттар топтамасы немесе сканерленген оқулық үшін файлдан күтетіні дәл осы.
Жұмыс тәртібі
- Алдыңызда шынымен скан тұрғанына көз жеткізіңіз: абзацты тінтуірмен бөлектеп көріңіз. Бөлектелсе — танитын ештеңе жоқ, мәтін бұрыннан бар.
- Көлемін тексеріңіз: файл 30 МБ-қа дейін және 20 беттен ұзын емес. Ұзынырақ құжатты алдымен бөліктерге бөліңіз.
- PDF жүктеп, беттерде бар тілдерді таңдаңыз. Артығын қоспаған жөн — олар әр бетке қосымша жұмыс әкеледі.
- Тануды іске қосып, аяқталуын күтіңіз: бетіне 2–5 секундтан санаңыз.
- Нәтижені жүктеп алып, іздеумен тексеріңіз — бірінші бетте нақты бар сөзді іздеп көріңіз.
- Ештеңе табылмаса, тану бос қабат қайтарған жағдайдың талдауын қараңыз.
Алдын ала білген жөн шектер
- Файл серверге кетеді: тануды браузерде есептеу мүмкін емес, біздің он тоғыз клиенттік құралымыздан айырмашылығы осы.
- Шифрланған құжат жұмыс басталмай тұрып қабылданбайды — алдымен құпиясөзді шешіңіз, сосын таныңыз.
- Мәтіні бұрыннан бар беттер қолға тимей өткізіліп жіберіледі: скан мен баспадан құралған аралас құжат толық өңделеді, бірінші мәтіндік бетте құламайды.
- Бет суреті қайта сығылмайды: шығыс кәдімгі PDF күйінде, PDF/A-ға айналдырусыз, ал оңтайландыру тек жоғалтусыз қолданылады.
- Қолжазба мәтін іс жүзінде танылмайды — бұл баптаудың емес, қозғалтқыштың шектеуі.
Жиі қойылатын сұрақтар
Танудан кейін мәтінді өңдей аламын ба?
Жоқ. Беттің көрінетін бөлігі сурет күйінде қалады, ал танылған мәтін оның астында көрінбейтін қабатта жатады. Іздеу, бөлектеу және көшіру өзгереді, ал экранда көріп тұрған суретіңіз өзгермейді.
Басқа құралдар браузерде жұмыс істесе, файлды неге серверге жіберу керек?
Тану үшін браузерде жоқ tesseract қозғалтқышы мен растеризатор қажет. Біз бұл фактіні жасырмаймыз: құрал беті серверлік деп белгіленген, файл шынымен біздің машинаға барып, өңделіп, өшіріледі.
Бір бөлігінде мәтіні бар құжатпен не болады?
Ондай беттер өзгеріссіз өткізіліп жіберіледі, тану тек қалғанына қолданылады. Аралас топтамалар — қалыпты жағдай, сканның ортасындағы бір мәтіндік парақ бүкіл файлдың өңделуін құлатпауы керек.
Файл көлемі қаншалықты өседі?
Азғантай ғана. Мәтін қабаты — таңбалар мен координаттар, олар бетіне бірнеше килобайт қана алады, ал суреттер шығыста қайта сығылмайды, себебі оңтайландыру тек жоғалтусыз қолданылады.