Қазақша мәтінді қалай тану керек
Қазақ тілі бізде орыс және ағылшын тілдерімен бірдей танылады: kaz пакеті серверде орнатылған және пішінде тікелей таңдалады. Онлайн танудың ішінде мұндайы орыс тілінің қолдауына қарағанда әлдеқайда сирек кездеседі. Бірақ екінші жартысын да бірден айтқан адал: қазақшада дәлдік төмен. Оған tesseract-те үйрету деректері азырақ, ал ә, ғ, қ, ң, ө, ұ, ү, һ, і әріптері қалғандарынан жиі жаңылысады.
Сандар туралы қысқаша
- Тіл пакеті
- tesseract 4.1.1 үшін kaz, серверде орнатылған
- Тізімдегі көршілері
- rus және eng — kaz-бен бірге қосуға болады
- Тілдер реті
- кириллица бірінші: даулы таңба соның пайдасына шешіледі
- Қаупі жоғары әріптер
- ә, ғ, қ, ң, ө, ұ, ү, һ, і
- Дәлдіктің төмен болу себебі
- қазақ тіліне үйрету деректері орыс пен ағылшыннан аз
Қазақша неге қиынырақ түседі
Танушы әріпті оқымайды — ол суреттегі пішінді үйрену кезінде көргенімен салыстырады. Нақты әріптің әртүрлі қаріпте, әртүрлі баспа сапасында берілген мысалы модельге неғұрлым көп түссе, ол соғұрлым сенімді таниды. Орыс пен ағылшын орасан корпустардан жиналған, қазақ тілінікі әлдеқайда шағын, және бұл дәл орыс әліпбиінде жоқ әріптерден көрінеді.
Екінші қиындық — пішіндердің өзі. Ұ мен У бір көлденең сызықпен ажырайды, Ү мен У бұтақтарының еңкейуімен, І мен I бір-біріне дерлік ұқсас, ал ғ әрпі г-дан қысқа көлденеңімен ерекшеленеді. 300 DPI таза сканда мұндай бөлшектер көрінеді, 150 DPI-де немесе жағылған көшірмеде көлденең сызық бірінші болып жоғалады да, әріп өзінің орысша көршісіне айналады.
Нәтиже жақсы болу үшін не істеу керек
- 150 емес, 300 DPI-мен сканерлеңіз: қазақ әріптерінің жіңішке элементтері рұқсаттылық түскенде бірінші болып жоғалады.
- Орысша және қазақша үзінділер бар құжатта екі тілді бірден таңдаңыз — файлды екі рет өткізудің қажеті жоқ әрі зияны бар.
- Тілдер тізімінде кириллица бірінші тұрады, сондықтан даулы таңба соның пайдасына шешіледі; қазақ тілі үшін бұл дұрыс мінез.
- Баспадан шыққан құжат көшірменің көшірмесін қайта сканерлегеннен әлдеқайда жақсы танылады.
- Танудан кейін нәтижені ә немесе қ бар сөзбен іздеп тексеріңіз — қателер сол жерден тез көрінеді.
Танудан кейін қазақша мәтінді қалай тексеру керек
- Танылған файлдың мәтінін TXT-ке шығарыңыз — сонда қабатты іздеу саңылауы арқылы емес, тұтас көресіз.
- Алғашқы абзацты оқыңыз: ә орнына а, қ орнына к келгені бірден байқалады.
- Тегі мен жер атауларын тексеріңіз — қате сол жерде қымбат тұрады және қолмен түзетуге тура келеді.
- PDF ішінен ұ немесе ү бар сөзді іздеңіз: табылса, қабат дұрыс жатқаны.
- Нәтиже бүкіл құжатта нашар болса, себебі әрдайым дерлік түпнұсқада: оригиналды ірілеу етіп қайта сканерлеңіз.
Жиі қойылатын сұрақтар
Құжатта орысша да, қазақша да болса, оны екі рет өткізу керек пе?
Жоқ, екінші өту тек нәтижені бұзады. Екі тілді бірден таңдаңыз: танушы оларды бір тізіммен алып, әр әріп бойынша шешім қабылдайды, ал екі бөлек өту қабаттарды бірінің үстіне бірін жазып тастайды.
Қазақ әріптері неге орысшаға айналып кетеді?
Ұ, ү, ғ және қ орысша көршілерінен бір ғана жіңішке бөлшекпен — көлденең сызықпен немесе штрихтың еңкейуімен — ажырайды. Төмен рұқсаттылықта сол бөлшек бірінші жоғалады да, модель орыс әліпбиіндегі жиірек әріпті таңдайды.
Қазақ латын жазуы қолдау табады ма?
Серверде тек rus, kaz және eng орнатылған, ал kaz пакеті кириллицада үйретілген. Латын әліпбиіндегі қазақша жазуды қозғалтқыш ағылшын моделімен оқымақ болады да, ерекше диакритикада жаңылысады.
Құжатты қайта сканерлесем, нәтиже қаншалықты дәл болады?
Түпнұсқа дюймге 300 нүктеден ұсақ болса немесе көшірменің көшірмесі болса, айтарлықтай дәлірек. Нақты пайыз уәде етудің мәні жоқ: нәтиже қаріпке, қағаздың күйіне және баспа контрастына тәуелді.