PDF-тегі қазақ тіліндегі құжаттар: неге ізделмейді және көшірілмейді
Себеп дәл үшеу және әрқайсысы бөлек емделеді. Біріншісі: файлда мәтін мүлде жоқ — бұл скан, беттің суреті, онда іздейтін ештеңе жоқ. Екіншісі: мәтін бар, бірақ қаріпте таңбаға сәйкестік кестесі жоқ, сондықтан көшіру бөгде әріптер жинағын береді. Үшіншісі: құжат қазақ әріптері латын орнында тұрған юникодқа дейінгі қаріппен жасалған.
Сандар туралы қысқаша
- Мәтін шығару
- толығымен браузерде, бос нәтиже сканды білдіреді
- Тану тілдері
- орыс, қазақ, ағылшын — жеке немесе бірге
- Тану шегі
- бір файлға 20 бет және 30 МБ
- Бүлінген қаріптің белгісі
- экранда мәтін оқылады, ал алмасу буферіне басқа таңбалар түседі
- Нені жөндемейміз
- бөгде файлдағы сәйкестік кестесін — оны тек тану қалпына келтіреді
Себептерді бір-бірінен қалай ажыратуға болады
- Жолды тінтуірмен бөліп көріңіз. Әріптеп емес, беттің тұтас тіктөртбұрышымен бөлінсе — алдыңызда скан.
- Бөлінгенді кез келген мәтін редакторына көшіріңіз. Сол сөздер келсе — мәтін қабаты дұрыс.
- ә, ғ, қ, ң, ө, ұ, ү, һ, і орнына латын әрпі немесе мағынасыз таңба келсе — қаріп пен оның сәйкестік кестесі кінәлі.
- Көшіру істеп тұрса да, экранда көрген сөзді іздеу таппаса — сөздің файлда қандай таңбамен терілгенін тексеріңіз.
- Файлды мәтін шығарудан өткізіңіз: бос нәтиже сканды, қоқыс мәтін қаріп мәселесін растайды.
Әр жағдайда не істеу керек
Скан танумен емделеді: сурет үстіне мәтін қабаты қосылады, содан кейін құжат ізделеді әрі көшіріледі. Қазақ тілі орыс және ағылшын тілімен қатар қолдау көреді, ал тану серверде жүреді, өйткені мұндай сөздік браузерге сыймас еді.
Қаріптің бүлінген сәйкестік кестесі мүлде жөнделмейді — бұл сізге жіберілген файлдың ақауы. Практикалық шешім сол: беттерді қайта тану, мәтінді бүлінген кестеден емес, суреттен алу. Қоса тексеріңіз: кейде көшірудегі қоқыс құжаттың бөтен бөліктерден жиналғанын әшкерелейді.
Юникодқа дейінгі қаріптер — тоқсаныншы жылдар мен екі мыңыншы жылдардың басынан қалған мұра, ол кезде қазақ әріптерін басқа әліпбилердің код орындарына қоятын. Экранда мәтін дұрыс көрінеді, ал файл ішінде мүлде басқа таңбалар жатыр.
Біз не істейміз, нені істемейміз
- Мәтін шығару файлда жазылғанды дәл сол күйінде алады және не айтылғысы келгенін болжамайды.
- Тану беттің суретімен жұмыс істейді, сондықтан түпнұсқаның қандай қаріппен терілгеніне тәуелді емес.
- PDF редакторы бар мәтін қабатын түзетеді; сканда оның жұмысы жоқ, ол бұл туралы тура хабарлайды.
- Мәтінді аудармаймыз, емлесін тексермейміз және латынды кириллге ауыстырмаймыз.
Жиі қойылатын сұрақтар
Бетте көрініп тұрған сөзді іздеу неге таппайды?
Не бетте мәтін емес, сурет бар, не сөз сіз тергеннен басқа таңбамен жазылған. Көшіріп тексеріңіз: буферге экрандағыдан өзге нәрсе келсе, бұл файлда іздеу ешқандай баптаумен істемейді.
Қазақша сканға мәтін қабатын қайтаруға бола ма?
Болады, тану арқылы. Ол беттің суретін оқып, астына мәтін салады, содан кейін құжат әдеттегідей ізделеді. Сапа түпнұсқаға байланысты: тегіс әрі контрасты скан қиғаш түсірілгеннен әлдеқайда жақсы танылады.
Көшіргеннен кейін қазақ әріптері неге латынға айналады?
Қазақ әріптері басқа әліпбилердің код орындарын алып тұрған ескі қаріптер осылай ұстайды. Файл дұрыс көрінеді, бірақ басқа таңба сақтайды. Мұны дайын құжатта түзету мүмкін емес, мәтінді қайта теру немесе тану керек.
PDF-ті Word-ке айналдырғанда қазақша мәтін сақтала ма?
Файлда шынайы мәтін қабаты болса — иә, таңбалар сол күйінде көшеді. Скан болса, құжатта мәтін емес, беттердің суреттері шығады: алдымен тану, сосын түрлендіру, әйтпесе өңдейтін ештеңе болмайды.