PDF-тегі мәтінді тану
Сканерленген пдф-ке мәтін қабатын қосыңыз: бет сол күйінде көрінеді, бірақ мәтінді белгілеуге, көшіруге және іздеу арқылы табуға болады. Орыс, қазақ және ағылшын тілдері.
Осы құралмен жиі кездесетін тапсырмалар
OCR деген не және ол файлмен не істейді
Сканерленген құжат — мәтін емес, мәтіннің фотосуреті. PDF ішінде беттің суреті жатыр, ал компьютер үшін ол мысықтың суретінен еш айырмашылығы жоқ: онда сөз де, әріп те жоқ, тек пиксельдер. Сондықтан мұндай файлдан іздеу ештеңе таппайды, абзацты тінтуірмен белгілеу де мүмкін емес — белгілейтін ештеңе жоқ.
OCR (optical character recognition, таңбаларды оптикалық тану) сол суретті оқып, содан мәтін құрастырады. Біз суретті ауыстырмаймыз: танылған сөздер оның АСТЫНА көрінбейтін қабат болып, әрбір әріп өз орнына қойылады. Сырттай бет бір пиксельге де өзгермейді — көшіргіштің сол дақтары, сол мөр, шет жағындағы сол қолжазба. Бірақ енді Ctrl+F сөзді табады, тінтуір жолды белгілейді.
OCR не істемейтінін түсіну маңызды: ол сканды өңдеуге болатын құжатқа айналдырмайды. Мәтінді беттің үстінен түзету мүмкін болмайды — сурет әлі де негізгі, ал мәтін қабаты оның астында іздеу мен көшіру үшін жатыр. Дәл өңделетін файл керек болса, құжатты осында танып, сосын мәтінді көшіріңіз немесе нәтижені «PDF-тен Word-қа» арқылы өткізіңіз.
PDF-тегі мәтінді қалай тану керек
- Сканерленген PDF-ті терезеге сүйреңіз немесе құрылғыдан таңдау үшін басыңыз. Шектеулер: 20 бетке және 30 МБ дейін.
- Құжатта бар тілдерді белгілеңіз: орыс, қазақ, ағылшын немесе олардың тіркесімі. Артық тілдерді алып тастаған жөн — олар жұмысты баяулатып, қате қосады.
- Қажет болса, скан қырынан жатса «Беттердің бұрылысын түзету», парақ шыныға қисық қойылса «Қисықтықты түзету» опциясын қосыңыз.
- «Мәтінді тану» түймесін басыңыз. Файл біздің серверге барады: біздің машинадағы өлшем — жиырма бетке 21 секунд, яғни параққа шамамен бір секунд. Тығыз түрлі-түсті скан ұзағырақ.
- Нәтижені жүктеп алып тексеріңіз: файлды ашып, Ctrl+F арқылы бір сөзді іздеп көріңіз. Құрал қанша таңба танылғанын бірден көрсетеді.
Құрал не істейді
- Бет суретінің астына көрінбейтін мәтін қабатын қосады — құжаттың сыртқы түрі өзгермейді.
- Орыс, қазақ және ағылшын тілдерін таниды, оның ішінде бір құжатта бірге де.
- Қазақ тілі шын мәнінде қолдау тапқан: серверде Tesseract-тің қазақ моделі тұр, жай ғана «кириллица» емес.
- Мәтіні бар беттерді қатемен құламай, аттап өтеді.
- Қалауыңыз бойынша қырынан жатқан беттерді бұрып, қисық сканның қисықтығын түзейді.
- Қанша таңба танылғанын шыншыл көрсетеді: нөл болса, скан оқылмайды дегені, біз бұны тікелей айтамыз.
- Суреттерді қайта қыспайды: нәтиже PDF/A-ға түрлендірілмеген кәдімгі PDF болып қалады.
- Tesseract қозғалтқышы бар ocrmypdf арқылы жұмыс істейді — ақылы OCR қызметтерінің көбінің артында тұрған сол қозғалтқыш.
Бұл қашан керек
Мұрағаттағы шарттар мен актілер
Бірнеше жылдық скандар, олардан бір тармақты не бір соманы табу керек. Танудан кейін іздеу бүкіл файл бойынша жұмыс істейді.
Қазақ тіліндегі құжаттар
Қ, ғ, ң, ү, ұ, һ, ө, і әріптері бар анықтамалар, үзінділер және мемқұжаттар. Қазақ моделі оларды ажыратады, ал «орысша» тану оларды ұқсас орыс әріптеріне айналдырады.
Кітаптар мен әдістемелер
Іздеу жүрмейтін сканерленген оқу құралы. Мәтін қабатымен дәйексөз бір секундта табылады.
Телефонмен түсірілген құжаттар
PDF-ке жиналған төлқұжат, чек не сауалнама суреттері. Тану сапасы беттердің қаншалықты түзу әрі анық түсірілгеніне байланысты.
Word-қа көшіруге дайындық
Мәтін қабаты жоқ скан Word-та суреттер жиынтығына айналады. Алдымен тану, сосын түрлендіру — сонда мәтін орнында болады.
Ізделетін PDF тапсыру талабы
Кейбір тендер алаңдары мен электрондық мұрағаттар тек іздеу жүретін құжаттарды қабылдайды.
Тану сапасы неге байланысты
OCR бізде де, басқа ешкімде де жүз пайыз дәлдік бермейді. Нәтижені сіз жүктеген файл айқындайды, төменде шыншыл шәкіл.
- 300 DPI, планшеттік сканерден түскен түзу скан — нәтиже жақсы: кәдімгі баспа мәтіні қатесіз дерлік танылады.
- 150 DPI — байқарлықтай нашар: ұқсас таңбалар шатасады, көбіне «и/н», «п/л», «rn/m» және 0/O, 1/l цифрлары.
- Үстелден қырынан, қол көлеңкесімен не жарық шағылысымен түсірілген фото — нашар. Суреттің шетіндегі әріптер созылған, тану дәл сол жерде бұзылады.
- Қолжазба мүлде танылмайды. Tesseract баспа қаріптерінде үйретілген, ал қолтаңба ол үшін — шу.
- Әріп үстіндегі мөрлер, су белгілері мен кесте сызықтары артық таңба береді: қозғалтқыш оларды мәтіннің бөлігі деп көреді.
- Төмен ажыратымдылықтағы 8 пункттен кіші ұсақ қаріп әрдайым дерлік қате оқылады — мұнда тек жоғары ажыратымдылықпен қайта сканерлеу көмектеседі.
Файлмен не болады
- Бұл — серверлік құрал. Сайттағы құралдардың көбінен өзгеше, файл браузерден шығады: тануды пайдаланушының құрылғысында орындау мүмкін емес, ол үшін Tesseract қозғалтқышы мен тіл модельдері керек.
- Жүктелген PDF Алматыдағы серверімізде уақытша файлға жазылады, өңделеді және жауап берілген соң бірден жойылады — өңдеу қатемен аяқталған не үзілген жағдайларды қоса.
- Біз бастапқы файлды да, нәтижені де, танылған мәтінді де сақтамаймыз. Ешқандай құжаттар базасы, ешқандай кейінге қалдырылған тазалау тапсырмалары жоқ — файл дәл сіздің сұрауыңыз жүрген уақыт бойы ғана өмір сүреді.
- Тіркелу қажет емес, файл ешбір аккаунтпен байланыстырылмайды.
- Тасымал тек HTTPS арқылы жүреді.
- Сайттың толықтай браузерде жұмыс істейтін құралдары бөлек белгіленген — онда файл шынымен еш жерге кетпейді. Мұнда кетеді, біз бұны тікелей жазамыз.
Бірдеңе дұрыс болмаса
- Нөл таңба танылды
- Қозғалтқыш беттерден әріп деп санайтын ештеңе таппады. Көбіне мәселе ажыратымдылықта немесе беттің қырынан түсірілгенінде. 300 DPI-мен қайта сканерлеңіз не түзу жарықта үстінен қайта түсіріңіз. Қолжазба негізінен танылмайды.
- Файлда мәтін қабаты бар деп жазады
- Демек құжат бұрыннан ізделеді әрі оған OCR қажет емес. Тексеріңіз: файлды ашып, Ctrl+F басыңыз. Іздеу жүрсе — бәрі дұрыс, танитын ештеңе жоқ.
- Файлда 20 беттен көп
- Бұл — біздің шегіміз: тану бір бетке 2–5 секунд алады, ал жүз беттік скан бірнеше минут және бүкіл серверді алар еді. Құжатты «PDF бөлу» құралымен бөліп, бөліктерін кезекпен таныңыз.
- Қазақ әріптері орысшаға айналды
- Бәлкім, тек орыс тілі белгіленген. Қазақ тілін қосыңыз — модель арнайы қ, ғ, ң, ү, ұ, һ, ө, і әріптерінде үйретілген. Құжатта екі тіл болса, екеуін де белгілеңіз.
- Танылған мәтінде қате көп
- Артық тілдерді алып тастаңыз: әр қосымша тіл қозғалтқышқа көбірек нұсқа әрі қателесуге көбірек себеп береді. Бұл көмектеспесе, мәселе скан сапасында — жоғарыдағы ажыратымдылық туралы блокты қараңыз.
- Сервер «бос емес» деп жауап береді
- OCR — сайттағы ең ауыр операция, сондықтан біз оны қатаң түрде бір мезгілде бір құжаттан орындаймыз. Бір минут күтіп, қайталаңыз: ешкім соқыр күтпес үшін кезек жиналмайды.
- Мәтін жылжып белгіленеді
- Солай: мәтін қабаты қозғалтқыш тапқан координаттар бойынша қойылады, ал қисық сканда олар жылжиды. Көшірілген мәтіннің өзі дұрыс болып қалады.
- Файл құпия сөзбен қорғалған
- Алдымен «Құпия сөзді алу» құралында қорғауды шешіңіз. Шифрланған PDF-ті шешпей оқуға ашу да мүмкін емес.
Жиі қойылатын сұрақтар
- OCR деген не, қарапайым тілмен?
- Бұл — суреттен мәтінді оқу. Скан — беттің фотосуреті, онда компьютер үшін бірде-бір әріп жоқ. OCR әріптерді танып, оларды файлға көрінбейтін қабат етіп жазады, сонда іздеу мен көшіру жұмыс істейді.
- Скан өңдеуге болатын болады ма?
- Жоқ. Бет суреті негізгі болып қалады, ал мәтін оның астына іздеу мен көшіру үшін жатады. Сөзді беттің үстінен түзету мүмкін емес. Өңделетін құжат керек болса, файлды осында танып, сосын оны Word-қа түрлендіріңіз.
- Қазақ тілі қолдау табады ма?
- Иә, әрі бұл сирек кездеседі: серверде жалпы кириллица емес, Tesseract-тің қазақ моделі орнатылған. Ол қ, ғ, ң, ү, ұ, һ, ө, і әріптерін ажыратады. Тілдерді біріктіруге болады — мысалы, екі тілдегі құжат үшін қазақшаны орысшамен бірге.
- Тану қаншалықты дәл?
- Сканға байланысты, ал жүз пайыз деп уәде беру өтірік болар еді. 300 DPI түзу скан жақсы нәтиже береді, 150 DPI — байқарлықтай нашар, қырынан түсірілген фото — нашар. Қолжазба мүлде танылмайды.
- Файл серверге жүктеле ме?
- Иә. Бұл серверлік құрал: тану үшін Tesseract қозғалтқышы мен тіл модельдері қажет, оны браузерде орындау мүмкін емес. Файл уақытша файлға жазылып, өңделеді және жауаптан кейін бірден жойылады — өңдеу үзілген жағдайда да.
- Бір ретте қанша бетті тануға болады?
- 20 бетке және 30 МБ дейін. Шектеу маркетингтік емес, шыншыл: бір бет 2–5 секунд процессор уақытын алады, шексіз болса бір үлкен файл серверді бірнеше минутқа бос емес қылар еді.
- Беттердің сыртқы түрі өзгере ме?
- Қосымша опцияларды қоспасаңыз, жоқ. Мәтін қабаты көрінбейді, сурет қайта қысылмайды. «Бұрылысты түзету» мен «Қисықтықты түзету» опциялары түрін саналы түрде өзгертеді — біріншісі бетті бұрады, екіншісі суретті дұрыс бұрышпен қайта салады.
- Тану қанша уақыт алады?
- Бір бетке 2–5 секунд, яғни 20 беттік құжат — шамамен бір минут. Ең ұзақ уақытты ұсақ қаріпті және кестелі тығыз беттер алады.
- Мәтіні бар беттерге не болады?
- Олар өзгеріссіз аттап өтіледі. Аралас құжат — беттердің бір бөлігі мәтінді, бір бөлігі сканерленген — қалыпты өңделеді: тек скандар танылады.
Ұқсас құралдар
Сондай-ақ оқыңыз
- PDF-ті Word-ке: 2026 жылы түрлендірудің ТОП-5 әдісі
- PDF-ті сапасын жоғалтпай қалай қысу керек: толық нұсқаулық
- PDF файлдарды сапасын жоғалтпай онлайн қалай біріктіруге болады
- PDF электрондық қолтаңбасы: Ресей мен Қазақстандағы құқықтық негіз
- PDF-тен мәтін шығару: OCR пен тікелей шығарудың айырмашылығы
- PDF онлайн электрондық қолтаңба
- PDF редакторы онлайн: Acrobat-сыз не істеуге болады
- PDF-ті құпиясөзбен қорғау: қалай және не үшін
- Барлық нұсқаулықтар →
Тану барлық ірі қызметтерде бар — шарттарды салыстыруға көмектеседі: iLovePDF шектеулерінің талдауы.