OCR дегеніміз не
OCR — таңбаларды тану: бағдарлама суретке қарап, ондағы әріп пішіндерін тауып, оларды мәтін ретінде жазады. Ол файлда мәтін жоқ жерде, яғни сканда ғана қажет. Word немесе 1С-тен PDF-ке басылған құжатта таңбалар бұрыннан бар, онда танитын ештеңе жоқ. Біздің құралдар OCR жасамайды: мәтінді шығару дайын қабатты оқиды және құжатта қабат болмаса, бұл туралы тура айтады.
Сандар туралы қысқаша
- Бізде OCR жоқ
- шығару құралы дайын қабатты оқиды және жоқ болса хабарлайды
- Құжат қалай тексеріледі
- бірінші, ортаңғы және соңғы беттен алынған үлгі
- Өлшем
- бос емес мәтін элементтері саналады, бос жолдар есепке кірмейді
- Сканмен жұмыс істейді
- сығымдау, қию, бұру, біріктіру, бөлу, JPG-ге экспорт
- Сканмен жұмыс істемейді
- іздеу, мәтін шығару, өңдеу, мәтіндік DOCX-ке түрлендіру
Мәтін қабаты мен тану — бір нәрсе емес
Мәтін қабаты — файлда кодтармен жазылған таңбалар, координаттарымен және қаріпке сілтемесімен бірге. Ол құжатты PDF-ке басып шығарғанда пайда болады және ешқайда кетпейді: мұндай файлдан іздеу лезде жүреді, өйткені пиксельден емес, мәтіннен іздеу керек. Тану — кері міндет: суретке қарап таңбаларды қалпына келтіру, ол әрқашан жуық, себебі скан сапасына, тілге және қаріпке тәуелді.
Аралық жағдай да болады — үстінде беттің суреті, ал астында көрінбейтін қабатпен тану нәтижесі тігілген гибрид файл. Мұндай құжат скан сияқты көрінеді, бірақ одан мәтін ізделеді. Әдетте ол тануы қосулы сканерлер мен КФҚ-дан шығады.
Танушы керек-керек емесін қалай білуге болады
- Құжатты просмотрщикте ашып, абзацты тінтуірмен бөлектеп көріңіз. Бөлектелсе — мәтін қабаты бар.
- Бөлектеу сурет үстіндегі жақтау сияқты жүрсе, мәтінді шығарып көріңіз: бос нәтиже алдыңызда скан тұрғанын растайды.
- Біздің редактор дәл сол тексеруді өзі жасайды: бірінші, ортаңғы және соңғы бетті алып, ондағы бос емес мәтін элементтерін санайды.
- Элементтер болмаса, құрал тура айтады: мәтін қабаты жоқ, тану қолдау таппайды — бос файл беріп үнсіз қалудың орнына.
Сканмен OCR-сыз не істеуге болады
- Керекті көлемге дейін сығымдау, жиектерді қию, беттерді бұру, топтаманы біріктіру немесе бөлу, бір параққа бірнеше бет орналастыру.
- Беттерді JPG немесе PNG-ге экспорттап, олармен сурет ретінде жұмыс істеу.
- Визуалды қолтаңба қою немесе су таңбасын салу — бұл үстіне сызу, мәтінге кедергі жасамайды.
- Не істеуге болмайды: сөз табу, абзац шығару, мәтінді өңдеу, сурет орнына мәтіні бар дұрыс DOCX алу.
Жиі қойылатын сұрақтар
Мәтінді шығарғанда неге бос файл шықты?
Демек, құжатта мәтін қабаты жоқ: беттер — суреттер. Шығаратын ештеңе жоқ, және құрал бұл туралы тура айтады, сәтті деген жасыл белгімен бос нәтиже бермейді.
Сайттарыңызда сканды іздеуге қолжетімді етуге бола ма?
Жоқ, бізде тану жоқ. Ол үшін OCR бар бөлек құрал керек: ол нәтижені бастапқы суреттің үстіне көрінбейтін қабатпен тігеді, содан кейін іздеу жұмыс істей бастайды.
Менің сканымнан мәтін неге бәрібір табылады?
Сірә, сканер немесе КФҚ түсіру кезінде бетті танып, нәтижені суреттің астына көрінбейтін қабатпен тіккен. Сырттай бұл скан, бірақ мәтін қабаты онда бұрыннан бар.
Тану негізінен қаншалықты дәл?
Түпнұсқаға байланысты: дюймге 300 нүктедегі таза баспа мәтіні қатесіз дерлік танылады, ал мыжылған көшірме, қолжазба немесе сұр фондағы ұсақ қаріп оқып түзетуге тура келетін қателер береді.