OCR-дан кейінгі қателерді түзету
Алдымен қабылдау керек нәрсе: тану қателері суреттің астындағы көрінбейтін қабатта отырады, ал суреттің өзі қолға тимейді. Сондықтан қабатты қалай түзетсеңіз де, ол іздеу табатын нәрсені өзгертеді, бетте көріп тұрғаныңызды емес — суретті өңдеу мүмкін емес. Осыдан үш жұмыс жолы шығады: қайта сканерлеп қайта тану, шығарылған мәтінді бөлек файлмен оқып түзету немесе іздеу дұрыс тауып тұрса, қателерді қалдыру.
Сандар туралы қысқаша
- Қателер қайда отырады
- бет суретінің астындағы көрінбейтін қабатта
- Қабатты түзету нені өзгертеді
- іздеу нәтижесін, беттің суретін емес
- Ең арзан жол
- 300 DPI-мен қайта сканерлеп, қайта тану
- Қайда оқып түзету керек
- PDF-те емес, мәтінді шығарғаннан кейін TXT-те
- Мүлде түзетілмейтіні
- қолжазба үзінді мен қабатсыз бет — онда тану болмаған
Үш жол және қайсысын қашан таңдау керек
- Түпнұсқаны 300 DPI-мен қайта сканерлеп, қайта тану. Түпнұсқа қолда болса, ең арзан жол: бір сағат оқып түзетудің орнына бір әрекет.
- Мәтінді TXT-ке шығарып, мәтін редакторында оқып түзету. Дәл мәтін керек болғанда жарайды — жіберу, дәйексөз келтіру немесе басқа құжатқа көшіру үшін.
- Сол күйінде қалдыру. Қателер жеке-дара әрі тегі мен нөмірлер бойынша іздеу жұмыс істеп тұрса, құжат өз міндетін атқарып тұр.
- Тұйық жол: беттің суретін түзетпек болу. Көрінетін бөлігі — растр, онда жеке әріптер жоқ, мәтін редакторы оларды таппайды.
Мәтін шынымен керек болса, оқып түзету тәртібі
- Танылған PDF мәтінін TXT-ке шығарыңыз — қабат жол ауысуларымен бірге тұтас жүктеледі.
- Құжатты қатарынан оқыңыз, күмәнді жерлерді салыстыру үшін бастапқы PDF-ті қасында ұстаңыз.
- Цифрлар мен жалқы есімдерден бастаңыз: қате сол жерде қымбат тұрады және мағынамен ұсталмайды.
- Қазақ әріптері ә, ғ, қ, ң, ө, ұ, ү, һ, і — оларды бөлек тексеріңіз, олар жиірек жаңылысады.
- Оқып түзетілген мәтінді бөлек файлға сақтаңыз: сенімді нұсқасы сол болады, ал PDF түпнұсқаның бейнесі күйінде қалады.
Нені түзетуге болмайды
Болмаған нәрсе түзетілмейді. Тануы отыз секундқа сыймаған бет және жиырма бес мегапиксельден үлкен бет құжатта мүлде мәтін қабатсыз қалады. Онда түзететін ештеңе жоқ: рұқсаттылықты кішірейту немесе құжатты бөліп, қиын парақтарды бөлек тану керек.
Қолжазба үзінді де түзетілмейді. Ол баптаудағы қате үшін емес, жарайтын модель мүлде жоқ болғандықтан танылмаған, мұнда оқып түзету көмектеспейді — мәтінді теруге тура келеді. Қолтаңба мен мөр де солай: бұл графика, ол ешқандай жағдайда мәтінге айналмайды.
Жиі қойылатын сұрақтар
Әріпті бетте тікелей түзетуге неге болмайды?
Себебі көрінетін бет — мәтін емес, сурет. Ондағы әріп пиксельдерден тұрады және жеке нысан емес, сондықтан мәтін редакторы оны қанша бөлектесеңіз де таппайды және алмастыра алмайды.
Көрінбейтін қабатты түзетсем, құжаттың көрінісі өзгере ме?
Жоқ, мұндай файлдың басты қасиеті осы. Қабат мөлдір және суреттің астында жатыр: ондағы түзету іздеуге, көшіруге және мәтін шығаруға әсер етеді, ал экрандағы бет бұрынғы қалпында қалады.
Қайсысы жылдам — мәтінді оқып түзету ме, құжатты қайта сканерлеу ме?
Түпнұсқа қолжетімді болса, әрдайым дерлік қайта сканерлеу. Дюймге үш жүз нүктедегі скан мен қайта тану минуттарды алады, ал тығыз мәтінді он бетті оқып түзету — бір сағаттық ықыласты жұмыс.
Бірнеше бетті ғана түзетуге бола ма?
Иә, әрі бұл орынды тәсіл. Қиын парақтарды бөлек файлға бөліп, қайта сканерлеп, қайта таныңыз, содан кейін қалған құжатпен біріктіріңіз — сәтті шыққан беттерге тиюдің қажеті жоқ.