PDF іздеуі көрініп тұрған сөзді таппайды
Беттің ішінде сөз де, бос орын да жоқ — қаріп қой, нүктеге көш және жолдың бір бөлігін сал деген командалар бар. Сөздер мен аралықтарды қараушы бөліктер арасындағы қашықтық бойынша өзі құрастырады. Сондықтан іздеу құрастыру көзбен көргеннен ажыраған жерде сүрінеді: сөз бөлікке бөлінген, дефиспен тасымалданған, әріп екі белгімен жазылған немесе мәтін қабаты мүлде жоқ.
Сандар туралы қысқаша
- Файлда шын мәнінде не бар
- нүктеге жол бөлігін салу командалары, сөз бен бос орын ұғымынсыз
- Бос орындар қайдан шығады
- бөліктер арасындағы саңылаудан; қатарлы бос орындар саны шектеулі
- Қоса жүктелетін деректер
- алдын ала белгіленген кодтау кестелері мен стандартты қаріп деректері
- Өңдеуге жарамдылықты тексеру
- үш бет таңдамасы, шегі — бетіне орта есеппен бес мәтін элементі
- Скандарды тану тілдері
- орыс, қазақ, ағылшын
Жиілігі бойынша бес себеп
- Қабат жоқ. Бет — сурет: скан, фотосурет немесе растрлайтын сығымдаудан кейінгі құжат. Іздейтін ештеңе жоқ, «нашар ізделеді» емес.
- Сөз бөліктерге бөлінген. Кернинг пен туралау генераторды сөзді бірнеше бөлікпен салуға мәжбүрлейді; қараушы оларды саңылау бойынша жабыстырады, саңылау бос орын деп саналса, тұтас сөз табылмайды, ал жартысы табылады.
- Буын бойынша тасымал. Сөз дефиспен және жол соңымен физикалық үзілген — бұл беттің әртүрлі жеріндегі екі бөлік, олар ешқашан жабыспайды.
- Белгілер сәйкестігінің кестесі жоқ. Глифтер дұрыс салынған, бірақ қаріпте символдарға кері бейнелеу жоқ: іздеу мен көшіру бөгде кодтар алады, ал сіз қалыпты әріптерді көресіз.
- Бір әріптің әртүрлі жазылуы. Й мен Ё бір белгі ретінде де, әріп пен белгіден тұратын жұп ретінде де бар; ё орнына е жиі кездеседі. Салыстыру сыртқы түріне емес, кодтарға қарап жүреді.
Үш әрекетпен диагностика
- Абзацты белгілеп, кез келген енгізу өрісіне қойыңыз. Бос болса — қабат жоқ; символ былығы болса — сәйкестік кестесі бұзылған; қалыпты мәтін болса — әрі қарай жүреміз.
- Тұтас сөзді емес, оның үш-төрт әріптен тұратын ортасын іздеңіз. Ортасы табылып, тұтасы табылмаса — сөз бөлікке бөлінген немесе тасымалданған.
- Сөзді ё мен й-сыз тексеріңіз: іздеу тірілсе, мәселе бір әріптің әртүрлі жазылуында.
- Құжатты мәтін шығарып алудан өткізіңіз: іздеу көретін нәрсені дәл сол күйінде, тұтас әрі бір жерде көресіз.
- Редактордағы түпнұсқамен салыстырыңыз, ол болса — онда сөздер сөз күйінде сақталады, айырма бірден көрінеді.
Біз не істейміз
Шығарып алу жолды бөліктерден жинап, бос орындарды саңылау шамасына қарай қояды: кіші саңылау сөз ішіндегі кернинг, орташасы бос орын, үлкені кесте бағаны деп саналады. Қатарынан келетін бос орындар саны шектелген, әйтпесе бағандар арасындағы кең аралық файлды бос орын алаңына айналдырар еді. Бұл қараушының жабыстыру ережелерімен бірдей, сондықтан шығарып алу нәтижесі — іздеуге қолжетімді нәрсенің адал көшірмесі.
Сонымен қатар құжат ашылғанда алдын ала белгіленген кодтау кестелері мен стандартты қаріптердің деректері қосылады. Онсыз пішімге ендірілген кодтауларға сілтейтін файлдарда мәтін мүлде шықпайды — ал бұл «құжатта мәтін қабаты жоқ» болып көрінеді, шын мәнінде қабат бар. Редактор қосымша үш бетті — біріншісін, ортасын және соңғысын — тексереді және құжатты бетіне орта есеппен бес мәтін элементінен кем болмағанда ғана жарамды деп санайды.
Біз нені жөндемейміз
- Бұзылған белгілер сәйкестігі кестесін: файлда дұрыс кодтар жоқ, оларды тек бет суретін тану арқылы қалпына келтіруге болады.
- Буын бойынша тасымалды: үзілген сөз екі бөлік күйінде қалады, өйткені құжат авторы оны солай салған.
- Әріптің әртүрлі жазылуын: қалыптандыруды құжат емес, іздеуші жасайды, ал біздің құралдар бөгде іздеуді баптамайды.
- Бөгде қараушының ішіндегі іздеуді: әрқайсысының жабыстыру ережелері өзінікі, біздің нәтиже оларда ештеңе өзгертпейді.
Жиі қойылатын сұрақтар
Іздеу сөздің жартысын табады, ал тұтасын таппайды. Бұл қалай мүмкін?
Сөз бірнеше бөлікпен салынған, олардың екеуінің арасына бос орын деп саналған саңылау түскен. Қараушы үшін бұл екі сөз, сондықтан жартысы табылады да, тұтасы табылмайды.
Іздеу жұмыс істемесе, мәтінді шығарып алу көмектесе ме?
Себебін түсінуге көмектеседі. Сіз іздеуге қолжетімді мәтінді дәл сол күйінде аласыз және онда не жоқ екенін бірден көресіз: тасымалмен үзілген сөзді ме, әлде бет сурет болып шыққанда бүкіл абзацты ма.
Неге бір файл бойынша іздеу екі бағдарламада әртүрлі жұмыс істейді?
Себебі бөліктерді сөзге жабыстыруды әр бағдарлама өз саңылау шектерімен жасайды. Бір қараушы аралықты кернинг, екіншісі бос орын деп санайды, іздеу нәтижелері бір құжатта ажырап кетеді.
Іздеу нақты жұмыс істейтін құжатты қалай жасауға болады?
PDF-ті файлға басып шығару арқылы емес, редактордан тікелей шығарыңыз, қаріптерді ендіріңіз және буын бойынша автоматты тасымалды өшіріңіз. Скандар үшін жалғыз жол — суреттің астына мәтін қабатын қосатын тану.