07
Tev ir nofotografēts līgums, pases kopija vai algas lapa, ko kāds birojā ieskenējis. Jāizņem viens vārds. Visi padomi saka vienu un to pašu: iezīmē tekstu, piemēro aizklāšanu. Velc pāri vārdam, bet nekas neiekrāsojas. Kursors pat formu nemaina.
Nekas nav salūzis. Tur nav teksta, ko iezīmēt.
01
Lapa ir fotogrāfija
Parastā PDF teksts glabājas kā instrukcijas — pa vienai katram glifam — ar koordinātām un fontu. Skenējumā ir tikai viens attēls katrā lapā. Vārds, uz kuru skaties, ir tumšu pikseļu puduris JPEG attēlā. Failam tas ir tāds pats objekts kā skenera vāka ēna.
Tāpēc iezīmēšanas rīkam nav, kur pieķerties. Tas lasa satura plūsmu, kur skenētā lapā būtībā ir viena norāde: uzzīmē šo attēlu visā platumā un augstumā. Tā ir visa lapa. Meklēšana neko neatrod, un teksta izguve atgriež tukšumu.
02
Šeit melnais taisnstūris tiešām var strādāt
Šis ir vienīgais gadījums, kad acīmredzamā pieeja var strādāt. To negaida neviens, kam simtreiz teikts, ka taisnstūris neaizklāj.
Īstā skenējumā zem tā nav paslēpta teksta, jo teksta nav vispār. Uzvelc pār pikseļiem aizpildītu taisnstūri un tad lapu saplacini: pikseļi zem taisnstūra tiek pārrakstīti. Tie nav apsegti. Tie vairs nepastāv.
Saplacināšana ir obligāta. Eksportējot katra lapa jāuzzīmē kā jauns attēls ar jau iekļautu taisnstūri, un pēc tam PDF jāsaliek no šiem attēliem. Ja rīks patur oriģinālo skenējumu un uzliek figūru virsū, tev ir melns taisnstūris virs neskartas vārda fotogrāfijas. Iegultos attēlus no PDF var izvilkt ar vienu komandu ikviens, kam ienāk prātā pamēģināt.
03
Pārbaudi, vai skenējums tiešām ir skenējums
Daudzi dokumenti, kas izskatās pēc skenējumiem, vairs nav tikai skenējumi. Skeneru programmas, dokumentu vadības sistēmas un rīki ar iestatījumu „meklējams PDF” palaiž OCR un atpazītos vārdus failā ieraksta kā neredzamu teksta slāni tieši virs attēla. Lapa izskatās tāpat, bet failā ir gan vārda bilde, gan īsta, izguvei pieejama teksta virkne.
Uzvelc taisnstūri uz attēla, un acij pikseļi ir aizsegti. Teksta slānis paliek neskarts un iznāk ārā, to vienkārši nokopējot. Tā ir tā pati melnā taisnstūra problēma ar fotogrāfiju pa virsu.
To pārbaudi vispirms. Atver failu un pavelc pāri teksta rindiņai. Ja parādās iekrāsojums vai Ctrl+F atrod lapā redzamo vārdu, teksta slānis ir un tas jāizņem tāpat kā pikseļi. Pārbaudi lapu pa lapai, jo jaukti dokumenti ir bieži: drukāta titullapa, tad divpadsmit skenētas lapas, tad parakstīts pielikums.
Pēc tam to pašu pārbaudi atkārto ar eksportēto failu, nevis dokumentu, kuru rediģēji.
04
Anotācija nav saplacināts taisnstūris
Taisnstūris, kas saglabāts kā PDF anotācija, ir atsevišķs objekts failā ar savām koordinātām, krāsu un ierakstu lapas anotāciju sarakstā. Lasītājs ļauj to uzklikšķināt, pārvietot vai izdzēst. Pat ja saskarne to neļauj, objekts failā paliek, un anotāciju noņemt nav grūti.
Saplacināšana šo jautājumu atrisina. Figūra vairs nav objekts, bet kļūst par tumšiem pikseļiem lapas attēlā. Vairs nav nekā, ko iezīmēt vai dzēst.
Te mēdz maldināt viena lieta: drukāšana PDF failā nav saplacināšana. Vairumā sistēmu drukas ceļš tekstu atkal izvada kā tekstu un anotācijas patur kā anotācijas. Meklē norādes par rastrēšanu, saplacināšanu vai eksportu attēla formātā un pēc tam pārbaudi rezultātu, nevis tici uzrakstam.
05
Izšķirtspēja un kopija, ko aizmirsi
Daži eksporta paņēmieni samazina izšķirtspēju. Privātumam tas neko nemaina, bet aizklāts skenējums zemā izšķirtspējā saņēmējam var kļūt nesalasāms. Tāpēc apskati rezultātu pirms nosūtīšanas, nevis pēc tam, kad to lūdz atsūtīt vēlreiz.
Privātuma problēma slēpjas citur failā. Skeneru programmas un biroja programmatūra reizēm katrai lapai iegulst sīktēlu vai priekšskatījuma attēlu, bet pakāpeniski saglabāts fails var paturēt iepriekšējās versijas. Ja šāds priekšskatījums radīts pirms taisnstūra uzvilkšanas, tajā pašā dokumentā līdzi brauc maza neaizklātās lapas kopija. Eksportē jaunā failā, nevis pārraksti oriģinālu, un, pirms fails atstāj tavu ierīci, vienreiz atver dokumenta rekvizītus.
06
OCR, izmantots apzināti
OCR palaišana šo darbu padara vieglāku. Atpazīstot tekstu, rīks lapu izlasa pietiekami labi, lai piedāvātu atradumus: vārdus, personas kodus, dzimšanas datumus, kontu numurus. Taisnstūri nonāk pareizajās koordinātēs, jo atpazīšana katram vārdam atdod ne tikai atšifrējumu, bet arī vietu.
OCR tomēr kļūdās. Blāvas faksa kopijas, šķības lapas, rokraksts malā, piecinieks, kas nolasīts kā S. Uztver atradumus kā sākumpunktu un lapu izlasi pats, jo neviens cits neatradīs to, ko atpazīšana izlaidusi. Eksportam joprojām jābūt saplacinātam. Precīzi atrast vārdu neko nedod, ja taisnstūris ir tikai uzlikts virsū.
hddn ar skenētām lapām strādā tieši tā: OCR notiek pārlūkā, atradumi parādās kā ieteikumi, kurus apstiprini vai noraidi, un saplacinātajā eksportā katra lapa tiek uzzīmēta kā attēls ar iestrādātiem apstiprinātajiem taisnstūriem. OCR lapās rīks teksta rediģēšanu atsaka, nevis izliekas, ka to prot.
Skenējums šķiet drošāks par teksta PDF, jo nekas neiezīmējas un nekas neatrodas. Tieši šī sajūta rada risku. Pirms uzvelc pirmo taisnstūri, pavelc pāri vienai rindiņai un noskaidro, vai fails sev klusi nav pievienojis teksta slāni.