07
Sul on pildistatud leping, passi koopia või palgateatis, mille keegi kontoris sisse skannis. Üks nimi peab kaduma. Iga juhend ütleb sama: vali tekst ja rakenda peitmine. Tõmbad nimest üle, kuid miski ei märgistu. Kursor ei muuda isegi kuju.
Midagi ei ole katki. Seal lihtsalt ei ole teksti, mida valida.
01
Lehekülg on foto
Päris PDF hoiab teksti juhistena: üks juhis iga märgi kohta koos koordinaatide ja fondiga. Skann hoiab lehekülje kohta üht pilti ja mitte midagi enamat. Nimi, mida vaatad, on tumedate pikslite kobar JPEG-is. Faili jaoks on see sama liiki asi nagu skanneri kaane vari.
Valikul pole seega millestki kinni haarata. Valimisvahendid loevad sisuvoogu ning skannitud leheküljel ütleb sisuvoog umbes nii: joonista see pilt täislaiuses ja täiskõrguses. Sellega on lehekülg valmis. Otsing ei leia midagi ja teksti eraldamine ei anna tulemust.
02
Siin võib must kast päriselt toimida
See on ainus juhtum, kus kõige ilmsem lahendus võib toimida. Seda ei oota keegi pärast sadat korda kuuldud lauset, et ristkülik ei ole peitmine.
Päris skannil ei peitu kasti all teksti, sest teksti pole seal kusagil. Kui tõmbad pikslite peale täidetud ristküliku ja lamestad seejärel lehekülje, kirjutab kast enda alla jäävad pikslid üle. Neid ei kaeta, vaid need kaovad.
Tingimus on lamestamine. See ei ole valikuline. Eksport peab iga lehekülje uueks pildiks joonistama nii, et ristkülik on juba sisse põletatud, ning koostama PDF-i neist piltidest uuesti. Kui tööriist jätab algse skanni alles ja laob kujundi selle peale, on sul must ristkülik nime puutumata foto peal. PDF-i põimitud piltide väljavõtmine on ühe käsu asi igaühele, kes selle peale tuleb.
03
Kontrolli, kas su skann on päriselt skann
Paljud skanni moodi dokumendid ei ole puhtad skannid. Skanneri tarkvara, dokumendihaldussüsteemid ja kõik, kus on valik „otsitav PDF”, käitavad OCR-i ning kirjutavad tuvastatud sõnad faili nähtamatu tekstikihina, mis on paigutatud täpselt pildi peale. Lehekülg näeb välja samasugune. Failis on nüüd korraga nime pilt ja sama nimi päris sõnena, mille saab välja lugeda.
Joonistad pildile kasti ja katad pikslid silma eest. Tekstikiht jääb puutumata ning tuleb kopeerimisega otse välja. See on musta ristküliku probleem, millele on lisatud foto.
Kontrolli seda enne kõike muud. Ava fail ja tõmba üle mõne tekstirea. Kui tekib esiletõst või Ctrl+F leiab sõna, mida leheküljel näed, on tekstikiht olemas ning eemaldada tuleb nii selle sisu kui ka pikslid. Kontrolli lehekülg haaval, sest segadokumendid on tavalised: trükitud tiitelleht, siis kaksteist skannitud lehte, siis allkirjastatud lisa.
Tee sama kontroll seejärel eksporditud failiga, mitte sellega, mida sa redigeerisid.
04
Märkus ei ole lamestatud kast
PDF-i märkusena salvestatud ristkülik on failis eraldi objekt oma koordinaatide, värvi ja kandega lehekülje märkuste loendis. Lugejad lubavad sellel klõpsata, seda lohistada ja kustutada. Ka seal, kus kasutajaliides seda ei luba, on objekt failistruktuuris olemas ning märkuste eemaldamine on tühine töö.
Lamestamine lõpetab selle vaidluse. Kujund ei ole enam objekt, vaid tumedad pikslid lehekülje pildis. Valida ega kustutada pole enam midagi.
Üks asi tekitab siin segadust: PDF-i printimine ei ole lamestamine. Enamikus süsteemides väljastab printimine teksti uuesti tekstina ja jätab märkused märkusteks. Otsi sõnastust, mis räägib rasterdamisest, lamestamisest või pildina eksportimisest, ning kontrolli tulemust, selle asemel et silti uskuda.
05
Lahutusvõime ja see koopia, mis meelest läks
Mõni eksporditee vähendab lahutusvõimet. Privaatsuse seisukohast pole sellel vahet, kuid madala DPI-ga peidetud skann võib saaja jaoks lugemiskõlbmatuks muutuda. Vaata väljund enne saatmist üle, mitte alles siis, kui seda sinult uuesti küsitakse.
Privaatsusprobleem võib olla failis mujal. Skanneri tarkvara ja kontoripaketid põimivad mõnikord iga lehekülje kohta pisipildi või eelvaate ning järkjärgult salvestatud fail võib hoida varasemaid versioone alles. Kui see eelvaade tehti enne kasti tõmbamist, sõidab samas dokumendis kaasa väike koopia peitmata leheküljest. Ekspordi uude faili, mitte ära salvesta originaali peale, ning ava dokumendi omadused enne, kui fail arvutist lahkub.
06
OCR, teadlikult kasutatuna
OCR-i käivitamine teeb selle töö talutavaks. Tuvasta tekst kõigepealt ning tööriist oskab lehekülge piisavalt hästi lugeda, et pakkuda välja võimalikke kohti: nimesid, isikukoode, sünnikuupäevi ja kontonumbreid. Kastid satuvad õigetele koordinaatidele, sest tuvastus annab iga sõna kohta lisaks tekstile ka asukoha.
OCR loeb siiski valesti. Kahvatud faksikoopiad, viltused leheküljed, käekiri veerisel, viis loetakse S-iks. Võta leiud lähtekohana ja loe lehekülg ise läbi, sest edasi ei püüa keegi kinni seda, mis tuvastajal kahe silma vahele jäi. Eksport peab ikkagi lamestama. Nime täpsest leidmisest pole kasu, kui kast on ainult selle peale laotud.
hddn töötab skannitud lehekülgedega täpselt nii: OCR töötab brauseris, leiud kuvatakse ettepanekutena, mille sa kinnitad või kõrvale lükkad, ning lamestatud eksport joonistab iga lehekülje pildiks koos sisse põletatud kinnitatud kastidega. Teksti redigeerimisest OCR-lehekülgedel keeldutakse otse, mitte ei teeselda, et seda osatakse.
Skann tundub tekstiga PDF-ist turvalisem, sest midagi ei saa valida ja otsing ei leia midagi. Just see tunne ongi risk. Tõmba enne esimese kasti joonistamist üle mõne rea ja vaata järele, kas fail on kogu selle aja vaikselt iseennast tekstiga täiendanud.