Späť na blog

OCHRANA ÚDAJOV V PRAXI

Anonymizácia skenovaného PDF: OCR a časté chyby

Ako anonymizovať skenované PDF? Zistite, čo OCR prehliadne, ako kontrolovať podpisy a pečiatky a ako overiť bezpečný export pred zverejnením.

20. augusta 2026

Bezkontaktný skener digitalizujúci otvorenú knihu

Ilustračná fotografia: Biswarup Ganguly, CC BY 3.0. Zmenšená verzia; fotografia nezobrazuje používateľa našej služby.

Skenované PDF treba anonymizovať v obraze aj v prípadnej textovej vrstve. To, že sa meno nedá vyhľadať klávesovou skratkou, ešte neznamená, že na stránke nie je. Môže byť vytlačené v obrázku, dopísané rukou alebo nesprávne rozpoznané pomocou OCR. Bezpečný postup preto začína kontrolou kvality skenu a končí otvorením nového exportu.

Čo je OCR a čo pri anonymizácii dokáže

OCR je optické rozpoznávanie znakov: z obrázka vytvára strojovo čitateľný text. Pomáha vyhľadať opakujúce sa mená, telefónne čísla či adresy. Nález však závisí od čitateľnosti vstupu. Dokumentácia Tesseractu upozorňuje na vplyv rozlíšenia, šumu, natočenia stránky a rozloženia textu.

Rozlišujte tri situácie: čistý sken bez textu, sken s OCR vrstvou a kombinovaný dokument, v ktorom sú niektoré strany digitálne a iné naskenované. Jeden úspešný pokus o označenie textu na prvej strane vám nepovie, ako sú vytvorené ostatné strany.

Pripravte čitateľný vstup

Ak máte papierový originál, skontrolujte, či sa pri skenovaní nezrezali okraje a či sú strany rovné. Pri bežnom tlačenom texte býva rozumným východiskom sken okolo 300 DPI; nejde však o záruku presného rozpoznania. Dodatočné zväčšenie rozmazanej fotografie nevráti stratené detaily. Drobné písmo a nekvalitná predloha môžu vyžadovať nový sken.

  • Skontrolujte tiene pri chrbte zviazaného dokumentu.
  • Prejdite svetlé kópie, pečiatky a text vytlačený cez linky tabuľky.
  • Overte správnu orientáciu každej strany.
  • Porovnajte počet strán s originálom vrátane zadných strán a príloh.

Ak nástroj hlási poškodený alebo heslom chránený súbor, najprv si zabezpečte použiteľný podklad oprávneným spôsobom. Chybové hlásenie ani prázdny zoznam nálezov nie sú potvrdením, že dokument neobsahuje osobné údaje.

Kontrolujte obraz a text vedľa seba

Najčastejšie zradia zámenné znaky: číslica nula a písmeno O, jednotka a malé l alebo chýbajúca diakritika. Telefón môže byť rozdelený medzerami, meno zalomené do dvoch riadkov a adresa vložená do pečiatky. Vyhľadanie presného reťazca preto používajte iba ako jednu z kontrol.

Pri vizuálnom prechode si označte aj miesta, ktoré automatika nenašla. Oblasť má pokrývať celý údaj vrátane diakritiky a spodných častí písmen. Na okrajoch strán kontrolujte, či maska nezostala posunutá po otočení alebo zmene mierky zobrazenia.

Modelový príklad: dvojstranová žiadosť s prílohou

Na prvej strane je meno vytlačené z počítača. Na druhej je podpis a ručne dopísaný kontakt. Príloha obsahuje rovnaké meno v nekvalitnej pečiatke. OCR nájde iba prvý výskyt. Ak pracovník potvrdí všetky automatické návrhy a hneď publikuje, zvyšné dve miesta zostanú odhalené.

Správny pracovný postup doplní ručné označenia, skontroluje všetky tri strany a vytvorí nový súbor. Príklad ukazuje rozdiel medzi úspešným rozpoznaním jedného výskytu a úplnou kontrolou dokumentu. Počet návrhov nie je mierou bezpečnosti výsledku.

Ako overiť export zo skenovaného PDF

  1. Otvorte uložený export, nie náhľad pôvodného dokumentu.
  2. Zväčšite každé odstránené miesto a hľadajte zvyšky písmen či podpisu.
  3. Vyhľadajte pôvodné citlivé výrazy a vyskúšajte kopírovanie.
  4. Ak výsledok obsahuje novú OCR vrstvu, overte, že nevychádza z nezačierneného originálu.
  5. Skontrolujte prílohy, vlastnosti súboru a úplnosť strán.

Prázdny výsledok vyhľadávania má pri obrazovom dokumente obmedzenú výpovednú hodnotu. Dôležité je overiť aj technický spôsob exportu: citlivé obrazové dáta sa musia odstrániť, nie iba zakryť ďalším objektom. Pri zavádzaní nástroja to otestujte na umelom dokumente s vopred známymi údajmi.

Časté otázky

Je sken bez OCR bezpečnejší?

Nie sám osebe. Čitateľný text na obrázku môže človek prečítať a ďalší program znovu rozpoznať. Chýbajúca textová vrstva nie je anonymizácia.

Musím ručne prejsť celý dokument?

Áno. Automatika môže pomôcť s hľadaním, no pre finálnu kontrolu nestačí prezrieť iba označené miesta. Osobitnú pozornosť venujte podpisom, pečiatkam a prílohám.

Prečítajte si aj prečo čierny obdĺžnik nestačí a kontrolu anonymizovaného exportu. Výsledok pred zverejnením vždy osobne skontrolujte.

Zdroje

Zdroje overené 7. septembra 2026.

Ing. Michal Dobrotka, MBA

AUTOR ČLÁNKU

Ing. Michal Dobrotka, MBA

Tím Anonymizéra dokumentov

anonymizerdokumentov.sk

Nevyhnutné cookies zabezpečujú prihlásenie a správne fungovanie webu. Analytické a marketingové cookies použijeme iba s vaším súhlasom na meranie návštevnosti a úspešnosti kampaní. Viac o ochrane súkromia