Naskenujete smlouvu do PDF, otevřete ji a chcete vyhledat konkrétní jméno. Vyhledávání ale nic nenajde, přestože dané jméno přímo vidíte. Důvodem bývá to, že PDF obsahuje stránky uložené jako obrázky, nikoli jako strojově čitelný text.
Právě tento problém řeší OCR. Technologie rozpozná text zachycený v obrazu a převede ho do podoby, se kterou dokáže pracovat počítač. Díky tomu lze i naskenované PDF prohledávat, kopírovat z něj text nebo jeho obsah dále zpracovávat.

Co je OCR
OCR je zkratka pro Optical Character Recognition, česky optické rozpoznávání znaků. Technologie identifikuje písmena, číslice a další znaky v obrazových datech a převádí je na text.
Typickým příkladem je papírová faktura. Samotným naskenováním vznikne její digitální obraz. Člověk text přečte, software ale bez dalšího zpracování vidí především obrazová data. OCR dokáže jednotlivé znaky rozpoznat a vytvořit jejich textovou podobu.
Jak OCR v PDF funguje
OCR software nejprve analyzuje obraz stránky. Podle použité technologie může upravit kontrast, odstranit obrazový šum nebo narovnat špatně naskenovanou stránku.
Následně vyhledá oblasti obsahující text a rozpoznává jednotlivé znaky a slova. Moderní OCR systémy k tomu využívají také strojové učení a neuronové sítě. Při zpracování mohou pracovat s jazykovými pravidly a slovníky, které pomáhají určit nejpravděpodobnější podobu rozpoznaného textu.
U PDF může být výsledný text uložen jako textová vrstva nad původním skenem. Vzhled dokumentu se tedy nemusí změnit. Stále vidíte původní naskenovanou stránku, ale nově můžete označovat text nebo pomocí vyhledávání najít konkrétní výraz.
To je užitečné například u smluv, faktur, formulářů, technické dokumentace nebo starších firemních materiálů.
Jak poznat PDF, které potřebuje OCR
Ne každé PDF je potřeba pomocí OCR zpracovávat. Dokument exportovaný například z Wordu nebo jiného textového editoru obvykle textovou vrstvu už obsahuje.
Rozdíl můžete zjistit jednoduchým testem. Zkuste v PDF označit několik slov nebo pomocí funkce hledání najít výraz, který na stránce vidíte. Pokud text nelze označit a vyhledávání jej nenajde, pravděpodobně pracujete s obrazovým PDF.
OCR je vhodné také tehdy, pokud chcete obsah většího množství naskenovaných dokumentů indexovat a následně v něm vyhledávat.

Jak přesné je OCR
OCR není bezchybné. Přesnost rozpoznávání závisí především na kvalitě vstupního dokumentu.
Nejlepších výsledků dosahuje u ostrého, dobře kontrastního tištěného textu. Problémy mohou způsobit rozmazané skeny, malé nebo neobvyklé písmo, složité tabulky, poškozené dokumenty či ručně psané poznámky.
Důležitý je také jazyk. Při rozpoznávání českého dokumentu by měl OCR nástroj podporovat češtinu včetně diakritiky.
Pokud mají být získané údaje použity například v účetnictví, smlouvách nebo jiných dokumentech, kde záleží na přesném znění, je vhodné výsledek zkontrolovat.
OCR a správa dokumentů v BrandCloudu
Význam OCR roste s množstvím uložených dokumentů. Pokud firma spravuje stovky PDF, nestačí vždy vědět, jak se soubor jmenuje nebo ve které složce se nachází. Potřebujete být schopni dohledat také informace uvnitř dokumentů.
BrandCloud využívá OCR k rozpoznání textového obsahu PDF dokumentů. Díky tomu lze pracovat také s informacemi, které byly původně součástí naskenovaných stránek. To usnadňuje dohledávání dokumentů a práci s rozsáhlejší knihovnou digitálních assetů.
OCR přitom doplňuje metadata a další způsoby organizace souborů. Zatímco metadata popisují samotný asset, OCR zpřístupňuje text, který se nachází uvnitř dokumentu.
Kdy OCR použít a na co si dát pozor
Před zpracováním dokumentů pomocí OCR se vyplatí ověřit několik základních věcí:
- Zkontrolujte, zda PDF už textovou vrstvu neobsahuje.
- Používejte co nejkvalitnější a nejostřejší skeny.
- Nastavte správný jazyk rozpoznávání.
- U důležitých údajů výsledek OCR zkontrolujte.
- U smluv a dalších citlivých souborů ověřte, kde online OCR služba dokumenty zpracovává a ukládá.
Z naskenovaného PDF se může stát prohledávatelný dokument
OCR řeší častý problém digitálních dokumentů: text, který člověk na naskenované stránce vidí, nemusí být pro počítač skutečným textem.
Optické rozpoznávání znaků tento obsah převede do strojově čitelné podoby. PDF pak lze prohledávat, text z něj kopírovat a jeho obsah využívat v dalších systémech.
U většího množství dokumentů má OCR ještě další význam. Informace uložené uvnitř PDF přestávají být závislé pouze na ručním procházení jednotlivých souborů a mohou se stát součástí systematické správy digitálního obsahu.

