Rozpoznat text v PDF: OCR, kontrola a vyhledávání
PDF Toucan editorial team · Naposledy aktualizováno 20. září 2026 · 8 min čtení

Chcete-li rozpoznat text v PDF, nahrajte naskenovaný dokument do nástroje OCR, vyberte jazyk a spusťte rozpoznání. Výsledkem bude prohledávatelné PDF, ve kterém lze text vyhledat a kopírovat; před dalším použitím vždy zkontrolujte důležitá jména, čísla, data a částky.
Jak rozpoznat text v PDF online?
Naskenované PDF často obsahuje jen obrázky jednotlivých stran. Na pohled vypadá jako běžný dokument, ale prohlížeč v něm nenajde žádné znaky. OCR neboli optické rozpoznávání znaků tento problém řeší: přečte obraz stránky a vytvoří v PDF textovou vrstvu.
V nástroji OCR PDF od PDF Toucan postupujte takto:
- Otevřete nástroj a klikněte na „Vyberte soubory PDF“.
- Vyberte jeden nebo více souborů PDF. Soubor můžete také přetáhnout kamkoli na stránku nebo jej vložit ze schránky.
- V části pro jazyk dokumentu vyberte alespoň jeden jazyk, který se v dokumentu skutečně používá.
- Podle stavu předlohy případně upravte volby pro rozsah stránek a opravy stránky.
- Klikněte na „Rozpoznat text“.
- Po dokončení zvolte stažení prohledávatelného PDF.
U rozsáhlých souborů může rozpoznání trvat několik minut. Nechte proto stránku otevřenou, dokud není zpracování hotové. Nástroj přijímá PDF a zvládne více souborů najednou, ale každý soubor zpracuje samostatně.
Poté otevřete stažený soubor v běžné čtečce PDF. Text by měl jít označit, zkopírovat a vyhledat.
Co OCR v naskenovaném PDF skutečně udělá?
Skener nebo fotoaparát v telefonu obvykle vytvoří obraz papíru, nikoli textový dokument. Písmena jsou tedy jen pixely. Proto ve skenu nemusí fungovat vyhledávání, označování vět ani kopírování.
OCR analyzuje tvary písmen a do výsledného PDF přidá neviditelnou textovou vrstvu ve správných místech. Vzhled stránky přitom zůstane zachován: stále uvidíte původní sken, ale nad ním bude možné pracovat s rozpoznaným textem.
Kvalita výsledku závisí hlavně na kvalitě předlohy. Dobře čitelný tisk a ostrý sken zpravidla poskytují lepší výsledky než:
- bledé kopie a propisovací papír,
- opakovaně kopírované dokumenty,
- fotografie pořízené šikmo nebo za špatného světla,
- rukopis a ozdobná písma,
- razítka, vodoznaky a text překrytý čarami tabulky.
OCR není ruční přepis ani záruka bezchybného obsahu. Je velmi užitečné pro čtení, hledání a kopírování, ale důležité údaje je nutné porovnat s originálním obrazem stránky.
Pro rychlé hledání otevřete výsledek například v Chrome, Adobe Acrobat Readeru nebo Náhledu na macOS. Použijte Ctrl+F ve Windows a ChromeOS, případně Cmd+F na Macu.
PDF vytvořené přímo v kancelářském programu obvykle OCR nepotřebuje, protože textovou vrstvu už obsahuje. Pro smíšené dokumenty je vhodná doporučená volba „Scan pages without text“: stránky, které už text obsahují, ponechá beze změny a rozpozná jen obrazové stránky.
Jaký jazyk vybrat pro OCR PDF?
Volba jazyka je pro přesnost rozpoznání důležitá. OCR podle ní očekává konkrétní abecedu, diakritiku a běžné vzory slov. Čeština například pomáhá správně rozlišit znaky s háčky a čárkami, které by při nevhodném nastavení mohly být nahrazeny podobnými písmeny.
- Vyberte jazyk, ve kterém je napsaná většina dokumentu, například češtinu pro českou fakturu nebo smlouvu.
- U dvojjazyčného dokumentu přidejte oba skutečně používané jazyky.
- Nevybírejte další jazyky pouze „pro jistotu“.
- Před spuštěním ověřte, že je vybraný alespoň jeden jazyk.
V jednom spuštění lze zkombinovat až pět jazyků. Nástroj podporuje 30 jazyků a pracuje mimo jiné s latinkou, cyrilicí, řečtinou, arabským a hebrejským písmem, dévanágarí, thajským, čínským, japonským a korejským písmem.
Více jazyků zpracování zpomaluje. Navíc mohou zvýšit riziko záměny podobných znaků. Pro český jednostranný dokument proto obvykle zvolte jen češtinu; angličtinu přidejte jen tehdy, když je v dokumentu opravdu podstatná část anglického textu.
Jak narovnat nakřivo naskenované stránky a opravit otočení?
Šikmý nebo otočený sken zhoršuje čitelnost i přesnost OCR. Před spuštěním se proto vyplatí prohlédnout alespoň několik stran, zejména první, prostřední a poslední.
V možnostech oprav stránek jsou k dispozici dvě užitečné volby:
- „Straighten tilted pages“ narovná stránky naskenované pod úhlem. Hodí se, když řádky mírně stoupají nebo klesají.
- „Fix page orientation automatically“ automaticky otočí stránky vzhůru nohama nebo na bok správným směrem.
Narovnání usnadňuje OCR čtení řádků a zároveň zlepšuje pohodlí při následném prohlížení. Automatická oprava orientace je praktická zejména u dokumentů se stránkami vloženými z různých zdrojů nebo s tabulkami na šířku.
Pro volbu způsobu rozpoznávání používejte následující vodítko:
| Volba | Co udělá | Kdy ji použít | Omezení |
|---|---|---|---|
| „Scan pages without text“ | Rozpozná jen stránky bez textu a existující text ponechá | Běžné skeny a smíšené PDF | Chybný starý text zůstane beze změny |
| „Recognize existing text again“ | Odstraní špatně rozpoznaný text a stránku přečte znovu | PDF s nekvalitní starší textovou vrstvou | Nelze použít narovnání stránek |
| „Treat every page as an image“ | Každou stránku převede na obraz a rozpozná od začátku | Poškozené nebo nespolehlivé textové vrstvy | Ztratí se původní volitelný text a odkazy |
Začněte doporučenou volbou „Scan pages without text“. Pokud lze na stránce text zřetelně přečíst, ale vyhledávání či kopírování dává nesmyslné výsledky, může pomoci „Recognize existing text again“. Pamatujte však, že při této volbě není narovnání dostupné.
Volbu „Treat every page as an image“ používejte cíleně. Je vhodná, když je textová vrstva zjevně poškozená nebo nekonzistentní. Současně ale odstraní původní odkazy i existující volitelný text.
Jak zkontrolovat, že OCR text rozpoznalo správně?
Hotové prohledávatelné PDF nejprve ověřte, teprve potom z něj přebírejte údaje do účetnictví, smlouvy nebo databáze.
- Otevřete stažený soubor ve své čtečce PDF.
- Stiskněte Ctrl+F, případně Cmd+F, a vyhledejte výraz, který na stránce vidíte: příjmení, datum, číslo faktury nebo částku.
- Vyzkoušejte hledání na různých místech dokumentu, nejen na první stránce.
- Označte krátký odstavec, zkopírujte jej do Poznámkového bloku nebo TextEditu a porovnejte jej s obrazem originálu.
- Pokud jsou výsledky chybné, zkontrolujte vybrané jazyky, orientaci stránek a případně zvolte nové rozpoznání existujícího textu.
Největší pozornost věnujte diakritice, číslům, variabilním symbolům, adresám, e-mailovým údajům, kódům a částkám. Časté jsou záměny jako 0/O, 1/l, 5/S nebo chybějící znaménko u částky. Složitější tabulky, vícesloupcová sazba a drobný text u poznámek pod čarou rovněž vyžadují ruční kontrolu.
Pokud PDF obsahuje elektronický digitální podpis, počítejte s důležitým omezením: po OCR už podpis nebude platný. Přidání textové vrstvy dokument změní. Podepsaný originál proto uchovejte nezměněný a prohledávatelnou kopii používejte pouze jako pracovní verzi.
Jak po OCR PDF vyhledávat nebo převést do Wordu?
Pro běžné čtení, dohledávání údajů a kopírování textu zpravidla stačí prohledávatelné PDF. Zachovává vzhled skenu, ale zároveň dovoluje vyhledat konkrétní slovo nebo zkopírovat vybraný úsek do jiného programu.
Pokud potřebujete upravovat celý dokument ve formátu DOCX, dodržte správné pořadí:
- Nejdříve proveďte OCR a stáhněte výsledné prohledávatelné PDF.
- Otevřete nástroj PDF do Wordu.
- Klikněte na „Vyberte soubory PDF“ a vyberte PDF po OCR, nikoli původní sken.
- Klikněte na „Převést do Wordu“.
- Stáhněte dokument DOCX a před úpravami jej porovnejte s PDF.
Toto pořadí je zásadní. Nástroj PDF do Wordu nerozpoznává text na naskenovaných stránkách; takové stránky vloží do Wordu jako obrázky. Pokud tedy převedete původní sken bez OCR, získáte dokument s obrazy stran, nikoli plně upravitelný přepis.
I po OCR kontrolujte rozvržení ve Wordu. Tabulky, sloupce, záhlaví, poznámky pod čarou a formuláře mohou po převodu potřebovat ruční úpravu. Při rozsáhlých skenech lze výsledné PDF případně zmenšit nástrojem compress, ale vždy si ponechte původní soubor, dokud neověříte kvalitu výsledku.
Je bezpečné nahrát citlivé PDF pro OCR?
OCR PDF v PDF Toucan zpracovává soubory na serverech v Evropské unii. Soubor se odesílá přes HTTPS, zpracovává se v paměti, neukládá se na disk ani se nearchivuje. Po stažení výsledku se maže, nejpozději do 10 minut.
Služba nevyžaduje účet, pro nástroje v prohlížeči nemá denní limity a do výsledku nepřidává vodoznak. Tyto vlastnosti však nenahrazují povinnosti vyplývající z interních pravidel organizace.
Před odesláním citlivého dokumentu zvažte zejména:
- zda pravidla zaměstnavatele, úřadu nebo klienta dovolují externí zpracování,
- zda dokument obsahuje osobní údaje, zdravotní údaje, obchodní tajemství nebo údaje o platbách,
- zda lze nepotřebné citlivé části předem začernit,
- zda pro dokument, který nesmí opustit zařízení, není nutné použít offline řešení.
U smluv s platným digitálním podpisem používejte OCR jen na kopii. Originální podepsané PDF uchovejte bez zásahu, protože rozpoznání textu podpis zneplatní.
Časté otázky
Je možné rozpoznat text v PDF zdarma?
Ano. Nástroj OCR PDF lze použít bez účtu, bez vodoznaku a bez denních limitů pro nástroje v prohlížeči. Nahrajte PDF, vyberte jazyk, klikněte na „Rozpoznat text“ a stáhněte prohledávatelný výsledek. Rozsáhlé dokumenty mohou vyžadovat několik minut zpracování.
Proč ve výsledném PDF nejde nic vyhledat?
Zkontrolujte, zda jste stáhli výsledné prohledávatelné PDF, nikoli původní soubor. Potom ověřte, že byl vybrán správný jazyk a že stránka není extrémně nečitelná, otočená nebo jen ručně psaná. U chybné starší textové vrstvy pomůže opětovné rozpoznání.
Kolik jazyků mohu při OCR vybrat?
V jednom spuštění můžete kombinovat až pět jazyků. Vybírejte pouze jazyky, které dokument skutečně obsahuje, například češtinu a angličtinu u dvojjazyčné smlouvy. Další zbytečné jazyky rozpoznání zpomalují a mohou zhoršit rozlišení podobných znaků.
Zachová OCR digitální podpis PDF?
Ne. OCR mění obsah PDF přidáním textové vrstvy, takže existující digitální podpis přestane být platný. Podepsaný originál proto zachovejte nezměněný. Prohledávatelnou kopii používejte jen pro práci s obsahem, vyhledávání, kopírování nebo následný převod.
Převede OCR naskenované PDF na upravitelný Word?
OCR vytvoří v PDF textovou vrstvu, kterou lze vyhledávat a kopírovat. Pro DOCX pak nejprve proveďte OCR a teprve potom použijte PDF do Wordu. Přímý převod původního skenu nerozpoznává text; stránky budou ve Wordu vloženy jako obrázky.
