PDF OCR online: Szkennelt PDF kereshetővé tétele
PDF Toucan editorial team · Utoljára frissítve: 2026. szeptember 20. · 9 perc olvasás

A PDF OCR online eljárással a szkennelt PDF oldalain látható betűkből kereshető és kijelölhető szövegréteg készül. A PDF OCR eszközben válassza ki a dokumentum nyelvét, szükség esetén javítsa a ferde vagy rosszul tájolt oldalakat, majd a letöltött fájlban kereséssel és másolással ellenőrizze az eredményt.
Mit csinál az OCR egy szkennelt PDF-fel?
A szkennelt PDF gyakran csak oldalképeket tartalmaz. Az ember számára úgy néz ki, mint egy hagyományos dokumentum, de a PDF-olvasó nem betűket, hanem pixeleket lát. Emiatt a keresés nem ad találatot, a szöveg kijelölése helyett egy képrészlet jelölődik ki, a másolt tartalom pedig használhatatlan vagy üres marad.
Az OCR, vagyis optikai karakterfelismerés elemzi az oldalképen lévő karakteralakokat, majd a felismert tartalmat szövegrétegként helyezi el a PDF-ben. Az oldal megjelenése alapvetően megmarad, de a szöveg kereshetővé és másolhatóvá válik.
A felismerés pontossága a forrásanyag minőségétől függ. Jó eredményt adhat egy éles, tiszta, megfelelő kontrasztú nyomtatott szöveg. Több hiba fordulhat elő halvány másolatoknál, ferde mobilfotóknál, apró betűknél, kézírásnál, pecséttel takart részeknél, dekoratív betűtípusoknál és bonyolult táblázatoknál. Az OCR hasznos munkasegéd, de fontos adatoknál nem helyettesíti az ellenőrzést.
Hogyan tehető kereshetővé a PDF online OCR-rel?
A PDF Toucan OCR funkciója PDF-fájlokat fogad, és kereshető PDF-et készít belőlük. Több fájlt is hozzáadhat, de az eszköz minden dokumentumot külön dolgoz fel.
- Nyissa meg a PDF OCR eszközt.
- Kattintson a „PDF-fájlok kiválasztása” gombra, majd jelölje ki a PDF-et. A fájlt az oldal tetszőleges részére is húzhatja, illetve beillesztheti.
- A Dokumentum nyelve résznél válasszon legalább egy olyan nyelvet, amely valóban szerepel az iratban.
- Ha szükséges, nyissa meg a további beállításokat, és állítsa be az olvasandó oldalakat vagy az oldaljavítási lehetőségeket.
- Kattintson a „Szöveg felismerése” gombra.
- Várja meg a feldolgozást. Sokoldalas dokumentumnál a szövegfelismerés néhány percet is igénybe vehet.
- A sikeres felismerés után válassza a kereshető PDF letöltését.
A használathoz nem kell fiókot létrehozni, nincs vízjel és nincs napi korlát a böngészős eszközöknél. Az OCR feldolgozás számításigényes, ezért a fájl HTTPS-en jut el az Európai Unióban működő szerverekre. Feldolgozás közben memóriában marad, nem írják lemezre és nem tárolják; a letöltés után törlődik, legkésőbb 10 percen belül. Ha egy dokumentum semmilyen körülmények között nem hagyhatja el az eszközét, célszerű helyben futó, offline megoldást választani.
Melyik OCR-nyelvet érdemes kiválasztani?
A nyelvválasztás nem puszta formai beállítás. A felismerő a kijelölt nyelvek betűkészletét és nyelvi mintáit használja, ezért a megfelelő választás javíthatja az ékezetek és a hasonló karakterek felismerését.
Magyar dokumentumhoz válassza a magyart. Ez különösen az olyan ékezetes betűknél fontos, mint az á, é, í, ó, ö, ő, ú, ü és ű. Magyar–angol szerződés, számla vagy melléklet esetén jelölje be mindkét nyelvet. Egy futtatásban legfeljebb öt nyelv kombinálható.
Csak a ténylegesen előforduló nyelveket válassza ki. A felesleges nyelvek lassítják a feldolgozást, és egyes esetekben bizonytalanabb karaktercseréket okozhatnak. Az eszköz 30 felismerési nyelvet támogat, többek között latin, cirill, görög, arab, héber, dévanágari, thai, kínai, japán és koreai írásrendszerekkel.
Melyik oldalbeolvasási módot válassza?
Nem minden PDF teljesen szkennelt. Egy irat tartalmazhat digitálisan létrehozott, eleve kereshető oldalakat és képként beszkennelt mellékleteket is. Az oldalbeolvasási mód határozza meg, hogy az OCR mely oldalakat olvassa újra.
| Beállítás | Mit tesz? | Mikor célszerű? | Fontos következmény |
|---|---|---|---|
| Szöveg nélküli oldalak beolvasása | Csak a szövegréteg nélküli oldalakat ismeri fel; a már szöveget tartalmazó oldalakat változatlanul hagyja | A legtöbb szkennelt vagy vegyes PDF-nél | A hibás meglévő szövegréteg nem javul meg |
| Meglévő szöveg újbóli felismerése | Eltávolítja a rosszul felismert régi szöveget, majd újraolvassa az oldalakat | Ha a PDF-ben van, de hibás a szövegréteg | A ferde oldalak javítása ebben a módban nem érhető el |
| Minden oldal kezelése képként | Minden oldalt képpé alakít, majd nulláról felismeri | Sérült, használhatatlan vagy következetlen szövegrétegnél | A korábbi kijelölhető szöveg és hivatkozások elvesznek |
Általában a „Szöveg nélküli oldalak beolvasása” az ajánlott kiindulópont. Nem módosítja a már jó minőségű digitális szöveget, miközben a ténylegesen szkennelt oldalakat felismeri. A másik két módot akkor érdemes választani, ha egyértelműen látszik, hogy a meglévő szöveg hibás: például egy olvasható szó keresése nem talál eredményt, vagy a másolás értelmetlen karaktereket ad.
Mikor kapcsolja be a ferde oldalak és a tájolás javítását?
A ferde, fejjel lefelé álló vagy oldalra fordított lapok rontják a felismerés eredményét. Különösen nagyobb, vegyesen szkennelt iratcsomagoknál érdemes figyelni ezekre a beállításokra.
- Kapcsolja be a „Ferde oldalak kiegyenesítése” lehetőséget, ha a szövegsorok szemmel láthatóan megdőlnek. Az egyenes sorokat az OCR általában pontosabban olvassa.
- Használja az „Oldaltájolás automatikus javítása” beállítást, ha vannak fejjel lefelé vagy oldalra fordítva beszkennelt oldalak.
- Ne feledje, hogy a ferdeség javítása nem érhető el a „Meglévő szöveg újbóli felismerése” módban.
- Ha hibás régi szövegréteg mellett teljes újrafelismerésre van szüksége, a „Minden oldal kezelése képként” lehetőség lehet a megoldás. Ennek ára, hogy a meglévő hivatkozások és kijelölhető szöveg elvesznek.
Nagy iratanyag esetén előbb teszteljen néhány jellemző oldalt. A táblázatok, űrlapok, többhasábos oldalak, nyomtatott pecsétek és rossz minőségű másolatok külön ellenőrzést igényelhetnek.
Hogyan ellenőrizze, hogy az OCR eredménye használható-e?
A sikeres feldolgozási üzenet azt jelenti, hogy az OCR lefutott, de nem bizonyítja, hogy minden karakter hibátlan. Néhány rövid ellenőrzési lépéssel gyorsan megállapítható, használható-e az eredmény.
- Nyissa meg a letöltött PDF-et a szokásos böngészőben vagy PDF-olvasóban.
- Keressen rá egy jellegzetes szóra, névre, dátumra vagy számlaszámra. Windows rendszeren gyakran a Ctrl+F, Macen a Command+F nyitja meg a keresőt.
- Ellenőrizze a dokumentum elején, közepén és végén található oldalakat is. Egyenetlen szkennelésnél az OCR minősége oldalak között változhat.
- Jelöljön ki néhány mondatot, másolja ki egy egyszerű szövegszerkesztőbe, és hasonlítsa össze az eredeti képpel.
- Külön ellenőrizze a neveket, címeket, dátumokat, összegeket, azonosítókat és a 0/O, 1/l, 5/S jellegű hasonló karaktereket.
Ha sok a hiba, próbálkozzon újra a megfelelő nyelvek kiválasztásával, a tájolás javításával vagy jobb minőségű szkenneléssel. Az élesebb, egyenesebb, nagyobb kontrasztú forrás rendszerint többet javít az eredményen, mint bármely utólagos beállítás.
Fontos korlát: az OCR módosítja a PDF tartalmát, ezért egy meglévő digitális aláírás többé nem lesz érvényes. Az eredeti, aláírt dokumentumot változatlanul őrizze meg, a kereshető másolatot pedig munkapéldányként kezelje.
Hogyan keressen a PDF-ben, vagy hogyan alakítsa Word dokumentummá?
Kereséshez és szövegmásoláshoz általában elegendő az OCR-ezett PDF. Ha szerkeszthető DOCX-fájlra van szüksége, a helyes sorrend különösen fontos.
- Először futtassa le az OCR-t, és töltse le a kereshető PDF-et.
- Nyissa meg a PDF Wordbe eszközt.
- Kattintson a „PDF-fájlok kiválasztása” gombra, és az OCR-rel már feldolgozott PDF-et adja hozzá.
- Kattintson a „Konvertálás Wordbe” gombra, majd töltse le a Word-dokumentumot.
- Nyissa meg a DOCX-et Wordben, és ellenőrizze a tördelést, táblázatokat, fejléceket, lábléceket és különleges karaktereket.
A közvetlenül Wordbe alakított szkennelt PDF oldalai képként kerülnek a DOCX-be, nem szerkeszthető szövegként. Ezért szükséges előbb OCR-t futtatni. Az OCR-ezett fájlban már van szövegréteg, amelyre a Word-konvertálás támaszkodhat. Összetett táblázatok, hasábos tördelés és lábjegyzetek esetén így is szükség lehet kézi javításra. Nagy, képalapú PDF-ek archiválásához később a PDF Toucan compress eszköze is hasznos lehet.
Gyakori kérdések
Ingyenes a PDF OCR online használata?
Igen. A PDF Toucan OCR eszközéhez nem kell fiók, a böngészős használatnál nincs napi korlát és az elkészült fájl nem kap vízjelet. Válassza ki a PDF-et, állítsa be a nyelveket, kattintson a „Szöveg felismerése” gombra, majd töltse le az eredményt.
Mennyi ideig tart egy szkennelt PDF szövegfelismerése?
Ez főleg az oldalak számától és a dokumentum képminőségétől függ. Néhány oldalas fájl gyorsabban elkészülhet, míg sokoldalas anyagoknál a felismerés néhány percet is tarthat. A feldolgozás alatt hagyja nyitva a böngészőlapot, és ne válasszon felesleges nyelveket.
Lehet egyszerre magyar és angol szöveget felismerni?
Igen. Magyar–angol dokumentumnál jelölje ki mindkét nyelvet a dokumentumnyelvek között. Egy feldolgozásban legfeljebb öt nyelv kombinálható. Csak azokat a nyelveket adja hozzá, amelyek valóban szerepelnek a fájlban, mert a többletnyelvek lassíthatják a felismerést.
Miért nem talál a kereső szavakat az OCR-ezett PDF-ben?
Lehet, hogy a forrás rossz minőségű, az oldal ferde vagy rosszul tájolt, illetve a megfelelő nyelv nem volt kijelölve. Az is előfordulhat, hogy a PDF hibás régi szövegréteget tartalmaz. Ilyenkor próbálja a meglévő szöveg újrafelismerését vagy a minden oldal képként kezelését.
Az OCR után szerkeszthető lesz a szkennelt PDF Wordben?
Az OCR elsősorban kereshető és másolható szöveget ad a PDF-hez. Szerkeszthető Word-fájlhoz ezután alakítsa át az OCR-ezett PDF-et a PDF Wordbe eszközzel. A végeredményt mindig ellenőrizze, mert a táblázatok, hasábok és összetett tördelések kézi korrekciót igényelhetnek.
