PDF tekstintunnistus: Tee skannatusta PDF:stä haettava
PDF Toucan editorial team · Päivitetty 20. syyskuuta 2026 · 8 min lukuaikaa

PDF tekstintunnistus tekee skannatusta asiakirjasta haettavan lisäämällä sivukuviin tekstikerroksen: valitse oikeat kielet, korjaa tarvittaessa sivujen asento, paina "Tunnista teksti" ja testaa lopputulos haulla ennen kuin käytät tiedostoa jatkotyössä.
Mitä PDF:n tekstintunnistus tekee?
Skannattu PDF on usein kokoelma sivukuvia. Ihminen näkee siinä kirjaimia ja sanoja, mutta PDF-lukija näkee vain pikseleitä. Siksi Ctrl+F-haku ei löydä asiakirjasta mitään, tekstin valitseminen valitsee ehkä koko sivun alueen ja kopiointi ei tuota käyttökelpoista tekstiä.
Tekstintunnistus eli OCR lukee sivukuvassa näkyviä merkkejä ja lisää PDF:ään näkymättömän tekstikerroksen. Sivun ulkoasu säilyy yleensä ennallaan, mutta sanoja voi hakea, tekstiä voi valita ja kohtia voi kopioida esimerkiksi muistiinpanoihin tai Wordiin.
Haku toimii tavallisesti näin:
- Windowsissa paina Ctrl+F.
- Macissa paina Cmd+F.
- Puhelimessa tai tabletissa avaa PDF-sovelluksen hakukuvake.
OCR ei ole virheetön litterointi. Selkeä painettu teksti onnistuu yleensä hyvin, mutta haalea kopio, vino puhelimella otettu kuva, käsinkirjoitus, pienet kirjasimet, leimat, monipalstaiset sivut ja taulukot voivat aiheuttaa virheitä. Tarkista aina tärkeät nimet, summat, päivämäärät ja tunnistenumerot alkuperäisestä sivukuvasta.
Miten teen skannatusta PDF:stä haettavan?
Tee tunnistus OCR PDF -työkalulla seuraavasti. Voit käsitellä myös useita PDF-tiedostoja samalla kertaa, mutta jokainen tiedosto tunnistetaan erikseen.
- Avaa OCR-työkalu ja paina "Valitse PDF-tiedostot". Voit myös pudottaa PDF:n sivulle tai liittää tiedoston.
- Valitse kohdasta "Document language" asiakirjassa käytetty kieli tai käytetyt kielet. Vähintään yksi kieli on valittava.
- Avaa tarvittaessa lisäasetukset ja tarkista kohta "Which pages should be scanned?". Useimmissa tapauksissa sopiva valinta on "Scan pages without text".
- Ota sivukorjaukset käyttöön, jos sivut ovat vinossa, sivuttain tai ylösalaisin.
- Paina "Tunnista teksti".
- Odota käsittelyn valmistumista. Monisivuisten tiedostojen tunnistus voi kestää muutaman minuutin.
- Paina "Download the searchable PDF" ja tallenna valmis haettava PDF.
PDF Toucanin OCR-työkalu käsittelee tiedoston EU:ssa sijaitsevilla palvelimilla HTTPS-yhteyden kautta. Tiedosto käsitellään muistissa, sitä ei kirjoiteta levylle eikä säilytetä. Se poistetaan, kun tulos on ladattu, kuitenkin viimeistään 10 minuutin kuluttua.
Jos asiakirja ei saa missään tilanteessa poistua laitteeltasi, käytä sen sijaan organisaatiosi hyväksymää offline-ohjelmistoa. Tekstintunnistus muuttaa myös PDF:n sisältöä, joten sitä ei pidä tehdä ainoalle allekirjoitetulle alkuperäiskappaleelle.
Mitkä OCR-kielet kannattaa valita?
Kielivalinta vaikuttaa tunnistuksen tulokseen. Se auttaa OCR-moottoria erottamaan samannäköisiä merkkejä sekä tulkitsemaan sanojen ja aakkosten rakenteita. Oikea, mahdollisimman suppea kielivalinta on yleensä sekä nopeampi että tarkempi kuin kaikkien mahdollisten kielten valitseminen.
Suomenkieliseen asiakirjaan valitse suomi. Lisää ruotsi esimerkiksi kaksikieliseen viranomaisasiakirjaan tai yhtiön raporttiin. Lisää englanti vain, jos dokumentissa todella on englanninkielisiä osia. Yhdellä käsittelykerralla voi yhdistää enintään viisi kieltä.
Työkalu tukee 30 tunnistuskieltä sekä muun muassa latinalaisia, kyrillisiä, kreikkalaisia, arabialaisia, heprealaisia, devanagari-, thai-, kiina-, japani- ja korealaisia kirjoitusjärjestelmiä.
Valitse kieli näin:
- Tarkista, mitä kieliä varsinaisessa leipätekstissä esiintyy.
- Valitse suomi, jos asiakirjassa on suomalaisia nimiä, osoitteita tai tekstikappaleita.
- Lisää toinen kieli vain, kun sitä esiintyy olennaisessa määrin.
- Aja tunnistus uudelleen oikeilla kielillä, jos ä-, ö- tai å-kirjaimet tai muut erikoismerkit toistuvat virheellisinä.
Pelkkä englannin valinta voi esimerkiksi heikentää suomenkielisten sanojen, henkilönnimien ja ääkkösten tunnistusta. Kieli on siis tunnistuksen asetus, ei vain käyttöliittymän valinta.
Miten vinot tai väärin päin skannatut sivut korjataan?
Vinoon syötetty sivu voi vaikeuttaa tekstirivien tunnistamista. Väärä sivusuunta taas voi estää tuloksen lähes kokonaan. Käytä sivukorjauksia ennen tunnistusta, jos tiedostossa on tällaisia ongelmia.
- Ota käyttöön "Straighten tilted pages", kun sivut ovat hieman kallellaan.
- Ota käyttöön "Fix page orientation automatically", kun sivuja on skannattu ylösalaisin tai sivuttain.
- Valitse "Recognize existing text again", jos PDF:ssä on jo tekstikerros, mutta haku ja kopiointi tuottavat selvästi virheellistä tekstiä.
- Valitse "Treat every page as an image" vain, jos koko tiedoston tekstikerros on käyttökelvoton ja haluat lukea jokaisen sivun uudelleen alusta.
Alla oleva vertailu auttaa valitsemaan sivutilan.
| Vaihtoehto | Mitä se tekee | Milloin käytetään | Huomio |
|---|---|---|---|
| "Scan pages without text" | Tunnistaa vain sivut, joilla ei ole tekstikerrosta | Tavallinen skannattu tai sekamuotoinen PDF | Suositeltu valinta; valmiit tekstisivut jätetään ennalleen |
| "Recognize existing text again" | Poistaa vanhan tunnistetun tekstin ja lukee sivut uudelleen | Vanha OCR-teksti on huonoa | "Straighten tilted pages" ei ole käytettävissä tässä tilassa |
| "Treat every page as an image" | Muuttaa kaikki sivut kuviksi ja tunnistaa ne alusta | Tekstikerros on pahasti rikki tai epäyhtenäinen | Vanha valittava teksti ja linkit menetetään |
Aloita yleensä vaihtoehdosta "Scan pages without text". Se säilyttää jo toimivan digitaalisen tekstin. Jos tiedostossa on paljon sivuja, kokeile ensin muutamalla edustavalla sivulla, miten tunnistus selviää taulukoista, lomakkeista ja leimatuista sivuista.
Miten tarkistan, että tekstintunnistus onnistui?
Älä päättele onnistumista vain siitä, että PDF näyttää samalta kuin ennen. OCR:n tekstikerros on näkymätön, joten tulos on testattava haulla ja kopioinnilla.
- Avaa ladattu PDF tavallisessa PDF-lukijassasi.
- Hae Ctrl+F:llä tai Cmd+F:llä erottuvaa sanaa, kuten sukunimeä, otsikkoa, päivämäärää tai laskun numeroa.
- Tarkista haku ainakin asiakirjan alusta, keskeltä ja lopusta. Sivujen laatu voi vaihdella saman tiedoston sisällä.
- Valitse yksi kokonainen lause, kopioi se pelkkää tekstiä käsittelevään editoriin ja vertaa sitä sivukuvaan.
- Tarkista erityisen huolellisesti nimet, osoitteet, euromäärät, päivämäärät sekä merkit 0 ja O, 1 ja l sekä 5 ja S.
Jos haku ei löydä selvästi sivulla näkyvää sanaa, tarkista ensin kielivalinnat ja sivun suunta. Jos PDF:ssä oli ennestään virheellinen tekstikerros, aja tunnistus uudelleen valinnalla "Recognize existing text again" tai tarvittaessa "Treat every page as an image".
Huomaa myös digitaalinen allekirjoitus: OCR muokkaa PDF-tiedostoa, joten digitaalinen allekirjoitus ei ole enää voimassa. Säilytä allekirjoitettu alkuperäinen muuttamattomana ja käytä haettavaa kopiota vain työskentelyyn, hakuun ja tekstin poimintaan.
Miten vien OCR-käsitellyn PDF:n Wordiin tai haen siitä tietoa?
Jos haluat vain löytää tietoa asiakirjasta, haettava PDF on usein paras lopputulos. Hae sanoja PDF-lukijassa, kopioi tarvittavat virkkeet ja säilytä sivun ulkoasu alkuperäisenä.
Jos tarvitset muokattavan DOCX-tiedoston, tee vaiheet oikeassa järjestyksessä:
- Tunnista ensin skannatun PDF:n teksti OCR-työkalulla.
- Lataa haettava PDF ja tarkista, että haku sekä kopiointi toimivat.
- Avaa PDF Wordiksi -työkalu.
- Paina "Valitse PDF-tiedostot" ja valitse OCR-käsitelty PDF, ei alkuperäistä pelkkää skannausta.
- Paina "Muunna Wordiksi".
- Avaa ladattu DOCX Wordissa ja tarkista asettelu sekä tekstin muokattavuus.
Järjestys on tärkeä. PDF Wordiksi -työkalu ei tunnista skannattua sivukuvaa tekstiksi, vaan pelkkä skannattu sivu lisätään Word-tiedostoon kuvana. Kun OCR on tehty ensin, PDF:ssä on tekstikerros, jota muunnos voi hyödyntää.
Tarkista Wordissa erityisesti taulukot, monipalstaiset sivut, lomakkeet, alaviitteet ja sivunvaihdot. Jos tavoitteena on vain pienentää OCR-käsitellyn, kuvapitoisen PDF:n tiedostokokoa, voit käyttää PDF Toucanin compress-työkalua.
Usein kysytyt kysymykset
Onko PDF:n tekstintunnistus sama asia kuin PDF:n muuntaminen Wordiksi?
Ei. Tekstintunnistus lisää skannattuun PDF:ään haettavan ja kopioitavan tekstikerroksen, mutta säilyttää PDF-muodon. Word-muunnos tuottaa DOCX-tiedoston muokkaamista varten. Skannattu PDF kannattaa tunnistaa ensin, koska muuten Word-muunnoksessa sivut päätyvät asiakirjaan kuvina.
Voinko tehdä haettavan PDF:n puhelimella?
Kyllä. OCR-työkalua voi käyttää puhelimen selaimella, kun PDF on saatavilla laitteella. Valitse kieli tai kielet, käynnistä "Tunnista teksti" ja lataa valmis tiedosto. Testaa lopuksi PDF-sovelluksen hakukuvakkeella, että jokin sivulla näkyvä sana löytyy.
Miksi Ctrl+F ei löydä sanaa OCR-käsitellystä PDF:stä?
Sana on voinut tunnistua väärin esimerkiksi epäselvän skannauksen, väärän kielen, vinon sivun tai pienen tekstin vuoksi. Kokeile hakea lyhyempää ja erottuvaa sanaa, tarkista kielivalinta sekä sivun asento ja aja tunnistus tarvittaessa uudelleen. Käsinkirjoitus voi jäädä tunnistamatta.
Säilyykö digitaalinen allekirjoitus tekstintunnistuksen jälkeen?
Ei säily. Tekstikerroksen lisääminen muuttaa PDF:n sisältöä, jolloin digitaalinen allekirjoitus ei ole enää voimassa. Arkistoi allekirjoitettu alkuperäinen omana muuttamattomana tiedostonaan. Käytä OCR-käsiteltyä kopiota hakuun, kopiointiin ja mahdolliseen Word-jatkokäsittelyyn.
