
OCR PDF on palvelimella tehtävä tekstintunnistus, joka muuttaa skannatun PDF:n haettavaksi ja valittavaksi tekstiksi. Käytä sitä, kun asiakirjan sivut ovat kuvia eikä PDF-haku löydä niiden sanoja. Lisää yksi tai useampi tiedosto, valitse asiakirjassa käytetyt kielet ja lataa valmis haettava PDF. Lopputulos säilyy PDF:nä, ei muutu suoraan Word-tiedostoksi.
Mitä voit tehdä työkalulla OCR PDF -tekstintunnistus
Hae ja kopioi skannauksen tekstiä
PDF tekstintunnistus lisää skannattuun asiakirjaan tekstikerroksen, jonka avulla voit etsiä sanoja, valita tekstikohtia ja kopioida niitä. Se sopii esimerkiksi arkistoiduille papereille, skannatuille muistiinpanoille ja asiakirjoille, joiden sisältöä haluat tarkistaa kirjoittamatta kaikkea uudelleen.
Valitse asiakirjan tunnistuskielet
Valitse vähintään yksi asiakirjassa käytetty kieli. Tunnistuksessa on 30 kieltä ja eri kirjoitusjärjestelmiä, kuten latinalainen, kyrillinen, kreikkalainen, arabialainen, kiina, japani ja korea. Voit yhdistää enintään viisi kieltä. Valitse vain tarvittavat kielet, sillä lisäkielet hidastavat käsittelyä.
Tunnista vain sivut ilman tekstiä
Suositeltu asetus tunnistaa sivut, joilla ei vielä ole valittavaa tekstiä. Sivut, joilla teksti on jo käytettävissä, jätetään muuttamatta. Tämä on käytännöllinen valinta, kun samassa tiedostossa on sekä digitaalisia sivuja että skannattuja liitteitä tai lomakkeita.
Lue virheellinen tekstikerros uudelleen
Valitse olemassa olevan tekstin uudelleentunnistus, jos PDF:ssä on valittavaa tekstiä mutta se on tunnistettu huonosti. Vanha tekstikerros poistetaan ja sivut luetaan uudelleen. Vaihtoehto käsitellä jokainen sivu kuvana tunnistaa kaiken alusta, mutta poistaa myös vanhan valittavan tekstin ja linkit.
Suorista vinot sivut ja korjaa suunta
Voit suoristaa vinossa skannatut sivut ja korjata ylösalaisin tai sivuttain skannattujen sivujen suunnan automaattisesti. Näin asiakirjaa on helpompi lukea ja tekstintunnistus saa sivusta selkeämmän lähtökohdan. Sivujen suoristus ei ole käytettävissä, kun valitset olemassa olevan tekstin uudelleentunnistuksen.
Käsittele useita PDF:iä erillisinä tiedostoina
Lisää useita PDF-tiedostoja samalla kertaa, kun haluat käsitellä asiakirjasarjan. Kukin tiedosto tunnistetaan erikseen ja säilyy omana haettavana PDF-tiedostonaan. Tiedostoja ei yhdistetä toisiinsa. Monisivuisten tiedostojen tai usean kielivalinnan käsittely voi kestää muutaman minuutin.
OCR PDF -tekstintunnistus verkossa – näin se käy

Lisää skannatut PDF-tiedostot
Valitse “Valitse PDF-tiedostot” ja poimi laitteeltasi yksi tai useampi skannattu PDF. Kukin tiedosto käsitellään erillään. Lisää tiedostoja, joiden tekstistä haluat tehdä haettavaa ja kopioitavaa; saat jokaisesta valmiin PDF-tiedoston.
Valitse asiakirjassa käytetyt kielet
Valitse vähintään yksi kieli ja lisää kaikki sivuilla esiintyvät kielet, enintään viisi kerrallaan. Jos asiakirja on esimerkiksi suomeksi ja englanniksi, valitse molemmat. Vältä tarpeettomia kieliä, koska ne voivat pidentää tunnistukseen kuluvaa aikaa.
Määritä tunnistettavat sivut
Pidä käytössä suositeltu asetus, jos haluat tunnistaa vain sivut ilman tekstiä. Valitse olemassa olevan tekstin uudelleentunnistus vain silloin, kun vanha tekstikerros on virheellinen. Käsittele jokainen sivu kuvana, kun haluat aloittaa kaiken alusta ja hyväksyt tekstin sekä linkkien poistumisen.
Korjaa sivut ja käynnistä tunnistus
Ota tarvittaessa käyttöön vinojen sivujen suoristus ja automaattinen suunnan korjaus. Käynnistä sitten käsittely painamalla “Tunnista teksti”. OCR PDF verkossa voi kestää muutaman minuutin, jos tiedostossa on paljon sivuja, useita kieliä tai käsittelet useita PDF:iä.
Lataa haettavat PDF-tiedostot
Kun tunnistus on valmis, lataa jokainen haettava PDF erikseen. Voit nyt hakea sanoja, valita tekstin ja kopioida sitä asiakirjasta. Jos alkuperäisessä tiedostossa oli digitaalinen allekirjoitus, se ei ole enää voimassa käsittelyn jälkeen.
Palvelinkäsittely EU:ssa ja lyhyt säilytysaika
PDF Toucan käsittelee tämän palvelinpohjaisen toiminnon Euroopan unionissa sijaitsevilla palvelimilla. PDF lähetetään HTTPS-yhteydellä ja käsitellään vain muistissa. Tiedostoa ei kirjoiteta levylle eikä tallenneta. Se poistetaan heti, kun lataat tuloksen, tai viimeistään 10 minuutin kuluttua, jos latausta ei tehdä. Palvelu on ilmainen, ei vaadi tiliä eikä lisää tiedostoon vesileimaa. Mainokset rahoittavat sivustoa. Koska tekstintunnistus muuttaa PDF-tiedostoa, mahdollinen digitaalinen allekirjoitus ei ole käsittelyn jälkeen enää voimassa. Säilytä allekirjoitettu alkuperäinen, jos allekirjoituksen voimassaolo on tärkeää.
Käsitellään muistissa palvelimillamme alueella Euroopan unioni. Tiedostoasi ei koskaan tallenneta: se poistetaan heti, kun lataat tuloksen, viimeistään 10 minuutin kuluttua.
OCR PDF -tekstintunnistus – usein kysytyt kysymykset
Miten teen skannatusta PDF:stä haettavan?
Lisää skannattu tiedosto, valitse siinä käytetyt kielet, määritä tunnistettavat sivut ja käynnistä tekstintunnistus. Kun käsittely valmistuu, lataa haettava PDF. Sen jälkeen voit etsiä asiakirjasta sanoja, valita tunnistettua tekstiä ja kopioida sitä tarvitsemaasi paikkaan.
Onko OCR PDF ilmaiseksi käytettävissä?
Kyllä, palvelu on ilmainen. Voit tehdä OCR PDF -käsittelyn ilman tiliä ja ladata haettavan lopputuloksen ilman vesileimaa. Monisivuisen tiedoston tai usean valitun kielen käsittely voi kestää muutaman minuutin.
Tarvitaanko OCR PDF -työkaluun tili?
Ei, tiliä ei tarvita. Valitse PDF-tiedosto, aseta asiakirjan kielet ja käynnistä tunnistus suoraan selaimessa. Valmis tiedosto on edelleen PDF, jossa tekstiä voi hakea, valita ja kopioida.
Mitä kieliä PDF-tekstintunnistus tukee?
Tunnistus tukee 30 kieltä ja useita kirjoitusjärjestelmiä, kuten latinalaista, kyrillistä, arabialaista, kiinaa, japania ja koreaa. Voit valita enintään viisi asiakirjassa käytettyä kieltä yhdelle käsittelykerralle. Tarpeettomat kielivalinnat hidastavat tunnistusta.
Muuttuuko jo valittavissa oleva teksti OCR-käsittelyssä?
Ei suositellulla asetuksella. “Skannaa sivut ilman tekstiä” jättää sivut, joilla on jo valittavaa tekstiä, muuttamatta ja tunnistaa vain tekstittömät sivut. Uudelleentunnistus tai jokaisen sivun käsittely kuvana voi poistaa aiemman valittavan tekstin.
Miksi digitaalinen allekirjoitus ei ole enää voimassa OCR:n jälkeen?
Koska OCR muuttaa PDF-tiedostoa, digitaalinen allekirjoitus ei enää vastaa muokattua asiakirjaa. Työkalu ilmoittaa, ettei allekirjoitus ole enää voimassa. Säilytä alkuperäinen allekirjoitettu PDF erillään, jos sinun on voitava todistaa allekirjoituksen voimassaolo.
Voinko muuntaa skannatun PDF:n Wordiksi tekstintunnistuksen jälkeen?
Kyllä, tee ensin skannatusta PDF:stä haettava PDF tällä toiminnolla ja käytä sen jälkeen erillistä pdf-to-word-työkalua. OCR PDF ei luo Word-tiedostoa suoraan, vaan lisää PDF:ään haettavan ja kopioitavan tekstin.
Käytä PDF Toucanin OCR PDF -tekstintunnistusta, kun haluat pitää lopputuloksen PDF-muodossa mutta tehdä skannauksesta haettavan. Jos tarvitset myöhemmin muokattavan asiakirjan, jatka pdf-to-word-työkaluun. Jos tunnistettu tiedosto kasvaa suureksi, voit pienentää sitä compress-työkalulla ennen tallennusta tai jakamista.
Päivitetty 20. syyskuuta 2026