Zum Inhalt springen
PDFToucan PDF Toucan Startseite

PDF durchsuchbar machen: Gescannte Dateien mit OCR lesbar machen

PDF Toucan editorial team · Zuletzt aktualisiert am 20. September 2026 · 7 Min. Lesezeit

PDF durchsuchbar machen: Gescannte Dateien mit OCR lesbar machen

Eine PDF durchsuchbar machen heißt: Eine OCR-Texterkennung ergänzt hinter den sichtbaren Scanbildern eine Textebene. Danach können Sie Wörter finden, Text markieren und kopieren. Wählen Sie die passenden Sprachen, korrigieren Sie bei Bedarf schiefe oder gedrehte Seiten und prüfen Sie das Ergebnis anschließend mit der Suchfunktion Ihres PDF-Readers.

Was bedeutet „PDF durchsuchbar machen“?

Eine gescannte PDF sieht auf den ersten Blick wie ein normales Textdokument aus. Technisch besteht sie jedoch oft nur aus Bildern einzelner Papierseiten. Der PDF-Reader erkennt darin keine Wörter: Die Suche findet nichts, beim Markieren wird höchstens ein Bereich aufgezogen, und kopierter Inhalt ist leer oder unbrauchbar.

OCR steht für optische Zeichenerkennung. Die Software analysiert die Buchstabenformen im Seitenbild und legt die erkannten Zeichen als unsichtbare, durchsuchbare Textebene über die Scanseite. Das ursprüngliche Seitenbild und damit das sichtbare Layout bleiben erhalten. Anschließend funktioniert die Volltextsuche, und Text lässt sich in vielen Fällen kopieren.

Die Erkennung ist allerdings nicht fehlerfrei. Gute Ergebnisse sind bei scharfen, kontrastreichen Scans von gedrucktem Text zu erwarten. Unscharfe Kopien, verblasste Durchschläge, Fotos aus schrägem Winkel, dekorative Schriften, Stempel, Tabellen und Handschrift können zu Fehlern führen. OCR ist daher eine praktische Lese- und Suchhilfe, aber kein Ersatz für eine sorgfältige Prüfung wichtiger Angaben.

Beachten Sie außerdem digitale Signaturen: Das Hinzufügen einer Textebene verändert die PDF. Eine vorhandene digitale Signatur ist danach nicht mehr gültig. Bewahren Sie signierte Originale unverändert auf und verwenden Sie die OCR-Version nur als Arbeitskopie.

Wie mache ich eine gescannte PDF online durchsuchbar?

Mit dem OCR-PDF-Tool von PDF Toucan erstellen Sie eine durchsuchbare Version direkt im Browser. Der Ablauf funktioniert auf Computer, Tablet und Smartphone.

  1. Öffnen Sie das OCR-Werkzeug und klicken Sie auf „PDF-Dateien auswählen“. Alternativ können Sie die PDF an einer beliebigen Stelle auf der Seite ablegen oder aus der Zwischenablage einfügen.
  2. Wählen Sie die gescannte PDF aus. Mehrere Dateien sind möglich; jede Datei wird einzeln verarbeitet.
  3. Wählen Sie unter „Document language“ mindestens eine Sprache aus, die im Dokument vorkommt, zum Beispiel Deutsch.
  4. Öffnen Sie bei Bedarf „More options“, um die zu lesenden Seiten und Korrekturen für die Scanseiten festzulegen.
  5. Klicken Sie auf „Text erkennen“. Bei umfangreichen PDFs kann die Texterkennung einige Minuten dauern.
  6. Nach der Erfolgsmeldung laden Sie das Ergebnis mit „Download the searchable PDF“ herunter.

Der Dienst ist kostenlos, benötigt kein Konto und versieht die Datei nicht mit einem Wasserzeichen. Für die OCR wird die Datei über HTTPS an Server in der Europäischen Union gesendet. Sie wird dort nur im Arbeitsspeicher verarbeitet, nicht auf Festplatte geschrieben oder gespeichert und nach dem Download gelöscht, spätestens nach zehn Minuten. Bei Dokumenten, die das Gerät unter keinen Umständen verlassen dürfen, ist lokale OCR-Software die passendere Wahl.

Welche OCR-Sprache soll ich für meine PDF wählen?

Die Sprachwahl beeinflusst die Qualität deutlich. Sie hilft der Erkennung, Buchstaben, Umlaute, Akzente und typische Wortmuster richtig einzuordnen. Für deutsche Briefe, Rechnungen oder Verträge wählen Sie Deutsch. Enthält ein Vertrag zusätzlich englische Passagen, wählen Sie Deutsch und Englisch.

Bis zu fünf Sprachen lassen sich in einem Durchgang kombinieren. Aktivieren Sie aber nur Sprachen, die tatsächlich vorkommen. Zusätzliche Sprachen verlangsamen die Verarbeitung und können mehrdeutige Zeichen schlechter auflösbar machen. Ein verwischtes Zeichen kann beispielsweise je nach Sprachmodell als Buchstabe, Ziffer oder Sonderzeichen interpretiert werden.

Die OCR unterstützt 30 Erkennungssprachen und Schriftarten aus mehreren Schriftsystemen:

SchriftsystemBeispiele
LateinischDeutsch, Englisch, Französisch
Kyrillisch und GriechischRussisch, Ukrainisch, Griechisch
Rechts-nach-links-SchriftenArabisch, Hebräisch
Weitere SchriftenDevanagari, Thai, Chinesisch, Japanisch, Koreanisch

Bei einem deutsch-englischen Dokument genügt in der Regel die Auswahl dieser beiden Sprachen. Bei einer deutschen Rechnung mit einzelnen englischen Produktnamen ist dagegen meist Deutsch ausreichend.

Wie korrigiere ich schiefe oder falsch gedrehte Scan-Seiten?

Unter „More options“ stehen Einstellungen zur Verfügung, mit denen sich problematische Scanseiten vor der Erkennung verbessern lassen. Besonders bei Einzugsscannern oder Handyaufnahmen lohnt sich ein Blick auf diese Optionen.

OptionWirkungGeeignet fürWichtiger Hinweis
„Scan pages without text“Liest nur Seiten ohne vorhandenen Text.Normale Scan-PDFs und gemischte Dokumente.Empfohlen; vorhandener Text bleibt unverändert.
„Recognize existing text again“Entfernt eine schlecht erkannte Textebene und liest erneut.PDFs mit fehlerhaftem altem OCR-Text.Schiefstellen-Korrektur ist dann nicht verfügbar.
„Treat every page as an image“Wandelt jede Seite in ein Bild um und erkennt alles neu.Stark beschädigte oder widersprüchliche Textebenen.Vorhandener auswählbarer Text und Links gehen verloren.

Gehen Sie in dieser Reihenfolge vor:

  1. Lassen Sie zunächst „Scan pages without text“ aktiviert. Das ist die empfohlene Einstellung, weil sauberer digitaler Text nicht unnötig verändert wird.
  2. Aktivieren Sie „Straighten tilted pages“, wenn Textzeilen leicht schräg verlaufen. Gerade Zeilen verbessern die Erkennung häufig merklich.
  3. Aktivieren Sie „Fix page orientation automatically“, wenn Seiten seitlich oder auf dem Kopf eingescannt wurden.
  4. Nutzen Sie „Recognize existing text again“ nur dann, wenn bereits vorhandener Text nachweislich schlecht ist, etwa wenn die Suche sichtbare Wörter nicht findet.
  5. Wählen Sie „Treat every page as an image“ erst als letzten Schritt. Diese Einstellung ist ein kompletter Neustart, entfernt aber auch bestehende Links und auswählbaren Text.

Bei langen Akten empfiehlt es sich, zuerst eine kleine Beispieldatei zu testen. So erkennen Sie frühzeitig, ob Tabellen, Stempel, mehrspaltige Seiten oder schlechte Kopien besondere Nacharbeit erfordern.

Wie prüfe ich, ob die PDF wirklich durchsuchbar ist?

Verlassen Sie sich nicht allein auf die Erfolgsmeldung. Eine Textebene kann vorhanden sein, einzelne Wörter können aber falsch erkannt worden sein. Prüfen Sie das heruntergeladene Dokument daher kurz und gezielt.

  1. Öffnen Sie die durchsuchbare PDF in Ihrem üblichen PDF-Reader.
  2. Suchen Sie nach einem auffälligen Wort, Namen, Datum oder einer Rechnungsnummer. Unter Windows verwenden Sie meist Strg+F, auf dem Mac Befehlstaste+F.
  3. Prüfen Sie nicht nur die erste Seite, sondern mindestens eine Seite am Anfang, in der Mitte und am Ende der Datei.
  4. Markieren Sie einen kurzen Satz, kopieren Sie ihn und fügen Sie ihn in einen einfachen Texteditor ein. Vergleichen Sie ihn mit dem Scanbild.
  5. Kontrollieren Sie besonders Namen, Beträge, Adressen, Umlaute, Nummernfolgen und Tabellenüberschriften. Häufige Verwechslungen sind 0 und O, 1 und l sowie 5 und S.

Wenn die Suche einzelne sichtbare Wörter nicht findet, wiederholen Sie die OCR mit der richtigen Dokumentsprache. Prüfen Sie außerdem die Ausrichtung. Besteht bereits eine falsche Textebene, kann „Recognize existing text again“ oder als weitreichendere Alternative „Treat every page as an image“ sinnvoll sein.

Wie wandle ich die durchsuchbare PDF anschließend in Word um?

Wenn Sie den Inhalt nicht nur suchen, sondern bearbeiten möchten, ist die Reihenfolge entscheidend: Führen Sie erst OCR aus und konvertieren Sie anschließend die durchsuchbare PDF.

  1. Erstellen und prüfen Sie zuerst die OCR-PDF wie oben beschrieben.
  2. Öffnen Sie den PDF-zu-Word-Konverter.
  3. Klicken Sie auf „PDF-Dateien auswählen“ und wählen Sie die bereits durchsuchbare PDF aus.
  4. Klicken Sie auf „In Word umwandeln“.
  5. Laden Sie die DOCX-Datei herunter und öffnen Sie sie in Microsoft Word.
  6. Prüfen Sie Text, Absätze und Formatierung vor der Weiterbearbeitung sorgfältig gegen die PDF.

Die OCR vor der Word-Umwandlung ist wichtig: Reine Scanseiten werden beim direkten Konvertieren nicht automatisch als editierbarer Text erkannt, sondern als Bilder in das Word-Dokument eingefügt. Nach der OCR enthält die PDF dagegen eine Textebene, mit der die Umwandlung arbeiten kann.

Komplexe Tabellen, mehrspaltige Seiten, Fußnoten und Formulare können im DOCX dennoch anders umbrechen als in der PDF. Halten Sie deshalb beim Korrigieren die durchsuchbare PDF daneben geöffnet. Große bildlastige Scan-PDFs lassen sich nach der Bearbeitung bei Bedarf mit dem Tool compress verkleinern.

FAQ

Kann ich eine PDF kostenlos durchsuchbar machen?

Ja. Das OCR-Werkzeug von PDF Toucan ist kostenlos, verlangt kein Konto und fügt kein Wasserzeichen hinzu. Wählen Sie die PDF und mindestens eine Dokumentsprache, klicken Sie auf „Text erkennen“ und laden Sie anschließend die durchsuchbare Version herunter.

Warum findet die Suche trotz OCR einzelne Wörter nicht?

Die Texterkennung hängt von Scanqualität, Sprache, Schrift und Seitenlayout ab. Unscharfe Buchstaben, Stempel, Handschrift, schiefe Seiten sowie ähnliche Zeichen wie 0 und O verursachen Fehler. Prüfen Sie Sprache und Ausrichtung und wiederholen Sie die OCR bei Bedarf mit passenden Optionen.

Welche Sprache wähle ich bei einem deutsch-englischen Dokument?

Wählen Sie Deutsch und Englisch gemeinsam aus. Bis zu fünf Sprachen können kombiniert werden. Aktivieren Sie jedoch keine weiteren Sprachen vorsorglich: Sie verlangsamen die Verarbeitung und können die Erkennung bei mehrdeutigen Zeichen weniger eindeutig machen.

Bleibt das Layout erhalten, wenn ich eine PDF durchsuchbar mache?

Ja, das sichtbare Seitenbild und das Layout bleiben erhalten. OCR ergänzt im Hintergrund eine Textebene für Suche und Kopieren. Bei Tabellen, Spalten, Stempeln und schlechter Scanqualität kann der kopierte Text dennoch eine andere Reihenfolge haben oder einzelne Fehler enthalten.

Was passiert mit einer digitalen Signatur nach der OCR?

Die digitale Signatur wird ungültig, weil die OCR die PDF verändert. Bewahren Sie daher immer die signierte Originaldatei unverändert auf. Nutzen Sie die durchsuchbare Kopie nur zum Finden, Kopieren, Lesen oder als Ausgangsdatei für die weitere Bearbeitung.

PDF durchsuchbar machen online – so geht's
PDF durchsuchbar machen online – so geht's

Ähnliche Anleitungen