Tutorial

Gescannte PDF per OCR durchsuchbar machen

So funktioniert OCR: Machen Sie aus einem gescannten PDF ein durchsuchbares Dokument mit kopierbarem Text – direkt im Browser. Mit Tipps zur Genauigkeit.

LuraPDF Team
LuraPDF Team

Redaktionelles & technisches Team · 4. Mai 2026 · 6 min Lesezeit

Ein gescanntes PDF ist ein digitales Foto eines Dokuments. Die Seiten sind Bilder. Sie können keinen Text auswählen, nach einem Wort suchen, einen Satz kopieren oder den Inhalt an ein Textverarbeitungsprogramm übergeben. Für die Informationsgewinnung ist ein gescanntes PDF im Wesentlichen undurchsichtig.

OCR (Optical Character Recognition) löst dieses Problem, indem es diese Bilder analysiert und eine Textebene erstellt, die den visuellen Inhalt überlagert. Das Ergebnis: ein PDF, das identisch mit dem Original-Scan aussieht, aber eine unsichtbare Textebene enthält, die alles auswähl-, such- und kopierbar macht.

Wie OCR funktioniert

LuraPDF verwendet Tesseract.js, die im Browser kompilierte Version von Tesseract – eine der genauesten Open-Source-OCR-Engines, die von Google gepflegt und ursprünglich von HP Labs entwickelt wurde. Tesseract nutzt ein neuronales Netzwerkmodell (LSTM-basiert), das auf Millionen von Dokumentseiten in Dutzenden von Sprachen trainiert wurde.

Die OCR-Pipeline:

  1. Seiten-Rendering: Jede PDF-Seite wird als Canvas-Bild mit hoher Auflösung gerendert (300+ DPI für beste Genauigkeit)
  2. Vorverarbeitung: Bildverbesserung – Binarisierung, Rauschreduzierung, Entzerrung (Begradigung gedrehter Scans)
  3. Layout-Analyse: Erkennung von Textbereichen, Spalten, Tabellen und Nicht-Text-Elementen
  4. Zeichenerkennung: Das neuronale Netzwerk klassifiziert jedes Zeichen aus segmentierten Textbereichen
  5. Nachverarbeitung: Sprachmodell-Bewertung zur Unterscheidung ähnlicher Zeichen (z. B. „l" vs. „1", „O" vs. „0")
  6. PDF-Schreiben: Der erkannte Text wird als unsichtbare Textebene eingebettet, die präzise über den entsprechenden visuellen Zeichen positioniert ist

Die unsichtbare Textebene macht das Ergebnis durchsuchbar. Das visuelle Erscheinungsbild der Seite bleibt das ursprüngliche Scan-Bild – Sie sehen genau das, was Sie gescannt haben, aber der Text darunter ist nun maschinenlesbar.

Was die OCR-Genauigkeit beeinflusst

Die Genauigkeit variiert erheblich je nach Eingabequalität:

Scan-Auflösung

300 DPI ist das Minimum für zuverlässige Genauigkeit. Unterhalb von 200 DPI verschlechtert sich die Zeichenerkennung erheblich. Wenn Sie Dokumente für OCR scannen, scannen Sie immer mit 300 DPI oder höher.

Dokumente, die mit 150 DPI oder weniger gescannt wurden, sollten vor der OCR mit höherer Auflösung neu gescannt werden. OCR auf niedrig aufgelösten Scans durchzuführen liefert schlechte Ergebnisse, unabhängig davon, wie gut die Engine ist.

Schrift- und Druckqualität

  • Gedruckter Text (Laserdrucker-Ausgabe, Bücher): 98–99 % Genauigkeit bei sauberen Originalen
  • Hochwertige Handschrift mit klaren Zeichen: 85–95 %
  • Blasser oder verblasster Text: 80–95 % je nach Kontrast
  • Durchschlagpapier: 60–85 %
  • Alte Zeitung / Schreibmaschine: 90–95 % bei sauberen Scans
  • Kursivschrift: 40–70 % – neuronale Netzwerk-OCR hat Schwierigkeiten mit Kursivschrift

Seitenausrichtung

Stark geneigte oder gedrehte Seiten beeinträchtigen die Genauigkeit. Die meisten OCR-Engines einschließlich Tesseract erkennen und korrigieren leichte Drehungen automatisch (bis zu ~10 Grad). Stark gedrehte Seiten sollten vorher manuell mit PDF drehen korrigiert werden.

Sprache

Tesseract unterstützt 100+ Sprachen. Das OCR-Tool von LuraPDF erkennt Englisch automatisch. Für nicht-lateinische Schriften oder nicht-englische Dokumente verbessert die Sprachauswahl die Genauigkeit erheblich.

So führen Sie OCR mit LuraPDF durch

  1. OCR-Tool öffnen: Navigieren Sie zu LuraPDF OCR PDF
  2. Das gescannte PDF hochladen: Ziehen Sie Ihre Datei per Drag & Drop
  3. Sprache auswählen (falls nicht Englisch): Wählen Sie die Hauptsprache des Dokuments
  4. Auf „OCR ausführen" klicken: Die Verarbeitung erfolgt seitenweise in Ihrem Browser. Die Dauer variiert je nach Dokumentlänge – ein 20-seitiger Scan dauert auf einem modernen Computer in der Regel 30–90 Sekunden.
  5. Das durchsuchbare PDF herunterladen: Die Ausgabe ist ein PDF mit den originalen Scan-Bildern plus einer eingebetteten Textebene

Das Ergebnis prüfen

Überprüfen Sie nach der OCR die Genauigkeit:

  • Markieren Sie Text auf der Seite – Text sollte genau über den gedruckten Zeichen auswählbar sein
  • Suchen Sie (Strg+F / Cmd+F) nach einem gebräuchlichen Wort – es sollte gefunden werden
  • Kopieren Sie einen Absatz und fügen Sie ihn in einen Texteditor ein – die Ausgabe sollte lesbar sein

Wenn die Genauigkeit gering ist, prüfen Sie zuerst die Qualität des Eingabe-Scans, bevor Sie andere Tools ausprobieren.

Wann OCR vor anderen Operationen ausgeführt werden sollte

OCR schaltet zusätzliche LuraPDF-Funktionen frei, die bei reinen Bild-PDFs nicht funktionieren:

  • PDF komprimieren nach OCR: Sobald Text extrahiert wurde, können die Bildbereiche manchmal aggressiver komprimiert werden
  • PDF zu Word nach OCR: Die Konvertierung eines OCR-verarbeiteten PDFs in Word liefert bearbeitbaren Text; die Konvertierung eines rohen Scans ergibt eine Word-Datei mit eingebetteten Bildern
  • PDF schwärzen nach OCR: Textbasierte Schwärzung funktioniert bei OCR-verarbeiteten Dokumenten korrekt
  • Suchen und extrahieren: Bestimmte Informationen finden und kopieren, ohne sie neu eintippen zu müssen

Datenschutz: OCR läuft in Ihrem Browser

Tesseract.js führt den gesamten OCR-Prozess lokal mit WebAssembly aus. Ihre gescannten Dokumente – die häufig Krankenakten, Kontoauszüge, rechtliche Dokumente oder personenbezogene Daten enthalten – verlassen Ihr Gerät niemals. Kein Remote-Server verarbeitet Ihre Datei.

Dies ist ein wesentlicher Vorteil gegenüber Cloud-OCR-Diensten, die zwangsläufig eine Kopie von allem erhalten, was Sie verarbeiten.

Einschränkungen der browserbasierten OCR

Verarbeitungszeit

Tesseract.js ist langsamer als natives Desktop-Tesseract oder Cloud-OCR-APIs. Erwarten Sie je nach Hardware etwa 3–8 Sekunden pro Seite. Ein 50-seitiges Dokument kann mehrere Minuten dauern.

Tabellen

Tesseract erkennt Tabelleninhalte, rekonstruiert jedoch keine Tabellenstruktur in der Textebene des PDFs – der Text liegt in Lesereihenfolge vor, aber die Zellenstruktur bleibt nicht erhalten. Für strukturierte Tabellenextraktion konvertieren Sie das OCR-verarbeitete PDF in Word und formatieren Sie die Tabelle manuell neu.

Mathematische Notation

LaTeX-Gleichungen und mathematische Symbole haben eine geringere Genauigkeit. Tesseract-Modelle sind für natürlichsprachigen Text optimiert.

Handschrift

Wie erwähnt ist die Genauigkeit bei Kursivschrift begrenzt. Druckschrift schneidet besser ab. Überprüfen Sie bei wichtigen handgeschriebenen Dokumenten jede Seite manuell.

Häufig gestellte Fragen

Der OCR-Text ist nicht deckungsgleich mit den Zeichen – ist das ein Fehler? Dies kann bei stark verzerrten Scans auftreten. Die Textpositionen werden aus den erkannten Zeichenpositionen berechnet, aber wenn die Seitengeometrie ungewöhnlich ist, kann die Ausrichtung abweichen. Versuchen Sie, das PDF zu drehen, um die Verzerrung zu korrigieren, bevor Sie OCR ausführen.

Kann ich OCR nur auf bestimmten Seiten ausführen? LuraPDF verarbeitet alle Seiten. Wenn Sie OCR nur auf bestimmten Seiten benötigen, extrahieren Sie diese Seiten zuerst mit PDF-Seiten extrahieren, führen Sie OCR aus und führen Sie die Ergebnisse optional anschließend zusammen.

Ändert OCR das visuelle Erscheinungsbild meines gescannten Dokuments? Nein. Die ursprünglichen Scan-Bilder bleiben unverändert erhalten. Es wird lediglich eine unsichtbare Textebene hinzugefügt.

Kann ich OCR auf einem PDF ausführen, das bereits einige Textseiten und einige gescannte Seiten enthält? Ja – Tesseract verarbeitet bildbasierte Seiten und fügt eine Textebene hinzu. Seiten, die bereits eine Textebene haben, bleiben unverändert.

Mein Dokument ist auf Arabisch / Chinesisch / Japanisch – funktioniert OCR? Ja, aber wählen Sie vor dem Ausführen die richtige Sprache im Tool aus. Die Genauigkeit von Tesseract für CJK- und Rechts-nach-links-Sprachen ist gut, variiert jedoch stärker mit der Scan-Qualität als bei Dokumenten mit lateinischer Schrift.

OCR verwandelt verschlossene Archive gescannter Dokumente in zugängliche, durchsuchbare und verarbeitbare Informationen. Ein Aktenschrank voller gescannter Verträge wird zu einer durchsuchbaren Datenbank. Ein Stapel Krankenakten wird zu einem Dokument, in dem Sie wirklich navigieren können. Der Vorgang dauert Sekunden bis Minuten und läuft vollständig auf Ihrem Gerät.

Über die Autorin

LuraPDF Team
LuraPDF Team

Redaktionelles & technisches Team · 4. Mai 2026 · 6 min Lesezeit

Das LuraPDF-Team besteht aus Experten für Dokumentenverarbeitung, Softwareentwicklern und technischen Redakteuren, die sich dafür einsetzen, PDF-Bearbeitung kostenlos, privat und zugänglich zu machen.