PDF Texterkennung (OCR)
Verwandle ein gescanntes Dokument in ein durchsuchbares PDF oder extrahiere den reinen Text, mit einer OCR-Engine, die vollständig auf deinem Gerät läuft. Die meisten kostenlosen OCR-Tools laden deinen Scan auf einen Server, um ihn zu lesen, dieses hier nicht.

Deine Datei verlässt dein Gerät nicht. Sie wird nicht auf einen Server kopiert, nicht zwischengespeichert und nicht nach einer Stunde gelöscht. Jedes Tool auf dieser Seite arbeitet mit JavaScript direkt in dem Tab, den du gerade offen hast.
Datei hierher ziehen oder zum Auswählen klicken
Warum mit Texterkennung umwandeln statt mit Desktop-Software?
- Die Erkennung läuft komplett in deinem Browser mit WebAssembly. Dein Scan wird nicht auf einen Server geladen, anders als bei den meisten kostenlosen OCR-Tools.
- Du wählst zwischen einem durchsuchbaren PDF (die Scanbilder bleiben, dazu kommt eine unsichtbare, markierbare Textebene) und einer reinen .txt-Datei.
- Ehrlich zur Abwägung: OCR im Browser ist bei langen oder schlechten Scans spürbar langsamer als ein Server, dafür verlässt nichts dein Gerät.
- Kostenlos, ohne Seitenlimit von unserer Seite und ohne Wasserzeichen auf dem Ergebnis.
Texterkennung Schritt für Schritt
1PDF auswählen
Ziehe das gescannte PDF in das Feld oder wähle es aus. Es bleibt auf deinem Gerät.
2Ausgabe wählen
Wähle die Ausgabe: „Durchsuchbares PDF erstellen“ behält die ursprünglichen Seitenbilder und fügt eine markierbare Textebene hinzu, „Nur den Text extrahieren (.txt)“ liefert eine reine Textdatei.
3OCR ausführen
Klicke auf „OCR ausführen“ und warte, während jede Seite gelesen wird. Bei mehreren oder großen Seiten dauert es länger, weil dein Gerät die Arbeit übernimmt.
4Herunterladen
Lade das Ergebnis herunter: ein durchsuchbares PDF (Zusatz -searchable) oder eine .txt-Datei (Zusatz -ocr), je nach Auswahl.
Wo das vorkommt
Eine Forscherin hat einen Zeitschriftenartikel mit 15 Seiten nur als Flachbettscan und muss einen Absatz von Seite 9 zitieren, ohne ihn abzutippen. Sie führt die Texterkennung mit der Ausgabe „Nur den Text extrahieren“ aus und kopiert den Absatz direkt aus der .txt-Datei, statt ihn Wort für Wort zu übertragen.
Wie die Umwandlung tatsächlich funktioniert
Das Tool lädt Tesseract.js, eine zu WebAssembly kompilierte OCR-Engine, direkt in deinem Browser-Tab, zusammen mit den nötigen Sprachdaten. Beides wird einmal geladen und lokal zwischengespeichert. Jede Seite deines Scans wird auf einer Zeichenfläche dargestellt, an die Engine übergeben und ausschließlich auf der CPU deines Geräts gelesen. Weder Seitenbilder noch erkannter Text werden an einen Server gesendet. Je nach Auswahl ist das Ergebnis eine PDF-Datei mit den ursprünglichen Seitenbildern plus unsichtbarer, markierbarer Textebene oder eine .txt-Datei mit allem, was erkannt wurde. Prüfen kannst du das mit F12 im Tab „Netzwerk“: Es geht keine Anfrage mit deiner Datei hinaus.
Was du vor dem Umwandeln wissen solltest
- Deutlich langsamer als ein Server-Dienst, weil dein Gerät statt eines Rechenzentrums die Erkennung übernimmt. Lange oder mehrseitige Scans können eine Weile dauern.
- Die Genauigkeit hängt von der Scanqualität ab. Klare, gerade gescannte Seiten mit gedruckter Schrift liefern die besten Ergebnisse. Handschrift, schiefe Fotos oder sehr kleine Schrift verschlechtern die Erkennung. Das ist eine Grenze der OCR-Technik allgemein, keine Fehlfunktion des Tools.
- Beim ersten Durchlauf werden OCR-Engine und Sprachdaten heruntergeladen (wenige Megabyte), bevor es losgeht. Danach werden sie im Browser zwischengespeichert.
- Es wird nur das englische Sprachmodell geladen, eine Sprachauswahl gibt es nicht. Bei deutschen Texten können Umlaute und ß deshalb häufiger falsch erkannt werden, kontrolliere das Ergebnis.
- Ein passwortgeschütztes PDF musst du zuerst entsperren, weil die Seiten zum Erkennen direkt geöffnet werden.
PDF Texterkennung (OCR): was sich nicht zuverlässig lesen lässt, prüfe das Ergebnis vor der Verwendung
- Handschrift. Diese Engine ist auf gedruckten Text trainiert. Schreibschrift oder handschriftliche Notizen führen zu verstümmelter oder fehlender Ausgabe, nicht zu einer bestmöglichen Abschrift.
- Schiefe oder gedrehte Seiten. Eine auch nur leicht schief gescannte Seite wird schlechter gelesen als eine gerade: Drehe sie zuerst mit PDF drehen, wenn ein Scan quer hereingekommen ist.
- Fotos mit niedriger Auflösung oder geringem Kontrast. Ein Handyfoto, das schräg, bei schlechtem Licht oder stark komprimiert aufgenommen wurde, verliert die Zeichendetails, die OCR braucht: Ein Flachbettscan wird weit genauer gelesen.
- Andere Sprachen als Englisch. Dieses Werkzeug lädt derzeit nur das englische Sprachmodell. Text in anderen Sprachen wird schlecht oder gar nicht erkannt.
- Komplexe Tabellen und mehrspaltige Layouts. OCR liest Text von links nach rechts und von oben nach unten gut, aber die Struktur einer Tabelle (welche Zelle zu welcher Zeile gehört) bleibt nicht erhalten: Erwarte die Wörter, nicht das Layout.
- Text mit Wasserzeichen oder geringem Kontrast. Text, der von einem Wasserzeichen, einem Stempel oder einer hellen Hintergrundfarbe überlagert wird, lässt sich schwerer vom Hintergrund trennen als sauberer schwarzer Text auf Weiß.