PDF OCR
Mach aus einem gescannten PDF eins, in dem du suchen kannst. Läuft in diesem Browser-Tab — ohne Konto, ohne Upload, ohne Seitenlimit.
Gescanntes PDF hierher ziehen oder klicken
Bis 100 MB · nichts wird hochgeladen
- 100 % in deinem Browser
- Kein Upload
- Download ohne Anmeldung
- Kein Seitenlimit
Warum ein gescanntes PDF OCR braucht
Ein gescanntes PDF ist ein Stapel Fotos. Deine Augen lesen es problemlos, für den Rechner stehen auf diesen Seiten aber nur farbige Punkte. Strg+F findet nichts. Eine Zeile herauskopieren geht nicht. Kein Index erfasst die Datei, also taucht sie später bei keiner Suche wieder auf.
OCR — optische Zeichenerkennung — ist der Schritt, der das ändert. Sie sieht sich die Formen auf jeder Seite an, entscheidet, welche Buchstaben das sind, und schreibt diese Buchstaben als unsichtbare Ebene unter das Bild in die Datei. Nach der Texterkennung sieht ein PDF exakt gleich aus; der Unterschied ist, dass jetzt Text darunter liegt.
Der Moment, auf den es ankommt, liegt meist Monate später. Ein Vertrag, den du eingescannt hast, eine Rechnung, ein Beleg, eine Buchseite — du erinnerst dich an einen Satz und sonst an nichts. Ein durchsuchbares PDF gibt dir diesen Satz zurück. Ein Stapel Fotos nicht.
Dieses PDF-OCR-Werkzeug läuft vollständig in deinem Browser. Die Datei wird nicht hochgeladen, es gibt kein Konto und keine Obergrenze für die Seitenzahl. Die Seite, die bei diesem Suchbegriff über uns steht, verarbeitet deine Datei gratis und verlangt dann eine Anmeldung, bevor sie sie wieder herausrückt.
Was ist OCR bei einem PDF?
OCR bei einem PDF ist Zeichenerkennung auf den Seitenbildern darin, wobei die erkannten Wörter als unsichtbare Textebene zurück in dieselbe Datei geschrieben werden — das Dokument sieht unverändert aus, wird aber durchsuchbar, markierbar und kopierbar.
Zwei Arten von PDF sehen auf dem Bildschirm gleich aus. Das eine kam aus einer Textverarbeitung und trägt echten Text; das andere stammt aus einem Scanner oder einer Handykamera und trägt Bilder von Text. Nur das zweite braucht OCR.
Es gibt einen schnellen Weg, sie ohne Werkzeug zu unterscheiden: Versuch, eine Zeile mit der Maus zu markieren. Läuft eine blaue Markierung den Wörtern entlang, ist der Text schon da. Wird die ganze Seite als ein Block markiert oder passiert gar nichts, hast du ein gescanntes PDF.
Dieses Werkzeug macht diese Prüfung für dich, bevor irgendetwas läuft. Hat die Datei bereits eine Textebene, sagt es das und schlägt vor, den Text stattdessen zu extrahieren — denn OCR würde etwas Exaktes durch etwas Ungefähres ersetzen, und du hättest hinterher keine Möglichkeit, das zu bemerken, weil die Seite so oder so gleich aussieht.
Der Text, den OCR erzeugt, liegt unter dem Seitenbild, nicht darüber. Deshalb sieht ein durchsuchbares PDF immer noch aus wie ein Scan: Du schaust stets auf das ursprüngliche Bild. Die unsichtbare Ebene ist nur für dein Suchfeld da, für deinen Kopierbefehl und für alles, was die Datei indexiert.
Es lohnt sich, klar zu sagen, was diese Ebene ist. Sie ist eine Vermutung — eine sehr gute bei sauberem Druck, eine schlechte bei einem zerknitterten Beleg, schräg abfotografiert. Das Bild, das du siehst, stimmt immer. Der Text darunter vielleicht nicht.
PDF mit OCR durchsuchbar machen — in vier Schritten
Alles passiert in diesem Browser-Tab. Die Datei verlässt dein Gerät nicht, und niemand verlangt ein Konto von dir, bevor du das Ergebnis herunterladen darfst.
Gescanntes PDF hineinziehen
Zieh die Datei auf das Feld oben oder klick darauf, um sie auszuwählen. Dateien bis 100 MB sind in Ordnung. Nichts wird irgendwohin geschickt — die Datei wird von dieser Seite geöffnet, in deinem Browser.
Den Befund lesen
Das Werkzeug prüft jede Seite auf eine vorhandene Textebene, bevor es irgendetwas tut. Es sagt dir, ob dein PDF überhaupt OCR braucht, es nur auf manchen Seiten braucht oder gar nicht. Sind nur einzelne Seiten Scans, bleiben die übrigen standardmäßig unangetastet.
Sprache des Dokuments wählen
Die Genauigkeit hängt davon stärker ab als von allem anderen, was du einstellen kannst. Wähl die Sprache, in der das Dokument geschrieben ist, nicht die Sprache dieser Oberfläche. Die Sprachdaten werden einmal geladen — rund 5,2 MB für Englisch, 1,7 MB für Hindi — und dann zwischengespeichert. Mehrere Sprachen gleichzeitig gehen, machen aber jede Seite langsamer.
Laufen lassen und nachsehen
Die Seiten werden nacheinander verarbeitet, mit einer Vorschau der Seite, die gerade gelesen wird — du kannst also früh abbrechen, wenn du die falsche Datei erwischt hast. Am Ende versuch, in der Vorschau Text zu markieren. Dann lad das durchsuchbare PDF herunter — oder den reinen Text, falls du nur den wolltest.
Nur die Wörter gebraucht? Wenn du den Text willst und nicht das PDF, und deine Datei schon eine Textebene hat, gibt es einen schnelleren Weg, bei dem überhaupt nichts geraten wird: den Text direkt aus dem PDF extrahieren.
Was dieses PDF-OCR-Werkzeug macht
Es fügt eine Textebene hinzu und ändert sonst nichts. Deine Originalseiten bleiben genau so, wie sie sind — dieselben Bilder, dieselbe Auflösung, dieselben Seitenrahmen. Die erkannten Wörter werden mit null Deckkraft darübergezeichnet, sind also markierbar und durchsuchbar, aber nie sichtbar. Seiten, die schon Text hatten, werden überhaupt nicht angefasst.
Es rendert Seiten mit 150 DPI, und das ist eine gemessene Entscheidung, keine Voreinstellung. Bei einem Testdokument lag die Genauigkeit bei 100, 150, 200 und 300 DPI innerhalb eines halben Prozentpunkts gleichauf, während 300 DPI viermal so lange brauchte. Unter 100 DPI gibt es eine Klippe: Bei 72 DPI fiel die Genauigkeit von 95,6 % auf 79,3 %. Mit 600 DPI zu scannen macht OCR nicht genauer. Es macht es nur langsamer.
Es beherrscht über 100 Sprachen, darunter Schriften, die die meisten Konverter auslassen. Eines der bekannteren Online-OCR-Werkzeuge führt 19 Sprachen, und nicht eine davon ist eine südasiatische Schrift. Hindi, Tamil und Bengali stehen hier in der Liste, und zwar weit oben — denn dort sind die meisten Leute, die danach suchen, tatsächlich zu Hause.
Es zählt, was es nicht geschafft hat. Kommt eine Seite ohne Text zurück — ein leeres Blatt, ein Foto, Handschrift —, bleibt sie unangetastet in der Datei und wird gemeldet. Nichts verschwindet stillschweigend.
Es verlangt nie eine Anmeldung. Du kannst ein Dokument mit 400 Seiten laufen lassen und danach noch eins. Es gibt kein Tageslimit, weil kein Server die Arbeit macht und es folglich nichts zu rationieren gibt.
Wofür Leute PDF-OCR benutzen:
- Gescannte Verträge durchsuchbar machen, bevor sie abgelegt werden
- Eine Zeile in einem Buchkapitel finden, das Seite für Seite abfotografiert wurde
- Einen Ordner gescannter Rechnungen in etwas verwandeln, das sich durchsuchen lässt
- Text aus einem Fax oder einer Kopie holen, die als PDF ankam
- Alte gescannte Unterlagen per Suche auffindbar machen statt per Erinnerung
- Scans so vorbereiten, dass ein Suchindex oder ein anderes Programm sie lesen kann
- Einen Absatz aus einem Scan kopieren, statt ihn abzutippen
Läuft auf jedem Gerät
Es gibt nichts zu installieren. Die Texterkennung läuft in dem Browser, den du ohnehin hast — dasselbe Werkzeug funktioniert also überall, und deine Datei bleibt auf dem Gerät, auf dem sie angefangen hat.
Windows
Chrome, Edge oder Firefox. Nichts herunterzuladen, und kein Acrobat-Abo nötig, um einen Scan durchsuchbar zu machen.
Mac
Safari oder Chrome. Die Vorschau zeigt dir ein gescanntes PDF, kann ihm aber keine Textebene hinzufügen.
iPhone und iPad
Läuft in Safari. Praktisch, wenn der Scan ein Foto ist, das du gerade gemacht hast — wobei genau dann geradehalten am meisten bringt.
Android
Läuft in Chrome. Lange Dokumente dauern und halten das Telefon beschäftigt, also häng es vorher an den Strom.
Chromebook
Passt gut, weil alles lokal im Browser läuft statt in einem installierten Programm.
Linux
Jeder moderne Browser. Keine Pakete, keine Kommandozeile, keine Warteschlange.
Was OCR richtig macht — und was nicht
Jedes OCR-Werkzeug macht Fehler, und fast keines sagt dir, wie diese Fehler aussehen. Hier ein echtes Ergebnis: eine saubere, am Rechner erzeugte Rechnung, kein Rauschen, nicht schief, 95,6 % Zeichengenauigkeit insgesamt. Von zwölf daraus geprüften Wörtern waren fünf per Suche auffindbar.
| Im Dokument | OCR las | Warum |
|---|---|---|
| Northwind | Northwind | Normaler Fließtext in einer Proportionalschrift ist der leichte Fall. |
| 2089.80 | 2089. 80 | Mitten in der Zahl tauchte ein Leerzeichen auf — die Suche nach der Summe geht ins Leere. |
| INV-2026-04471 | INV2026-04471 | Ein Bindestrich fiel weg. Belegnummern sind ungewöhnlich empfindlich. |
| Replacement | Repl acenent | Ein m als n gelesen, dazu ein Leerzeichen, das dort nicht hingehört. |
| Payment is | Paymentis | Der umgekehrte Fehler: ein echtes Leerzeichen wurde entfernt. |
| 1741.50 | 1741.50 | Dieselbe Tabelle, dieselbe Schrift wie bei der Summe darüber — und hier stimmte es. Die Fehler sind nicht vorhersehbar. |
Was einen Scan wirklich ruiniert
Es ist nicht die Kompression und nicht die Auflösung. Ein JPEG mit Qualität 60 lag nur den Bruchteil eines Punkts hinter einer verlustfreien Ausgabe. Weh tat die Schräglage: Eine um zwei Grad gekippte Seite war unproblematisch, bei sieben Grad fiel die Genauigkeit um neuneinhalb Punkte und die Konfidenz von 91 auf 74. Wenn du etwas einscannst, leg es gerade hin. Die DPI hochzudrehen lohnt sich nicht.
Durchsuchbares PDF, reiner Text oder eine Word-Datei?
Ein durchsuchbares PDF ist das, was diese Seite erzeugt: der Scan, den du hattest, plus eine unsichtbare Textebene, weiterhin ein PDF. Reiner Text sind die Wörter ohne das Layout — praktisch, wenn du sie irgendwo einfügen willst, und hier als zweiter Download dabei. Ein bearbeitbares Word-Dokument ist eine andere Aufgabe, bei der das Layout neu gebaut wird, und die übernimmt dieses Werkzeug nicht. Hat dein PDF schon Text und willst du nur die Wörter, überspring OCR ganz und extrahier sie direkt.
Dein Scan verlässt diesen Browser nicht
Das PDF, das du hier ablegst, wird von dieser Seite geöffnet, von deinem eigenen Prozessor gelesen und von deinem eigenen Browser wieder herausgeschrieben. Es wird nicht hochgeladen, nicht auf einem Server eingereiht und nirgends für eine Aufbewahrungsfrist gehalten — weil an der Arbeit überhaupt kein Server beteiligt ist.
Bei OCR wiegt das schwerer als bei den meisten Umwandlungen. Was Leute durchsuchbar machen müssen, sind Verträge, Arztunterlagen, Kontoauszüge und Ausweispapiere — also genau die Scans, die es gibt, weil das Original es wert war, aufgehoben zu werden. Jeder große Online-OCR-Dienst verarbeitet sie auf eigenen Rechnern und löscht sie nach Plan, meist nach einer bis acht Stunden.
Es heißt außerdem, dass es nichts zu rationieren gibt. Dienste, die die Arbeit auf eigener Hardware erledigen, müssen die kostenlose Nutzung begrenzen — deshalb deckeln sie dich bei ein paar Aufgaben am Tag oder zehn Seiten pro Datei. Hier passiert die Arbeit auf deinem Gerät, also gibt es keine Grenze durchzusetzen und keine Anmeldung einzusammeln.
Nichts wird hochgeladen
Die Datei wird lokal gelesen. Auf keinem Server entsteht eine Kopie davon.
Nie ein Konto
Du wirst nicht zur Anmeldung aufgefordert, um das Ergebnis herunterzuladen — anderswo ist genau das der übliche Preis für kostenloses OCR.
Kein Seiten- oder Dateilimit
Lass einen Scan mit 400 Seiten laufen und danach noch einen. Es gibt kein Tageskontingent.
Nur Sprachdaten
Das Einzige, was geladen wird, sind die Erkennungsdaten für die Sprache, die du wählst. Dein Dokument ist an dieser Anfrage nie beteiligt.
Häufige Fragen
Ist dieses PDF-OCR-Werkzeug wirklich kostenlos, und gibt es ein Seitenlimit?⌄
Muss ich mich anmelden, um das Ergebnis herunterzuladen?⌄
Woran erkenne ich, ob mein PDF überhaupt OCR braucht?⌄
Wie genau ist die Texterkennung?⌄
Welche Sprachen werden unterstützt?⌄
Erkennt es Handschrift?⌄
Sieht das PDF danach anders aus?⌄
Liefert ein Scan mit höherer DPI bessere OCR-Ergebnisse?⌄
Wie lange dauert es?⌄
Wird meine Datei irgendwohin hochgeladen?⌄
Was ist der Unterschied zu „PDF in Text umwandeln“?⌄
Bekomme ich stattdessen ein bearbeitbares Word-Dokument?⌄
Mach dein gescanntes PDF durchsuchbar
Kostenlos, unbegrenzt, und es läuft in diesem Tab. Kein Upload, keine Anmeldung — und es sagt dir, wenn deine Datei gar kein OCR braucht.
PDF mit OCR bearbeitenVerwandte Konvertierungs-Tools
Entdecke weitere Tools in unserer umfassenden Sammlung zur Dateikonvertierung
PDF zu Text
Text extrahieren, kopieren oder als .txt speichern. Stellt die Lesereihenfolge her, liest ausgefüllte Formularfelder mit und sagt dir, wenn eine Seite ein Scan ist.
Gescanntes PDF zu PNG
Privates, verlustfreies PNG aus gescannten Dokumenten
PDF komprimieren
PDF-Dateigröße um bis zu 80 % reduzieren